DC娱乐网

无限OCR火过一轮,又和Kimi K3碰上了

最近HuggingFace全球模型趋势榜出现了一个挺有意思的画面。

月之暗面Kimi K3开源权重刚放出,就冲到榜首。排在它旁边的,是已经发布一个多月的百度Unlimited OCR。Kimi K3与百度Unlimited OCR一前一后,成了中国开源模型“双子星”,领衔全球模型榜。

这次Kimi K3有2.8万亿参数,采用原生多模态MoE架构,支持百万Token上下文。权重开放以后,海外开发者很快开始下载、测试,热度是真挺猛。

Unlimited OCR这边是上个月发布时,就已经拿过GitHub和HuggingFace多个榜单第一。过了一个月,讨论还在继续。目前GitHub Star超过1.97万,HuggingFace下载量达到265万,图灵奖得主杨立昆也转发推荐了。

我看海外开发者社区里,有人说Unlimited OCR是近期增长最快的开源项目之一,还有博主直接喊出“中国刚刚杀死了OCR领域的比赛”。

话说得有些满,背后的技术问题却真实存在。

书籍、论文、研报这类长文档,以前大多逐页识别,再把结果拼起来。页数增加以后,跨页表格容易断,章节顺序容易乱,生成内容越长,KV Cache和显存占用也会继续上涨。

Unlimited OCR提出的R-SWA机制,只保留最近一段生成内容,同时持续参考原始文档。这样一来,数十页内容可以连续解析,缓存规模也不会随着输出长度一路增加。

所以这轮榜单变化,还真不只是国内自己热闹。
海外开发者一边围观,一边下载测试,最后硬是把Kimi K3与百度Unlimited OCR推到了全球模型榜前列。