DC娱乐网

百度基于DeepSeek OCR推出了Unlimited OCR模型。作为每天处

百度基于DeepSeek OCR推出了Unlimited OCR模型。作为每天处理PDF和手写稿的打工人,我试用后发现这个模型确实有点意思。
📌 核心特点:用滑动窗口注意力机制重构3B参数模型,让普通显卡也能处理百页级文档批量识别,准确率比原版提升6%。
主要亮点:
1. 百页文档一键解析传统OCR需要逐页处理,Unlimited OCR通过参考滑动窗口注意力,实现KV缓存恒定。在OmniDoc Bench V1.6上达到94%准确率,内存占用却少一半。
2. 消费级显卡就能跑3B参数+500M活跃参数的MoE架构,连Colab免费版都能用。Hugging Face已集成,复制代码5分钟部署。
3. 手写体识别能力测试了Reddit上传的潦草笔迹,连"2×2=5"这种梗都能准确识别。虽然医生处方级的字迹还有进步空间,但对比需要35B参数的VL模型,这个小身板表现不错。
个人体验:当百度用一个算法改动就突破算力限制时,我意识到AI时代的创新不一定需要堆参数。普通人加上好工具,真的能改变游戏规则。
OCR 百度 效率工具 AI 深度学习 开源模型
【快孵联盟】如果你也想把 AI 工具变成可落地的副业/项目,欢迎加入快孵联盟:一起拆解项目、打磨内容、连接资源,把想法更快孵化成生意。加入入口: