
OCR 这条赛道,最近突然又热了起来。
百度正式发布并开源端到端 OCR 模型 Unlimited OCR。这个模型面向书籍、论文、报告、扫描件等长文档解析场景,核心卖点是:不再依赖传统的“逐页解析 + 结果拼接”,而是让模型在一次前向推理中连续解析数十页文档,并输出结构化 Markdown 内容。官方论文显示,Unlimited OCR 以 DeepSeek OCR 为基础,引入 Reference Sliding Window Attention(R-SWA)机制,在标准 32K 最大长度下可转录数十页文档。
更关键的是,它开源后热度非常快。GitHub 页面显示,百度 Unlimited OCR 项目当前已经达到约 13k Star,媒体报道中也提到,该项目开源后 5 天 GitHub Star 突破 1 万,并登上 GitHub 与 HuggingFace 多个趋势榜。
Unlimited OCR 是什么?
Unlimited OCR 是百度开源的端到端 OCR 模型,主要解决长文档解析问题。
过去很多 OCR 系统处理长 PDF、扫描书籍、论文报告时,通常会先把文档拆成一页一页,再分别识别,最后把结果拼接起来。这个方法能用,但问题也很明显:工程流程复杂、上下文割裂、跨页内容容易不连贯,遇到超长输出时,推理速度和显存占用也会受到影响。
Unlimited OCR 的思路更直接:
把长文档当成一个连续解析任务,让模型一次性从第一页读到最后一页。
根据 ModelScope 社区披露的信息,Unlimited OCR 总参数规模为 3B,推理时激活参数约 570M,采用 MoE 架构,并结合 DeepSeek OCR 的高压缩视觉编码能力,用更小的激活参数完成长文档识别与结构还原。
为什么 Unlimited OCR 会突然火?
这次 Unlimited OCR 火起来,主要有三个原因。
第一,开源速度快,开发者关注度高。
项目上线后不久就冲上 GitHub 热榜,5 天 Star 破万,当前 GitHub Star 已经来到约 13k。对于一个 OCR 模型来说,这个增长速度非常少见。
第二,它解决的是刚需场景。
长文档解析一直是 OCR 的难点。书籍、合同、财报、论文、扫描资料、历史档案、企业知识库文档,这些内容都不只是“识别文字”,还需要保留段落、标题、表格、公式、版面结构和上下文连续性。
第三,模型不只是拼速度,还在结构上做了针对性优化。
Unlimited OCR 提出的 R-SWA 机制,可以让模型始终关注原始视觉输入,同时只保留最近一段输出内容作为工作记忆,从而把 KV Cache 控制在恒定规模。
核心技术:Reference Sliding Window Attention
Unlimited OCR 最重要的技术点,是 Reference Sliding Window Attention,简称 R-SWA。
简单理解,它把注意力分成两部分:
一部分是“参考内容”,也就是图像 Token 和提示词,模型始终可以完整看到。
另一部分是“生成内容”,也就是已经输出的文本,模型只保留最近一段窗口,默认窗口为 128 个 Token。论文中明确提到,每个生成 Token 会关注全部参考 Token,同时只关注前面最近的 n 个输出 Token,从而保持恒定 KV Cache。
这个设计很适合 OCR。
因为 OCR 的原始文档图像是固定的,模型在解析时最重要的是持续看清文档内容,而不是无限记住所有已经输出过的文字。R-SWA 的作用,就是让模型像人一样“看着原文抄写”:原文一直可见,短期上下文保持,历史输出不无限堆积。
这样带来的好处很明显:
- 长文档输出时,KV Cache 不再持续膨胀
- 显存占用更稳定
- 输出越长,速度优势越明显
- 可以减少逐页解析和拼接带来的工程复杂度
- 更适合书籍、论文、报告等连续文档解析任务
长文档一次性解析:从逐页识别到连续阅读
Unlimited OCR 的重点不是只识别单页图片,而是面向长程解析。
ModelScope 社区文章中提到,Unlimited OCR 可以输入数十页 PDF 文档图像,在一次前向传播中从第一页连续解析到最后一页,并输出 Markdown 格式结构化内容,且 KV Cache 始终保持恒定。
这对于文档数字化非常实用。
比如一份 40 页的企业报告,过去可能要先切页、识别、拼接、校对,再处理标题层级、表格结构和跨页语义。Unlimited OCR 这类端到端模型,则尝试把这些步骤放进一个连续生成流程里,让最终结果更接近“整篇文档被读懂后输出”。
适合的场景包括:
论文解析:识别标题、摘要、正文、公式、图表说明和参考文献。
财报解析:提取章节、表格、注释、财务数据和说明文字。
合同解析:识别条款、编号、签署信息、附件内容。
扫描书籍解析:把多页扫描图片转成结构化文本。
知识库构建:把 PDF、报告、手册转成可检索、可喂给大模型的 Markdown 内容。
企业文档归档:将历史纸质资料转成数字化结构数据。
OmniDocBench v1.6:综合成绩 93.92%
性能方面,Unlimited OCR 在公开评测中表现很亮眼。
ModelScope 社区披露的结果显示,Unlimited OCR 在 OmniDocBench v1.6 基准测试中取得 93.92% 综合得分,在同类端到端 OCR 模型中位居前列。对比表中,Qianfan-OCR 为 93.90%,Logics-Parsing-v2 为 93.33%,FireRed-OCR 为 93.26%,DeepSeek-OCR 2 为 90.25%。
同时,ModelScope 文章还提到,相比 DeepSeek OCR 基线,Unlimited OCR 综合得分提升 6.22%,文本编辑距离下降 0.035,表格结构还原准确率提升接近 6%。
这说明它不是只做长文档速度优化,而是在识别质量、结构还原和端到端输出上也保持了较强水平。
推理速度更快:真实文档场景提升约 12.7%
速度也是 Unlimited OCR 的核心卖点。
公开测试数据显示,在 OmniDocBench 真实文档评测中,Unlimited OCR 吞吐量为 5580 TPS,DeepSeek OCR 为 4951 TPS,速度提升约 12.7%。在更长输出场景下,优势会继续放大:输出长度达到 6144 tokens 时,Unlimited OCR 相比 DeepSeek OCR 的速度差距扩大到约 34.8%。
这背后还是 R-SWA 的作用。
普通注意力机制在输出越来越长时,KV Cache 会不断增加,模型需要维护越来越多历史信息;而 Unlimited OCR 把文本侧上下文控制在固定窗口内,所以越到长输出场景,速度和显存优势越明显。
这对实际应用非常关键。
因为真实业务里的文档往往不是几百字,而是几十页、几万字,甚至更多。长输出下还能保持速度稳定,才是真正能进入生产流程的能力。
对文档数字化有什么价值?
Unlimited OCR 的价值,不只是“识别文字更快”。
它更重要的意义在于:让长文档可以更低成本地转成大模型能理解、能检索、能处理的结构化内容。
现在很多企业都在做知识库、智能客服、合同审核、财报分析、档案数字化、论文检索,但第一步经常卡在文档解析上。PDF 扫描件、图片型文档、复杂表格、跨页内容、版式混乱,都可能影响后续大模型问答效果。
Unlimited OCR 这类模型可以作为底层文档解析模块,把原始文档转成更干净的 Markdown 或结构化文本,再进入向量库、RAG 系统、知识库系统或企业内部 AI 助手。
未来它可能会被用于:
- 企业知识库文档预处理
- PDF 转 Markdown 工具
- AI 论文阅读工具
- 财报与合同智能解析
- 扫描书籍数字化
- 教育资料结构化整理
- 政务档案和历史文献识别
- 大模型长上下文记忆压缩研究
对开发者有什么吸引力?
Unlimited OCR 这次开源,对开发者也比较友好。
GitHub 仓库显示,项目代码和模型相关资源已经开放,许可证为 MIT License;README 中也提供了 Transformers、SGLang 等推理方式,并在 2026 年 6 月 28 日更新中提到已经支持 vLLM 推理。
Hugging Face 页面也提供了 baidu/Unlimited-OCR 模型入口,支持通过 Transformers、vLLM、SGLang 等方式使用。
这意味着开发者可以围绕它做很多应用:
PDF 转 Markdown 工具
上传 PDF 后自动输出结构化 Markdown,适合知识库建设。
AI 论文解析工具
自动提取论文标题、摘要、公式、表格和参考文献。
企业合同解析系统
识别长合同中的条款、金额、签署人、日期和附件。
扫描书籍数字化工具
把纸质书扫描件转成可搜索、可编辑文本。
RAG 文档预处理管线
将文档切分前先完成高质量 OCR 和结构化解析。
AI 资料整理助手
批量处理报告、教材、PPT 截图和图片型 PDF。
为什么说它和大模型长程记忆有关?
Unlimited OCR 看起来是 OCR 模型,但它背后的 R-SWA 思路,对大模型长程记忆也有启发。
传统大模型在长上下文生成时,也会遇到类似问题:输出越长,需要维护的上下文越多,KV Cache 越大,推理成本越高。
Unlimited OCR 的思路是:
不是所有历史内容都需要一直完整保留。对于某些任务,只要原始参考信息始终可见,再保留最近一段生成状态,就可以稳定完成长程任务。
论文中也提到,R-SWA 不只适用于 OCR,还可能扩展到 ASR、翻译等解析类任务。
所以它的价值不只在文档识别,也可能为长上下文推理、长程生成和大模型记忆管理提供一种新的工程思路。
总结:Unlimited OCR 把 OCR 又带回了 AI 热点
百度 Unlimited OCR 这次能在 5 天 Star 破万,并不是偶然。
一方面,OCR 本身是非常基础但刚需的能力,几乎所有文档数字化、知识库、RAG、企业 AI 应用都绕不开。
另一方面,Unlimited OCR 把问题切到了一个更具体的方向:长文档一次性解析。
3B 总参数、约 570M 激活参数、R-SWA 机制、32K 上下文、OmniDocBench v1.6 93.92%、真实文档速度提升约 12.7%、长输出场景速度优势接近 35%,这些数据让它不只是一个开源 OCR 项目,更像是长文档解析方向的一次重要进展。
如果你正在做 AI 知识库、PDF 解析、论文阅读器、合同识别、财报分析、RAG 文档预处理,Unlimited OCR 值得重点关注。
相关链接
- GitHub 项目地址:
https://github.com/baidu/Unlimited-OCR










评论区 (0)
最新评论登录后发布评论并参与互动。
暂无评论,欢迎抢沙发。