大数跨境

一年从3B卷到0.xB:MonkeyOCRv2用0.7B拿下17语种文档解析开源第一

一年从3B卷到0.xB:MonkeyOCRv2用0.7B拿下17语种文档解析开源第一 量子位
2026-07-26
5
导读:模型不一定要继续变大,但每一部分参数必须知道自己究竟负责什么。

从 3B 参数的 MonkeyOCR,到 1.2B 的 MinerU、1.0B 的 HunyuanOCR,再到 0.7B 和 0.6B 的 MonkeyOCRv2,文档 OCR 正加速迈入小模型时代:模型体量持续缩小,性能上限却一次次被重新定义。

一年多时间里,文档 OCR 从 3B 快速进入 0.xB 区间。

一年前,3B 参数尚被称为“轻量文档模型”,如今这一门槛已降至 0.xB。在覆盖电子原生文档、拍照文档及 17 种语言的 MDPBench 评测中,总参数仅 0.6B 的 MonkeyOCRv2-S 得分 82.5,0.7B 版本更是达到 83.3 分。相比之下,此前排名最高的开源模型 dots.mocr 参数量高达 3B,得分仅为 80.5。榜单中体量最小的两个模型,反而占据了开源结果的前列。

这并非单纯的“大力出奇迹”,而是文档 OCR 领域的一次认知重构:模型无需盲目做大,关键在于让每一部分参数明确其职责。华中科技大学白翔团队提出的新路线,不再是机械裁剪大模型,而是重新分配系统职能:由前端视觉编码器精准捕捉字符、公式与版面细节,后端小型语言模型专注于组织与理解。

0.7B 反超 3B 的核心逻辑在于:真正减少的不仅是参数量,更是后端语言模型替前端“猜测”的工作量。

架构演进:从三元组拆解到视觉前置

回顾 2025 年 6 月发布的第一代 MonkeyOCR(3B 参数),其创新在于将复杂文档解析拆解为三个核心问题:“它在哪里?”(结构检测)、“它是什么?”(内容识别)以及“它们之间如何组织?”(关系预测)。这种 Structure-Recognition-Relation(SRR)三元组架构,为模型提供了清晰的执行路径。

随后推出的 MonkeyOCR-pro-1.2B 证明,当任务拆解足够清晰时,模型小型化并不必然导致能力缩水。一年后问世的 MonkeyOCRv2 将总参数进一步压缩至 0.6B 和 0.7B。此次升级并未止步于流程拆解,而是在 SRR 之前引入了一个更基础的前置问题:“你真的看清了吗?”

第一代 MonkeyOCR 用三个问题拆解解析流程;MonkeyOCRv2 将问题进一步前移至视觉入口。

性能突破:小参数模型的榜单逆袭

MDPBench 开源模型列表完整记录了文档 OCR 的小型化进程:从 3B 的 dots.mocr、1.2B 的 MinerU2.5-Pro,到 0.6B/0.7B 的 MonkeyOCRv2。通常模型越小性能越难维持,但 MonkeyOCRv2 打破了这一规律。0.7B 版本在拍照文档上得分 81.7,在非拉丁文字上得分 82.1,证明其优势不仅限于规整 PDF 或常见拉丁文字。

参数分布的差异揭示了成功的关键。MonkeyOCRv2-B 由 0.1B 视觉编码器和 0.6B 语言模型组成,而 dots.mocr 则包含约 1.2B 视觉编码器和 1.8B 语言模型。前者总参数不足后者的四分之一,视觉编码器更是仅为对方的十一分之一。

这并非简单的“剪枝”,而是对模型分工的重构:视觉端负责提供干净、完整的页面证据,语言端不再承担大量补字、猜字和修复结构的冗余工作。参数的价值不在于总额大小,而在于配置效率。

在 MDPBench 论文对比中,0.6B 和 0.7B 的 MonkeyOCRv2 占据开源结果前两名。

核心理念:重建即视觉记忆

文档识别与自然图像识别存在本质差异。自然图像模型需忽略不影响语义的变化(如姿态、遮挡),而文档识别对细节极度敏感:“王”与“玉”差之一点,“o”与"0"形似意异,公式横线、上标或表格边界的微小差异都可能直接改变答案。

案例显示,信息图上实际写着"700,000",多种通用视觉编码器却误读为"100,000"。一旦关键数字在视觉入口处丢失,后端大语言模型再强大也无法基于错误信息进行推理。

页面上真实写着"700,000",多种通用视觉编码器却把关键数字读成"100,000"。

为此,MonkeyOCRv2 采用两种互补的预训练目标:图像到文本生成让模型学习“页面写了什么”,像素级文档重建则强制视觉 Token 保留足以恢复字符笔画、公式符号和版面结构的信息。重建训练的目的并非输出图片,而是通过约束机制,确保小型视觉编码器在压缩页面时不丢失决定答案的关键细节。

模型可以更小,但不能将小数点、笔画和阅读顺序一并“瘦身”掉。

数据基石:亿级文档库与全开源策略

小型视觉编码器承担重任的底气源于高质量数据。团队构建的 MonkeyDoc v2 包含 1.13 亿张文档图像,覆盖 17 种语言。其中 800 万张为完整页面,用于训练版面理解和跨区域关系;1.05 亿个为细粒度元素(文字、表格、公式等),提供密集监督。数据来源涵盖真实世界文档(6100 万)与合成样本(5200 万),包括论文、财报、手写笔记及多语言复杂版式。

MonkeyDoc v2 由 800 万张完整页面和 1.05 亿个细粒度元素组成,覆盖 17 种语言。

17 种语言对应不同字体、阅读方向和真实文档形态,而非同一种模板的多语言翻译。

团队罕见地开源了这套亿级文档图像数据。以往许多模型仅公开权重和代码,私有数据成为黑盒,导致社区难以复现或判断性能提升的真实来源。MonkeyOCRv2 开放了独立视觉编码器、解析模型、训练推理代码及 MonkeyDoc v2 数据,均采用 Apache License 2.0 协议。这不仅降低了部署成本,更为社区提供了公平的起跑线,推动领域从“比拼私有资源”转向“比拼架构设计与训练策略”。

泛化能力:单一底座赋能多类任务

小模型的价值不仅体现在单项榜单。测试显示,将 MonkeyOCRv2 的视觉编码器迁移至文字识别、公式识别、文档篡改检测、重叠文字分割等七类不同任务中,均带来显著性能提升。

在传统文字识别任务中,CRNN 综合结果从 58.7 提升至 67.3;即使在接近饱和的基准上,PARSeq 也提升了 0.4 个百分点。在公式识别任务中,仅 110M 参数的 UniMERNet-T 替换编码器后,精确匹配率超越了 325M 参数的 UniMERNet-B。此外,在文字检测、篡改检测和分割任务上分别提升了 3.3、7.5 和 5.3 个百分点。这证明该视觉底座学到的是一套通用的文档视觉表示,而非特定解码器的技巧。

同一 MonkeyOCRv2 编码器迁移到七类文档任务,均带来绝对性能提升。

未来展望:效率与忠实性的平衡

随着 DeepSeek-OCR 等研究将效率衡量单位从“参数量”推进到“视觉 Token 数量”,行业开始关注一页文档能被压缩得多小。然而,压缩后的核心问题在于:Token 究竟保留了什么?如果关键细节在压缩中消失,后端的推理便成了无源之水。

MonkeyOCRv2 提出的“重建即视觉记忆”给出了答案:视觉 Token 数量衡量压缩效率,而重建能力检验压缩后的信息保真度。压缩解决效率问题,视觉记忆决定忠实性。

从 3B 到 0.7B 的演进,实质是不断重新划分模块职责的过程。下一代文档 OCR 的竞争核心,将不再是单纯的参数规模或 Token 数量,而是“能力密度”:让视觉端提供更可靠的证据,让语言端专注于理解而非猜测。0.7B 反超 3B 的启示在于:如果错误能在视觉入口处避免,就不应留待后端用更大的模型去补救。大模型让 AI 更会思考,而小模型时代要求它先少忘一点。

“重建即视觉记忆”,或许才是 MonkeyOCRv2 留下的、比一次榜单第一更长久的命题。

GitHub:https://github.com/Yuliang-Liu/MonkeyOCRv2
论文:https://arxiv.org/abs/2607.11562
数据:https://modelscope.cn/datasets/zenosai/MonkeyDocv2

【声明】内容源于网络
0
0
量子位
各类跨境出海行业相关资讯
内容 16308
粉丝 1
量子位 各类跨境出海行业相关资讯
总阅读343.4k
粉丝1
内容16.3k