MonkeyOCRv2:面向文档智能的视觉-文本基础模型 MonkeyOCRv2: A Visual-Text Foundation Model for Document AI
面向文档智能的视觉文本基础模型,联合文本生成与像素重建,七大文档任务全面领先
前置知识
视觉编码器预训练 (Visual Encoder Pretraining)
指在大规模图像数据上自监督或弱监督训练一个 Vision Transformer(如 ViT、CLIP、DINO、SAM),使其学到可迁移到多种下游任务的通用视觉表征;下游任务只需替换或微调该编码器即可受益。主流模型多在自然图像(ImageNet、LAION、SA-1B)上训练。
本文的出发点正是现有通用编码器不适配文档,理解预训练范式才能理解为什么要重新设计文档专用目标。
图像到文本生成 (Image-to-Text Generation)
一个解码器接收视觉 token 序列,结合任务提示自回归地逐 token 预测图像对应的文字(如 OCR 文本、LaTeX、结构化输出),用交叉熵损失训练,本质是把视觉表示与文本内容对齐,提供稠密监督。
这是 MonkeyOCRv2 双目标之一,理解它才能看出仅靠文本生成会让编码器学语义捷径的问题。
像素级重建 (Pixel-level Reconstruction)
借鉴 MAE 思想,让视觉解码器从编码器输出的 token 重建原始输入图像,本文用均方误差损失 $\mathcal{L}_{pix}=\frac{1}{3HW}\|\hat{I}-I\|_2$,迫使编码器把笔画、字形、版式等细粒度信息编码进 token,而非丢弃。
本文核心创新,理解它才能理解为何重建能对抗语言先验、提升纯视觉感知。
文档解析 vs 文档理解 (Document Parsing vs Understanding)
文档解析把文档图像系统性转换为结构化信息(坐标、类别、阅读顺序、文本/公式/表格内容,常输出 Markdown 或 JSON);文档理解则是针对文档图像的视觉问答(VQA),回答关于内容的问题。两者是文档智能两大高级任务。
本文最重要的两个下游应用,冻结编码器加 LLM 的范式在这里得到验证。
语言先验依赖 (Linguistic Context Dependence)
当视觉信号模糊时,解码器可利用语言上下文(词频、语法、常识)猜出正确字符,获得高准确率却并未真正看清笔画;这会导致模型在文字被人为打乱或与语义冲突时产生幻觉。本文用 scrambled-text 实验量化这种依赖。
理解它才能看懂 Figure 5 与 CHAOS-Bench 实验,以及重建目标为何能缩小语义-打乱差距。
研究动机
主流视觉基础模型(如 CLIP、SAM、DINO、DINOv2/v3)几乎都在自然图像上预训练,其数据分布与预训练目标与文档场景严重错配。自然图像理解侧重高层语义(物体类别、场景上下文),且对姿态、纹理、背景等局部变化保持不变性;而文档图像的核心语义高度依赖局部视觉细节——字符笔画、字形结构、标点、小数点、上下标的细微差异都会导致完全不同的含义。更具体地,ImageNet 分类预训练鼓励模型忽略局部变化;CLIP/SigLIP 强调图文全局语义对齐;DINO 通过跨视角一致性学习稳定语义特征;SAM 聚焦区域边界与可分割物体,这些目标都优先高层语义而非字符级细节。此外,现有文档导向预训练数据集也存在短板:oCLIP 主要由场景文字图像构成,DiG 被小规模场景文字识别数据主导,DiT 背后的 IIT-CDIP 缺乏细粒度文本标注且文档类型单一,且大多只覆盖中英文,多语言支持有限。CLIP、SigLIP、DINOv2 的训练数据更是不公开,难以扩展。这导致文档解析、文档理解等任务在使用这些通用编码器时表现受限。
本文的目标是本文目标是构建一个真正面向文档智能的视觉基础模型,使编码器在预训练阶段就能学习到字符级的视觉保真度,而不是全局语义抽象。具体地,作者希望:(1)构建迄今最大规模的文档视觉-文本预训练语料 MonkeyDoc v2,覆盖 17 种语言、1.13 亿张图像,涵盖印刷论文、扫描书籍、手写笔记、报纸、杂志、财报、渲染文档等多种类型;(2)设计一种文档专用的预训练策略,把图像到文本生成与像素级文档重建联合起来——前者对齐视觉表示与文本内容、提供稠密监督,后者强制编码器保留字符笔画、字形与版式等细粒度证据;(3)验证该编码器作为通用骨架的迁移能力:既能直接替换现有系统的视觉编码器在五大文档分析任务上稳定提升,也能冻结后与轻量 LLM 组合,在更具挑战性的文档解析与文档理解任务上达到开源 SOTA。总体目标是证明文档专用视觉预训练本身就能成为文档智能的基础,而非只能由自然图像编码器来服务。
与已有工作不同的是,本文的独特切入角度在于表征错配(representation mismatch)这一论断的实证化。以往工作要么聚焦自然图像通用表征(CLIP/DINO/SAM),要么针对文档的某一狭窄切片(oCLIP 做文本检测、DiT 做文档分类、Donut/Nougat 做端到端 OCR-free 生成),缺乏一个通用、多语言、可作为骨架替换的文档编码器。本文三点区别于以往:(1)从零预训练一个独立的编码器,并在七类文档任务上统一地以骨架替换(backbone substitution)方式评测,而非端到端 VLM;(2)不同于纯生成式预训练,在目标中加入像素级重建项,专门保留局部视觉证据,并通过受控的 scrambled-text 实验证明:重建项在语言上下文缺失时能把精度差距几乎减半;(3)用 1.13 亿、17 语言的 MonkeyDoc v2 把文档预训练扩展到前所未有的规模与多样性。这一组合(数据规模加双目标加骨架替换评测)在文献中尚属首次,为文本作为一等视觉模态提供了可复用的基础设施。
核心方法
整体思路是双目标预训练一个独立编码器。文档智能需要两类能力:把视觉内容正确读成文字(语义对齐),以及不丢掉笔画、字形、版式等局部细节(视觉保真)。作者用视觉编码器 $E_v$ 提取视觉 token 序列 $z = E_v(I)$,再把这些 token 分别送往两个解码器:视觉解码器 $D_v$ 从 token 重建原图 $\hat{I} = D_v(z)$,文本解码器 $D_t$ 结合任务提示自回归预测图中文字。两目标联合优化,总损失 $\mathcal{L}_{pretrain} = \mathcal{L}_{text} + \lambda \mathcal{L}_{rec}$。文本生成提供稠密直接监督,像素重建则鼓励编码器保留那些在纯文本监督下可能被丢弃的细粒度视觉证据,二者互补。作者在 ViT-Small/Base 与 ViTAEv2-Small 三个骨干上用同一目标、同一语料训练,得到 MonkeyOCRv2-S(28M)、-B(113M)、-AS(21M)三变体,下游按需加载。预训练阶段的视觉/文本解码器在下游全部丢弃,只迁移编码器。
核心创新是文本生成加像素级重建这一互补监督组合,其本质区别于已有方法。现有文档/视觉预训练要么只做生成(OpenVision 2、Donut、Nougat 的 image-to-text),要么只做对比或掩码自监督(DiG 的对比加 MIM、DiT 的 MIM、CLIP 的对齐),都没有显式要求编码器同时保留字符级视觉细节。本文的关键洞察是:纯文本监督会诱导编码器学习语义捷径——当语言上下文可用时,解码器可以靠语言先验猜出视觉模糊的字符,从而让编码器不必精确编码笔画。像素重建项正是为了对抗这种捷径:要重建出正确的笔画和字形,编码器就必须把细粒度视觉信息编码进 token。作者用 scrambled-text 受控实验给出有力证据——在分辨率降到 448 时,加重建使打乱文本识别从 55.4% 升到 72.1%,语义-打乱精度差距从 29.3% 缩到 15.3%。这把视觉感知与语言先验依赖区分开来,是本文区别于所有生成式或对齐式预训练的根本所在。
方法步骤详情
流程分四步。(1)数据:MonkeyDoc v2 共 1.13 亿样本、17 语言、真实与合成各半,经多专家一致性标注、多语料合成渲染(含 0.8M 公式)与白块遮挡加 LLM 校验的三重过滤构建。(2)预训练:输入图过编码器 $E_v$ 得 token $z$,同时送视觉解码器做 MSE 重建 $\mathcal{L}_{pix}$ 与文本解码器做自回归交叉熵 $\mathcal{L}_{text}$,总损失 $\mathcal{L}_{pretrain}=\mathcal{L}_{text}+\lambda\mathcal{L}_{rec}$;可选结构感知变体加边缘图与截断距离图匹配损失,默认只用 MSE。64 块 A800,学习率 $1\times10^{-3}$,批 256,patch 14/16,动态分辨率。(3)下游:五类分析任务只迁移编码器按原协议微调;解析/理解冻结编码器经 MLP 接 Qwen3-0.6B/1.7B 两阶段训练以隔离编码器贡献,解析先预测元素坐标与阅读顺序再裁剪并行识别。下游 benchmark 官方验证/测试集均未参与预训练或调参。
技术新颖性
技术新颖性体现在三方面。第一,目标设计:首次把像素级文档重建与文本生成显式组合为文档编码器的预训练目标,并用受控 scrambled-text 实验把视觉感知能力可量化地与语言先验依赖分离——这是对文档预训练到底学到了什么的诊断性贡献,而非仅报告 SOTA 数字。第二,数据规模与多样性:MonkeyDoc v2 的 1.13 亿样本、17 语言、8 种以上文档类型(论文/书籍/手写/报纸/杂志/财报/渲染/幻灯片等)在文档预训练语料中前所未有(DiG 35.6M 单语言、DiT 42M、Donut 13M、Pix2Struct 80M 单语言网页截图),且真实加合成均衡。第三,评测范式:以骨架替换在七类跨度极大的任务(识别/检测/分割/篡改/解析/理解)上统一评测一个独立编码器,而非端到端 VLM;并在文档理解上做严格控制(同一 Qwen3-1.7B、同一数据、同一优化,只换编码器)做归因。这套组合使论文能下出文档专用预训练可作为文档智能基础本身这一更宽泛的结论。此外,结构感知重建用 Sobel 梯度加迭代 min-pooling 近似截断距离图来强化笔画建模,是工程上的小创新。
实验结果
实验在七类文档任务上系统验证。骨架替换层面,把现有系统的视觉编码器换成 MonkeyOCRv2 在五大分析任务全面提升:弱基线 CRNN 文本识别整体精度从 58.7% 跃升至 67.3%,强基线 PARSeq 在 Union14M 超此前 SOTA SVTRv2;公式识别上仅 110M 参数反超 325M 的 UniMERNet-B;文本检测、文档篡改检测(Test F1 +11.3 达 93.3)、重叠文字分割亦稳定增益且优于专用 oCLIP。最具说服力的是两个高级任务:冻结 0.1B 编码器加 0.6B LLM 构建的 0.7B 解析模型在 17 语言 MDPBench 达 83.3 开源 SOTA,超 3B 的 dots.mocr 2.8%、编码器小约 11 倍;在严格受控的文档理解对比中(同一 Qwen3-1.7B、同数据),MonkeyOCRv2-B 八基准平均 57.2,超次优 OpenVision-B 13.2,远超 SAM/SigLIP2/DINOv3。消融显示 MSE 重建 +1.0、结构感知再 +4.2,CHAOS-Bench 忠实度 17.9 居首。
查看结构化数据
| 任务 | 指标 | 本文 | 基线 | 提升 |
|---|---|---|---|---|
| 文本识别(CRNN, Union14M-Benchmark Overall) | 平均准确率 (%) | 67.3 | 58.7 (CRNN-ResNet) | +8.6 |
| 文本识别(PARSeq, Union14M-Benchmark Overall) | 平均准确率 (%) | 87.6 | 86.1 (SVTRv2, 此前 SOTA) | +1.5 |
| 公式识别(UniMERNet-T, OmniDocBench 1.6 ExpRate) | ExpRate (%) | 90.8 | 89.9 (UniMERNet-T-Swin) | +0.9 (110M 反超 325M UniMERNet-B 89.5) |
| 文本检测(DBNet, ICDAR2015) | F-measure | 88.5 | 85.0 (ImageNet 预训练) | +3.5,且超 oCLIP +1.1 |
| 文档篡改检测(FFDN, DocTamper-Test) | F1 (%) | 93.3 | 82.0 (FFDN-ViTAEv2) | +11.3 |
| 重叠文字分割(MOTS, MOT 数据集) | mIoUText (%) | 76.9 | 72.6 (MOTS-ResNet) | +4.3 |
| 文档解析(MDPBench Total, 17 语言) | Overall (%) | 83.3 (MonkeyOCRv2-B-Parsing, 0.7B) | 80.5 (dots.mocr, 3B) | +2.8,视觉编码器小约 11 倍 |
| 文档理解(8 个 VQA 基准平均,同 Qwen3-1.7B) | Overall | 57.2 (MonkeyOCRv2-B) | 44.0 (OpenVision-B) | +13.2 |
| 文档幻觉忠实度(CHAOS-Bench) | page-average Recall | 17.9 (MonkeyOCRv2-B-Parsing) | 14.2 (HunyuanOCR-1.5) | +3.7 |
局限与改进
作者承认四点局限。(1)解析采用最小化监督微调加冻结编码器,未用领先专用解析器的渐进式 post-training,在已饱和的 OmniDocBench 上落后于 GLM-OCR/MinerU2.5-pro/PaddleOCR-VL-1.6/HunyuanOCR-1.5,尽管在更具区分度的 MDPBench 上达开源 SOTA。(2)解析架构自回归预测布局、每个元素单独识别一遍,偏重精度与结构保真而非推理速度,对延迟敏感部署不利。(3)证明了重建目标改善细粒度感知,但尚未隔离解码器设计、重建权重调度各自的贡献,留待未来。(4)虽覆盖 17 语言,仍偏向高资源文字,低资源与历史书写系统的均衡监督是重要方向。我的额外观察:scrambled-text 指标只是操作性代理,字符打乱会引入分布偏移并与 tokenization/解码交互,不能完全等同于幻觉度量;OmniDocBench 上落后也说明在通用文档解析这种系统级比拼中,编码器优势会被训练数据、布局模块、后处理等稀释,编码器本身的红利有上限。
独立分析的弱点
独立分析弱点。(1)解析速度:自回归布局加逐元素识别两遍前向,在长文档上延迟与显存开销大,改进方向是引入并行布局阶段或一次性整页识别(如 GOT 式 patch-level 解码)。(2)受控对比中编码器各自用 native 输入分辨率/patch/token 数(见 App. D),并未完全等价比较,可能高估或低估个别编码器;改进方向是统一分辨率与 token 预算后再比。(3)scrambled-text 实验虽具诊断价值,但打乱引入 OOD 分布,gap 不能等同于幻觉率,且仅在解析流水线上度量;改进方向是设计更纯净的视觉与语言解耦探针(如字符级掩码、可控模糊)。(4)OmniDocBench 落后说明编码器红利有天花板,下游系统级差异(数据、post-training、布局模块)仍主导;改进方向是放开编码器微调或加入布局/表格专用监督。(5)低资源语言覆盖不均,历史/罕见字形仍弱;改进方向是均衡采样与字形集增强。(6)结构感知重建只用于文档理解,未在所有任务系统消融,其与任务特性的交互不清;改进方向是全任务网格搜索。
未来方向
作者明确提出的方向:系统研究解码器设计与重建权重调度的单独贡献;把均衡监督扩展到低资源与历史书写系统;为延迟部署设计更并行的布局阶段。基于成果可延伸的方向:(1)把双目标预训练迁移到更多文档模态,如表格结构识别、版式分析、数学公式渲染 LaTeX 的端到端统一建模;(2)探索更大规模编码器(ViT-Large/Giant)与 MonkeyDoc v2 的 scaling law,验证收益是否随规模持续;(3)把像素重建对抗语言捷径的思路推广到通用 VLM,缓解多模态幻觉;(4)结合 CHAOS-Bench 式忠实度评测,把视觉证据忠实度作为预训练/对齐的一等奖励信号;(5)开源后社区可基于此编码器构建专用下游(票据、医疗病历、古籍),形成文档智能生态;(6)与 layout-aware 位置编码、动态分辨率策略协同,进一步提升多语言右-左排版(如阿拉伯)与竖排(如日文古籍)的鲁棒性。
复现评估
复现评估较好。代码与数据承诺开源(github.com/Yuliang-Liu/MonkeyOCRv2),标注管线在仓库完整列出。数据来源透明:真实数据来自 FinePDFs、MonkeyDoc、Union14M、UniMER-1M、DocLayNet、M6Doc 等公开数据集官方训练集,合成数据来自公开 LLM 语料、Unicode 字符集、arXiv 公式,真实 54% 加合成 46% 配比清晰。关键超参全公开:64 块 A800、学习率 $1\times10^{-3}$、批 256、patch 14/16、$\lambda=1.0$、$\alpha=0.5$、$\beta=0.25$、$T=16$、$\tau=0.08$;解析两阶段学习率 $2\times10^{-4}$ 与 $2\times10^{-5}$、序列长度 16384、1280 token 上限。主要门槛是算力:64 块 A800 对普通研究组较重;专家标注依赖多个 OCR 模型可能引入偏差;一致性阈值等过滤细节需进一步披露才能完全复刻数据集。整体属可复现但需较大算力级别,下游受控对比实验设计严谨、可复用性强。
论文图表
左侧自然图像(车、人、路)强调语义类别与物体几何,右侧文档图像(论文、发票、公式、手写、古文)需要字符笔画、字形细节、版式、阅读顺序与细粒度文本;中间指出两类需求之间的分布鸿沟与任务鸿沟,现有视觉基础模型(ImageNet/CLIP/DINO/SAM)学的是物体语义、全局对齐、语义特征、区域边界,而 MonkeyOCRv2 通过文本生成加像素重建产出文档原生视觉表征,迁移到文本/公式识别、检测、解析、VQA 等任务。
一图建立全文核心论点——表征错配与本文的双目标解法,是理解 motivation 的钥匙。