← 返回 2026-08-18

TeleOCR:贯通数字文档与相机拍摄文档的统一文档解析框架 NaviDC-OCR: Navigating Document Parsing Across Digital and Camera-Captured Documents

Peng Cai, Zhaofan Zou, Shifa Liu, Yikun Wang, Jiawei Tang, Kaicheng Yang, Meng Tong, Zhongjiang He, Hao Sun 📅 2026-08-13 👍 5 2026-08-23 18:30
OCR 公式识别 形变矫正 文档解析 表格结构识别 视觉语言模型

以形变感知学习与内容-结构解耦训练,让1.2B参数VLM统一高精度解析数字与拍摄文档

前置知识

VLM(视觉语言模型)

VLM 是同时接收图像与文本输入的自回归生成模型,典型结构为视觉编码器(如 Qwen2.5-VL 的 ViT)+ 投影对齐层(MLP)+ 语言模型。图像被切成 patch 并压缩为视觉 token 序列,与文本 token 拼接后送入语言模型,统一以『下一个 token 预测』的方式完成识别、描述、定位等任务。

TeleOCR 整体就是一个 1.2B 参数的 VLM(Qwen2.5-VL 视觉编码器 + Qwen3-0.6B 语言模型 + MLP Aligner),文中所有训练策略都是围绕这个 VLM 展开的。

解耦式 vs 端到端文档解析

文档解析的两种 VLM 范式:解耦式采用『先布局分析、后内容解析』两阶段流水线(如 PaddleOCR-VL、MinerU2.5、Dolphin),可控性强、高分辨率数字文档表现出色,但布局错误会级联传播;端到端方法(如 OvisOCR、DeepSeek-OCR)直接从整页图像生成 Markdown,避免误差累积,但高分辨率下计算开销大、易幻觉。

论文的问题定义就建立在这两者的互补缺陷上:TeleOCR 选择解耦范式并针对性修复其对几何畸变的脆弱性。

Dewarping(文档去弯曲)

相机拍摄平面文档时会产生弯曲、褶皱、透视等几何畸变。Dewarping 模型(如 DDCP、DocGeoNet、ForCenNet)预测后向映射场,把畸变图像重采样回平整矩形。传统做法中它是独立的预处理模块,专用模型需预测数万个控制点(ForCenNet 用 82,944 个)来稠密描述形变场。

本文的核心创新恰是把 dewarping 能力内化到 VLM 中:仅需 1024 个下采样控制点加区域边界点序列即完成形变建模,理解这条对照线才能读懂其贡献。

OTSL(优化表格结构语言)

一种紧凑的表格结构描述 token 序列,用 (单元格)、(换行)等少量 token 表达表格拓扑与单元格合并关系,相比 HTML 大幅缩短序列长度且无歧义。Lysak 等人 2023 年提出,已成为表格识别的结构表示标准之一,可无损转换为 HTML。

TeleOCR 的表格解析与科学图表转表格都以 OTSL 为输出格式;内容-结构解耦学习正是通过『只保留 OTSL 结构 token、剥离单元格内容』实现的。

TEDS 与 CDM 评测指标

TEDS(Tree Edit Distance based Similarity)把表格预测与真值解析为树结构,用树编辑距离衡量相似度,范围 0-1;TEDS-S 是只比结构不比内容的变体。CDM(Character Detection Metric)针对 LaTeX 公式,把预测与真值渲染后做字符级检测匹配,衡量公式还原度。文本则用归一化编辑距离 NED。

论文所有核心数字(Overall 96.87/88.53 等)都由这三个指标加权而来,GRPO 强化学习的奖励函数也直接复用它们作为可验证奖励。

GRPO(组相对策略优化)

DeepSeek 提出的强化学习算法:对同一提示采样一组回答,以组内相对优势(回答奖励减去组均值)作为策略梯度信号,省去独立的价值网络。适合奖励可程序化验证的任务(数学、代码),近年来被广泛用于给大模型做任务级对齐。

TeleOCR 的 Stage 4 用 GRPO 做强化学习,奖励函数直接采用 $1-\text{NED}$(文本)、TEDS(表格)、CDM(公式),是 SFT 之后进一步提升解析质量的关键一步。

Douglas–Peucker 算法与曲率

DP 算法是经典的折线简化方法:递归选择偏离误差最大的点作为节点,在给定误差阈值下用最少的点逼近原始曲线。对光滑曲线其距离近似满足 $d \approx \kappa L^2/8$($\kappa$ 为局部曲率、$L$ 为区域尺度)。曲率描述曲线的局部弯曲程度,折痕、尖角处曲率显著偏高。

论文的 CGDP 采样把 DP 距离与曲率结合成打分 $S_i = d_i(1+\lambda\hat{\kappa}_i)$,理解 DP 与曲率的分工(整体形变 vs 局部折痕)是掌握其区域级形变表示的前提。

研究动机

文档解析是把非结构化文档图像转成 Markdown 等机器可读表示的基础任务,直接决定模型训练数据管线与 RAG 系统的质量。现有 VLM 方法分两大阵营,各有明确痛点。解耦式方法(PaddleOCR-VL、MinerU2.5、GLM-OCR 等)采用『先布局分析、后内容解析』的两阶段范式,在高分辨率数字文档上表现出色,但严重依赖布局检测的准确性——其布局模块假设区域是规则矩形,一旦文档弯曲或折叠,该假设失效,误差会级联传播到后续所有解析模块。作者做了一个关键验证实验:对 Wild-OmniDocBench 中的真实拍摄样本先用文档去弯曲模型做预处理,发现仅消除几何畸变一项就能大幅提升两阶段解析性能,说明几何形变正是数字文档与拍摄文档之间的核心鸿沟。另一边,端到端方法(OvisOCR、DeepSeek-OCR、HunyuanOCR 等)虽摆脱了显式布局检测,对几何畸变更鲁棒,但在高分辨率场景下计算开销大,且存在冗余生成、幻觉与结构推理不足的问题。此外,先前研究(Zhong et al. 2025)指出文档中表格、公式等高结构化内容占比越高,生成预测熵越大:OCR 本质是稳定的字符到文本映射,而表格解析、科学图表转表格需要同时完成视觉理解、结构建模与跨模态转换,结构推理与内容生成耦合在同一个自回归过程里,学习与优化难度显著增加。

本文的目标是本文目标是构建统一文档解析框架 TeleOCR(约 1.2B 参数),同时高质量处理两类文档:布局规整的数字文档(PDF 渲染、扫描件)和存在弯曲、褶皱、透视畸变、阴影模糊等退化的相机拍摄文档,且无需为拍摄文档单独部署去弯曲预处理模块。目标可拆成三个子目标:其一,把几何矫正能力内化进 VLM,让模型直接在畸变图像上完成布局与内容解析,并用更灵活的边界点序列取代规则矩形框,提升复杂布局的细粒度建模能力;其二,针对表格、公式、科学图表等高结构化任务,降低结构推理与内容生成之间的优化耦合,显式建模公式语法与表格拓扑作为中间推理过程;其三,在不依赖大规模人工标注的前提下,通过自动化数据工程获得覆盖文本、布局、表格、公式等多样元素的高质量训练数据。最终在 OmniDocBench v1.6、Wild-OmniDocBench、PureDocBench 三个公开基准上分别取得 96.87、88.53、78.41 的总分,并在 ICDAR 2026 Sci-ImageMiner 挑战赛科学图表转表格任务中夺冠,以此验证框架的有效性与泛化能力。

与已有工作不同的是,本文的独特切入角度有三点。第一,对『形变』的处理路径不同于传统研究:以往 Dewarping 工作(DDCP、DocGeoNet、RDGR、ForCenNet)都把几何矫正做成独立预处理模块,用 CNN 显式建模稠密后向映射场(ForCenNet 需要 82,944 个控制点);TeleOCR 则把矫正变成 VLM 的内部联合建模能力,用全局点级(1,024 个控制点)与区域级(边界点序列)两类形变感知监督直接在解析模型中学习几何模式,表示复杂度降低约 80 倍。第二,对布局的表示方式不同:主流两阶段框架假设布局区域为规则矩形,TeleOCR 把布局检测重新表述为 VLM 序列预测任务,用曲率引导的自适应采样点集描述弯曲区域的任意形状边界——数字文档输出矩形框、拍摄文档输出多边形,统一在同一个模型接口下。第三,对结构化生成的处理不同:端到端方法让模型一次性自回归生成含内容的表格 HTML 或公式 LaTeX,而 TeleOCR 提出『内容-结构解耦学习』,让模型先显式预测 OTSL 结构骨架或公式语法模板,再基于结构填充内容,把高熵的结构决策从内容生成中剥离。数据层面,多节点共识投票用异构模型交叉共识替代单模型伪标签,也是对 MinerU2.5-Pro 多模型融合与 PaddleOCR-VL-1.5 同模型推理一致性筛选的直接推广与改进。

核心方法

TeleOCR 是一个约 1.2B 参数的解耦式 VLM:视觉编码器继承自 Qwen2.5-VL,语言模型采用 Qwen3-0.6B,中间是从头训练的 MLP Aligner。整体思路可概括为『数据引擎 + 渐进训练』两条腿。直觉上:拍摄文档与数字文档的本质差异是几何形变,只要让模型『看得懂』形变模式、用点序列『画得出』弯曲边界,一套模型就能通吃两类文档;表格公式之所以难,是结构预测与内容转写耦合,把结构作为显式中间推理步骤即可降低学习难度。技术路线分四步走。第一步是数据工程:先用多节点共识投票(MCV)从多个异构大模型的预测中筛选高置信伪标签;再基于 ForCenNet 的形变生成策略与 Doc3D 映射场合成带畸变的训练样本,构造区域级边界点与全局控制点两类形变监督;最后训练 Self-Judgement VLM 把预测渲染回图像做图-图一致性校验,自动过滤与纠错。第二步是四阶段渐进训练:Stage 1 视觉-语言对齐预训练建立基础 OCR 与布局理解,Stage 2 形变感知训练注入几何感知能力,Stage 3 内容-结构解耦学习统一建模表格、公式等结构化元素,Stage 4 基于 GRPO 的强化学习对齐任务级指标。第三步是推理接口:所有 8 类任务(数字布局检测、拍摄布局分割、文本、公式、表格、代码块、科学图表、印章)共享统一 prompt 格式( + 指令),输出分别是矩形框布局、多边形边界布局、纯文本、LaTeX、OTSL 序列、Markdown 代码等结构化表示。

核心创新有两个。第一是『形变感知的布局分割范式』:不依赖 dewarping 预处理模块,也不用矩形检测框,而是让 VLM 直接输出弯曲区域的任意多边形边界点序列。监督信号通过前向映射 $FM$ 同时扭曲无畸变图像、CGDP 采样的区域边界点和全局控制点来合成。采样算法上提出曲率引导 Douglas–Peucker(CGDP):作者观察到文档形变分两类——bending 是大尺度连续弯曲,DP 距离 $d \approx \kappa L^2/8$(由局部曲率 $\kappa$ 与区域尺度 $L$ 共同决定)即可刻画;creasing 是局部方向不连续的折痕,空间范围小、DP 误差不大但结构上极其关键。因此给每个候选点的 DP 距离乘以曲率调制因子,打分 $S_i = d_i(1 + \lambda \hat{\kappa}_i)$($\hat{\kappa}_i$ 为归一化局部曲率),曲率低时退化为标准 DP,曲率高时折痕与尖角获得更高采样优先级,在有限点数预算下兼顾整体轮廓与局部细节。第二是『内容-结构解耦学习』:训练时把表格 OTSL 序列中的单元格内容全部剥离、只留结构 token,公式则构建语法 token 库并通过正则匹配与语法验证自动抽取语法骨架,让模型先学『表格长什么样、公式语法怎么走』再学内容填充;推理时模型在 标签中先输出结构再生成完整内容。这与端到端方法一次性混合生成的本质区别,在于把高预测熵的结构决策变成了显式的中间推理过程,显著降低了优化耦合与生成不确定性。

方法步骤详情

完整流程分数据工程与四阶段训练。数据工程三步:(1)MCV:$N$ 个异构模型对同一样本预测得 $Y(x)=\{y_1,\dots,y_N\}$,按任务定义一致性函数 $S(y_i,y_j)$(布局用 IoU、文本用编辑相似度、表格用 TEDS、公式用 CDM),共识分 $C_i = \frac{1}{N-1}\sum_{j \neq i} S(y_i, y_j)$,取分数最高者为伪标签,超过阈值 $\tau$ 才入库,否则转自动校正或人工核查。(2)形变合成:从 Doc3D 后向映射 $BM$ 推导前向映射 $FM$,作用于无畸变图像、CGDP 采样的边界点 $R$ 与 $M \times M$ 控制点 $P$,得到畸变样本及标签 $R^w$、$P^w$。(3)Self-Judgement VLM:把布局、文本、表格、公式四类预测渲染成图像,用规则扰动与 LLM 引导扰动合成错误版本,构成『原图-正确渲染』正对与『原图-错误渲染』负对,SFT Qwen2.5-VL-7B 得到判别器 $J_\theta$,按检查标准逐项分析 $r_k = M(I(x), \hat{I}_y, e_k)$ 后裁决一致性。训练四阶段:Stage 1 视觉-语言对齐预训练,仅训 Patch Merger 两层 MLP 与视觉编码器(学习率 $1\times10^{-3}$ 与 $1\times10^{-4}$,LM 冻结,batch 256);Stage 2 形变感知全参数微调,数据含 4M 数字布局样本、2M 合成拍摄样本(1.2M 区域级 + 0.8M 点级)与 120K 相机风格增强样本(LM lr $1\times10^{-5}$、视觉编码器 $1\times10^{-6}$,batch 128);Stage 3 内容-结构解耦学习;Stage 4 GRPO 强化学习,奖励为文本 $1-\text{NED}$、表格 TEDS、公式 CDM,归一化到 $[0,1]$。

技术新颖性

技术新颖性可以从五个对比维度看清。(1)对比专用 Dewarping 模型:DDCP、DocGeoNet、ForCenNet 依赖 CNN 显式几何建模并输出稠密后向映射场(ForCenNet 用 82,944 个控制点),TeleOCR 把矫正变成 VLM 内部能力,仅用 1,024 个下采样控制点建模形变,表示复杂度降低约 80 倍,还省去独立预处理模块的部署成本。(2)对比 MLLM 分割方法:SAM 系方法(SAM4MLLM、SAM3)需外挂分割模型带来额外参数与开销;VistaLLM 等序列预测方法用梯度动态采样转化掩码;TeleOCR 针对文档场景设计 CGDP,用曲率-尺度联合度量 $S_i = d_i(1+\lambda\hat{\kappa}_i)$ 自适应分配采样点,专门解决折痕这类『DP 误差小但结构关键』的局部不连续问题。(3)对比伪标签构造:MinerU2.5-Pro 的多模型交叉验证与 PaddleOCR-VL-1.5 的多轮推理一致性最终都受限于单一模型的能力上限,一旦模型有系统性错误就会污染训练集;MCV 用异构模型间共识突破单模型偏置,并给出可计算的一致性分数与阈值机制。(4)对比伪标签校验:作者实测通用 VLM Qwen3-VL-235B 直接做零样本校验的召回率不足 40%,TeleOCR 把四种模态统一渲染成图像、把跨模态图文比对转化为更稳定的图-图一致性判断,并用规则+LLM 双通道扰动合成可控错误来训练专用 7B 判别器。(5)结构化解耦:把 OTSL 结构预测作为 中的中间推理,是对 OTSL 表示在 VLM 训练策略层面的新用法,直接成就了 Sci-ImageMiner 挑战赛的夺冠。

Overview of the TeleOCR data engineering pipeline.
Figure 2: Overview of the TeleOCR data engineering pipeline.
Overview of the key training strategies.
Figure 3: Overview of the key training strategies.
Case studies of synthetic data generation for Scientific Figure-to-Table.
Figure 6: Case studies of synthetic data generation for Scientific Figure-to-Table.

实验结果

核心结果分四块。(1)OmniDocBench v1.6(1,651 页、10 类文档、5 种语言):TeleOCR 总分 96.87 第一,超过 OvisOCR2(96.58)、PaddleOCR-VL-1.6(96.33)、MinerU2.5-Pro(95.75)与 Gemini 3 Pro(92.85);文本 Edit 0.027 最低、表格 TEDS 97.05 与 TEDS-S 98.52 最高、阅读顺序 Edit 0.122 最低,公式 CDM 96.36 略低于 OvisOCR2 的 97.53,作者归因于一阶段布局粒度与官方公式标注不一致。(2)Wild-OmniDocBench v1.5(真实拍摄):总分 88.53 第一,领先 OvisOCR2(87.91)、PaddleOCR-VL-1.6(87.36)、MinerU2.5-Pro(87.33),表格 TEDS 89.05 与 TEDS-S 92.14 均最高,验证形变感知学习在真实退化场景的价值。(3)PureDocBench 三轨道:Clean 86.90、Digital Degraded 77.47、Real Degraded 70.85,总均分 78.41 全面领先;Clean 轨道比最强竞品 OvisOCR2(82.14)高近 5 分,Real Degraded 仅 Gemini-3.1-Pro(71.98)略高,但 1.2B 模型效率占优。(4)ICDAR 2026 Sci-ImageMiner 科学图表转表格挑战赛:RMS 17.23、TEDS 66.39、加权 41.81 夺冠,TEDS 比第二名 VLMinators(64.31)高约 2 分,也超过 Qwen3-VL-8B 基线(57.86)。消融证据:对 Wild-OmniDocBench 仅施加 dewarping 预处理即可显著提升两阶段模型,证明形变是主要瓶颈;加入结构学习后 Sci-ImageMiner 的 TEDS 即达参赛队竞争水平,证明两条主线的独立贡献。

Performance comparison of document parsing methods on OmniDocBench v1.6 Full.
Table 1: Performance comparison of document parsing methods on OmniDocBench v1.6 Full.
Performance comparison of document parsing methods on Wild OmniDocBench v1.5 Full.
Table 2: Performance comparison of document parsing methods on Wild OmniDocBench v1.5 Full.
Comparison with existing document parsing models under clean and degraded scenarios.
Table 3: Comparison with existing document parsing models under clean and degraded scenarios.
Data Extraction performance comparison among the top-5 teams and the best baseline in the ICDAR 2026 Sci-ImageMiner Challenge.
Table 4: Data Extraction performance comparison among the top-5 teams and the best baseline in the ICDAR 2026 Sci-ImageMiner Challenge.
Markdown prediction files removed from TeleOCR for PureDocBench evaluation.
Table 5: Markdown prediction files removed from TeleOCR for PureDocBench evaluation.
Case study of Code Block Recognition.
Figure 4: Case study of Code Block Recognition.
Case studies of Scientific Figure-to-Table and Seal Recognition.
Figure 5: Case studies of Scientific Figure-to-Table and Seal Recognition.
Qualitative comparison of layout recognition on captured structured documents.
Figure 7: Qualitative comparison of layout recognition on captured structured documents.
Qualitative comparison of layout recognition on rotated and creased documents.
Figure 8: Qualitative comparison of layout recognition on rotated and creased documents.
Qualitative comparison of layout recognition on complex captured documents.
Figure 9: Qualitative comparison of layout recognition on complex captured documents.
Qualitative comparison of layout recognition on severely distorted tables.
Figure 10: Qualitative comparison of layout recognition on severely distorted tables.
Qualitative comparison on a distorted handwritten-note table.
Figure 11: Qualitative comparison on a distorted handwritten-note table.
Qualitative comparison on a small table embedded in a camera-captured newspaper page.
Figure 12: Qualitative comparison on a small table embedded in a camera-captured newspaper page.
Qualitative comparison on a dense financial ledger table.
Figure 13: Qualitative comparison on a dense financial ledger table.
Qualitative comparison on a low-resolution formula region with wrinkles and shadows.
Figure 14: Qualitative comparison on a low-resolution formula region with wrinkles and shadows.
Qualitative comparison on a severely rotated formula region.
Figure 15: Qualitative comparison on a severely rotated formula region.
Parsing evaluation on the DIR300 dataset.
Figure 16: Parsing evaluation on the DIR300 dataset.
Parsing evaluation on the DocUNet dataset.
Figure 17: Parsing evaluation on the DocUNet dataset.
查看结构化数据
任务指标本文基线提升
数字文档解析(OmniDocBench v1.6 Full) Overall 96.87 OvisOCR2 96.58 / PaddleOCR-VL-1.6 96.33 +0.29(较最强竞品)
拍摄文档解析(Wild-OmniDocBench v1.5 Full) Overall 88.53 OvisOCR2 87.91 / PaddleOCR-VL-1.6 87.36 +0.62 / +1.17
纯净文档解析(PureDocBench Clean) Overall 86.90 OvisOCR2 82.14 +4.76
真实退化文档解析(PureDocBench Real Degraded) Overall 70.85 OvisOCR2 66.61 / Gemini-3.1-Pro 71.98 +4.24(较同类型 VLM)
表格解析(OmniDocBench v1.6) Table TEDS 97.05(TEDS-S 98.52) OvisOCR2 / PaddleOCR-VL-1.6 94.76 +2.29
文本识别(OmniDocBench v1.6) Text Edit(越低越好) 0.027 OvisOCR2 0.025 基本持平(-0.002,次优)
公式识别(OmniDocBench v1.6) Formula CDM 96.36 OvisOCR2 97.53 -1.17(略低于最优)
科学图表转表格(ICDAR 2026 Sci-ImageMiner 挑战赛) TEDS / 加权总分 66.39 / 41.81(第一名) 第二名 VLMinators 64.31 / 40.80 +2.08 TEDS

局限与改进

作者承认的局限有三点。其一,PureDocBench 上模型在少数样本出现严重重复生成,作者移除了 6 个无效 Markdown 预测文件(clean 轨道 1 个、real_degraded 轨道 5 个)后再评分——虽然评测协议下缺失预测记零分、不影响公平性,但这暴露了模型在分布外退化文档上仍有生成崩溃风险。其二,公式 CDM 未达最优,错误主要来自第一阶段布局输出与 OmniDocBench 官方公式标注粒度不一致,说明细粒度布局建模仍有改进空间。其三,PureDocBench 被作者明确定性为『substantially more challenging』,总体分数(78.41)与数字基准(96.87)差距显著,退化场景远未解决。我自己的观察还有五点:MCV 依赖多个异构大模型的推理算力,工程成本高,且『共识即正确』只是假设——训练语料重叠可能导致多个模型犯相关错误;1,024 个控制点相对 82,944 点稠密形变场是粗粒度近似,对极局部褶皱的像素级矫正能力存疑(尽管边界点表示部分弥补);合成形变基于 Doc3D 映射场,与真实拍摄中光照、运动模糊、纸张材质的组合退化仍有域差距;解耦范式需要两阶段推理(全页布局分割 + 逐区域解析),其端到端延迟与吞吐在论文中完全未报告;所有对比统一采用 OmniDocBench 的 quick_match 协议(超时 1,200 秒及 fallback 参数),对其他方法是否完全公平难以独立核验。

独立分析的弱点

独立分析五个弱点,每个附改进方向。第一,重复生成崩溃:PureDocBench 上 6 个样本产生无效输出,说明内容-结构解耦与 GRPO 之后模型在长尾退化样本上的稳定性仍不足;可在 RL 阶段加入针对重复与退化的惩罚奖励(如 n-gram 重复率、长度异常检测),或在推理端引入回退解码与最大长度熔断策略。第二,MCV 的成本与盲区:$N$ 个异构大模型的共识投票在百万级样本上开销巨大,且共识高不代表正确,模型间可能共享系统性偏误;可用轻量代理模型初筛、只在分歧大的样本上唤起大模型投票,或把已有的 Self-Judgement 图-图一致性校验前置到投票环节降低成本。第三,两阶段推理延迟:解耦范式先全页布局分割再逐区域识别,密集页面(如金融台账)的区域数线性推高推理次数;可引入区域批处理与视觉特征缓存,或对简单数字文档自适应切换单阶段直出 Markdown 的快速路径。第四,公式粒度失配:公式 CDM 落后于 OvisOCR2,根源是布局切分粒度与标注不一致;可设计公式感知的细粒度布局头,或在内容解析前增加公式区域的合并/拆分后处理。第五,结构先验可能成为束缚:OTSL 骨架先行意味着结构预测错误会直接传导到内容填充,多级表头加深度合并单元格的复杂表格一旦骨架出错难以恢复;可引入结构-内容双向校验,把填充内容渲染回图像与原图局部比对,自适应修正骨架后重新填充。此外,Benchmark 覆盖上仍缺少多语言(论文评测集中在中英文)与手写体、票据等垂直文档的系统评测。

未来方向

作者在结论与局限中隐含的方向包括:更细粒度的布局建模以解决公式评测粒度不一致问题;继续扩展支持元素(当前已支持文本、表格、公式、代码块、印章,以及 5 大类 19 小类科学图表)。基于本文成果可自然延伸的方向:其一,把点级/区域级形变感知从静态图像推广到视频文档场景(翻页、手持拍摄抖动),建立时空形变建模;其二,把 Self-Judgement 升级为在线自校验闭环——推理时模型自渲染预测结果与原图比对,自动重解析低置信区域,形成无需人工的推理时修正;其三,MCV 与强化学习结合,用多模型共识分数直接充当 RL 奖励的组成部分,替代或补充静态标注的 TEDS/CDM,实现对无标注真实数据的持续自举学习;其四,科学图表转表格 TEDS 66.39 仍有很大空间,可引入数值一致性约束(如图表数据满足单调性、总量守恒、坐标轴刻度对齐等先验)作为额外奖励或解码约束;其五,端侧化:1.2B 模型对手机部署仍偏重,可对 0.6B 语言模型进一步剪枝或蒸馏,并结合视觉 token 压缩(DeepSeek-OCR 方向)实现实时文档解析;其六,跨语言扩展:OmniDocBench 覆盖 5 种语言,但形变感知与文字结构(如阿拉伯语连写、泰文元音符号)的联合建模值得系统研究;其七,与下游 RAG 管线联合优化,让解析模型直接为检索分块输出语义边界与阅读顺序置信度。

复现评估

开源情况较好:模型权重发布在 HuggingFace(StarDoc-AI/TeleOCR),代码发布在 GitHub(caipeng328/TeleOCR),论文明确声明『为促进复现,提供完整实现与基于社区模型的配置』。有利因素:基座全部是公开社区模型(Qwen2.5-VL 视觉编码器、Qwen3-0.6B 语言模型),架构是标准三件套(编码器 + MLP Aligner + LM),1.2B 参数推理在单张消费级 GPU(如 RTX 4090 级别)即可流畅运行;评测全部基于公开基准(OmniDocBench v1.5/v1.6、Wild-OmniDocBench、PureDocBench),附录 D 还详细给出了评测协议(quick_match、1,200 秒超时、fallback 参数、Overall 计算公式),诚意较高。困难因素:从零完整复现训练需要相当资源——Stage 2 需要 4M 数字布局样本、2M 合成拍摄样本与 120K 风格增强样本,Stage 1 需要大规模 VQA 语料;MCV 需要部署多个异构大模型(论文未公布具体是哪几个、$N$ 取多少),这是最大的信息缺口;Self-Judgement 需要 Qwen2.5-VL-7B 级别的 SFT 与渲染扰动管线;Stage 4 需要 GRPO 训练设施;CGDP 与 Doc3D 形变合成虽已给出公式但工程实现量不小。总体评估:推理复现与轻量微调难度低,四阶段全流程复现难度中高;实用建议是直接采用开源权重,在自有数据上仿照 Stage 3/4 做继续训练。