← 返回 2026-07-22

HPD-Parsing:层级并行文档解析 HPD-Parsing: Hierarchical Parallel Document Parsing

Shu Wei, Jingjing Wu, Lingshu Zhang, Qunyi Xie, Hao Zou, Le Xiang, Xu Fan, Yangliu Xu, Manhui Lin, Xiaolong Ma, Cheng Cui, Tengyu Du, YY 📅 2026-07-21 👍 11 2026-07-27 18:30
vLLM 多token预测 并行解码 推理加速 文档解析 视觉语言模型

用层级并行解码范式重构文档解析,吞吐量达4752 TPS。

前置知识

自回归解码与文档解析

自回归解码指模型逐个token地、依据前面已生成内容预测下一个token,输出长度决定了串行步数。基于统一视觉语言模型(VLM)的文档解析器把整页图像编码为视觉token后,由LLM解码器沿单条轨迹逐token产出全页结构化解析结果(文本/公式/表格/阅读顺序)。这种“端到端统一生成”虽精度高、泛化好,但每个token都要做一次注意力计算,长输出导致解码延迟随序列长度线性甚至超线性增长,成为效率主瓶颈。

本文的全部动机都建立在“自回归解码是文档解析效率瓶颈”这一事实之上(Figure 2显示长输出解码耗时是视觉编码的近500倍)。不理解自回归的串行性,就无法理解为什么要费力气把单条轨迹拆成并发分支。

KV缓存与共享前缀复用

Transformer解码时会把每层每头的Key/Value张量缓存下来避免重复计算,称为KV cache,其大小随已生成token数线性增长,且每步注意力成本也随之上升。共享前缀KV复用指:当多个序列有相同前缀(如相同的系统提示或文档视觉编码)时,这些前缀的KV只需算一次,多个请求/分支可直接引用同一块物理内存。本文进一步用“零拷贝指针共享+引用计数”让动态fork出的内容分支直接复用主分支的视觉与结构前缀KV,几乎零额外编码开销。

层级并行解码之所以高效,关键就在于fork出的内容分支不需要重新编码整页图像、不重复prefill,直接共享父分支已有KV。若不理解KV复用,会误以为“多分支=多倍计算”,从而低估方法的效率收益。

多token预测(MTP)与P-MTP

标准MTP(Multi-Token Prediction)用一个轻量预测头从当前隐状态同时预测未来多个token,配合投机式验证可让一次解码步推进多个token,减少串行步数;DeepSeek-V3等把MTP用于训练时辅助优化。本文沿用的P-MTP(Progressive MTP)是作者前作提出的变体:用残差MLP在look-ahead深度 $k$ 处组合前一层隐表示与已预测token的embedding,经共享LM头得到投机分布 $\hat{p}_t^k$,并用渐进式损失权重 $W_{t,k}$(结合距离衰减与路径/目标一致性)压制不可靠的远距离预测。

P-MTP是HPD-Parsing缩短“分支内”解码路径的核心机制,论文报告平均每步接受6.6个token。它与“跨分支”并发是互补的两条加速维度,必须区分才能理解方法的双层提速逻辑。

FCFS调度与vLLM推理框架

vLLM是主流LLM推理服务框架,其调度器以先到先服务(FCFS)为基础,配合PagedAttention管理KV内存块、支持连续批处理。HPD-Parsing在vLLM 0.17.1上扩展调度,加入动态分支fork、KV零拷贝共享、引用计数式资源释放(Algorithm 1),保留FCFS的稳定在线服务行为。调度时用KV占用阈值 $\tau$ 和并发上限 $N_{max}$ 控制内存,并对子分支放宽准入(可绕过门控),使并发内容分支不阻塞主布局分支。

本文不只是模型创新,还是一套深度改造的serving系统。理解FCFS/PagedAttention/vLLM这些底层概念,才能看懂Algorithm 1中为什么子分支key优先级设为 $(0, arrival(parent), -m, arrival(child))$、为什么要引用计数释放共享KV。

OmniDocBench与文档解析指标

OmniDocBench是综合评估文档解析能力的公开基准(v1.6为最新版),覆盖文本识别、公式识别、表格结构抽取、阅读顺序预测等多维度。常用指标:文本编辑距离TextEdit↓、公式CDM↑、表格TEDS↑(含内容)与TEDS-S↑(仅结构)、阅读顺序编辑距离ReadOrderEdit↓,Overall是文本/公式/表格的加权平均。

论文几乎所有精度数字(Overall 94.91、ReadOrderEdit 0.124、FormulaCDM 97.28等)都来自OmniDocBench v1.6。读Table 1/Table 2时必须先理解这些指标的方向(↑好还是↓好)和含义,才能判断HPD-Parsing相对GLM-OCR(95.22)、PaddleOCR-VL-1.6(96.3)等方法的真实优劣。

InternVL3.5视觉语言骨干

InternVL3.5-1B是本文骨干,由0.3B的InternViT视觉编码器和0.8B(基于Qwen3-0.6B)的LLM解码器组成。InternViT用动态分块裁剪(dynamic tile-based cropping):依据输入图像分辨率与长宽比,从预定义长宽比(1×2、1×3、…4×6)中自适应选择,最多切24个tile,每个resize到448×448独立编码。LLM解码器为28层Transformer、hidden 1024、FFN 3072、GQA(16 query头/8 KV头)、SwiGLU+RMSNorm。

所有训练超参(lr 1e-4/1e-5/5e-7、batch 128/96、max seq 16000)与每页约4809输入token这一数字都基于这套骨干。理解动态分块才知道为何输入token数偏高、为何视觉端仍有压缩空间(也是改进方向之一)。

研究动机

现有基于统一视觉语言模型(VLM)的文档解析器虽通过单一模型联合建模提升了精度和泛化性,但仍依赖逐token的自回归生成来产出整页解析结果,造成随文档长度增长的串行瓶颈。作者以InternVL3.5-1B为骨干训练基线解析器,并用vLLM在batch size=16下做延迟剖析(对应Figure 2):随输出长度增加,编码器延迟相对稳定,但解码器延迟随序列长度迅速增长并逐步主导总推理成本,对长输出样本解码耗时几乎是视觉编码的近500倍。这表明统一文档解析的效率瓶颈不在全页视觉处理,而在token-by-token自回归解码强加的长串行执行路径。已有加速工作要么压缩视觉token(DeepSeek-OCR)、要么用Reference Sliding Window Attention(Unlimited OCR)降低每步注意力开销,要么用MTP(GLM-OCR)、DFlash(HunyuanOCR-1.5)、query/token并行(Youtu-Parsing)增加每步并行度,但都仍在单条自回归轨迹内提速,未触及“重构全页生成轨迹”这一根本问题。

本文的目标是本文目标是设计一种新的文档解析解码范式,能在保持统一生成框架(端到端可联合优化、可保留全局文档上下文)的前提下,把单条全页自回归轨迹重构为可并发的解码路径,从而大幅降低解码步数、提升吞吐量,同时维持有竞争力的解析精度。具体目标量化为:在公开基准OmniDocBench v1.6上达到4752 tokens/秒的峰值吞吐,达到现有最快文档解析模型的2.62倍、vanilla自回归基线的3.06倍;并以仅1B参数量取得Overall 94.91的精度与0.124的ReadOrderEdit,在端到端统一解析器中刷新SOTA,从而证明“全局布局协调+局部并行解码”可替代单条串行生成轨迹,为高效统一文档解析开辟新方向。

与已有工作不同的是,作者切入的角度独特在于抓住了文档解析任务本身的“局部性”与“全局性”不对称:页面级布局需要全局协调(决定空间结构、区域关系、阅读顺序),而每个区域的内容解码高度局部化(主要依赖对应视觉证据,对远处区域依赖有限)。这与已有只做token级或区域级并行的加速方法(如Youtu-Parsing的query/token并行、GLM-OCR的MTP)本质不同——那些方法仍在单条自回归轨迹内提速,而HPD-Parsing直接重构轨迹结构,把“布局协调”与“内容生成”分离为两种解码角色,并利用共享前缀KV复用让并发分支几乎零额外编码开销。此外作者洞察到内容生成的视觉强grounding使生成轨迹更可预测,恰好利于多token预测,从而把层级分支并行与P-MTP在“跨分支”和“分支内”两个维度同时压缩串行路径,这是已有任何单一加速手段都没做到的协同设计。

核心方法

整体思路是:文档解析的瓶颈是解码而非编码,而文档结构是“全局布局+局部内容”。因此用一个主布局分支按阅读顺序串行建立全局结构,每次发出标记时为对应区域动态分裂出并发的局部内容分支,各分支复用共享的视觉与结构前缀KV缓存,只维护自身增量内容KV;每个分支内部用P-MTP每步预测多个未来token。技术路线上,模型基于InternVL3.5-1B(0.3B InternViT+0.8B基于Qwen3-0.6B解码器,28层、hidden 1024、GQA 16/8),视觉用动态分块裁剪(最多24个tile,每个448×448)。训练三阶段:全页能力初始化(Stage1,2.8M样本,lr 1e-4)→范式迁移+难例(Stage2,100K分支样本,lr 1e-5)→奖励RL(Stage3,600难例,lr 5e-7,batch 96)。推理基于vLLM 0.17.1扩展FCFS调度,每分支最大生成长度8000 token。训练在8×A800 80GB上以bfloat16、DeepSpeed ZeRO-1、FlashAttention完成,max seq 16000。

核心创新与已有方法的本质区别在于:现有方法无论统一式还是pipeline式,都在“单条自回归轨迹”内生成整页内容;HPD-Parsing把这条轨迹拆成“全局协调”与“局部并发”两层,引入/两个特殊标记分别触发分支分裂与内容起始。内容分支只监督后的局部转录,对应掩码 $M_{dec}^t = \mathbb{I}(t > t_{\langle CHILD\rangle})$,让结构前缀仅作条件而非被复现。配合P-MTP联合目标 $\mathcal{L} = \frac{\sum_{t,k}\mathbb{M}_{t+k+1}W_{t,k}\ell(\hat{p}_t^k, y_{t+k+1})}{\sum_{t,k}\mathbb{M}_{t+k+1}}$($k=0$为标准下一token、$W_{t,0}=1$,$k\ge1$为渐进式多token预测),在分支与token两维度同时压缩串行路径,平均每步接受6.6个token。这种“层级”是已有MTP/区域并行方法都没有的。

方法步骤详情

推理工作流如Algorithm 1:调度器维护活动池P与队列Q,FCFS排序——子分支key为 $(0, arrival(parent), -m, arrival(child))$($m$为父已有子数),主分支key为 $(1, arrival)$;KV占用超阈值$\tau$或活跃数达$N_{max}$时只放行父请求,子分支可绕过;每步对P中请求并行用P-MTP草拟(窗口$K$)并验证接受长度 $n_{acc}=\max\{k\mid y^*_{n+i}=\hat{t}_i,\forall i\le k\}$;检测到则spawn子分支并KV零拷贝共享;分支结束按引用计数释放KV,所有子分支结束才交错输出父结果。训练三阶段:(1)Stage1全页序列生成初始化通用解析能力;(2)Stage2重组为布局/内容两类实例做分支监督,内容分支用$M_{dec}$只监督后转录;(3)Stage3针对公式/表格/布局/计数一致性构造任务感知奖励做轻量RL。配套数据流水线四步:聚类采样→多模型标注+难度估计→VLM迭代精炼→分布均衡。

技术新颖性

技术新颖性体现在三方面。第一,首次把文档解析从单条自回归轨迹重构为“布局协调+局部并行”的层级解码,并通过/标记把训练监督与推理分支分裂解耦,使内容分支只需监督局部转录而结构前缀仅作条件——这区别于Youtu-Parsing只在区域内做query/token并行(仍是单轨迹)、GLM-OCR只用MTP(仍是单轨迹)。第二,把KV缓存复用从单纯prefill优化提升为“分支分裂即零拷贝共享+局部上下文隔离”,使每个分支只关注共享视觉+自身结构前缀+自身内容历史,避免全页KV随文档长度线性增长,并显著缩短每步注意力的活跃范围。第三,把P-MTP的渐进式损失权重 $W_{t,k}$ (距离衰减+路径/目标一致性)自然嵌入两种分支的联合目标,与层级分支并发形成“跨分支+分支内”双重路径压缩,平均每步接受6.6个token。此外,把“自动难度感知数据流水线+三阶段分阶段训练”作为范式迁移稳定精度的工程支撑,使1B模型在OmniDocBench v1.6上仍能达到Overall 94.91,这也是端到端统一解析器的新SOTA。

HPD-Parsing accelerates document parsing through a hierarchical parallel decoding paradigm.
Figure 3: HPD-Parsing accelerates document parsing through a hierarchical parallel decoding paradigm.
Overview of the automated difficulty-aware data curation pipeline.
Figure 4: Overview of the automated difficulty-aware data curation pipeline.

实验结果

在OmniDocBench v1.6上,HPD-Parsing仅1B参数取得Overall 94.91,超越更大的Qianfan-OCR(93.90, 4B)、Logics-Parsing-v2(93.33)、FireRed-OCR(93.26)、Unlimited OCR(93.92)、HunyuanOCR-1.5(94.74),是端到端统一解析器新SOTA;子项FormulaCDM 97.28、ReadOrderEdit 0.124领先多数pipeline方法。效率上(Table 2),BS=512下达4752.1 TPS、2.68 PPS,相比自回归基线(1554.8 TPS/1.02 PPS)提升3.06×/2.62×;每页输入约4809 token(DeepSeek-OCR-2的4倍多)仍比其高1.62× TPS。按输出长度分桶(Figure 5),加速随长度越发显著:最长桶解码步数减少18.04×、吞吐提升3.67×、单请求延迟降低5.80×,验证“关键路径由最长活跃分支而非块长之和决定”。Figure 9还显示对检测框错误、形近字符、重复错误传播有更强鲁棒性。

Performance comparison on OmniDocBench v1.6.
Table 1: Performance comparison on OmniDocBench v1.6.
Inference speed comparison on OmniDocBench v1.6 (TPS/PPS under BS=512).
Table 2: Inference speed comparison on OmniDocBench v1.6 (TPS/PPS under BS=512).
Efficiency scaling across output-length buckets.
Figure 5: Efficiency scaling across output-length buckets.
Qualitative results on document images with complex formulas.
Figure 6: Qualitative results on document images with complex formulas.
Qualitative results on document images with complex layout.
Figure 8: Qualitative results on document images with complex layout.
查看结构化数据
任务指标本文基线提升
OmniDocBench v1.6 综合解析 Overall (加权平均,越高越好) 94.91 (1B参数) GLM-OCR 95.22, HunyuanOCR-1.5 94.74, Unlimited OCR 93.92, Qianfan-OCR 93.90, FireRed-OCR 93.26, DeepSeek-OCR-2 90.25 在端到端统一解析器中刷新SOTA,超越多个更大模型(4B Qianfan-OCR +1.01、2B FireRed-OCR +1.65),仅略低于最强pipeline方法PaddleOCR-VL-1.6(96.3)与MinerU2.5-Pro(95.75)
OmniDocBench v1.6 阅读顺序 ReadOrderEdit (编辑距离,越低越好) 0.124 MinerU2.5-Pro 0.120, Unlimited OCR 0.129, HunyuanOCR-1.5 0.129, GLM-OCR 0.133, PaddleOCR-VL 0.135 优于绝大多数pipeline方法,仅次于MinerU2.5-Pro,说明分解布局/内容监督反而更利于阅读顺序优化
OmniDocBench v1.6 推理吞吐 TPS (tokens/second, BS=512) 4752.1 自回归基线 1554.8, DeepSeek-OCR-2 2932.1, GLM-OCR 2133.8, Unlimited OCR 2901.5 相对自回归基线提升3.06×,相对现有最快模型DeepSeek-OCR-2提升1.62×(尽管输入token是其4倍多)
OmniDocBench v1.6 推理吞吐 PPS (pages/second, BS=512) 2.68 自回归基线 1.02, DeepSeek-OCR-2 2.05, GLM-OCR 1.86, MinerU2.5-Pro 1.58 相对自回归基线提升2.62×,相对DeepSeek-OCR-2提升1.31×
长输出分桶效率增益 解码步数/请求吞吐/单请求延迟 最长桶分别改善18.04× / 3.67× / 5.80× vanilla自回归基线随输出长度线性恶化 输出越长加速越显著,证明层级并行+P-MTP把关键路径从‘所有块长之和’降为‘最长活跃分支’

局限与改进

作者承认精度(Overall 94.91)虽在统一解析器中领先,但仍低于最强pipeline方法PaddleOCR-VL-1.6(96.3)与MinerU2.5-Pro(95.75),以及GLM-OCR(95.22),说明范式迁移仍有精度损失,部分源于训练数据覆盖不足,未来需扩充数据。每页约4809个输入token的视觉开销仍较高,是DeepSeek-OCR-2(1100.2)的4倍多,说明视觉编码端仍有压缩空间;作者自己也提到未来要探索结构感知注意力设计以降低有效注意力上下文与单步计算。从我的观察看,层级fork调度与KV零拷贝共享对serving系统改造极深(Algorithm 1只是伪代码),复现与部署门槛不低;论文也未给出与最强pipeline方法在更大规模或更复杂真实文档上的对比,对超长文档(超过8000 token/分支上限)的处理、对极稀疏或异形版面的泛化都缺乏定量证据;三阶段训练依赖PaddleOCR-VL-1.5、MinerU-2.5 Pro等私有伪标注,数据可复现性存疑。

独立分析的弱点

弱点一:精度受限于1B模型与数据规模,相对PaddleOCR-VL-1.6(96.3)仍差约1.4分;FormulaCDM(97.28)虽领先但TableTEDS(91.35)明显弱于Youtu-Parsing(92.02)与HunyuanOCR-1.5(93.67),表格解析仍是短板,可迁移到更大骨干(如InternVL3.5-241B)并强化Stage3表格奖励。弱点二:视觉token开销大(每页4809,是DeepSeek-OCR-2的4倍多),视觉端未做压缩,可结合DeepSeek-OCR的token压缩或自适应tile控制,并用Unlimited OCR的Reference Sliding Window Attention处理超长序列。弱点三:层级fork+KV零拷贝共享+FCFS改造对推理系统侵入深,易引入调度抖动、内存碎片与负载不均,可设计专用层级解码框架、引入结构感知注意力降低单步开销。弱点四:固定tile上限(最多24个448×448)对超长/异形文档可能信息丢失,且未给失败案例定量分布。

未来方向

作者明确提出的未来工作:一是扩充训练数据以提升更多文档场景的覆盖,缩小与最强pipeline方法的精度差距;二是探索结构感知注意力设计以降低有效注意力上下文和每步计算。基于本成果可延伸的方向包括:把层级并行解码推广到关键信息抽取、多页文档理解等结构化生成任务(作者在结论中已暗示文档“全局协调而局部可分解”的普适性);把P-MTP的平均接受长度(当前6.6)进一步推高,或与树形/图结构投机解码验证结合;把自动难度感知数据流水线做成通用工具服务其他解析范式的迁移训练;把布局分支的阅读顺序预测与Stage3的强化学习奖励进一步强化以提升读序与表格质量;研究层级解码在KV管理、显存占用上的最优策略,使其能扩展到更大模型规模与在线服务场景。整体看,“层级并行解码”作为一类新范式,其方法论价值远超单一文档解析任务。

复现评估

复现性中等偏好。有利条件:基于开源InternVL3.5-1B,提供GitHub(PaddlePaddle/PaddleOCR)与HuggingFace(PaddlePaddle/HPD-Parsing)入口;训练细节披露充分(8×A800 80GB、bfloat16、DeepSpeed ZeRO-1+gradient checkpointing、FlashAttention、max seq 16000、三阶段lr 1e-4/1e-5/5e-7、batch 128/96、Stage1 2.8M/Stage2 100K/Stage3 600例);推理基于公开vLLM 0.17.1。难点在于:其一,层级fork+KV零拷贝共享+FCFS调度对vLLM改造极深,Algorithm 1只是伪代码,分支交错输出、引用计数释放、子分支准入门控都需从零实现;其二,数据流水线依赖PaddleOCR-VL-1.5、MinerU-2.5 Pro做伪标注和难度估计,原始文档图像未明确开源,数据可复现性存疑;其三,算力门槛高(8×A800)。完整端到端复现需较强系统工程能力。