InSight-doc:面向长文档理解的智能体式视觉感知 InSight-doc: Agentic Visual Perception for Long-Document Understanding
低分辨率通读全文、按需放大关键区域,让8B模型在长文档问答上同时更准、更快、更少幻觉
前置知识
context rot(上下文腐烂)
指大模型性能随 prompt 变长而显著退化的现象:注意力机制需要让每个 token 关注上下文中全部 $N$ 个 token,带来 $O(N)$ 空间和 $O(N^2)$ 时间开销,长上下文中注意力被稀释、真正相关的信息被无关内容淹没,导致模型「读得越多、答得越差」。一般认为是注意力稀释加长上下文训练数据稀缺共同造成的。
这是本文动机的出发点:长文档理解是典型的长上下文任务,全页高分辨率输入会同时触发算力爆炸与 context rot,InSight-doc 的低分辨率开局加按需放大正是为了缓解它。
视觉 token 与图像分辨率(DPI)
多模态大模型把图像切成 patch 编码为视觉 token,token 数大致与像素面积成正比。DPI(每英寸点数)衡量页面栅格化密度:本文以 200 DPI 渲染原始页面,再按缩放因子 $r$ 降采样,$r=0.25/0.35/0.5/0.7$ 分别对应 50/70/100/140 DPI,50 DPI 下每页约 $425\times550$ 像素。
分辨率直接决定视觉 token 数与序列长度,是本文效率分析的核心变量;理解 $r$ 与 DPI 的换算才能读懂实验设置和成本上界推导。
ReAct 式工具调用智能体
ReAct 范式让模型在多轮交互中交替输出「思考」与「行动」:模型生成推理文本后调用工具(如搜索、裁剪),工具返回结果被追加进上下文,模型基于新证据继续推理,直到给出最终答案。它把一次性闭卷作答变成可迭代获取证据的开卷过程。
InSight-doc 就是一个 ReAct 循环:模型在 think 后发出 zoom_in(img_idx, label, bbox) 工具调用,裁剪的高分辨率区域作为工具返回追加进上下文,多轮循环后才输出答案。
以图思考(Thinking with Images)
OpenAI o3 带火的范式:把图像裁剪、缩放等操作内化为模型思维链的固有动作,让模型在推理过程中主动寻求多尺度视觉证据,而不是被动接收固定分辨率输入。后续工作通过强化学习(DeepEyes)、合成启动数据(Pixel-Reasoner)或多轮 RL(Mini-o3)训练模型内化缩放能力。
InSight-doc 是该范式在长文档领域的落地:区别在于它处理多页文档、证据散布在相距遥远的非相邻页面上,且要在严格 token 预算下获取多区域证据。
SFT + GRPO 强化学习
SFT(监督微调)用人工或更强模型生成的轨迹做模仿学习;GRPO 是 DeepSeek 提出的 RL 算法,对每个 prompt 采样多个 rollout,用组内相对奖励替代价值网络计算优势,配合 KL 正则防止策略漂移。先用 SFT 冷启动、再用可验证奖励 RL 精化是当前智能体训练的标准配方。
本文正是这个配方:17,913 条高质量放大轨迹做 SFT,再用 GRPO 加二值准确率奖励在 19,236 个难例 prompt 上训练,理解两者分工才能看懂消融(SFT 定位好但会卡死,RL 消灭卡死)。
LLM-as-judge 评测
用强 LLM 比对模型答案与标准答案来判定正确性,适用于长答案、多目标、开放式回答。但判官存在假阳性(错判对)与假阴性(错判错)风险:假阳性在 RL 中尤其危险,因为模型可能学会钻奖励漏洞(reward hacking)。
本文的 RL 奖励就是 GPT-5-nano 判官的二值正确性,论文专门用 150 例人工标注集校准出 legacy-v2 判官(准确率 94.7%),这是结果可信度的关键基础设施。
研究动机
多模态大模型处理长文档(如科研论文、财报)时,默认把每一页都当高分辨率图像全部塞进上下文:注意力机制带来 $O(N)$ 的显存开销和 $O(N^2)$ 的计算开销,页数一多推理成本迅速失控,同时引发 context rot——注意力被稀释后性能急剧下降。论文实验量化了这一困境:基座 Qwen3-VL-8B 以 140 DPI 处理长文档时平均序列长度达 111.7k token、单例延迟 29.57 秒,错误率仍高达 42.54%;在不可回答问题上幻觉率高达 58.31%。已有替代方案各有硬伤:传统 OCR 解析式多级流水线(版面检测、识别、阅读顺序重建)存在级联误差且对复杂版面泛化差;视觉 RAG(ColPali、VDocRAG 等)用外部检索器选 top-k 页,性能对 $k$ 敏感、检索错了无法恢复,且最接近的 Doc-V⋆ 有 94.0–99.8% 的轨迹依赖外部检索器;现有粗到细方法(CogDoc、Doc-V⋆)只在页级别提供高分辨率,整页无关内容也照样消耗大量视觉 token,无法精确隔离含答案的子页区域。
本文的目标是本文目标是构建一个完全端到端、免检索器(retriever-free)的智能体框架 InSight-doc,把「视觉分辨率」当作推理时可动态分配的资源:模型先看低分辨率全文,在多轮推理中自主决定对哪个页面的哪个子区域放大取证,最后给出有据可依的答案,而当文档证据不足时应明确弃答而非编造。量化目标包括:在中长文档 VQA 基准上比基座提升 4.3–16.4 个准确率点;在长文档上把幻觉率降低 40% 以上;同时大幅压缩序列长度与推理延迟(理论预测序列长度可压至基线的 7.8%–45.0%、延迟上界最低约 4.6%)。训练层面,要用 17.9K 带区域级放大轨迹的高质量 SFT 样本加 19.2K 难例 RL 样本,把这套主动感知能力装进一个开源 8B 模型,并改进准确率-效率 Pareto 前沿。
与已有工作不同的是,本文的独特切入角度有三。第一,把粗到细的粒度从「页」下沉到「子页区域」:不做页检索,而是在统一的图文交错思维链中直接发出边界框裁剪放大,一方面实现区域级定位,另一方面天然支持多跳问题和多轮自我纠错(裁错了可以再裁)。第二,一个关键观察支撑激进降采样:放大操作是在高分辨率源图像上执行的,所以初始输入可以压到 50 DPI(每页约 425×550 像素)而不必担心信息丢失——丢掉的细节事后都能通过 zoom 取回,这让「敢用超低分辨率开局」有了理论依据。第三,拒绝外部检索器:Doc-V⋆ 等方法把找证据外包给 ColQwen2.5 这类检索模型,引入索引/检索开销和策略无法恢复的检索错误;InSight-doc 让策略自己定位,81.6–99.3% 的轨迹由智能体自身完成区域级取证,错误可以在后续轮次中自我修正。
核心方法
直觉上,InSight-doc 模仿人类读长文档的方式:先快速浏览全文把握结构(低分辨率、便宜),发现关键图表或段落后再凑近细看(区域放大、高保真)。技术上它是一个 ReAct 式多轮智能体。形式化地,设文档 $D=\{p_i\}_{i=1}^N$ 共 $N$ 页,初始视觉上下文为降采样图像 $\tilde{I}^{(0)}_k=\mathrm{resize}(I_k, r\cdot\mathrm{size}(I_k))$,其中 $r\le 1$ 是初始缩放因子($r=0.25$ 即 50 DPI)。每一轮模型先输出思考(think),若需要细节则发出工具调用 $\mathrm{zoom\_in}(k, d, b)$:$k$ 是目标图像在当前视觉空间中的索引,$d$ 是对目标区域的自然语言描述,$b$ 是边界框。系统从对应高分辨率源图裁剪 $I^{(t)}_{\mathrm{crop}}=\mathrm{crop}(I_s(k), b, r)$,再按缩放因子 $c>1$(实验中 $c=2.0$)放大为 $\tilde{I}^{(t)}_{\mathrm{crop}}$ 追加进视觉上下文;支持递归放大($r\leftarrow c\cdot r$),最多 10 次工具调用,直到模型给出最终答案或声明证据不足。论文还给出推理成本的形式化分析:记 $x(r)=r^2+\delta n(r)$、$y(r)=1+\lambda n(r)$($n(r)$ 为工具调用次数),证明相对序列长度满足 $S_r/S_0\le x(r)+\kappa^{-1}y(r)$($\kappa=P_0/R_0$ 为基线 prompt-响应比),在典型参数下序列长度仅为无缩放基线的 7.8%–45.0%。
核心创新是把「分辨率」从固定的输入属性变成推理时按需分配的资源,并通过数据工程让模型内化「何时放大、放大哪里」的策略。与已有工作的本质区别:(1)相较端到端全高分辨率输入,低分辨率开局换来数量级的 token 节省,且因为放大发生在高分辨率源图上,细节并非真正丢失,这是与固定分辨率处理信息论的差异;(2)相较视觉 RAG,不把取证外包给检索器,从机制上避免 top-k 敏感性和不可恢复的检索错误;(3)相较 Doc-V⋆/CogDoc 等页级粗到细方法,区域级取证只给答案相关内容付高分辨率代价,且 InSight-doc 是唯一同时具备免检索器、粗到细、迭代多轮、区域级四个特性的方法(Table 5 中唯一四项全勾);(4)配套闭式成本理论:延迟被建模为 $T(P,R)=\alpha P+\beta R(2P+R)$($\alpha,\beta$ 为 prefill 与解码成本系数),导出相对延迟的二次型上界,例如 $r=0.35$、两次工具调用时延迟上界仅为基线的约 32.5%,为「低分辨率+少量放大」的效率优势提供了先验保证。
方法步骤详情
整套系统分数据构造、SFT、RL 三步。第一步构造「必须放大才能解」的难例数据:从 arXiv、DUDE、DocVQA、InfographicVQA、Paper2Poster、MapTab 六个来源收集文档 QA,经三级过滤——(1) 先验过滤:Qwen3-VL-8B 在 20 DPI 超低清下就能答对的问题判为不依赖文档,丢弃;(2) 免放大过滤:Qwen3-VL-32B 在 50/70/100 DPI 下不放大即可答对的删除(50,903 个可回答问题过滤后剩 26,943,保留率 52.9%);(3) 用 InSight-o3 双智能体流水线生成显式放大轨迹:GPT-5-mini 担任 vReasoner 维护推理状态并发出 ⟨PageID, Desc⟩ 取证请求,微调过的 Qwen3-VL-8B 担任 vSearcher 返回边界框 ⟨Box⟩,裁剪区域拼回上下文,最终合并为单条扁平多模态思维链作为模仿目标;轨迹答案正确(GPT-5-nano 判定)的进 SFT,失败的进 RL。另用「最小自然扰动 + Gemini 宽窗口验证」合成大量不可回答的困难负例。第二步 SFT:17,913 条轨迹(可回答 14,216 条 / 不可回答 3,697 条,平均 2.61 轮工具调用),对 Qwen3-VL-8B-Instruct 全参微调 2 个 epoch(1118 步),学习率 $5\times10^{-6}$ 余弦衰减,序列上限 65,536,序列并行 4,视觉编码器冻结。第三步 RL:19,236 个 prompt(55% 可回答),用 GRPO 加仅二值准确率奖励训练 800 步,每 prompt 8 次 rollout,KL 系数 0.01,用加权补充采样把有效混合比控制在 86% 可回答 / 14% 不可回答;奖励判官用经 150 例人工标注集校准的 legacy-v2(准确率 94.7%,旧两段式判官仅 84.7%),避免 RL 钻判官漏洞。
技术新颖性
技术新颖性体现在四点。其一,数据工程围绕「主动感知」而非「问答对」设计:三级过滤保证留下的问题必须依赖文档、必须放大才能解;InSight-o3 生成失败的轨迹不丢弃而是自动路由给 RL 作难例,这种 SFT/RL 按难度自动分流的构造方式少见。其二,双智能体蒸馏:用专门的 vSearcher 模型代替策略完成定位,再把双智能体轨迹拍平成单智能体格式做模仿学习,让 8B 学生模型学会何时/何处放大,绕开了直接 RL 探索连续定位空间的高方差问题。其三,不可回答负例的系统性构造:对可回答种子做最小自然扰动(替换实体、数字、日期、比较对象),经 Gemini 在更宽页面窗口验证「确实缺证据」才保留,专门训练弃答能力,这是幻觉率腰斩的直接原因;另有针对性 add-on(带「信息不足」选项的多选题、结构化文档题)分别抑制错误弃答和补强结构理解。其四,把多轮放大的推理开销折算成关于初始缩放因子 $r$、工具调用次数 $n(r)$、prompt-响应比 $\kappa$、prefill-解码系数比 $\gamma=\alpha/\beta$ 的闭式上界(Proposition 1/2),使分辨率选择有理论指导,而不只是经验调参。
实验结果
核心结果有五组。(1) 文档 VQA(Table 2):50 DPI($r=0.25$)下 InSight-doc-8B(SFT+RL) 平均准确率 66.9%,比基座 Qwen3-VL-8B 高 16.4 点(DUDE +17.2、MP-DocVQA +18.3、MMLongBench-Doc +17.1、LongDocURL +12.8),超过所有 GPT 闭源变体;100 DPI 下 72.6%(+4.3),与 Gemini-3-Flash(75.3)相当。RL 贡献巨大:SFT 单独只有 56.6%(50 DPI),RL 后跳到 66.9%。直接给基座挂 zoom 工具几乎无收益(50.4%),说明关键是训练策略而非工具本身。(2) 泛化(Table 3):MME-RealWorld-Lite 48.2%(+7.2),略超最强闭源结果 Gemini-3.1-Flash-lite 的 47.8%;O3-Bench 100 DPI 达 43.8%(+8.7),但 50 DPI 下仅 24.1%,极端降采样对细粒度视觉搜索仍有损耗。(3) 与相关方法对比(Table 5):MMLongBench-Doc 57.8% vs Doc-V⋆ 42.1%(+15.7),LongDocURL 65.6% vs 56.3%(+9.3);控制骨干的 ColQwen2.5 检索对照(Table 18)中,70 DPI 用约 41K token 得 56.2%,优于 Top-16 检索的 49.1%(约 57K token)。(4) 效率与幻觉(Figure 1/7):不可回答问题上的幻觉率从 58.31% 降到 31.61–32.96%(相对降幅超 40%);最长文档子集上 70 DPI 用 42.4k token、11.2 秒达到 56.2%,对比 140 DPI 基线的 136.8k token、39.3 秒、53.2%——token 省 69%、延迟省 71% 还多 3 个点;总体 70 DPI 比 140 DPI 基线延迟省 54% 且准确率还高 1.2 点,与 Proposition 2 预测的 48%–81% 降幅一致。(5) 轨迹质量(Table 6):LongDocURL 证据框覆盖率从基线 27.5% 提到 RL 后 82.3%,冗余轨迹 14.1%→5.8%,卡死轨迹 9.7%→0.1%;不可回答 F1 在 DUDE 上从 44.5 提到 69.1(+24.6),说明模型真正学会判断文档证据不足。
查看结构化数据
| 任务 | 指标 | 本文 | 基线 | 提升 |
|---|---|---|---|---|
| DUDE 文档 VQA(r=0.25,50 DPI) | LLM-as-judge 准确率 (%) | 70.1 | Qwen3-VL-8B 端到端 52.9 | +17.2 |
| MP-DocVQA(r=0.25,50 DPI) | LLM-as-judge 准确率 (%) | 83.4 | Qwen3-VL-8B 端到端 65.1 | +18.3 |
| MMLongBench-Doc 长文档 VQA(r=0.25,50 DPI,平均 49.4 页) | LLM-as-judge 准确率 (%) | 50.8 | Qwen3-VL-8B 端到端 33.7 | +17.1 |
| LongDocURL 长文档 VQA(r=0.25,50 DPI,平均 85.6 页) | LLM-as-judge 准确率 (%) | 63.3 | Qwen3-VL-8B 端到端 50.5 | +12.8 |
| MMLongBench-Doc 与最强相关方法对比(r=0.5) | 准确率 (%) | 57.8 | Doc-V⋆ 42.1(依赖外部检索器 ColQwen2.5) | +15.7 |
| MME-RealWorld-Lite 通用高分辨率 VQA(r=0.25) | 准确率 (%) | 48.2 | Qwen3-VL-8B 41.0;闭源最佳 Gemini-3.1-Flash-lite 47.8 | +7.2(超过全部闭源模型) |
| O3-Bench 高分辨率视觉搜索(r=0.5) | 准确率 (%) | 43.8 | Qwen3-VL-8B 35.1 | +8.7 |
| DUDE 不可回答子集(r=0.25) | 弃答 F1 | 69.1 | Qwen3-VL-8B 44.5 | +24.6 |
| 最长文档子集(MMLongBench-Doc 与 LongDocURL 各 200 例,70 DPI vs 140 DPI 基线) | token / 延迟 / 准确率 | 42.4k token、11.2 s、56.2% | Qwen3-VL-8B 140 DPI:136.8k token、39.3 s、53.2% | token −69%、延迟 −71%、准确率 +3.0 点 |
| 证据定位质量(LongDocURL,r=0.25) | 证据框覆盖率 / 冗余率 / 卡死率 (%) | 82.3 / 5.8 / 0.1 | Qwen3-VL-8B 挂 zoom 工具:27.5 / 14.1 / 9.7 | 覆盖率 +54.8 点,冗余 −8.3 点,卡死 −9.6 点 |
局限与改进
作者承认的局限:只在 Qwen3-VL-8B-Instruct 一个骨干上做了 SFT+RL,未验证跨模型、跨厂商的泛化;未尝试更先进的 RL 算法或奖励设计,认为该方向仍有提升空间。我自己的观察:其一,主表因闭源 API 限制把输入页数截断为 40 页,超长文档的真实难度被低估(附录 Table 16 显示去限后所有模型都掉点,LongDocURL 在 $r=0.7$ 下基座从 70.5 掉到 63.9);其二,与 Doc-V⋆、CogDoc 等最接近方法的对比是跨论文数字,骨干、训练数据、输入分辨率、页数预算、评测协议(对方常用 ANLS,本文用 LLM-as-judge)均未对齐,只能作定位参考;其三,RL 虽消灭了卡死和冗余,代价是裁剪联合面积增大到页面的 22.5–28.5%(基线 11.1–15.2%),即学会「搜得更广」来对冲定位误差,在高分辨率档位会侵蚀部分 token 优势;其四,缩放因子固定 $c=2.0$、每轮只允许一个裁剪(max parallel tool calls = 1),多跳问题只能串行取证;其五,SFT 轨迹质量依赖闭源模型(GPT-5-mini、GPT-5-nano、Gemini 3.1 Flash-Lite)生成的监督信号,数据管线本身不可完全自持。
独立分析的弱点
弱点一:贪心式串行区域选择。策略每次只发出一个 bbox(最大并行工具调用数为 1),在多跳、多区域问题上依赖多轮串行取证,任何一轮定位偏差都会传播到后续轮次;Table 6 显示 SFT 模型在激进降采样下卡死率仍有 5.1%。改进方向:允许每轮并行提出多个候选区域(论文已有 Multi-o3 式先例可借鉴),或引入区域置信度与回溯机制。弱点二:奖励信号过稀疏。RL 只用最终答案对错的二值奖励,定位质量、证据充分性、弃答时机都没有塑形信号,导致模型靠「多裁一点」(联合面积 22.5–28.5%)来对冲定位不确定性。改进方向:LongDocURL 类证据框标注可构造覆盖率/IoU 奖励,或引入过程奖励模型对每轮取证打分。弱点三:初始分辨率是全局超参而非策略决策。评测时 $r$ 需人工指定,模型不能按问题难度自适应选档,导致 O3-Bench 在 50 DPI 下只有 24.1%。改进方向:训练轻量难度估计器先行选档,或把 $r$ 纳入 RL 动作空间。弱点四:训练域窄。数据全部来自文档,虽然 MME-RealWorld-Lite 显示零样本泛化到自然图像(如读懂街景红招牌「CINEMA」的例子),但监控视频、遥感、医疗影像等高分辨率场景未经训练验证,域差距下策略稳健性存疑。弱点五:判官依赖。GPT-5-nano 判官即便校准后在边界案例(缩写表标题、部分指定的层级标题、简短弃答)上仍有误判风险,且闭源判官本身损害完全可复现性。
未来方向
作者提出的方向:把框架移植到更多新模型与其他厂商的骨干上做更完整的评估;探索更先进的 RL 算法与奖励设计(作者明言这是最大的低垂果实)。基于本文成果可延伸的方向:其一,把「分辨率即推理时资源」框架迁移到长视频理解——论文自己在相关工作中指出长文档与连续帧的类比(稀疏证据 + 高分辨率细节),LongVideo-R1、VideoDeepResearch 等可与其互补;其二,与 DeepSeek-OCR 式光学压缩编码器结合,把「低分辨率开局」进一步升级为可学习的上下文光学压缩;其三,引入多区域并行放大与跨页证据聚合结构,优化多跳问题的取证拓扑,减少串行轮次;其四,把弃答能力扩展为带证据引用的可验证回答——每条答案附带 zoom 轨迹作为 provenance,天然适配审计需求强的金融、医疗、法律文档场景;其五,在奖励中加入延迟/token 预算项,直接优化准确率-成本 Pareto 前沿而非单纯准确率,与本文的延迟理论(Proposition 2)形成闭环;其六,把「三级过滤 + 双智能体蒸馏 + 失败轨迹转 RL」的数据流水线泛化为通用难例自动挖掘框架,服务于其他智能体能力(网页操作、代码库导航)的训练数据生产。
复现评估
复现条件在同类工作中属于相当好的水平:代码、数据集(含 17,913 条 SFT 轨迹与 19,236 条 RL prompt)和模型权重均在 GitHub(github.com/m-Just/InSight-doc)发布,训练样本示例还放在 HuggingFace 供检查。骨干是开源的 Qwen3-VL-8B-Instruct,训练框架为 verl + GRPO,超参全部公开:SFT 全参微调、全局 batch 32、学习率 $5\times10^{-6}$、2 epochs、序列上限 65,536、序列并行 4、视觉编码器冻结;RL 800 步、每步 24 prompt × 8 rollout、学习率 $1\times10^{-6}$、KL 系数 0.01、rollout 温度 0.7。数据构造与评测依赖闭源 API(Gemini 3.1 Flash-Lite、GPT-5-mini、GPT-5-nano、GPT-5),完整复刻数据管线需要相应 API 预算;判官虽经 150 例人工校准集验证(legacy-v2 准确率 94.7%),但闭源判官仍是复现性的薄弱环节。算力方面,8B 全参 SFT + GRPO 需要多卡高端 GPU(论文未披露确切 GPU 时),推理评测用 vLLM 单机多卡即可(4 副本、前缀缓存开启)。总体难度评估:中等偏低——权重和已处理数据覆盖了最难的文档部分,从零重建数据管线才有较高成本。
论文图表