← 返回 2026-07-31

See2Think:诊断多模态模型是否真正使用中间视觉状态的统一评测框架 See2Think: Do Multimodal Models Really Use Intermediate Visual States?

Siyu Yan, Zhuoran Yan, Haiying Xu, Panhao Zhou, Jingyu Chen, Chenhao Ji, Shuo Cao, Yongheng Zhang, Haoze Liu, Siyu Zhang, Xiwen Gu, Yihao Liu, Alex Jinpeng Wang 📅 2026-07-29 👍 24 2026-08-05 19:06
可解释性诊断 基准评测 多模态推理 视觉动作 视觉思维链

提出含1.2K基准与VAoT协议的See2Think框架,分离视觉状态效用与行为依赖。

前置知识

Chain-of-Thought (CoT) 思维链

让语言模型把推理过程外化为一系列中间文本步骤的技术,由「让我们一步步思考」式提示或训练获得。它通过显式写出每一步推导,提升复杂推理的准确率与可解释性,是当前大模型推理增强的主流范式。

本文把CoT从纯文本延伸到视觉领域,对比「文本CoT」与「视觉动作CoT」四种设定,理解CoT才能理解论文在解构的对象。

多模态大语言模型 (MLLM)

能同时处理图像与文本的大模型,如GPT-5.5、GPT-o3、Gemini 3.5 Flash、Qwen3-VL等。它们通过视觉编码器把图像变成token,再与大语言模型对齐,可看图答题、生成图像标注或调用视觉工具。

论文评测的四个对象就是当前最前沿的MLLM,要理解它们的差异才能读懂模型profile(text-first/planner-first/closed-loop)的分类。

视觉动作与外部渲染器 (Visual Action / Renderer)

视觉动作是模型输出的结构化指令,如highlight(高亮)、annotate(标注)、draw_line(画辅助线)、crop(裁剪)、zoom(放大)、trace_highlight(描线),坐标归一化到0-1000。外部渲染器接收当前图像与动作,执行受限编辑并返回新图像状态,它「只编辑不解题」,不接收参考答案或推理目标。

VAoT协议的核心机制,理解动作空间和渲染器原则才能理解三维度评分(动作相关性、渲染忠实度、反馈吸收)测的是什么。

视觉状态效用 vs 行为依赖 (Utility vs Dependence)

效用指「正确渲染的中间图像能否带来净准确率提升」(VAoT-NoRender→VAoT);行为依赖指「损坏返回的图像是否导致准确率下降」(VAoT→VAoT-WrongRender)。两者不等价:模型可能「用上了图」却没变准,也可能「没受益」但「一篡改就崩」。

这是论文最锐利的概念贡献——把过去混为一谈的两件事拆开,整个诊断框架都建立在这个区分之上。

Caption-only 可解性过滤

用强多模态模型对每题生成「只描述视觉证据、不答题」的详细caption,再让推理模型只看问题+caption(隐去原图)答题5次,3次以上答对即判为「caption可解」并剔除,保留真正需要看原图的样本。这用于压制文本捷径。

保证基准题目真的依赖视觉而非语言先验,是整个数据构造质量的关键,也是See2Think区别于MIRA等基准的卖点。

研究动机

现有视觉推理基准存在双重局限。数据层面,MIRA、ViC-Bench、TWI-PRMBench、TwiFF-Bench等任务集视觉多样性有限,且未筛除文本捷径——很多题目靠问题文本、语言先验或详细文字描述就能蒙对,并不真正需要看图。评估层面,标准多模态基准只看最终答案,多模态CoT评估只评文本理由,视觉思维基准虽然引入了草图、工具或中间图像,但要么通过端任务性能、oracle视觉线索,要么通过聚合过程分数评估,缺少匹配的干预实验。结果是无法联合判断三个问题:模型自生成的视觉动作是否任务相关、返回的视觉状态是否忠实实现了该动作、后续推理是否行为性地依赖这些视觉证据。例如Robot Manipulation任务在GPT-o3上VAoT准确率仅0.0%-2.0%,即便有视觉动作也救不回定位错误,但既有基准无法揭示这种「动作正确却答错」的失效。

本文的目标是本文目标是构建一个统一评测框架See2Think,把长期被混为一谈的「中间视觉状态是否真有用」和「模型行为是否真依赖它」这两个问题显式解耦。具体包括三点:(1)提供See2ThinkBench,一个1.2K样本、12类任务、覆盖2D结构化/3D场景/真实世界三层视觉环境的视觉依赖基准,并通过caption-only可解性过滤系统性压制文本捷径;(2)设计Visual Action-of-Thought(VAoT)协议,一个可观测、可干预的推理时框架,记录文本思考、视觉动作、渲染状态、后续推理的交错序列;(3)在四种受控推理设定(CoT/VAoT-NoRender/VAoT/VAoT-WrongRender)下诊断动作选择、视觉执行、反馈使用三个阶段,并用任务相关损坏反馈区分视觉状态效用与行为依赖。

与已有工作不同的是,本文独特角度在于首次显式分离「视觉状态效用」(correct rendering是否带来净增益)与「行为依赖」(corrupt返回状态是否导致性能退化),并用任务相关的损坏反馈做受控干预。之前的诊断工作要么引入训练目标(如View Dropout通过限制原始视图信息流来强制依赖生成的thinking image),要么对比独立训练的tool/non-tool agent,而See2Think是模型无关的推理时框架,在四个前沿模型上对同一组样本做匹配的标准/损坏渲染对照。它还首次联合诊断Action Relevance、Render Faithfulness、Feedback Uptake三个阶段,精确定位到「忠实渲染」才是真正瓶颈——Action Relevance已达0.95+饱和,而Render Faithfulness仅约0.59-0.63,这种阶段化归因是过去工作没有的。

核心方法

整体思路建立在一个直觉上:模型生成的「视觉草稿纸」(crop、annotate、sketch中间图像)未必真的被用上,单纯存在视觉轨迹或最终答对都不能证明真用了图。技术路线分两条腿。数据侧See2ThinkBench负责「题目要难、要真依赖图」:从RBench-V、EMMA、M3CoT、PRISM-Bench、CLEVR、SuperCLEVR、VLABench、DROID、IntPhys2九个源数据集收集候选,做caption-only可解性过滤、答案格式归一、人工质控,每类100样本共1200题。协议侧VAoT负责「过程要可观测、可干预」:把推理建模为交错序列 $T = \{T_t, A_t, R_t\}_{t=1}^{N}$,下一步文本由 $T_{t+1} \sim \mathcal{M}(I, q, H_t)$ 生成(其中 $H_t$ 是累积历史),动作空间含highlight/annotate/draw_line/crop/zoom等,外部渲染器只执行受限编辑不解题。两条腿合在一起,既保证题目质量,又让推理过程可被外部检查和干预。

核心创新是把「动作相关性—渲染忠实度—反馈吸收」三个阶段拆开独立评分,并配合四种受控设定做对照实验,从而把「有视觉轨迹」「答对了」「真依赖」三件事分清。这区别于以往只看最终答案或只看轨迹质量的范式:CoT只在原图上文本推理(基线);VAoT-NoRender只生成结构化动作但不执行,用来隔离「单纯规划」的收益;VAoT闭环执行并返回渲染状态,测净效用;VAoT-WrongRender返回任务相关但被损坏的「自然但错误」的状态,测行为依赖。最锐利的洞察是 utility ≠ dependence:VAoT可能并不比NoRender准(净效用低),但WrongRender却仍能让准确率掉10+个百分点(依赖强),说明模型确实在看返回的图,只是没看对或没受益。评分时用GPT-5.4对每个轨迹选一个关键视觉步,对三维度打 $\{0, 0.5, 1\}$ 分,并隐藏模型身份和正误标签以防偏置。

方法步骤详情

完整流程分为七步。(1)源数据收集:从9个数据集按语义类映射到12类,过滤缺图/重复/无效样本。(2)视觉依赖过滤:用强多模态模型对每题生成「只描述视觉证据不答题」的详细caption,再把问题+caption(隐去原图)喂给推理模型5次,3次以上答对判为caption-solvable并剔除,保留真正依赖图的样本。(3)答案格式转换:尽量去掉选项改写为free-form题(1073题),仅127题因选项本身是推理一部分而保留结构化候选。(4)人工质控:检查答案唯一性、图题一致、视觉接地是否充分,歧义或文本捷径样本修订或剔除。(5)推理:四个模型在1200题上跑四种设定,渲染器收到当前图+结构化动作,忠实渲染时只执行编辑保留无关内容,WrongRender用modify_key条件篡改任务相关证据但保持自然外观。(6)评估:结构化答案做归一化精确匹配,free-form用语义等价判定器判断,过程维度由judge对关键步打分。(7)分析:配对干预——VAoT-NoRender→VAoT算render benefit/harm,VAoT→VAoT-WrongRender算 $\text{Acc}_{\text{VAoT}} - \text{Acc}_{\text{WrongRender}}$,并按Render Faithfulness/Feedback Uptake分箱。

技术新颖性

技术新颖性体现在三方面。一是caption-only可解性过滤(5次查询3次以上答对即剔除)系统压制文本捷径,比单纯声称「需要视觉」的基准更可信,1073题采用free-form格式进一步消除选项猜测。二是VAoT作为模型无关、推理时、无需访问模型内部的诊断协议,把视觉推理拆成可外部检验的有限动作空间,渲染器被约束成「只编辑不解题」的工作台——这让它能跨任意黑盒模型部署。三是utility/dependence解耦,这是最锐利的贡献:对照实验显示Feedback Uptake最高的Qwen3-VL(0.871)反而最终准确率最低(35.7%),印证「用上了」≠「用对了」;而3D场景下WrongRender随Feedback Uptake从0→0.5→1升高,accuracy drop从3.5→10.3→15.5个百分点单调增大,提供了行为依赖存在的强证据。对比TwiFF-Bench虽有Feedback Intervention却缺Action-Render-Use三段诊断,See2Think是首个同时具备五项能力(生成IVS、闭环、过程评估、反馈干预、三段诊断)的基准。

Construction pipeline.
Figure 3: Construction pipeline.
Visual Action-of-Thought.
Figure 4: Visual Action-of-Thought.

实验结果

核心发现可归纳为八点。(1)无单一最优策略:GPT-5.5/Qwen3-VL最优设定是CoT(50.2%/38.7%),GPT-o3是VAoT(43.8%),Gemini 3.5 Flash是VAoT-NoRender(58.2%),视觉推理是条件性能力而非通用加速器。(2)任务regime:2D结构化题直接在原图推理最强,3D场景VAoT-NoRender平均最强(即使不渲染,显式选对象也能组织关系推理),真实世界三者持平。(3)过程瓶颈定位:Action Relevance接近饱和(0.958-0.994),Render Faithfulness明显偏低(0.594-0.630),最大退化发生在动作选择之后——规划合理但渲染失真且没被正确用上。(4)不同环境失败阶段不同:3D场景correct-incorrect的Render Faithfulness gap最大(0.097),真实世界靠Action Relevance区分(0.044),2D三者gap都很小(≤0.026)。(5)render benefit/harm:完全失真渲染在2D/3D带来-6.1/-9.3pp净负效应,提高faithfulness主要减少harm,faith=1时2D仍-1.2pp但3D/真实世界转正(+0.3/+0.9)。(6)行为依赖:corrupted feedback使3D场景随FU升高drop从3.5→10.3→15.5pp,并在32.7%-54.2%样本上改变语义答案。(7)Robot Manipulation是稳定低分离群点(多数1%-4%),因要求精确目标定位。(8)人工验证:两个标注员480次评分中92.9%-96.9%至少部分合理。

Comparison with representative benchmarks and evaluation frameworks for visual intermediate reasoning.
Table 1: Comparison with representative benchmarks and evaluation frameworks for visual intermediate reasoning.
Overall accuracy on See2ThinkBench.
Table 2: Overall accuracy on See2ThinkBench.
Process-level diagnosis on the complete VAoT trajectories.
Table 3: Process-level diagnosis on the complete VAoT trajectories.
Human alignment of process-level evaluation.
Table 4: Human alignment of process-level evaluation.
Visual-action reasoning across task groups and models.
Figure 5: Visual-action reasoning across task groups and models.
Process-level diagnosis across visual environments.
Figure 6: Process-level diagnosis across visual environments.
Rendering benefit and harm by Render Faithfulness.
Figure 7: Rendering benefit and harm by Render Faithfulness.
Accuracy degradation under corrupted feedback.
Figure 8: Accuracy degradation under corrupted feedback.
查看结构化数据
任务指标本文基线提升
整体1200题准确率 Overall Accuracy (%) Gemini 3.5 Flash + VAoT-NoRender 达 58.2% Qwen3-VL-32B CoT 38.7% / GPT-o3 VAoT 43.8% Gemini 3.5 Flash为四模型最强,但最优设定随模型变化,无单一策略通吃
3D场景行为依赖(损坏反馈) Acc_VAoT − Acc_WrongRender (pp) FU=1时drop达15.5pp(FU=0.5时10.3pp) FU=0时仅3.5pp Feedback Uptake越高,损坏反馈造成的退化越大,证明模型确实行为性依赖返回的视觉状态
渲染忠实度对净效用的影响 Net = Benefit − Harm (pp) Render Faithfulness=1时3D净+0.3pp、真实世界+0.9pp Render Faithfulness=0时3D净-9.3pp 提高渲染忠实度主要靠减少harm,把净平衡从负推向中性或微正
过程瓶颈定位 Action Relevance / Render Faithfulness (0-1) Action Relevance 0.976,Render Faithfulness 仅0.616(GPT-5.5) Action Relevance接近饱和 明确指出渲染忠实度是视觉推理的主要瓶颈,而非动作选择

局限与改进

作者承认的局限有三:(1)只评了4个代表模型,未必覆盖所有当前和未来VL系统的多样性;(2)VAoT依赖外部渲染组件和自动过程评估,虽有3D渲染器误差和人工验证,仍可能引入噪声——Render Faithfulness人工strict reasonable率仅70.2%,partial达92.9%,边界争议明显;(3)WrongRender效应幅度依赖干预质量,120例人工审核仅56.7% Strict Pass、78.3% Acceptable,质量过滤后strict子集drop 8.82pp、relaxed子集仅3.19pp,方向稳定但幅度敏感。我自己的观察:benchmark全来自已有数据集再加工,未见全新真值标注,可能继承源数据偏差;外部judge统一用GPT-5.4,对Gemini/Qwen可能有系统偏差;WrongRender用图像编辑模型生成「自然但错误」图,本身有失败率,且modify_non_key条件完全没用在主实验;1200题每类100题规模偏小,单类方差大(如Robot Manipulation近乎全错),3D仅200题统计不稳。

独立分析的弱点

独立分析的弱点有六。(1)模型覆盖窄:只4个模型,缺开源中型模型(InternVL、Llama-Vision等)和专门视觉agent,建议未来纳入专门训练过tool-use的模型,并报告模型族间方差。改进方向:扩大评测矩阵。(2)外部渲染器既是瓶颈源也是评分对象,存在循环风险——渲染不好导致faithfulness低,但渲染器本身能力未独立评估。改进方向:把渲染器作为可控变量,或学习更好的渲染机制。(3)WrongRender干预质量不可控(Strict Pass仅56.7%),modify_key但保留「自然外观」的语义本身模糊,不同图像编辑模型产出差异大。改进方向:用确定性程序化扰动(交换颜色、移动坐标)替代生成式篡改,提升可复现性和信号纯净度。(4)Feedback Uptake与行为依赖关联在2D/真实世界非单调(real-world FU=1时drop反为-0.7),说明该指标作为依赖proxy在部分环境失效。改进方向:引入更直接的注意力/梯度探针验证依赖。(5)评测judge用GPT-5.4单一模型,存在评估同源偏差风险。改进方向:多judge集成或人评校准。(6)样本量每类仅100,少数类别近乎全错导致统计不稳。改进方向:分层扩大样本。

未来方向

作者明确提的方向:更广模型覆盖、学习型渲染机制、更细粒度的过程监督。基于成果可延伸六点。(1)把VAoT从诊断协议扩展为训练信号——用Render Faithfulness/Feedback Uptake做RL奖励,训练真正「会看图」的模型,而非只产出视觉轨迹。(2)探索可微渲染器或神经符号渲染,让渲染错误可反向传播纠正,直接优化瓶颈环节。(3)将utility/dependence解耦思路推广到其他工具调用场景(检索、代码执行、计算器),判断agent是否真依赖工具输出而非装饰性调用。(4)构建动态/视频版本See2ThinkBench,诊断时序中间状态使用,现有版本仅静态图。(5)研究为何Feedback Uptake高≠准确率高(如Qwen3-VL的0.871 uptake对应35.7% accuracy),可能是模型机械复读渲染内容但未正确推理,提示需要「深度吸收」而非「表面引用」的新评估维度。(6)开发针对性数据增强或课程学习,专门提升Render Faithfulness这个被明确指出的瓶颈。

复现评估

复现性较好。代码和网站公开(github.com/CSU-JPG/See2Think、sgysy.github.io/seetothink),论文附录详尽给出所有prompt(caption生成、caption-only测试、free-form改写、Text-CoT、VAoT、VAoT-NoRender、WrongRender干预、答案判定、过程评分)、源数据集到12类的映射表、人工审核协议和240条人审结果。数据构建流水线可复现,9个源数据集均公开。主要挑战有四:(1)依赖闭源前沿模型GPT-5.5/GPT-o3/Gemini 3.5 Flash作为被测对象、GPT-5.4作为judge,这些模型会迭代导致结果漂移,长期复现困难;(2)VAoT和WrongRender的多轮交互需较大API预算(4模型×4设定×1200题+4800条过程评分+judge调用),算力/资金成本不低;(3)WrongRender依赖图像编辑模型,论文未完全公开该编辑器实现和随机种子,干预复现最难,56.7%的Strict Pass率本身也说明干预信号不纯;(4)过程评分是judge主观打分,需人工校准(论文已做240条/2标注员人审)。整体属于benchmark论文中复现度上乘者,但闭源模型依赖是结构性限制。