See2Think:诊断多模态模型是否真正使用中间视觉状态的统一评测框架 See2Think: Do Multimodal Models Really Use Intermediate Visual States?
提出含1.2K基准与VAoT协议的See2Think框架,分离视觉状态效用与行为依赖。
前置知识
Chain-of-Thought (CoT) 思维链
让语言模型把推理过程外化为一系列中间文本步骤的技术,由「让我们一步步思考」式提示或训练获得。它通过显式写出每一步推导,提升复杂推理的准确率与可解释性,是当前大模型推理增强的主流范式。
本文把CoT从纯文本延伸到视觉领域,对比「文本CoT」与「视觉动作CoT」四种设定,理解CoT才能理解论文在解构的对象。
多模态大语言模型 (MLLM)
能同时处理图像与文本的大模型,如GPT-5.5、GPT-o3、Gemini 3.5 Flash、Qwen3-VL等。它们通过视觉编码器把图像变成token,再与大语言模型对齐,可看图答题、生成图像标注或调用视觉工具。
论文评测的四个对象就是当前最前沿的MLLM,要理解它们的差异才能读懂模型profile(text-first/planner-first/closed-loop)的分类。
视觉动作与外部渲染器 (Visual Action / Renderer)
视觉动作是模型输出的结构化指令,如highlight(高亮)、annotate(标注)、draw_line(画辅助线)、crop(裁剪)、zoom(放大)、trace_highlight(描线),坐标归一化到0-1000。外部渲染器接收当前图像与动作,执行受限编辑并返回新图像状态,它「只编辑不解题」,不接收参考答案或推理目标。
VAoT协议的核心机制,理解动作空间和渲染器原则才能理解三维度评分(动作相关性、渲染忠实度、反馈吸收)测的是什么。
视觉状态效用 vs 行为依赖 (Utility vs Dependence)
效用指「正确渲染的中间图像能否带来净准确率提升」(VAoT-NoRender→VAoT);行为依赖指「损坏返回的图像是否导致准确率下降」(VAoT→VAoT-WrongRender)。两者不等价:模型可能「用上了图」却没变准,也可能「没受益」但「一篡改就崩」。
这是论文最锐利的概念贡献——把过去混为一谈的两件事拆开,整个诊断框架都建立在这个区分之上。
Caption-only 可解性过滤
用强多模态模型对每题生成「只描述视觉证据、不答题」的详细caption,再让推理模型只看问题+caption(隐去原图)答题5次,3次以上答对即判为「caption可解」并剔除,保留真正需要看原图的样本。这用于压制文本捷径。
保证基准题目真的依赖视觉而非语言先验,是整个数据构造质量的关键,也是See2Think区别于MIRA等基准的卖点。
研究动机
现有视觉推理基准存在双重局限。数据层面,MIRA、ViC-Bench、TWI-PRMBench、TwiFF-Bench等任务集视觉多样性有限,且未筛除文本捷径——很多题目靠问题文本、语言先验或详细文字描述就能蒙对,并不真正需要看图。评估层面,标准多模态基准只看最终答案,多模态CoT评估只评文本理由,视觉思维基准虽然引入了草图、工具或中间图像,但要么通过端任务性能、oracle视觉线索,要么通过聚合过程分数评估,缺少匹配的干预实验。结果是无法联合判断三个问题:模型自生成的视觉动作是否任务相关、返回的视觉状态是否忠实实现了该动作、后续推理是否行为性地依赖这些视觉证据。例如Robot Manipulation任务在GPT-o3上VAoT准确率仅0.0%-2.0%,即便有视觉动作也救不回定位错误,但既有基准无法揭示这种「动作正确却答错」的失效。
本文的目标是本文目标是构建一个统一评测框架See2Think,把长期被混为一谈的「中间视觉状态是否真有用」和「模型行为是否真依赖它」这两个问题显式解耦。具体包括三点:(1)提供See2ThinkBench,一个1.2K样本、12类任务、覆盖2D结构化/3D场景/真实世界三层视觉环境的视觉依赖基准,并通过caption-only可解性过滤系统性压制文本捷径;(2)设计Visual Action-of-Thought(VAoT)协议,一个可观测、可干预的推理时框架,记录文本思考、视觉动作、渲染状态、后续推理的交错序列;(3)在四种受控推理设定(CoT/VAoT-NoRender/VAoT/VAoT-WrongRender)下诊断动作选择、视觉执行、反馈使用三个阶段,并用任务相关损坏反馈区分视觉状态效用与行为依赖。
与已有工作不同的是,本文独特角度在于首次显式分离「视觉状态效用」(correct rendering是否带来净增益)与「行为依赖」(corrupt返回状态是否导致性能退化),并用任务相关的损坏反馈做受控干预。之前的诊断工作要么引入训练目标(如View Dropout通过限制原始视图信息流来强制依赖生成的thinking image),要么对比独立训练的tool/non-tool agent,而See2Think是模型无关的推理时框架,在四个前沿模型上对同一组样本做匹配的标准/损坏渲染对照。它还首次联合诊断Action Relevance、Render Faithfulness、Feedback Uptake三个阶段,精确定位到「忠实渲染」才是真正瓶颈——Action Relevance已达0.95+饱和,而Render Faithfulness仅约0.59-0.63,这种阶段化归因是过去工作没有的。
核心方法
整体思路建立在一个直觉上:模型生成的「视觉草稿纸」(crop、annotate、sketch中间图像)未必真的被用上,单纯存在视觉轨迹或最终答对都不能证明真用了图。技术路线分两条腿。数据侧See2ThinkBench负责「题目要难、要真依赖图」:从RBench-V、EMMA、M3CoT、PRISM-Bench、CLEVR、SuperCLEVR、VLABench、DROID、IntPhys2九个源数据集收集候选,做caption-only可解性过滤、答案格式归一、人工质控,每类100样本共1200题。协议侧VAoT负责「过程要可观测、可干预」:把推理建模为交错序列 $T = \{T_t, A_t, R_t\}_{t=1}^{N}$,下一步文本由 $T_{t+1} \sim \mathcal{M}(I, q, H_t)$ 生成(其中 $H_t$ 是累积历史),动作空间含highlight/annotate/draw_line/crop/zoom等,外部渲染器只执行受限编辑不解题。两条腿合在一起,既保证题目质量,又让推理过程可被外部检查和干预。
核心创新是把「动作相关性—渲染忠实度—反馈吸收」三个阶段拆开独立评分,并配合四种受控设定做对照实验,从而把「有视觉轨迹」「答对了」「真依赖」三件事分清。这区别于以往只看最终答案或只看轨迹质量的范式:CoT只在原图上文本推理(基线);VAoT-NoRender只生成结构化动作但不执行,用来隔离「单纯规划」的收益;VAoT闭环执行并返回渲染状态,测净效用;VAoT-WrongRender返回任务相关但被损坏的「自然但错误」的状态,测行为依赖。最锐利的洞察是 utility ≠ dependence:VAoT可能并不比NoRender准(净效用低),但WrongRender却仍能让准确率掉10+个百分点(依赖强),说明模型确实在看返回的图,只是没看对或没受益。评分时用GPT-5.4对每个轨迹选一个关键视觉步,对三维度打 $\{0, 0.5, 1\}$ 分,并隐藏模型身份和正误标签以防偏置。
方法步骤详情
完整流程分为七步。(1)源数据收集:从9个数据集按语义类映射到12类,过滤缺图/重复/无效样本。(2)视觉依赖过滤:用强多模态模型对每题生成「只描述视觉证据不答题」的详细caption,再把问题+caption(隐去原图)喂给推理模型5次,3次以上答对判为caption-solvable并剔除,保留真正依赖图的样本。(3)答案格式转换:尽量去掉选项改写为free-form题(1073题),仅127题因选项本身是推理一部分而保留结构化候选。(4)人工质控:检查答案唯一性、图题一致、视觉接地是否充分,歧义或文本捷径样本修订或剔除。(5)推理:四个模型在1200题上跑四种设定,渲染器收到当前图+结构化动作,忠实渲染时只执行编辑保留无关内容,WrongRender用modify_key条件篡改任务相关证据但保持自然外观。(6)评估:结构化答案做归一化精确匹配,free-form用语义等价判定器判断,过程维度由judge对关键步打分。(7)分析:配对干预——VAoT-NoRender→VAoT算render benefit/harm,VAoT→VAoT-WrongRender算 $\text{Acc}_{\text{VAoT}} - \text{Acc}_{\text{WrongRender}}$,并按Render Faithfulness/Feedback Uptake分箱。
技术新颖性
技术新颖性体现在三方面。一是caption-only可解性过滤(5次查询3次以上答对即剔除)系统压制文本捷径,比单纯声称「需要视觉」的基准更可信,1073题采用free-form格式进一步消除选项猜测。二是VAoT作为模型无关、推理时、无需访问模型内部的诊断协议,把视觉推理拆成可外部检验的有限动作空间,渲染器被约束成「只编辑不解题」的工作台——这让它能跨任意黑盒模型部署。三是utility/dependence解耦,这是最锐利的贡献:对照实验显示Feedback Uptake最高的Qwen3-VL(0.871)反而最终准确率最低(35.7%),印证「用上了」≠「用对了」;而3D场景下WrongRender随Feedback Uptake从0→0.5→1升高,accuracy drop从3.5→10.3→15.5个百分点单调增大,提供了行为依赖存在的强证据。对比TwiFF-Bench虽有Feedback Intervention却缺Action-Render-Use三段诊断,See2Think是首个同时具备五项能力(生成IVS、闭环、过程评估、反馈干预、三段诊断)的基准。
实验结果
核心发现可归纳为八点。(1)无单一最优策略:GPT-5.5/Qwen3-VL最优设定是CoT(50.2%/38.7%),GPT-o3是VAoT(43.8%),Gemini 3.5 Flash是VAoT-NoRender(58.2%),视觉推理是条件性能力而非通用加速器。(2)任务regime:2D结构化题直接在原图推理最强,3D场景VAoT-NoRender平均最强(即使不渲染,显式选对象也能组织关系推理),真实世界三者持平。(3)过程瓶颈定位:Action Relevance接近饱和(0.958-0.994),Render Faithfulness明显偏低(0.594-0.630),最大退化发生在动作选择之后——规划合理但渲染失真且没被正确用上。(4)不同环境失败阶段不同:3D场景correct-incorrect的Render Faithfulness gap最大(0.097),真实世界靠Action Relevance区分(0.044),2D三者gap都很小(≤0.026)。(5)render benefit/harm:完全失真渲染在2D/3D带来-6.1/-9.3pp净负效应,提高faithfulness主要减少harm,faith=1时2D仍-1.2pp但3D/真实世界转正(+0.3/+0.9)。(6)行为依赖:corrupted feedback使3D场景随FU升高drop从3.5→10.3→15.5pp,并在32.7%-54.2%样本上改变语义答案。(7)Robot Manipulation是稳定低分离群点(多数1%-4%),因要求精确目标定位。(8)人工验证:两个标注员480次评分中92.9%-96.9%至少部分合理。
查看结构化数据
| 任务 | 指标 | 本文 | 基线 | 提升 |
|---|---|---|---|---|
| 整体1200题准确率 | Overall Accuracy (%) | Gemini 3.5 Flash + VAoT-NoRender 达 58.2% | Qwen3-VL-32B CoT 38.7% / GPT-o3 VAoT 43.8% | Gemini 3.5 Flash为四模型最强,但最优设定随模型变化,无单一策略通吃 |
| 3D场景行为依赖(损坏反馈) | Acc_VAoT − Acc_WrongRender (pp) | FU=1时drop达15.5pp(FU=0.5时10.3pp) | FU=0时仅3.5pp | Feedback Uptake越高,损坏反馈造成的退化越大,证明模型确实行为性依赖返回的视觉状态 |
| 渲染忠实度对净效用的影响 | Net = Benefit − Harm (pp) | Render Faithfulness=1时3D净+0.3pp、真实世界+0.9pp | Render Faithfulness=0时3D净-9.3pp | 提高渲染忠实度主要靠减少harm,把净平衡从负推向中性或微正 |
| 过程瓶颈定位 | Action Relevance / Render Faithfulness (0-1) | Action Relevance 0.976,Render Faithfulness 仅0.616(GPT-5.5) | Action Relevance接近饱和 | 明确指出渲染忠实度是视觉推理的主要瓶颈,而非动作选择 |
局限与改进
作者承认的局限有三:(1)只评了4个代表模型,未必覆盖所有当前和未来VL系统的多样性;(2)VAoT依赖外部渲染组件和自动过程评估,虽有3D渲染器误差和人工验证,仍可能引入噪声——Render Faithfulness人工strict reasonable率仅70.2%,partial达92.9%,边界争议明显;(3)WrongRender效应幅度依赖干预质量,120例人工审核仅56.7% Strict Pass、78.3% Acceptable,质量过滤后strict子集drop 8.82pp、relaxed子集仅3.19pp,方向稳定但幅度敏感。我自己的观察:benchmark全来自已有数据集再加工,未见全新真值标注,可能继承源数据偏差;外部judge统一用GPT-5.4,对Gemini/Qwen可能有系统偏差;WrongRender用图像编辑模型生成「自然但错误」图,本身有失败率,且modify_non_key条件完全没用在主实验;1200题每类100题规模偏小,单类方差大(如Robot Manipulation近乎全错),3D仅200题统计不稳。
独立分析的弱点
独立分析的弱点有六。(1)模型覆盖窄:只4个模型,缺开源中型模型(InternVL、Llama-Vision等)和专门视觉agent,建议未来纳入专门训练过tool-use的模型,并报告模型族间方差。改进方向:扩大评测矩阵。(2)外部渲染器既是瓶颈源也是评分对象,存在循环风险——渲染不好导致faithfulness低,但渲染器本身能力未独立评估。改进方向:把渲染器作为可控变量,或学习更好的渲染机制。(3)WrongRender干预质量不可控(Strict Pass仅56.7%),modify_key但保留「自然外观」的语义本身模糊,不同图像编辑模型产出差异大。改进方向:用确定性程序化扰动(交换颜色、移动坐标)替代生成式篡改,提升可复现性和信号纯净度。(4)Feedback Uptake与行为依赖关联在2D/真实世界非单调(real-world FU=1时drop反为-0.7),说明该指标作为依赖proxy在部分环境失效。改进方向:引入更直接的注意力/梯度探针验证依赖。(5)评测judge用GPT-5.4单一模型,存在评估同源偏差风险。改进方向:多judge集成或人评校准。(6)样本量每类仅100,少数类别近乎全错导致统计不稳。改进方向:分层扩大样本。
未来方向
作者明确提的方向:更广模型覆盖、学习型渲染机制、更细粒度的过程监督。基于成果可延伸六点。(1)把VAoT从诊断协议扩展为训练信号——用Render Faithfulness/Feedback Uptake做RL奖励,训练真正「会看图」的模型,而非只产出视觉轨迹。(2)探索可微渲染器或神经符号渲染,让渲染错误可反向传播纠正,直接优化瓶颈环节。(3)将utility/dependence解耦思路推广到其他工具调用场景(检索、代码执行、计算器),判断agent是否真依赖工具输出而非装饰性调用。(4)构建动态/视频版本See2ThinkBench,诊断时序中间状态使用,现有版本仅静态图。(5)研究为何Feedback Uptake高≠准确率高(如Qwen3-VL的0.871 uptake对应35.7% accuracy),可能是模型机械复读渲染内容但未正确推理,提示需要「深度吸收」而非「表面引用」的新评估维度。(6)开发针对性数据增强或课程学习,专门提升Render Faithfulness这个被明确指出的瓶颈。
复现评估
复现性较好。代码和网站公开(github.com/CSU-JPG/See2Think、sgysy.github.io/seetothink),论文附录详尽给出所有prompt(caption生成、caption-only测试、free-form改写、Text-CoT、VAoT、VAoT-NoRender、WrongRender干预、答案判定、过程评分)、源数据集到12类的映射表、人工审核协议和240条人审结果。数据构建流水线可复现,9个源数据集均公开。主要挑战有四:(1)依赖闭源前沿模型GPT-5.5/GPT-o3/Gemini 3.5 Flash作为被测对象、GPT-5.4作为judge,这些模型会迭代导致结果漂移,长期复现困难;(2)VAoT和WrongRender的多轮交互需较大API预算(4模型×4设定×1200题+4800条过程评分+judge调用),算力/资金成本不低;(3)WrongRender依赖图像编辑模型,论文未完全公开该编辑器实现和随机种子,干预复现最难,56.7%的Strict Pass率本身也说明干预信号不纯;(4)过程评分是judge主观打分,需人工校准(论文已做240条/2标注员人审)。整体属于benchmark论文中复现度上乘者,但闭源模型依赖是结构性限制。
论文图表
对比图:左侧Traditional Evaluation只看最终答案对错;右侧See2Think记录文本思考→视觉渲染→多轮反馈,并做三个过程级诊断(Action Relevance动作是否相关、Render Faithfulness渲染是否忠实、Feedback Uptake反馈是否被吸收),还用受控干预测试模型是否依赖返回的视觉状态。
这张图一图说清论文相对以往基准的定位差异——从「只看答案」升级到「诊断视觉状态是否真被用」,是理解整篇论文贡献的最佳入口。
展示12个任务类别的代表性样例,按三层视觉环境组织:2D结构化推理(Geometry、Spatial Puzzle、Physics、Chemistry、Science QA、Abstract Pattern)、3D场景推理(Object Attributes、Compositional 3D)、真实世界视觉推理(Robot Manipulation、Robot State Change、Visual Commonsense、Intuitive Physics),每类配一道典型题。
直观呈现基准覆盖的视觉推理广度,帮助读者理解后续按task group分析时各环境代表什么任务类型。