← 返回 2026-08-11

Evidence-RL:迈向证据密集的视觉推理 Evidence-RL: Towards Evidence-intensive Visual Reasoning

Haojie Huang, Xinlei Yu, Chengming Xu, Zhangquan Chen, Cheng Yang, Qingdong He, Yu Yang, Jiangning Zhang, Xiaobin Hu 📅 2026-08-08 👍 16 2026-08-16 18:30
GRPO 反事实推理 多模态大模型 奖励设计 强化学习后训练 视觉定位

用反事实证据干预把“答案是否依赖视觉证据”变成GRPO奖励,让VLM不再靠语言先验答题。

前置知识

GRPO(组相对策略优化)

GRPO 是一种免价值网络(critic-free)的强化学习后训练算法:对每个问题采样一组(group)候选回答,用组内奖励的均值和标准差把每个回答的奖励归一化成相对优势 $A_i=(R_i-\mu)/\sigma$,再用策略梯度更新模型。它省去了 PPO 中额外训练的价值模型,被 DeepSeek-R1 等广泛采用,是当前可验证奖励强化学习的主流选择。

本文的方法就是在 GRPO 框架内替换奖励定义,理解奖励如何在组内区分“同样答对但依赖路径不同”的轨迹,是看懂 Evidence-RL 的前提。

反事实干预与因果路径分解

源自 Pearl 结构因果模型的思想:要判断一个变量是否“导致”结果,需要在因果图上对它做干预(do 算子),观察结果如何变化,并与“排除其他路径”的对照比较。本文把“模型答对”分解为三条汇聚到答案节点的路径:目标证据路径、无关上下文路径(nuisance)、语言先验路径(shortcut),只有切断证据路径时答案支持度大幅下降,才说明答案真正走的是证据路径。

CED 的整个奖励设计就是把这条因果直觉变成可计算的训练信号,论文的动机和理论分析(evidence-closed self-evolution)都建立在这个因果视角上。

视觉 token 与 spatial merging

VLM 用视觉编码器把图像切成 patch 并编码为视觉 token 序列,与文本 token 一起送入语言模型。spatial merging 会把相邻的若干视觉 token 合并成一个,因此图像上一个矩形区域对应一组连续的视觉 token 下标,这使“在特征空间删掉某个区域”成为可能:直接把这些 token 替换成邻近 token 的均值 $\mu_T$ 即可,其余 token 不变。

CED 的干预不是在像素上打码,而是在特征空间替换视觉 token,理解这一点才能明白为什么它比置零、加噪等像素级干预引入更少伪影。

语言先验与捷径学习

模型不依赖图像中的关键证据,而是利用训练数据中的统计规律(如“眼镜通常有两个镜臂”“轿车通常有四个轮子”)或数据集偏差直接给出看似正确的答案。HallusionBench、VLMsAreBlind、FREAK 等基准专门度量这类失败:例如强大的 Qwen2.5-VL-7B 在 FREAK 上只有 12.18 分、在 VLMsAreBlind 上仅 46.44 分,大量输给了与图像证据冲突的先验答案。

本文的核心论点是:只看答案对错的奖励无法区分“靠证据答对”和“靠先验答对”,整个方法就是为消除这一捷径而设计的。

奖励破解(reward hacking)

当奖励定义中存在可被策略钻空子的自由度时,RL 会找到提高奖励但偏离设计意图的行为。本文在 CoT 变体中观察到典型案例:因为推理链长度由策略自己控制,模型学会截断低边际的连接词、把平均每 token 证据边际刷高,均值链长缩到 3.6 个 token,退化成对象线索速记,下游收益反而不如只对最终答案打分的 Answer 变体。

它解释了论文为什么默认采用 Answer-CED 而不是训练信号更强的 CoT-CED,也是设计任何过程类奖励时的通用教训。

研究动机

VLM 的正确答案未必建立在图像证据上。面对“图中有几个眼镜镜臂”这类问题,预训练模型常常直接套用“眼镜有两个镜臂”的语言先验,而无视图中实际可见的数量;这种失败在幻觉、计数、空间与捷径推理评测中被系统性记录,例如 Qwen2.5-VL-7B 作为强底座,在 FREAK 上仅得 12.18 分、在 VLMsAreBlind 上仅 46.44 分。近年的感知感知型后训练方法试图把图像拉回训练回路:PAPO 比较原图与全局损坏图像下模型行为的一致性,VPPO 用注意力推导的视觉依赖调整训练信号,但它们度量的都只是“模型是否对整张图敏感”这种粗粒度视觉依赖,无法回答“当前这个答案是否因果地依赖支撑它的局部证据”:全局扰动只能证明模型用到了图像,不能证明答案依赖的是那块关键区域;注意力只是内部路由的代理指标;而纯文本的审计型奖励(过程奖励、自进化评审)在结构上与图像条件独立——论文证明此时 $I(S_t; G_t \mid \hat{Y}_t, Q_t)=0$,两条同样答对的接地/捷径轨迹获得完全相同的奖励分布,捷径无法被惩罚。

本文的目标是论文的目标是构造一个能在训练时直接审计“证据依赖”的奖励信号,并无缝嵌入 GRPO,使模型在同组同样答对的候选回答中优先选择依赖目标视觉证据的那条轨迹。具体诉求有四点:第一,信号必须是答案条件化的反事实检验——对每个采样回答问“如果把支撑它的证据区域抹掉,这个回答的对数似然掉多少”,而不是对整张图做全局扰动;第二,不需要问题相关的证据标注,只用现成的对象级 COCO 框作为弱空间先验;第三,不引入任何推理时开销,反事实审计只在训练期进行,部署时模型照常推理;第四,信号要能跨底座迁移,在九个公开基准上带来非负增益。形式化地说,训练奖励为 $R_{train}=R_{ans}\cdot g(m)+\epsilon_{tie}\,m$,其中证据门控 $g(m)=\frac{1}{2}(1+\tanh(\tau_g m))$ 让同样正确的回答按证据边际被进一步排序,正确性始终保持主导。

与已有工作不同的是,本文的独特切入是把问题从“模型是否用了图像”升维到“答案是否依赖那块特定证据”,并用因果对照给出可计算的定义。与 PAPO 的全局扰动、VPPO 的注意力代理不同,CED 对每个候选回答执行区域级反事实干预:抹掉对象中心的证据区域 $\Omega_{ev}$,与 $K$ 个面积匹配、空间分离的非证据区域 $\{\Omega_{non_k}\}$ 的干预结果对比,后者构成样本局部的零假设分布——若回答只是对掩码伪影或无关上下文敏感,两类干预造成的支持度下降应当相当,只有证据区域造成更大下降才产生正边际。另一个关键差异是干预方式:不做像素置零或加噪,而是在 spatial merging 之后用邻域均值替换视觉 token,只移除区域特异信息而保留局部表征流形,减少干预伪影。论文还从信息论角度刻画了纯文本自进化的根本缺陷(evidence-closed self-evolution),论证图像条件信号是结构性必需,而不是评审器容量或可信度加权能解决的问题。

核心方法

Evidence-RL 是训练期流水线:策略模型对每道题采样候选回答,CED 为每个回答打一个“证据边际”分,再与答案正确性合成 GRPO 奖励。直觉上,真正看图回答的模型,其答案的对数似然应显著依赖证据区域:抹掉证据,支持度大幅下降;抹掉别处,几乎不变。技术上:(1) 用 COCO 对象框解析出证据区域 $\Omega_{ev}$,采样 $K$ 个面积匹配、空间分离的非证据区域作局部零分布;(2) 在 spatial merging 后对每个区域做均值替换,把该区域视觉 token 换成邻近 token 均值 $\mu_T$;(3) 由反事实对数似然下降 $s(\Omega)$ 归一化出有界对比边际 $m=\tanh\frac{s(\Omega_{ev})-\mu(s_{non})}{\sigma(s_{non})+\epsilon}$,正值说明回答更依赖证据区域而非对照区域;(4) 以 $R_{train}=R_{ans}\cdot g(m)+\epsilon_{tie}\,m$ 进入 GRPO 组内归一化($\tau_g=0.20$、$\epsilon_{tie}=0.10$),正确性主导梯度,边际只负责在同分回答中排序。审计仅存在于训练期,推理零开销。

核心创新是把“证据依赖”从模糊直觉变成样本内可对照检验的因果量。已有方法的信号要么全局(整图扰动),要么间接(注意力),要么纯文本(过程奖励);CED 的关键洞察是引入“面积匹配的非证据区域”作为每个样本自己的对照零分布:同一个回答、同一种干预方式,只是位置不同。这样,对掩码伪影的普遍敏感、对无关上下文的敏感会同时体现在证据组和对照组里,在 $\frac{s(\Omega_{ev})-\mu(s_{non})}{\sigma(s_{non})+\epsilon}$ 中被抵消,剩下的才是证据特有的依赖。第二个关键设计是正确性锚定的门控奖励:答案错误时 $R_{ans}\to 0$,证据项退化为有界平局打破项 $|\epsilon_{tie}\,m|\le 0.10$,防止模型为刷证据分牺牲正确率;答案正确时 $g(m)$ 按证据边际放大奖励,论文案例显示一条靠“轿车四轮”先验答对的轨迹 $g(m)=0.18$、$R=0.11$,而真正数出“1前+2后+1备”的轨迹 $g(m)=1.00$、$R=0.78$,组内形成约 7 倍奖励差,GRPO 据此选中接地的轨迹。

方法步骤详情

流程分五步。第一步采样:策略模型对问题 $q$ 与图像 $I$ 生成候选回答 $y$(Answer 变体对最终答案段计分,CoT 变体对整条推理链平均边际)。第二步区域解析:从 COCO 对象级标注取出相关对象框作证据区域 $\Omega_{ev}$,再采 $K$ 个面积匹配、空间分离的非证据区域 $\{\Omega_{non_k}\}$ 联合估计局部零分布——它们不是人工负例,只是同一样本的对照。第三步干预:经 spatial merging 把区域映射到视觉 token 下标集 $T(\Omega)$,把这些 token 替换为邻近 token 均值 $\mu_T$,其余不动,得到反事实图像 $\tilde{I}$。第四步打分:计算反事实对数似然下降 $s(\Omega)=\log\pi_\theta(y\mid I,q)-\log\pi_\theta(y\mid\tilde{I}\backslash\Omega,q)$,合成边际 $m=\tanh\frac{s(\Omega_{ev})-\mu(s_{non})}{\sigma(s_{non})+\epsilon}$。第五步奖励与更新:按 $R_{train}=R_{ans}\cdot g(m)+\epsilon_{tie}\,m$ 计分($g(m)=\frac{1}{2}(1+\tanh(\tau_g m))$,$\tau_g=0.20$、$\epsilon_{tie}=0.10$),组内归一化后做 GRPO 更新;yes/no 型 presence 任务用二值动作路由适配。

技术新颖性

从技术谱系看,这篇论文处在三个方向的交汇点上并各自推进了一步。相对图像条件奖励(PAPO、VPPO 等),它第一次把干预从整图缩小到单个对象级区域,并要求信号超越面积匹配对照,因此测量的是证据特异依赖而非损坏幅度——把 COCO 框换成随机框,边际从 $\bar{m}=0.268$ 崩塌到 0.015,证明信号确实跟踪证据相关性。相对过程奖励与自进化方法,它指出文本闭环的结构性缺陷:文本奖励满足 $S_t\perp\!\!\!\perp I_t\mid(\hat{Y}_t,Q_t)$,故 $I(S_t;G_t\mid\hat{Y}_t,Q_t)=0$,无论评审器多强都无法区分接地与捷径轨迹;CED 通过注入图像条件信号打破这一闭环。相对推理期反事实探测与扰动可解释性方法,它把事后解释分数改造成训练奖励而不加标注与推理开销。机制上,特征空间均值替换也比置零、加噪更干净:判别 AUC 对比 0.669 > 0.641 > 0.629,而全局随机掩码低于基线(above-baseline rate 仅 0.490),说明方法依赖结构化局部反事实而非损坏幅度。

Overview of EVIDENCE-RL during post-training
Figure 2: Overview of EVIDENCE-RL during post-training
A case showing why correctness-only reward is insufficient
Figure 3: A case showing why correctness-only reward is insufficient

实验结果

五组核心结果。主表(Table 2,Qwen2.5-VL-7B):九基准平均 67.13,较底座 61.19 提高 +5.94,是对比 RL 方法中唯一九项 $\Delta$ 全非负的;增益集中在感知重基准——VLMsAreBlind 54.02(+7.58)、FREAK 26.40(+14.22,底座仅 12.18)、MMMU 57.47(+6.84),MathVista +6.30、MMBench +2.80、ScienceQA +3.10 亦为正。受控对比(Table 3,Qwen3.5-9B,同 15,314 样本与 LoRA 配置):Answer-CED 73.80(+11.34),correctness-only 61.22(−1.24),重训 VPPO 60.68(−1.78),重训 PAPO 41.07(−21.39,25% 重复片段率、58% 预算耗尽);CED 相对 correctness-only 平均多 +12.58。跨底座(Table 4):平均增益 +4.59 / +5.94 / +1.33 / +11.34(3 种子 +11.83),36 个单元非负。变体消融(Table 5):Answer +11.34 优于 CoT +10.60,后者计数链长坍缩至 3.6 token。信号验证(Table 1):计数任务 99.5% 组非恒定、90% 同答案不同奖励;presence 79% 零方差。鲁棒性:随机框使边际 0.268→0.015,IoU 分级退化 0.501→0.219(地板 0.147),冻结探针证据信号 1.534 对错类别 0.319。纯文本基准平均 −0.27 pp,单项 ≤1.5 pp。

Signal-validation statistics on counting and presence tasks
Table 1: Signal-validation statistics on counting and presence tasks
Nine-benchmark evaluation using Qwen2.5-VL-7B as the base model for Ours
Table 2: Nine-benchmark evaluation using Qwen2.5-VL-7B as the base model for Ours
Controlled comparison on Qwen3.5-9B with matched data, router, and compute
Table 3: Controlled comparison on Qwen3.5-9B with matched data, router, and compute
Answer vs. CoT variants on Qwen3.5-9B
Table 5: Answer vs. CoT variants on Qwen3.5-9B
CED probe robustness under proposal perturbation
Figure 5: CED probe robustness under proposal perturbation
查看结构化数据
任务指标本文基线提升
九基准平均(Qwen2.5-VL-7B 底座) 平均准确率 67.13 Qwen2.5-VL-7B 底座 61.19 +5.94,为对比 RL 方法中唯一九项全非负
VLMsAreBlind(感知盲区) 准确率 54.02 底座 46.44 +7.58
FREAK(细粒度视觉推理) 准确率 26.40 底座 12.18 +14.22,为最大单项增益
MMMU(大学级多模态推理) 准确率 57.47 底座 50.63 +6.84
CountBench(计数) 准确率 88.89 底座 81.82 +7.07
MathVista(数学视觉推理) 准确率 69.40 底座 63.10 +6.30
受控对比·九基准平均(Qwen3.5-9B) 平均准确率 Answer-CED 73.80 correctness-only 61.22 / 重训 VPPO 60.68 / 重训 PAPO 41.07 相对 correctness-only +12.58,相对 VPPO +13.12
跨底座九基准平均增益 平均绝对增益 Qwen3.5-9B +11.34(3 种子 +11.83) 各冻结底座 四个底座全部正增益(+4.59 / +5.94 / +1.33 / +11.34),36 个单元非负
Answer vs CoT 变体 九基准平均增益 Answer +11.34 CoT +10.60(训练奖励更高但链长坍缩至 3.6 token) Answer 平均高 0.74 且无奖励破解
纯文本基准(ARC、BoolQ、WinoGrande 等 8 项) 平均准确率变化 −0.27 pp 训练前 Qwen3.5-9B 几乎无损,单项跌幅 ≤1.5 pp

局限与改进

作者承认并展示的局限:其一,presence 类任务上 79% 的组奖励方差为零,说明二值动作路由下证据边际的组内区分度有限,信号主要在计数等开放答案任务上生效;其二,证据区域依赖 COCO 对象框这种弱空间先验,论文只实例化了空间区域型证据,属性级和关系级证据只给出扩展构想而未实现;其三,blank-image ScienceQA 上的行为与评分协议冲突——面对空白占位图(如“水泥卡车的质量是多少”),CED 回答“无法从图像判断”却被判错,压低了 ScienceQA 的表观增益,也说明该奖励会系统性抑制先验作答。我自己的观察:干预发生在特征空间,需要白盒访问视觉 token,对闭源模型不适用;训练奖励依赖可字符串验证的答案格式(计数、选择、yes-no),对开放式生成任务如何定义 $R_{ans}$ 未讨论;被训练底座全部来自 Qwen 系(LLaVA-v1.6-7B、InternVL3.5-8B 只作参考行),方法在其他模型家族上的迁移性仍是开放问题;此外,抑制先验的副作用会把“本来就该靠常识作答”的问题也拒答,在某些评测协议下可能被误判为能力退化。

独立分析的弱点

第一,对 proposal 质量敏感:随机框使边际从 0.268 崩到 0.015、relevant-beats-random 率跌至 0.487(近乎随机),IoU 低于 0.3 时边际逼近地板 0.147,说明弱标注框在真实场景(小目标、密集场景、非 COCO 类别)可能失效;改进方向是用开放词汇检测器提供候选框,或让策略自己提名区域并对提名质量加辅助损失。第二,特征空间干预与像素级接地不等价:均值替换作用在语言模型输入侧,可能被表征冗余部分抵消,也存在模型逐渐对干预鲁棒、信号衰减的风险;可补充像素级反事实作一致性正则并监控全程边际分布。第三,奖励破解在过程式变体上已被证实(CoT 链长坍缩到 3.6 个 token),扩展到更长推理链或工具调用场景时需要长度不变的打分界面。第四,证据定义局限于空间区域,颜色、属性、空间关系、图表等证据类型只有构想而无实验。第五,答案空间基本是可验证的短答案,开放式生成任务上“正确性”与“证据依赖”如何联合定义仍是空白;且每个候选回答需 $K+1$ 次干预前向,训练开销随组大小线性增长,论文未给出具体成本数字。

未来方向

作者在文中明确给出的延伸方向是把同一套反事实审计配方推广到属性级与关系级证据——通过更换干预方式(例如成对交换属性、破坏相对位置)而不必改动奖励框架;3.2 节的二值动作路由也暗示可针对不同答案类型设计专门的路由与打分接口。基于其成果可自然延伸的研究包括:把 CED 与可验证奖励结合用于多步工具调用与 agent 场景,逐步审计“每个结论是否依赖对应观测”;把训练期的证据边际复用为推理期的置信度或拒答信号,直接缓解幻觉;将 evidence-closed self-evolution 的信息论论证推广到多模态 judge、自博弈与自生成数据管线,给出“何时必须注入图像条件信号”的可检验判据;在视频与时序场景定义时空证据区域;以及工程上降低 $K+1$ 次额外前向的开销,例如缓存干预结果、蒸馏审计信号或用小模型做代理审计,使该方法能扩展到更大规模的预训练后训练流程。

复现评估

复现所需的关键配置论文披露得比较完整:训练集为 15,314 个 COCO 派生样本(对象级标注提供证据框),GRPO + LoRA、2000 步调度,固定超参 $\tau_g=0.20$、$\epsilon_{tie}=0.10$;底座为 Qwen2.5-VL-3B/7B、Qwen3-VL-8B、Qwen3.5-9B,LoRA 级训练在单机多卡上可行,主要额外开销是每个候选回答的 $K+1$ 次干预前向。评测覆盖九个公开基准,与训练图像无重叠,Qwen3.5-9B 块报告 3 种子均值与标准差(+11.83,各基准 std 约 ±0.04–0.50),可信度较高。正文与附录给出了信号验证、干预类型消融、IoU 分级诊断等完整协议。需注意:文中未提及代码与数据是否开源(截至该预印本),COCO 派生训练集的具体构造与 presence 任务二值动作路由的实现细节需依赖附录;若最终不开源,复现难度为中高——方法不要求超大算力,但需要熟悉 GRPO 训练框架并实现对视觉 token 的区域级特征干预。