← 返回 2026-08-27

V-Rubrics:基于量规强化学习的视觉忠实性 V-Rubrics: Visual Faithfulness via Rubric-Based Reinforcement Learning

Shulin Tian, Minglun Li, Yuhao Dong, Hao Ding, Jiarui Yao, Haiwen Diao, Jingkang Yang, Hongyuan Zhu, Ziwei Liu 📅 2026-08-26 👍 15 2026-09-01 18:30
GRPO 后训练 多模态大模型 奖励设计 强化学习 视觉幻觉

把参考答案拆成原子量规条目,为VLM后训练提供细粒度、前缀定位的RL奖励

前置知识

GRPO(组相对策略优化)

DeepSeek 提出的在线强化学习算法:对每个输入采样 $G$ 个回答(rollout),在组内计算每个回答奖励的相对标准化 $z_u^{(g)} = (u^{(g)} - \mu_u)/\sigma_u$ 作为优势,省去独立的评论家网络,仅靠组内比较即可更新策略,通常配合 KL 惩罚约束偏移。

本文的 RL 训练完全建立在 GRPO 之上,所有奖励设计(答案项、量规项、前缀掩码)最终都要嵌入 GRPO 的优势构造中,读懂公式 (5)-(7) 必须先理解组内标准化。

视觉幻觉与视觉忠实性(VF)

视觉语言模型生成看似流畅但图像中不存在依据的细节,如编造图表数值、数错物体、虚构关系。视觉忠实性指回答中的每个视觉声明(物体、属性、计数、中间推断)都能在图像证据中找到支撑,这是判断多模态回答可靠性的核心维度。

本文把视觉忠实性从事后评估指标升级为训练时的奖励信号,整篇论文的动机就是把 VF 错误从'最后一票否决'变成可定位、可部分计分的训练目标。

信用分配(Credit Assignment)

强化学习核心问题:当一次交互获得总奖励时,如何确定奖励应归功/归咎于哪些具体动作或 token。标量结果奖励只告诉'最终对不对',无法区分'观察正确但推断错误'和'观察错误但碰巧答对'这两种截然不同的失败模式。

作者明确把视觉幻觉定义为多模态后训练的信用分配失败,其方法本质是给每个原子命题独立的奖励通道和作用范围(前缀掩码),这是理解本文贡献的钥匙。

拒绝采样与难度分层

用当前模型对每道题独立采样 $k$ 次并判分,得到经验成功率 $k/8$,既可筛选数据(保留中等难度、剔除全对或全错),也可估计样本难度。本文用 SFT 模型采 8 个 rollout,按通过数把题目分为 hard/medium/simple 三档。

V-Rubrics 50K 的难度分层(18,121 hard / 25,306 medium / 6,821 simple)直接来自这一步,它保证训练集对当前策略而言信息量最大化。

量规(Rubric)与 LLM-as-Judge

量规是把'回答好不好'拆成一组自包含、可独立判定的判据条目,每条打 0/1 分再加权求和。LLM-as-Judge 指用大模型自动执行这种逐条判定,替代人工评分,常配固定输出 schema 保证可解析、可审计。

本文的训练奖励就是一份实例化量规:每道题配有若干 VF/RC/IF 判据,由 Qwen3-VL-235B-A22B 判官逐条独立打分,理解量规 schema 是读懂方法的前提。

研究动机

视觉语言模型能生成流畅但缺乏视觉证据支撑的回答:一个无依据的物体、一个编造的图表数值、一步站不住的中间推理,就足以毁掉整个看似合理的答案。论文用一道潮汐视觉题举例:模型若认对了太阳、地球、月球的连线关系,却把'离 月球/太阳 最近处潮位最高'错误外推,答案就会从 spring tide 滑向 neap tide。作者把这类失败归因于多模态后训练中的信用分配问题:标准 RL 流水线把回答压缩成标量偏好、二元正确标签或整体判官分,当答案可严格验证时有效,但视觉推理常常是混合证据——回答可能认对了所有相关物体、却做出一个无支撑推断、同时还满足了格式要求。单个结果奖励无法指出哪个视觉声明有据、哪步推理失效、哪条指令约束被违反。已有幻觉评估工作(Rohrbach et al. 2018、Li et al. 2023 等)证明这是普遍现象,但它们只做事后诊断,不参与训练;图表、文档、密集场景中单个无支撑声明就能改变最终答案,问题尤其严重。

本文的目标是本文的目标是把视觉忠实性从事后评估标签改造成可用于优化的细粒度训练信号,具体分三层。第一,提出 Visual Rubrics-Based Reinforcement Learning 框架:对每个图像-指令对,把参考回答分解为沿 Visual Faithfulness(VF,视觉事实是否有据)、Reasoning Consistency(RC,结论是否从观察到的视觉证据合法推出)、Instruction Following(IF,是否满足提示要求)三个维度的原子判据,训练时保留条目级奖励分量而非塌缩成单一序列分数,并在验证器能对齐到支撑句子时把优势定位到响应前缀。第二,构建 V-Rubrics 50K:从 17 个视觉接地数据源出发,产出 50,248 条带原子判据和重要性权重的训练样本。第三,在共享 SFT 初始化和共享 RL 数据的公平设置下,验证基于量规的 GRPO 同时优于 SFT 基线和纯答案 GRPO,且增益集中在依赖接地中间推理的任务上。

与已有工作不同的是,现有工作的夹缝在于奖励粒度。多模态 RLVR 方法(Liu et al. 2025、Shen et al. 2025 等)把可验证或感知奖励用于视觉任务,但奖励仍挂在整条回答或最终答案上;偏好/批评类对齐方法(LLaVA-RLHF、RLHF-V、RLAIF-V 等)提供整体性反馈,无法区分局部对错;文本侧的 rubric judge(Liu et al. 2023 等)和 Rubrics as Rewards(Gunjal et al. 2025)证明实例化判据能把 RL 扩展到不可严格验证的领域,但判据没有视觉接地。V-Rubrics 的独特切入是三件事同时做:判据必须绑定可核查的图像证据(VF/RC 条目锚定物体、属性、计数、图表值或被许可的推断,IF 条目捕捉提示约束);奖励不塌缩——每个条目独立做组内标准化,保留 item-level 分量;信用不均摊——当验证器返回支撑句并能模糊对齐回响应时,该条目的优势只写入对应前缀的掩码区间。这三点组合把'哪里错了'显式写进了梯度。

核心方法

直觉上,本文把'这个回答好不好'替换成'回答里的每句话:有图可依吗、推理成立吗、满足要求吗'。技术路线分五步。第一步 SFT 初始化:以 Qwen3-VL-8B-Instruct 为骨干,在公开的 OpenMMReasoner-SFT-874K 冷启动语料上微调得到 $\pi_{\text{SFT}}$,作为后续所有环节的共享起点。第二步数据构建:从图表、文档、数学、计数、教育等 17 个视觉接地数据源做规则过滤,再用 $\pi_{\text{SFT}}$ 每题采 8 个 rollout,以通过率 $k/8$ 分难度档,得到固定的 50,248 例训练集。第三步量规标注:用 Gemini-3-Pro 按统一结构化多模态提示把参考回答转成原子 VF/RC/IF 判据,附重要性标签和数值权重。第四步奖励与训练:Qwen3-VL-235B-A22B 担任答案判官与量规验证器,奖励 $R(a,x) = \alpha R_{\text{ans}} + (1-\alpha) R_{\text{rub}}$,在 verl 实现的 GRPO(actor loss 加 KL 惩罚、$\pi_{\text{ref}}$ 冻结)中做分量级标准化和前缀定位。第五步用 VLMEvalKit 在 10 个基准家族上评测。

核心创新是把奖励从'一个数'变成'一组带作用范围的结构化分量'。参考响应被分解为 $R(x) = \{(r_j, d_j, c_j, w_j)\}_{j \in \mathcal{I}(x)}$,$r_j$ 是自包含原子判据,$d_j \in \{\text{VF}, \text{RC}, \text{IF}\}$,$w_j$ 为重要性权重。验证器对每条判据独立给出二值分 $s_j(a;x) \in \{0,1\}$(只看回答与判据文本,不看原图),权重归一化为 $\rho_j = w_j/\sum_k w_k$ 后得部分得分 $R_{\text{rub}} = \sum_{j} \rho_j s_j$;PITFALL 判据写成'应避免的失败',确认违反即对答案分施加语义否决。与标量奖励的本质区别在优势构造:$A_t^{(g)} = \alpha\, z_{R_{\text{ans}}} + (1-\alpha) \sum_{j} \rho_j\, z_{s_j^{(g)}} M_{j,t}^{(g)}$,前缀掩码 $M_{j,t}^{(g)} = \mathbb{1}[t \le t_{j,\text{end}}^{(g)}]$——答案优势广播全句,每条量规优势只写入支撑其判定的响应前缀,掩码后不重新归一化,保持信用定位。

方法步骤详情

完整流程五步。步骤一 SFT 初始化:输入 OpenMMReasoner-SFT-874K 冷启动语料,以 Qwen3-VL-8B-Instruct 为骨干微调,输出共享的 $\pi_{\text{SFT}}$。步骤二数据筛选:17 个来源(图表/文档/数学/计数/教育等)归一化后做规则过滤(媒体有效、字段齐全、语言质量、去重);$\pi_{\text{SFT}}$ 每题采 8 个 rollout,成功率 $k/8$ 映射为难度档,固定 50,248 例:18,121 hard(36.1%)、25,306 medium(50.4%)、6,821 simple(13.6%)。步骤三量规生成:Gemini-3-Pro 按统一提示产出原子 JSON 判据,共 352,938 条,标签分 ESSENTIAL/IMPORTANT/OPTIONAL/PITFALL,遵循视觉接地、自包含、覆盖中间步骤、编码重要性四原则。步骤四 RL 训练:verl 下 GRPO,$\pi_\theta^{(0)} = \pi_{\text{ref}} = \pi_{\text{SFT}}$ 且 $\pi_{\text{ref}}$ 冻结;Qwen3-VL-235B-A22B 判官做答案等价判定,量规验证器逐条打分并在前缀模式返回支撑句,模糊对齐得 $t_{j,\text{end}}^{(g)}$。步骤五评测:VLMEvalKit 覆盖 10 个基准家族,从 MMBench-Dev 到 CharXiv。

技术新颖性

技术新颖性体现在三个层次。其一,奖励单元的粒度:现有视觉 RLVR 的奖励挂在整条回答或最终答案上,本文把奖励单位细化到'单个可核查的原子视觉命题',并在组内对答案项与每条判据分别标准化 $z_u^{(g)} = (u^{(g)} - \mu_u)/(\sigma_u + \epsilon_z)$,而不是把判据先加权求和成一个标量再标准化——这保留了'哪条成立'的信息进入梯度。其二,前缀定位信用:受过程奖励启发但更轻量,验证器只额外返回一句支撑文本,用模糊匹配回响应定位 $t_{j,\text{end}}^{(g)}$,即得到 token 级掩码;对比需要逐步骤标注的 PRM,成本几乎不变却把量规优势限制在了相关前缀。其三,判据 schema 的可审计性:每条判据短小、自包含、只验证一个命题,验证器无需从整篇参考答案重建评价标准,降低了与整体判官偏好的耦合,也便于人审。消融证明两个机制缺一不可:标量序列级量规聚合得 67.74,分量+前缀得 68.04,均高于答案-only 的 66.25。

Rubric-grounded visual reasoning
Figure 1: Rubric-grounded visual reasoning
Overview of Visual Rubrics-Based Reinforcement Learning
Figure 2: Overview of Visual Rubrics-Based Reinforcement Learning
Data Distribution of V-Rubrics 50K
Figure 3: Data Distribution of V-Rubrics 50K

实验结果

三种模型共享 SFT 初始化与 RL 数据,只差奖励与信用分配。表 1(通用/知识):Overall Avg 从 SFT 64.93 → 答案级 GRPO 66.25 → 量规 GRPO 68.04,比答案级高 1.79 点(约 2.7% 相对);增益集中在 MMMU Val(66.78→70.56)、MMMU-Pro(54.34→58.15)、MMMU-Pro V(53.82→56.94),而 MMBench-Dev 上标量 GRPO 86.94 略高于量规版 86.51,说明量规主要帮助多步学术推理。表 2(视觉数学/图表/逻辑):Overall Avg 58.45 → 61.94 → 62.45,比 SFT 高 4.00 点(约 6.8% 相对);强项在依赖接地中间感知的指标:MathVision 55.46→58.88、WeMath Loose 77.43→86.29、LogicVista 60.63→62.42;但 MathVerse V/O 49.37 低于答案级 52.16、CharXiv 56.60 低于 57.00,提升并非均匀。表 3 消融:答案-only 66.25,标量序列级量规 67.74(+1.49),分量+前缀 68.04(+1.79)。注意未超过 Qwen3-VL-8B-Thinking(69.55/62.22)。图 4 定性案例:答案级模型数对人数却做无据的年龄推断,量规模型保留正确中间步骤;另一例量规模型先追踪图表线段再作答。

Performance on general VLM and knowledge benchmarks
Table 1: Performance on general VLM and knowledge benchmarks
Performance on visual math, chart, and logic benchmarks
Table 2: Performance on visual math, chart, and logic benchmarks
Reward and credit-assignment ablation
Table 3: Reward and credit-assignment ablation
Qualitative comparison between answer-only GRPO and rubric-based checkpoints
Figure 4: Qualitative comparison between answer-only GRPO and rubric-based checkpoints
查看结构化数据
任务指标本文基线提升
知识/学术推理整体 Overall Avg.(MMBench-Dev + MMMU 系列) 68.04 66.25(+GRPO 答案级)/ 64.93(SFT) +1.79 vs 答案级 GRPO(约 2.7% 相对),+3.11 vs SFT
MMMU Val 准确率 70.56 68.00(+GRPO)/ 66.78(SFT) +2.56 vs 答案级 GRPO
MMMU-Pro 准确率 58.15 55.72(+GRPO)/ 54.34(SFT) +2.43 vs 答案级 GRPO
视觉数学/图表/逻辑整体 Overall Avg.(7 项指标均值) 62.45 61.94(+GRPO)/ 58.45(SFT) +4.00 vs SFT(约 6.8% 相对),+0.51 vs 答案级 GRPO
WeMath(Loose) 准确率 86.29 84.86(+GRPO)/ 77.43(SFT) +8.86 vs SFT
MathVision(test) 准确率 58.88 56.71(+GRPO)/ 55.46(SFT) +2.17 vs 答案级 GRPO
奖励机制消融 知识表 Overall Avg. 68.04(分量+前缀) 67.74(标量序列级量规)/ 66.25(答案-only) +0.30 vs 标量量规聚合

局限与改进

作者明确承认三点。第一,V-Rubrics 50K 的质量受自动生成量规与判官验证的双重制约:写得差的判据可能编码参考答案偏置、视觉歧义或图像不支持的假设。第二,前缀定位是近似:验证器返回的支撑句靠模糊匹配对齐回响应,所得前缀信用只能视为实用的局部反馈而非精确 token 级监督。第三,判官同族偏置:Qwen3-VL-235B-A22B 给 Qwen 家族策略打分,且验证器只接收生成回答与判据文本、不接收原图,图像转判据文本时的信息丢失或错误会直接传播进奖励;判官还可能偏好特定写作风格与推理模板。我的补充观察:难度分层依赖 $\pi_{\text{SFT}}$ 的 8-rollout 成功率,换了基础模型整个数据构建都要重跑;提升未覆盖 Qwen3-VL-8B-Thinking(69.55/62.22),对已具备长思维链能力的模型其价值存疑;MathVerse 与 CharXiv 上的回退提示量规信号与某些任务目标存在错位,但论文未深入归因;作者也未报告判官打分与人工评分的一致率,量规质量的量化审计缺失。

独立分析的弱点

独立分析四个弱点。其一,判官成本与吞吐瓶颈:352,938 条判据要由 235B 级判官在训练中逐 rollout 逐条打分,量规验证器在前缀模式还要返回支撑句,训练一次的成本远超标量 GRPO;改进方向是把判官蒸馏成 7B 级专用验证器,或对组内 rollout 共享判据缓存、只对增量 rollout 增量打分。其二,模糊字符串对齐脆弱:支撑句一旦被模型改写、翻译或拆分就对不齐,掩码退化回全句广播;改进方向是强制模型用引号引用原文片段、或利用注意力权重做软定位。其三,判据静态过时:量规在训练前由 Gemini-3-Pro 一次性生成,随策略进化,简单题判据全满足后不再产生梯度(论文也承认 scored rollouts 全 agree 的条目无梯度),硬题判据可能始终无法对齐;改进方向是训练中周期性用当前策略的失败模式更新判据,形成课程式量规。其四,验证器盲视图像:VF 条目本应核查图像证据,但验证器只看文本,若 Gemini 标注阶段就误读了图,错误会以'权威判据'身份贯穿训练;改进方向是让验证器多模态化,或对低一致判据加人审抽检。

未来方向

作者在展望与附录中提出的方向包括:用更大规模人工审计集评估量规质量、测试判官多样性以消除同族偏置、向其他模型家族和安全敏感领域迁移,以及把量规监督延伸到幻觉诊断、长链视觉推理、视频推理和上下文适应。基于本文成果还可以自然延伸出几条路线。第一,在线量规生成:训练过程中用当前策略的 rollout 与失败案例动态生成或修订判据,解决静态判据过时问题。第二,与过程奖励模型(PRM)融合:前缀掩码目前只二值化地截断到支撑句末尾,可替换为软性的步骤级奖励并学习定位头。第三,推理时复用:量规条目天然是可解释的检查清单,可作为解码期约束或自我核查提示,把训练信号反哺给推理端。第四,扩展到视频与具身任务:VF/RC/IF 的分解对时序证据链(视频问答、操作规划)同样适用,只需重新定义'视觉证据'的对齐方式。第五,跨家族验证:在 InternVL、LLaVA 系列上复现,检验增益是否依赖 Qwen 判官。

复现评估

复现评估:中高难度。有利条件是各组件均可获得——骨干 Qwen3-VL-8B-Instruct 公开,SFT 数据 OpenMMReasoner-SFT-874K 公开,17 个上游数据集全部公开,RL 框架 verl 与评测套件 VLMEvalKit 开源,判官 Qwen3-VL-235B-A22B 有开源权重,项目页 shulin16.github.io/v-rubrics 提供示例。不利条件有三:论文正文未明确声明代码、模型权重或 V-Rubrics 50K 数据集已开源,需等待作者发布;判据标注依赖 Gemini-3-Pro 的私有 API,标注协议在附录 C.3 有描述但完整提示与 50,248 例的判据本体若不开源则需自费重新生成(估计数百万次多模态调用);算力上 8B 模型的 GRPO 需要多卡 A100/H100 级别,且每个 rollout 都要过 235B 判官,训练成本显著高于标量 GRPO。若数据与代码开源,核心管线(规则过滤 + 拒绝采样分层 + GRPO 训练)可在中等规模集群复现;若不开源,完整复现的工程与 API 成本都相当可观。