← 返回 2026-07-20

SVR-R1:用强化学习中的自验证引导多模态推理 SVR-R1: Bootstrapping Multi-modal Reasoning with Self-verification in Reinforcement Learning

Mingyuan Wu, Jingcheng Yang, Shengyi Qian, Xudong Wang, Jize Jiang, Qifan Wang, Aashu Singh, Khoi Pham, Fei Liu, Zhaolun Su, Zhuokai Zhao, Klara Nahrstedt, Jianyu Wang, Hanchao Yu 📅 2026-07-13 👍 5 2026-07-25 18:30
GRPO RL微调 多模态推理 强化学习 自验证 视觉语言模型

把VLM二值自验证循环嵌入GRPO,无需外部监督大幅提升多模态推理

前置知识

视觉语言模型 (VLM)

视觉语言模型同时处理图像和文本,能根据图像I和文本提示x生成文本响应y,即从分布$\pi_\theta(I, x)$中采样。代表如Qwen2.5-VL、GPT-4o。本文以Qwen2.5-VL 3B/7B作为底座。

本文的全部工作建立在VLM之上,关键在于让同一组模型权重$\theta$同时充当答案生成器和答案验证器。

GRPO (Group Relative Policy Optimization)

GRPO是一种无需critic的在线策略梯度算法,通过一组蒙特卡洛采样的rollout估计组内相对优势$\hat{A}(y_i)$来更新策略,去掉了PPO中昂贵的价值函数,训练开销更低,被广泛用于RL后训练。

SVR-R1直接以GRPO为基础并在其中插入自验证循环,理解GRPO的clipped目标、KL项与group-relative advantage是读懂其损失设计的关键。

验证-生成差距 (Verification-Generation Gap)

指'判断一个答案对错'往往比'从零生成正确答案'更容易。若验证更简单,模型就能成为自身输出的较优验证者,从而实现自我改进。Song et al. (2025)将其作为self-improvement的理论依据。

这是整篇论文的立论根基——SVR-R1正是利用VLM预存的自验证能力,把这一不对称性转化为可优化的RL信号。

RL后训练 / RLHF-PPO 谱系

从RLHF用PPO对齐人类偏好,到DeepSeek-R1等用可验证奖励训练推理模型,RL后训练让LLM涌现自我纠正、回溯等推理行为。GRPO、DAPO都是PPO的计算高效变体。

本文处于RL后训练在VLM上的前沿,需要理解为何要在rollout中引入多轮交互、KL惩罚以及loss masking等标准技巧。

研究动机

现有方法在'让VLM学会自我纠错与重思'这条路上存在明显空缺。一方面,纯语言LLM在经过RL微调(如DeepSeek-R1、Zeng et al. 2025)后能涌现迭代重思、自我纠正、回溯等推理行为,但这种能力主要在数学、代码等可验证任务上被验证,近期才扩展到视觉语言任务(Zhou et al. 2025a、Chen et al. 2025a、Zhang et al. 2025等)。另一方面,仅靠在推理阶段用prompt让模型二次反思(Madaan et al. 2023的Self-Refine思路)虽能带来一定提升,但在多模态场景下'有效的自重思'仍非常困难且被严重欠探索——Wu et al. (2025)、Huang et al. (2025b)指出VLM的自验证能力有限。即便Liao et al. (2025)证明GPT-4o等强商业VLM能在分割等任务上一定程度地自验证,如何系统地把这种预存的自验证能力转化为训练信号仍不清楚。具体到表格/图表推理这种半开放问答,标准GRPO已经很强却仍有提升空间,而'验证比生成容易'这一不对称性尚未被RL利用。

本文的目标是本文的目标是设计一个完全不依赖外部监督、也不需要额外critic模型的多模态RL框架SVR-R1,让VLM用自身的二值自验证(YES/NO)作为学习信号来引导重思:若模型自认为答错就给第二次机会重新生成,若自认为答对或达到最大轮数上限就最终化答案并用于奖励计算。在完全相同的训练数据和超参数下,相比标准GRPO大幅提升多模态推理准确率;并且希望模型在训练过程中逐渐减少验证轮数、内化自验证能力,最终能在推理时单轮就给出自信的正确答案,从而兼顾推理质量与推理效率。

与已有工作不同的是,本文的独特切入角度是探索了一个此前'未被探索的中间地带'——介于'显式prompt引导自重思'与'RL微调'之间。与VL-Rethinker(Wang et al. 2025a)仅在推理时用prompt诱发自反思不同,也不同于纯prompt级别的Self-Refine,SVR-R1首次把自验证循环直接嵌入RL的rollout过程作为训练信号。其关键洞察是充分利用VLM预存的自验证能力:生成器和验证器共享同一组权重$\theta$(只是输入文本指令不同),无需外部reward model或critic,把'验证比生成容易'这一不对称性转化为可被GRPO优化的目标。

核心方法

直觉上:人类在复杂问题上'再想一次'常能找到更好的解,LLM也展现出类似模式。SVR-R1把这个直觉搬进RL rollout——在生成答案后插入一轮自验证循环。技术路线:以Qwen2.5-VL为底座,用VeRL框架实现多模态、多轮RL。每次rollout中,模型先依据初始prompt(含需求说明和few-shot示例,见Figure 10)生成带推理链的答案(一个assistant turn),然后把多模态问题、该答案连同验证指令一起喂回同一模型(同一权重$\theta$但不同的文本指令),让它输出YES或NO二值判断。若为NO且未达最大轮数MAX,则追加'验证者不同意,再想一次'的触发词让模型重新生成;若为YES或达到轮数上限,最终答案交给reward计算。整体训练用GRPO搭配outcome-based奖励与KL惩罚,所有user/assistant轮都保留在对话历史中作为后续轮次的上下文。

核心创新是把模型自身的二值自验证(而非外部critic)作为RL训练信号嵌入rollout,并对验证token做loss masking。与已有方法的本质区别有三:(1)生成器和验证器共享同一份权重$\theta$,只是输入文本指令不同,因此无需额外critic模型或任何外部监督,权重也无需在GPU间搬运,额外开销仅约10% wall clock时间;(2)只对最终答案(首个被YES确认的响应,或达到轮数上限后的最后一个响应)计算outcome-based奖励,验证步骤本身不分配process reward;(3)对验证token(YES/NO)做loss mask,避免同时优化验证与生成导致冲突的训练目标(这一思路借鉴自Search-R1的多轮RL)。其训练目标为最大化$\mathbb{E}[r_\phi(I,T,y) - \beta D_{KL}(\pi_\theta \| \pi_{ref})]$。

方法步骤详情

步骤如下:1)构造初始prompt header(Figure 10,含需求说明与单样本示例),输入图像$I$与文本问题$x$;2)第$i$轮自生成:$\pi_\theta$生成带推理链和答案的响应$y_i$;3)第$i$轮自验证:把拼接输入(问题+上一轮响应+验证指令)喂回同一$\pi_\theta$,采样$y'\in\{YES,NO\}$;4)分支:若$y'=NO$且$i<MAX$(图表/表格MAX=3,11K困难子集MAX=5),追加rethink触发词递归重新生成;若$y'=YES$或$i=MAX$则最终化答案;5)奖励:半开放任务用gpt-oss-120b作LLM judge做二值匹配,可验证任务用rule-based judge;6)GRPO更新:对一组rollout计算组相对优势,最大化公式(2)的clipped目标并减KL惩罚,验证token在loss中被mask。超参:AdamW、学习率$1\times10^{-6}$、rollout group 16、KL系数$\beta=10^{-3}$、bf16、温度1.0。

技术新颖性

技术新颖性体现在五点:(1)作者明确声称这是首个将自反思直接集成进RL post-training流程的VLM工作,区别于VL-Rethinker仅在推理时用prompt诱发;(2)自验证采用最简的二值Yes/No反馈——作者论证VLM在提供带理由的详细反馈上不如LLM,而二值反馈在VLM域对最小化幻觉最有效(依据Liao et al. 2025),实验中模型输出稳定地只产生YES/NO;(3)用同一组权重充当生成器和验证器,无需移动权重到GPU,额外开销仅约10% wall clock时间;(4)将LLM-judge奖励(gpt-oss-120b)引入VLM的RL训练以处理半可验证任务,作者称此前VLM RL工作多聚焦于严格可验证reward(如几何数学Chen et al. 2021),把计算密集型judge融入RL且不显著增加成本是非平凡的;(5)借鉴Search-R1对验证token做loss masking以稳定多轮训练。

Multi-rollout with self-verification
Figure 3: Multi-rollout with self-verification
Multi-Modal GRPO w. Self Verification Training Pipeline
Figure 4: Multi-Modal GRPO w. Self Verification Training Pipeline

实验结果

Table 1主结果(Qwen2.5-VL 3B/7B,PR=纯运行、FV=带最终验证):ChartQA Split上3B纯运行从63.3%提升到SVR-PR 83.3%,7B从76.0%到82.9%;TableVQA Split上3B从56.4%到72.4%,7B从67.8%到80.3%。SVR-R1在两个尺度、两个数据集、两种设置下都显著超越标准GRPO(Qwen-RL)。Table 2横向对比:Chart上SVR-3B 83.3%、SVR-7B 82.9%超过R1-VL-7B-PR 73.2%、GPT-4o-FV 79.3%及各弱基线;Table上SVR-7B 80.6%居首。Table 3(ThinkLite,7B):MathVision 17.4→19.1、MMStar 48.7→49.3。训练动态亮眼:验证轮数随训练单调下降并收敛到约2,纯运行(PR)与最终验证(FV)后期准确率几乎一致;熵更低但未过度牺牲探索——DAPO高clip-high实验($\epsilon_h=2.8$对比2.0)证明更高熵并不带来提升。反例:11K困难子集上准确率无提升且验证轮数剧增。

Main results (accuracy in %) on ChartQA & TableVQA splits
Table 1: Main results (accuracy in %) on ChartQA & TableVQA splits
Ours vs. other models (R1-VL, GPT-4o, weaker baselines)
Table 2: Ours vs. other models (R1-VL, GPT-4o, weaker baselines)
SVR-R1 vs standard GRPO on general reasoning (ThinkLite)
Table 3: SVR-R1 vs standard GRPO on general reasoning (ThinkLite)
Validation Reasoning Accuracy (%) vs. Training Steps
Figure 2: Validation Reasoning Accuracy (%) vs. Training Steps
SVR-R1 surpasses standard GRPO on table tasks
Figure 5: SVR-R1 surpasses standard GRPO on table tasks
SVR-R1 outperforms high-entropy baselines
Figure 6: SVR-R1 outperforms high-entropy baselines
Cat Breed Identification with Self-reflection(定性示例)
Figure 7: Cat Breed Identification with Self-reflection(定性示例)
查看结构化数据
任务指标本文基线提升
ChartQA图表推理 (Qwen2.5-VL 3B, 纯运行PR) 准确率(%) 83.3 63.3 (原始Qwen2.5-VL) / 80.5 (标准GRPO) 相比基线+20.0,相比GRPO +2.8
TableVQA表格推理 (Qwen2.5-VL 3B, 纯运行PR) 准确率(%) 72.4 56.4 (原始Qwen2.5-VL) / 68.3 (标准GRPO) 相比基线+16.0,相比GRPO +4.1
ThinkLite MathVision (Qwen2.5-VL 7B) 准确率(%) 19.1 17.4 (标准GRPO RL-BEST) +1.7

局限与改进

作者承认的局限主要有三:(1)在ThinkLite上无法复现原文(Wang et al. 2025b)报告的绝对高准确率,因为可复现的训练和评估尚未完全发布;(2)在11K困难子集上SVR-R1完全无效——推理准确率无提升且验证轮数剧增(Figure 14),方法本质上依赖'中等难度'问题,对太难的问题无能为力;(3)熵降低虽在本文任务上不损害性能,但作者也提醒在需要探索的任务(如数学,Yu et al. 2025)中过度用准确率换探索未必理想。我自己的观察:奖励依赖LLM judge(gpt-oss-120b),引入了judge本身的偏差与计算成本,judge质量直接上限化方法效果;自验证只在表格/图表等相对结构化任务上被验证,开放域视觉理解未覆盖;二值Yes/No反馈信息量低,理论上存在'总是YES'以快速终止rollout的reward hacking风险(虽实验显示收敛到正确行为,但缺乏对verification token行为的深入机制分析);MAX轮数、KL系数等超参需手动调节。

独立分析的弱点

独立分析的主要弱点及改进方向:1)对问题难度高度敏感——11K困难子集实验暴露方法本质是在'中等难度'问题上榨取收益,对太难问题无效甚至有害。改进方向:引入Gao et al. (2025)式的难度感知课程学习,根据当前模型权重动态筛选中等难度样本。2)二值反馈信息稀薄——仅Yes/No无法告诉模型'错在哪',重思全靠'验证者不同意,再想一次'这种弱触发词。改进方向:让验证器输出结构化反馈(如指出可疑步骤),但需平衡VLM的幻觉风险。3)Reward hacking风险——模型可能学到'直接给YES'以快速终止rollout。改进方向:加入对验证准确率的隐式约束或针对验证的process reward,并做更深入的机制分析。4)任务范围窄——主要在表格/图表等结构化任务验证,通用视觉理解(开放域VQA、视频理解)未覆盖。改进方向:扩展到更多模态与任务类型。5)依赖强LLM judge——gpt-oss-120b作reward,judge能力直接限制方法上限且增加部署复杂度。改进方向:用更轻量的可验证reward或自训练judge。

未来方向

作者明确提出的方向:(1)开放源码SVR-R1以促进未来VLM研究;(2)探索如何通过RL直接用inference-time scaling优化VLM策略——SVR-R1被视为这一方向的早期尝试,并提出'随着VLM自验证能力持续提升,如何用inference-time scaling直接驱动RL优化'这一开放问题;(3)更深入理解模型如何在RL训练循环中通过交错生成与验证实现持续自我bootstrap。基于本成果可延伸的方向包括:把自验证扩展到更多模态(视频、3D、音频)和更开放任务;把难度感知课程学习与自验证结合,以解决11K困难子集无效问题;研究比Yes/No更细粒度的验证反馈;分析自验证能力的迁移性(训出来的自验证能否迁移到未训练任务);与更强的推理时scaling方法(如树搜索)结合。

复现评估

复现评估:作者承诺将开源SVR-R1。训练基于开源Qwen2.5-VL(3B/7B)与开源VeRL框架,超参给出详尽——AdamW、学习率$1\times10^{-6}$、micro-batch 2/GPU、mini-batch 256(图表)/128(表格)、rollout group 16、bf16、温度1.0、KL系数$\beta=10^{-3}$(图表表格)/ $10^{-2}$(ThinkLite)、最大自验证轮数3或5。数据集ReFocus与ThinkLite-VL-70K有明确来源与split(ChartQA训练14,344例/测试826例;TableVQA 1,250例按7:3划分)。但障碍明显:(1)算力门槛极高,3B和7B均在8×8 A100 80GB(64卡)上训练;(2)ThinkLite上无法复现原文绝对精度,因可复现训练/评估未完全发布;(3)奖励依赖gpt-oss-120b,需单张80GB GPU用vLLM部署;(4)rethink触发词等关键prompt虽在附录给出,但完整对话构造仍需对照代码。整体复现难度中高。