VBVR-Pro:面向原生视觉推理的可扩展可验证套件 VBVR-Pro: A Scalable and Verifiable Suite for Native Visual Reasoning
300个程序化视觉推理任务+可验证奖励评分器,让视觉生成成为可训练、可验证、可优化的推理媒介
前置知识
原生视觉推理
指把视觉生成当作推理本身的载体:模型通过构造、更新和优化视觉状态(图像或视频)来解题,而不是把视觉输入翻译成语言后用文字链条推理。视觉状态在这里是一等公民,类似语言模型中「文字思维链」的角色,只是载体换成了像素。
这是全文的核心范式。整篇论文的一切设计(任务、评分器、模态对照、RL)都是为了回答「通过生成进行视觉推理能否被规模化训练、可靠验证和机制分析」这一问题。
VLM-as-a-Judge(VLM 裁判)
用多模态大模型(如 GPT-5.5、Gemini)给生成结果打分或做两两比较的评估范式。部署方便、适用于开放式输出,但论文发现它在需要精确计数、细粒度空间关系、时间一致性的视觉推理任务上会高估错误答案、低估正确答案,且重复评估时分数不稳定。
本文的可验证评分器正是针对该范式的缺陷提出的替代方案,理解其失败模式(感知不精确、忽略细节、误解任务规则)才能理解论文为何坚持规则化验证。
可验证奖励(Verifiable Rewards, RLVR)
不用神经网络打分,而是用确定性、任务特定的程序规则从标准答案元数据出发计算奖励,例如检查物体数量、路径是否穿墙、最终标签是否正确。优点是精确、廉价、完全可复现,能为强化学习提供方向明确的学习信号,类似数学代码题里的单元测试。
VBVR-Pro 的评分器既是评估协议也是 RL 奖励函数,论文用 RLVR 对比 RLVLM(VLM 打分)证明可验证奖励训练更稳定、提升更大。
程序化任务生成
每个任务写成一个参数化程序:从结构化参数空间(网格大小、物体数量、布局、外观、难度)随机采样配置后实例化问题,同时由任务专用求解器程序化算出正确解并记录随机种子等元数据,因此可以无限生成带标准答案的样本,无需人工标注。
这是 300 个任务和 125 万训练数据可行的前提,也是元数据能支撑可验证评分的原因;同时它让「同一任务的多种模态渲染」成为可能。
Flow-GRPO 与组相对优化
把扩散/流模型的反向去噪过程当作序列决策问题,同一提示采样一组 rollout,用组内相对奖励作为优势信号、配合裁剪的策略目标更新模型。Flow-GRPO、DanceGRPO 是视觉生成 RL 的主流选择,要求组内 rollout 在「奖励相关的决策」上有多样性。
本文的 RL 基线建立在这类方法上,并指出视觉推理的探索本质是语义级离散决策(左转还是右转),标准 SDE 噪声只改变外观不改变决策,因此引出 CPS 采样。
CPS(系数保持采样)
一种在采样时注入随机性的方式:$x_{t-\Delta t} = (1-(t-\Delta t))\hat{x}_0 + (t-\Delta t)\cos(\eta\pi/2)\hat{x}_1 + (t-\Delta t)\sin(\eta\pi/2)\epsilon$,噪声系数满足 $\cos^2+\sin^2=1$,即用新采样的高斯噪声替换部分预测噪声而不超过调度器规定的总噪声量,从而在高随机性下仍保持画面干净。
它是本文 RL 探索的关键工具:对比之下 Flow-SDE 在 $\eta=0.7$ 就产生背景伪影、$\eta=0.9$ 严重破坏画面,而 CPS 在高随机性下仍能生成干净且决策多样的 rollout。
Chain-of-Step(去噪步思维链)
把扩散模型每个去噪步的噪声潜变量解码成图像后可以观察到:模型在早期去噪步会同时浮现多个候选解(如多条候选路径、多个叠加状态),随步数推进逐渐收敛到最终答案,类似语言模型的思维链,只是发生在去噪步维度上。
论文用它做两个关键分析:可视化训练后模型的「多路径探索」「叠加探索」等视觉推理行为,以及展示 RLVR 带来的「后期步自我修正」能力,是「视觉轨迹是推理载体」这一论断的直接证据。
研究动机
现有视觉推理研究面临三重瓶颈。其一,任务源不可训练:现有基准如 VideoThinkBench(48 任务、6,845 张图)、V-ReasonBench(13 任务、652 张图)、RISE-Video(8 任务)、MME-CoF-Pro(16 任务)等全部只为评估设计,训练数据为零;而此前最大的合成训练源 VBVR(150 任务、约 200 万图像)虽然能训练,其迁移到更广泛下游基准的效果仍有限——作者假设瓶颈在任务覆盖度而非实例数量:从固定任务生成器反复采样只会产生相似推理模式的变体,不会扩展被训练的能力范围。其二,反馈不可靠:主流 VLM-as-a-judge 范式在需要精确计数、细粒度空间关系、时间一致性和规则满足的任务上频频出错,例如在加色混合任务中生成球体色相错误,三个强 VLM 裁判却都打出至少 0.80 分(正确应约 0.40);且即使在温度 0 下重复评估,55–93% 的样本分数会漂移。其三,缺乏受控比较:视频生成、图像生成、交错生成三种范式从未在同一任务分布和同一验证协议下被训练与评估,「哪种生成基底最适合视觉推理」这一基本问题悬而未决。
本文的目标是本文的目标是构建闭环测试台 VBVR-Pro,使「通过生成进行原生视觉推理」变得可训练、可验证、可优化、可实验控制。具体拆解为四点:(1) 任务扩展——把视觉推理变成 300 个程序化生成的受控任务空间,同一实例同时渲染为对齐的视频、图像和交错文本标注三种模态,并记录支撑可验证评估的全部元数据,以验证「任务覆盖度比实例数量更决定迁移」的假设;(2) 可验证奖励——为基准中全部 100 个任务(50 域内 + 50 域外)配备基于确定性规则的可验证评分器,并用竞技场式大规模人类偏好研究验证其对齐度与成本优势;(3) 机制研究——在同一任务分布下训练和比较 30 多个图像、视频、交错生成模型,诊断模型学到的是可复用视觉推理操作还是指令模板拟合;(4) 可优化性——以可验证奖励为信号,给出覆盖 50 个任务的联合多任务强化学习端到端基线。
与已有工作不同的是,本文的独特切入是把「视觉状态」从被理解的输入或被渲染的输出提升为一等推理基底,并为这一主张配上完整基础设施。以往工作大多继承语言中心视角:交错思维链方法把视觉状态当作文本推理的辅助插图;部分研究虽提出视频模型是推理器、链式去噪步等机制,但只在极小的任务集上验证——DiffThinker 仅 4 个任务、VPRL 仅 3 个导航任务、VideoRLVR 仅 3 个视觉任务,缺乏统一基础设施支撑大规模多样化训练、可验证评估与跨模态系统对比。VBVR-Pro 的差异化在于三点同时成立:任务由程序生成因而元数据天然支撑可验证评分;同一底层问题的视频/图像渲染解完全等价,支撑严格的模态对照实验;评分器不止用于评估,还能直接充当 RL 奖励。这使作者能首次在受控条件下系统回答「视觉轨迹而非语言思维链是否才是视觉推理更关键的载体」这一机制问题。
核心方法
VBVR-Pro 是一个闭环测试台,直觉上就是把「生成式视觉推理」变成像棋类环境那样可控、可验证的训练场:任务由程序生成,答案由求解器计算,输出由规则评分器打分,模型再拿这些分数做强化学习。技术路线分四层。第一层是数据:300 个任务专用生成器(150 个改造自 VBVR、150 个全新设计),每个生成器从结构化参数空间采样配置并实例化问题,任务专用求解器程序化算出正确解,同时记录随机种子、问题规范、完整解和关键元素属性等元数据。第二层是模态对齐:同一实例渲染为视频和图像两种解等价的模态,交错设置额外用 Gemini-3.1-Pro 按任务专属提示生成中间解题步骤文本。第三层是评估:为基准的 100 个任务各实现一个基于 HSV 颜色分割、轮廓检测、OCR、跨帧轨迹跟踪等经典视觉方法的确定性评分器。第四层是优化:以评分器为奖励,采用基于 CPS 探索采样的 Flow-GRPO 类组相对策略优化,在 5 万样本、50 任务上做多任务 RL,并与 SFT、VLM 打分的 RLVLM 做对照。
核心创新有三。其一是「模态对齐的任务生成」:视频和图像不是两个独立语料,而是同一底层问题的不同渲染、解完全等价——图像模态按任务需求采用三种输出机制:Last-Frame(终态单图即可评判,如选择题)、Key-Frame(保留解题过程的关键过渡帧,迷宫类任务还会在选中帧上叠加绘制完整轨迹)、Multi-Frame(均匀采样中间状态用于检查过程完整性、每帧有效性与时间连续性)。这使得图像、视频、交错生成器能在严格相同的任务条件下公平对照。其二是「语义级可验证奖励」:评分器刻意避开像素级差异,先用经典 CV 提取颜色、形状、位置、数量等语义属性,再执行任务特定检查并聚合——软准则用加权求和(如球簇合并任务:合并过程、球数、终态标签各占权重),硬约束用乘法合并(如迷宫任务中穿墙一次就急剧拉低总分),还能输出可解释的错误分解。其三是机制层面的核心主张:通过训练时监督消融与推理时中间态干预双重证据,证明中间视觉轨迹对视觉推理的贡献大于显式语言思维链,这与主流语言中心的推理观形成本质区别。
方法步骤详情
步骤一,任务构建:50 多位研究者按四原则设计 300 个生成器——解法视觉原生(依赖视觉状态变换而非纯语言推演)、结果无歧义可严格检验、随机化外观/布局/属性/提示保证多样性、鼓励多步推理;每个生成器输出问题实例、求解器答案和含随机种子的元数据。步骤二,数据划分与渲染:留出 50 个任务做域外评估,其余 250 个任务每任务采样 5,000 实例共 125 万训练实例;VBVR-Pro-Bench 由 50 域外 + 50 域内任务组成;另建 5 万实例 RL 专用集;图像模态按任务选 Last-Frame/Key-Frame/Multi-Frame 渲染。步骤三,评分器实现:先用 HSV 分割、轮廓检测、OCR、跨帧轨迹跟踪提取语义实体与属性,再按人工校准权重执行任务特定检查,软准则加权求和、硬约束乘法合并,输出分数与错误分解。步骤四,模型训练:9 个开源基座(3 图像:BAGEL-7B-MoT、FLUX.2-dev、Qwen-Image-Edit;2 交错:ThinkMorph-7B、SenseNova-U1;4 视频:Wan2.1-I2V-14B、Wan2.2-TI2V-5B、Wan2.2-I2V-A14B、LTX-2.3-I2AV)在 $512\times512$、单 epoch 下微调,视频 16fps,超 10B 模型用 Rank-32 LoRA,小模型全参微调。步骤五,强化学习:从 VBVR-Pro-Wan2.2-TI2V-5B 出发,在同一 5 万 RL 子集上对照 SFT、RLVLM(Qwen3.6-27B 打分)与 RLVR(评分器打分),探索采样用 CPS($\eta=0.7$),推理同样在 CPS 下保证可比。
技术新颖性
技术新颖性体现在多个「首次」。它是首个把图像、视频、交错三类生成器放在统一任务分布、统一验证协议下训练与评估的系统研究,覆盖 30 多个模型、横跨规模/架构/输出格式。评估上,它首次在实例层面(而非以往聚合的排名相关性)用竞技场式人类研究——100 任务、8 个视频生成模型、共 4,000 个视频、每对模型 10 份独立标注——严格校验评分器与人类偏好的一致性,并系统揭示 VLM-as-a-judge 的三类失败模式与不可复现性(温度 0 下 55–93% 样本分数漂移)。RL 上,作者针对「视觉推理的有效探索本质是语义级离散决策」这一观察,弃用 Flow-SDE 改用系数保持采样 CPS:其噪声系数满足 $\cos^2(\eta\pi/2)+\sin^2(\eta\pi/2)=1$,增大 $\eta$ 只是用新采样噪声替换部分预测噪声而不抬高调度器规定的总噪声系数,因此能在保持画面干净的同时产生奖励差异明显的多样决策,而 Flow-SDE 在 $\eta=0.7$ 即出现背景伪影、$\eta=0.9$ 严重破坏画面并拉低奖励。此外,50 任务联合 RL 训练加 100 任务评估也是视觉推理 RL 迄今最大规模。
实验结果
(1) 基准主结果(Table 4):专有模型 Seedance 2.0(视频,0.499)、Nano Banana Pro(交错,0.564)、GPT-Image-2(0.507)领先,学术开源模型普遍低于 0.2(如 HunyuanVideo-I2V 仅 0.054);经 VBVR-Pro 训练后 9 个模型全部提升,平均 Overall +0.290(域内 +0.401、域外 +0.179),最强 VBVR-Pro-Wan2.2-I2V-A14B 达 0.670(ID 0.808 / OOD 0.532),但仍远低于人类。(2) 模态对比:最强交错模型 SenseNova-U1(0.638)在许多域内任务与最强视频模型持平且成本低得多;视频模型在需精确状态转移的任务(域内变换类 0.636)保持优势;单图像最弱,难表达多步过程。(3) 监督消融(Table 5):多帧轨迹压成单帧使 SenseNova 降 0.111、ThinkMorph 降 0.024;把文本换成占位符几乎不掉分(0.629 / 0.374)——视觉轨迹监督贡献远大于文本。(4) 反事实诊断(Table 6):改写输入文本不掉分(0.640)、删输入图像暴跌至 0.064;推理时删中间文本仅降至 0.533,删中间图像暴跌至 0.099、加噪 0.190——中间视觉状态被因果性地使用。(5) 跨套件迁移(Table 7):在 7 个外部基准最高提升约 20 个百分点:V-ReasonBench 10.21→38.22、VideoThinkBench-mini 25.71→52.86、MME-CoF-Pro 24.76→48.39、BabyVision-Gen 0.36→12.50、RULER-Bench 57.89→66.96,并在 V-ReasonBench 上超过 Veo-3.1(38.22 vs 24.25);最近邻检索证实测试样例与训练样本相距甚远,排除记忆。(6) RL(Table 8):RLVR 0.548 > RLVLM 0.508 > SFT 0.503,OOD 上 RLVR 0.377 vs SFT 0.328;RLVR 曲线稳定上升,RLVLM 在 400–500 步骤降后停滞。(7) 评分器(Fig.6):per-vote 人致度 >0.60,优于 GPT-5.5(0.54)与 Gemini-3.1-Pro(0.52),约为人类天花板 0.77 的 78%,成本最低;模型级排名域外 Spearman ρ=1.00、域内 0.95。
查看结构化数据
| 任务 | 指标 | 本文 | 基线 | 提升 |
|---|---|---|---|---|
| VBVR-Pro-Bench 总分(100 任务) | Overall 分数(0–1) | 0.670(VBVR-Pro-Wan2.2-I2V-A14B) | 同基座 Wan2.2-I2V-A14B 为 0.182;最强专有视频模型 Seedance 2.0 为 0.499 | 较基座 +0.488;较最强专有模型 +0.171 |
| V-ReasonBench(外部迁移) | 准确率(%) | 38.22 | Wan2.2-I2V-A14B 10.21;Veo-3.1 24.25 | +28.01(相对基座),超 Veo-3.1 约 14 个百分点 |
| VideoThinkBench-mini(外部迁移) | 准确率(%) | 52.86 | Wan2.2-I2V-A14B 25.71;Veo-3.1 27.69 | +27.15,约翻倍 |
| MME-CoF-Pro(外部迁移) | 准确率(%) | 48.39 | Wan2.2-I2V-A14B 24.76;Veo-3.1 55.90 | +23.63(仍未超 Veo-3.1) |
| BabyVision-Gen(外部迁移) | 准确率(%) | 12.50 | Wan2.2-I2V-A14B 0.36 | +12.14(约 35 倍) |
| 多任务强化学习(50 域内任务训练) | VBVR-Pro-Bench Overall | RLVR 0.548 | SFT 0.503;RLVLM(Qwen3.6-27B 打分)0.508 | 较 SFT +0.045,较 RLVLM +0.040;OOD 上 RLVR 0.377 vs SFT 0.328 |
| 评分器与人类偏好对齐(竞技场式) | per-vote 一致率(人类天花板 0.77) | >0.60(规则评分器) | GPT-5.5 0.54;Gemini-3.1-Pro 0.52 | 约 +0.06–0.08,且单次评估成本最低(较 VLM API 低 1–2 个数量级) |
| 模型排名一致性(域外 50 任务) | Spearman ρ / Pearson r | ρ=1.00, r=0.9524 | 上一代 VBVR 评分器 ρ=0.9333, r=0.9794 | ρ +0.0667,r +0.0273 |
局限与改进
作者承认的最强模型(0.670)仍远低于人类水平,说明该任务空间远未攻克;人类标注者在接近的比较上本身存在分歧(一致率天花板 0.77),评分器只达到天花板的约 78%,完美一致不可能。我自己的观察有五点。其一,任务虽过程化生成,本质仍是画布上的合成抽象,从合成到真实世界的迁移虽被验证(机器人抓放、真实物体排序),但真实场景的开放性、歧义性与物理复杂性远超程序化任务。其二,评分器依赖 HSV 分割、轮廓检测、OCR 等经典 CV 方法提取语义属性,在纹理丰富、光照复杂的真实背景下的鲁棒性存疑,这也解释了为何评分器只覆盖基准 100 任务而非全部 300 任务。其三,RLVR 相对 RLVLM 的优势(0.548 vs 0.508)幅度不算大,且实验只在 Wan2.2-TI2V-5B 一个基座上完成,外推性未验证;RLVLM 的骤降也只做了归因分析而未彻底解决。其四,交错数据的中间文本由 Gemini-3.1-Pro 单一模型生成,文本质量与风格的单一性可能影响「文本不重要」这一消融结论的普适性。其五,域外提升(+0.179)仍显著小于域内(+0.401),外部基准最高分也只有 66.96,合成到真实的差距依然明显。
独立分析的弱点
弱点一:评分器的可扩展性悖论。每个基准任务都需要人工设计语义检查项并校准权重,300 个任务靠 50 多人社区尚可完成,但按此路线扩到数千任务的人力成本极高;改进方向是让 LLM 自动合成验证器(生成检查代码),再用小规模人工抽检校准权重。弱点二:语义提取前端脆弱。HSV 颜色分割和轮廓检测对真实图像的泛化差,一旦背景非纯色、物体带纹理或遮挡,属性抽取即失效;可引入开放词汇分割模型(如 SAM 类)作为前端,但需重新验证确定性与速度。弱点三:图像生成模态的结构性弱势未深入补救。单图无法表达中间状态,论文只观察到失败而未探索图像内推理表示(如草稿叠加、分区域作答)或多图自回归的图像变体,值得补齐这一中间形态。弱点四:RL 实验单薄。仅一个 5B 基座、50 任务、CPS 的 $\eta=0.7$ 为经验选择,缺少 $\eta$ 扫描、基座规模消融和与更多 RL 算法的对比;RLVLM 骤降问题也未给出机制性解释。弱点五:迁移不均衡。域外与外部基准的提升集中在变换、空间类能力,知识类提升相对小(如 RLVR 模型 OOD 知识类仅 0.282),说明纯程序化任务对世界知识的补益有限,可能需要引入基于真实图像的任务生成器。
未来方向
作者明确提出的方向包括:继续扩大任务空间与模态覆盖(音频尚未涉及)、深化 Chain-of-Step 机制研究以理解去噪步内的计算分配、以及把可验证奖励进一步推广为视觉推理的通用 RL 基础。基于本文成果可自然延伸的工作有:(1) 视觉过程奖励模型——用可验证奖励训练对中间帧逐步打分的 PRM,实现更细粒度的 credit assignment,替代当前只奖励终态聚分的做法;(2) 混合模态架构——交错生成外化中间视觉状态、计算高效,视频生成状态跟踪强,可探索让模型自适应切换「关键帧+视频」的混合输出;(3) 自动验证器合成——用代码生成 LLM 为新任务自动产出评分器,实现任务空间的指数扩展;(4) 把「视觉原生轨迹比语言思维链更重要」的假说移植到理解侧多模态 LLM,测试强制模型以草图而非文本解题是否同样获益;(5) 与具身智能结合,用真实机器人交互数据构造生成器背景,缩小合成到真实的鸿沟;(6) 探索 CPS 探索机制在更广泛扩散 RL 场景(美学、编辑)中的通用性。
复现评估
复现条件在同类工作中属于相当好的一档。作者明确声明释放全部数据、模型、评分器和代码(摘要与结论均写明「We release all data, models, scorers, and code」)。数据侧:约 347 万张图像与 125 万训练实例全部程序化生成,元数据包含随机种子,理论上可精确重新生成;基准为 100 任务 × 5 实例,评分器确定性、零 API 成本、不依赖 GPU(仅 OCR 可选),评估结果可完全复现——对比 VLM 裁判在温度 0 下仍有 55–93% 样本分数漂移,这是评估可复现性的重要卖点。训练侧:9 个基座均为公开模型,配置(512×512、单 epoch、Rank-32 LoRA、视频 16fps)对中型实验室可负担;RL 从 5B 模型出发、仅 5 万样本,但 Flow-GRPO 类方法每步需大量 rollout,仍需多卡 GPU 集群,论文未披露精确 GPU 时数,且致谢提到 AWS Trainium 支持,其硬件栈与主流 CUDA 生态可能不完全可迁移。另需注意交错数据的中间文本依赖 Gemini-3.1-Pro API,复现交错模态需一笔 API 预算。总体评估:复现评估容易(下载权重与数据即可),复现 SFT 中等,复现 RLVR 需要可观算力与工程经验。
论文图表
三列分别展示 VLM 裁判的三类失败:加色混合任务中色相错误但三个裁判都打 0.80 分以上(真值 0.40);同心圆任务中改变应保持的大小颜色仍得 0.78–0.93;模式补全任务中正确答案仅得 0.24–0.80(评分器给 0.94)。附各裁判的完整评分理由文本。
这是论证「为什么需要可验证评分器」的最直接证据,具体展示裁判高估错误、低估正确的双向失败。