TRACE:面向多领域视觉推理的分类法引导环境 Trace: A Taxonomy-Guided Environment for Multidomain Visual Reasoning
分类法驱动的可验证视觉推理环境,RLVR训练后24个外部基准平均提升约4个百分点
前置知识
RLVR(带可验证奖励的强化学习)
RLVR 指用可以客观、确定地验证的奖励信号来训练语言模型做推理的范式,典型于数学和编程这类答案可精确判定的领域。它的优势是奖励廉价且无噪声,能让模型在大量试错中逐步提升推理能力。扩展到视觉语言模型时,难点在于需要既能从视觉内容中导出问题、又能被精确验证、还可大规模复现的训练数据。
整篇论文的目标就是把 RLVR 扩展到视觉推理,理解奖励可验证性与可复现性这一核心动机是读懂本文贡献的前提。
场景文法(Scene Grammar)
场景文法定义了一类可复用的语义状态与视觉实现的家族:包括物体词汇、关系、布局家族和面向问题的可见支架。它规定了“能渲染什么”,但不规定“要回答什么”。同一个场景文法可被多个不同的任务程序复用,从而把视觉构建与推理计算解耦。
场景文法是 TRACE 任务层级 domain → scene grammar → task 的中间层,是理解其任务身份与可复用性的关键。
任务程序与任务身份(Task Program & Identity)
任务程序 P 是一段可执行的计算,规定了候选物体如何构造、操作数的角色、中间运算、最终算子以及结果到答案的绑定。任务身份 T = (S, P, Y, C) 由场景文法 S、任务程序 P、答案模式 Y、奖励契约 C 共同决定,任一结构性改变都构成新任务。这种严格定义防止了任务清单的虚增或误并。
TRACE 的核心创新正是把可执行的任务程序作为生成、采样、验证、分析的稳定单元,理解它才能看懂分类法的价值。
GRPO(组相对策略优化)
GRPO 是一种强化学习优化器:每次更新采样一批 prompt,每个 prompt 生成多条响应,奖励在每组的若干条响应内做相对归一化后,用截断的 token 级策略目标进行优化。它无需单独训练 critic,常用于带可验证奖励的推理训练。
本文用 GRPO 在 Qwen2.5-VL-3B/7B 上训练,理解其采样与归一化机制有助于看懂训练曲线与 500 个 update 的实验设置。
研究动机
带可验证奖励的强化学习(RLVR)已在数学、编程等领域大幅提升了语言模型的推理能力,但把它扩展到视觉语言模型时,遭遇了一个核心瓶颈:缺乏同时具备“覆盖广、可精确验证、可复现”三项性质的训练数据。现有两条路线都各有缺陷。其一,大混合数据集(如 Vero 用了来自 59 个数据集的 60 万样本)虽覆盖广,但继承了各源数据集异质的任务粒度、采样单元和推理边界,难以统一管控;其二,程序化系统(如 Reasoning Gym、Sphinx、Jigsaw-R1)能提供精确监督与可控生成,却通常只聚焦于单一场景文法或一小簇相近目标。结果是“广度、可控性、精确验证”三者很少在一个连贯的任务组织中被同时实现,限制了视觉推理训练数据的可迁移性。
本文的目标是本文的目标是构建一个单一、连贯的环境,同时统一“广度、可控性与精确验证”这三项此前难以兼得的性质,用于视觉推理的 RLVR 训练。具体而言,作者希望得到一个分类法引导的环境,包含跨多视觉领域的 1000 个任务,每个实例的答案都能从任务计算本身精确导出(而非渲染后贴标签),支持受控的语义与视觉变异同时保持稳定的任务身份,并提供可确定重放的实例轨迹。随后,作者在 Qwen2.5-VL-3B 与 7B 两个规模上训练,检验这种程序化生成数据上的 RLVR 能否把增益迁移到 24 个外部视觉推理基准,而不仅仅停留在同环境的留出实例上。
与已有工作不同的是,本文的独特切入角度是把任务构建彻底解耦为相互独立的组件——场景文法、可执行任务程序、有界查询变异、奖励契约——并让“可执行的任务定义”成为生成、采样、验证与分析的稳定单元。不同于既有程序化系统把单一场景文法与狭窄目标绑定,TRACE 把场景文法(定义“能渲染什么”)与在其上执行的任务程序(定义“算什么、答什么”)分离开,二者共享同一语义状态。这种分解使 277 个场景文法可被多个推理目标复用(每文法中位数 3 个任务、范围 1–26),也允许视觉实现变化而不重定义被采样、被验证、被分析的任务,从而在 11 个视觉领域上获得 1000 个稳定任务程序。
核心方法
TRACE 的直觉是:一个视觉推理实例应从单一的共享语义状态派生,这一状态同时决定渲染图像、问题提示、有类型答案、验证器状态与可重放轨迹,使监督直接来自任务计算而非渲染后标注。技术上它沿 $ ext{domain} o ext{scene grammar} o ext{task}$ 的层级分解每个任务,其中任务 $T = (S, P, Y, C)$ 耦合了场景文法 $S$(物体词汇、关系、布局家族、可见支架)、可执行任务程序 $P$、答案模式 $Y$、奖励契约 $C$。对每个被采样的任务,TRACE 先用场景生成器构造语义状态 $x$,执行任务程序得到答案与验证器状态,再从同一状态独立地渲染图像和生成提示,最终在 277 个场景文法和 11 个视觉领域上产出 1000 个任务。环境支持四种答案接口(整数、规范数值、字符串、选项字母),其中 790 个任务使用开放式答案。
核心创新是把可执行的任务程序作为稳定的身份单元,并严格定义任务等价 $T_i \equiv T_j \iff S_i \simeq S_j, P_i \simeq P_j, Y_i = Y_j, C_i \simeq C_j$:该关系允许字面操作数(如颜色、类别)重命名,但任何对计算或场景文法的结构性改变都构成新任务。这与既有工作本质不同:大混合数据集的采样单元继承自源数据集的粒度,程序化系统则把单一文法与单一目标绑定。通过把场景文法与任务程序分离,TRACE 让 277 个文法被多个推理目标复用——一个“箱线图极值”任务与一个“网格线计数极值”任务共享规范签名 filter → 计算度量 → 选极值 → 返回标签,却因场景文法不同而仍是两个不同任务;同时让视觉实现(主题、布局、调色板)可变而不重定义被采样、验证、分析的任务。
方法步骤详情
实例构造遵循流水线 $x = G_s(z, heta_s)$ → $(y, v) = P_t(x; q)$ → $I = R_s(x; z, heta_r)$ → $p = H_{s,t}(x, q; z, heta_p)$ → $c = \mathrm{bind}(C_t; y, v)$,并由 $ au = \Gamma(\cdot)$ 记录轨迹。步骤一:场景生成器 $G_s$ 用种子 $z$ 与语义参数 $ heta_s$ 构造语义状态 $x$。步骤二:任务程序 $P_t$ 在 $x$ 上(可选查询 $q$)执行,返回有类型答案 $y$ 与验证器状态 $v$。步骤三:渲染器 $R_s$ 与提示函数 $H_{s,t}$ 用独立种子流从同一状态实现图像 $I$ 与提示 $p$。步骤四:奖励契约 $C_t$ 绑定 $(y, v)$ 得到打分器 $c$。实例须通过唯一答案、提示-图像一致性与确定性重放校验。训练用 GRPO 在 Qwen2.5-VL-3B/7B 上进行,奖励 $R = 0.95 R_a + 0.05 R_f$,64000 实例,500 update 共采样 512000 条响应。
技术新颖性
技术新颖性体现在多条轴线上。其一,带显式等价规则的程序化分类法(式 $3$)防止任务清单失真——既不会把操作数变体过度计为新任务,也不会把不同的中间运算错误合并——给出稳定的采样单元;317 个任务含多查询(共 1475 个查询变体),但任务选择先于查询选择,故变体不会让父任务被过采样。其二,生成-渲染-验证管线让图像、提示、答案、打分器、轨迹共享同一语义状态 $x$,实现精确监督与确定性重放,这在视觉 RL 环境中较为罕见(以往多在文本/符号输入上操作)。其三,把语义生成参数 $ heta_s$(物体计数、阈值)与仅渲染参数 $ heta_r$(调色板、布局、光栅效果)分离,使视觉变异保持任务身份不变。其四,这种分解把生成-验证模型扩展到 11 个视觉领域,远超单领域的程序化系统。
实验结果
在 64000 个 TRACE 实例上的 RLVR 带来了广泛且可迁移的增益。在留出 TRACE 验证集上,3B 准确率从 24.45 升到 41.05(+16.60),7B 从 34.25 升到 51.55(+17.30)。在 24 个外部基准上,宏平均从 39.34 升到 42.85(3B,+3.51)、从 47.93 升到 51.99(7B,+4.06);六个类别平均在两个规模上全部提升,3B 上 24 个基准中 21 个均值改善、7B 上 24 个全升,配对自举区间分别在 18 与 21 个基准上排除零。视觉数学类别增益最大(3B +7.44、7B +5.65),单基准最大改善是 WeMath(3B +10.95、7B +10.96)。训练奖励在 500 update 内由 0.240→0.432(3B)、0.353→0.542(7B)。在 7B 上,TRACE 检查点宏平均比 Game-RL-7B 高 3.94、比 Sphinx-7B 高 2.64、比 PC-GRPO-7B 高 3.18,在 24 个基准中 21 个取得最高均值、六类平均全部领先。
查看结构化数据
| 任务 | 指标 | 本文 | 基线 | 提升 |
|---|---|---|---|---|
| 外部 24 基准宏平均(7B) | 宏平均准确率(%) | 51.99(TRACE) | 47.93(Qwen2.5-VL-7B base) | +4.06 个百分点,24/24 基准均值全升 |
| 外部 24 基准宏平均(3B) | 宏平均准确率(%) | 42.85(TRACE) | 39.34(Qwen2.5-VL-3B base) | +3.51 个百分点,21/24 基准均值改善 |
| 视觉数学类别(3B/7B) | 类别平均(%) | 39.7 / 48.7 | 32.2 / 43.0 | +7.44 / +5.65 个百分点,最大类别增益 |
| WeMath 单基准 | 准确率(%) | 28.8(3B)/ 46.2(7B) | 17.9 / 35.2 | +10.95 / +10.96 个百分点,最大单基准增益 |
| 留出 TRACE 验证集 | 准确率(%) | 41.05(3B)/ 51.55(7B) | 24.45 / 34.25 | +16.60 / +17.30 个百分点 |
局限与改进
TRACE 的分类法虽显式但仍是人工设计的——任务边界仍需主观判断,1000 个手工任务也无法穷尽视觉推理;13 个操作家族刻画了计算类型,但并未在跨领域间定义统一的“难度”概念。实验只展示了完整 TRACE 混合的迁移效果,未把增益归因到具体领域、操作家族、采样选择或渲染控制,而归因需要做混合消融。目前仅研究了单次固定训练 pass 上的均匀任务采样。每个规模只跑了一次训练,因此解码种子的方差只反映推理波动而非训练波动。与已发布 RLVR 检查点的比较是描述性的,因为它们在数据、优化、算力上均不匹配。最后,程序化一致性并不能保证感知难度相等——合成渲染器可能引入自然图像中没有的规律性或偶发歧义。
独立分析的弱点
一个关键弱点是缺少混合消融:训练用的是完整 TRACE 集合的均匀采样,因此无法判断 11 个领域或 13 个操作家族是否都同样有用,开发者也无从知道该优先采用哪个子集——改进方向是做留一领域消融与逐家族消融来归因增益。其二,单次训练意味着 3B 在 ChartQAPro(−0.14)、TreeBench(−0.66)、EvoChart(−1.68)上的负变化可能只是噪声而非真实回归,需多种子加置信区间。其三,基准评分器质量参差,部分用模型评分,引入标签噪声,可用自一致性或人工审计子集缓解。其四,程序化规律性(干净的合成渲染)可能让模型过拟合渲染伪迹,掺入精选真实图像(如 Vero 的做法)或能改善自然图像迁移。基于显式任务身份,可做难度感知课程、按学习进度的自适应采样与混合优化。
未来方向
作者建议用程序结构、语义状态规模、视觉密度与经验求解率来建模任务复杂度,因为现有操作家族并未定义跨领域难度。他们还呼吁做混合消融以把增益归因到具体领域/操作,并探索基于模型能力或学习进度的难度感知课程、自适应采样与混合优化。基于本文成果,自然的延伸包括:(1)通过众包新场景文法与任务程序把任务清单扩展到 1000 以上;(2)引入更丰富的渲染来源(含真实图像与神经渲染)以减少合成规律性;(3)用基于重放的失败分析修复歧义生成;(4)把奖励接口从 {整数、数值、字符串、选项} 扩展到结构化或自由形式输出;(5)利用显式任务身份做课程学习与训练中的在线 RL(TRON 式的实时新实例生成)。
复现评估
可复现性中等偏上。论文给出了关键训练细节:全参数 GRPO、BF16、学习率 $10^{-6}$、每 update 一个策略 epoch、每 update 128 prompt × 8 响应、共 500 update、温度 1.0 与 top-p 1.0、8×H100 80GB GPU 上 3B 耗时 12.2 小时、7B 耗时 13.9 小时,附录 B 提供完整配置。评估用 VLMEvalKit,每模型每解码种子跑 32805 个样本、重复 3 个种子。奖励公式 $R = 0.95 R_a + 0.05 R_f$ 与生成-渲染-验证管线定义精确。然而 TRACE 环境本体(277 个场景文法、1000 个任务程序、各类渲染器)虽被详尽描述,其代码/数据发布状态仍是主要不确定点——论文引用了项目页 maveryn.github.io/trace。算力门槛(8×H100、约 13 小时)较高但对学术实验室可行;一旦环境发布,由于每个实例都可从轨迹确定重放,程序化特性将显著提升复现度。
论文图表