标注即推演:面向视频多模态大模型的高效可扩展强化学习 Annotations as Rollouts: Efficient and Scalable Reinforcement Learning for Video MLLMs
将标注作为oracle加入RL组,解耦优势估计防反转,免CoT高效训练统一视频感知。
前置知识
GRPO(组相对策略优化)
DeepSeekMath 提出的免 critic 强化学习算法:对同一 query 采样一组(如 8 条)on-policy rollout,用任务奖励函数打分,然后做组内归一化 $A_i = (r_i - \mu_{grp})/(\sigma_{grp}+\epsilon)$ 得到每个 rollout 的优势,再用 PPO 裁剪目标更新策略。组均值天然充当基线(baseline),组内相对比较替代了价值网络。
OraRL 的全部改动都建立在 GRPO 的组归一化框架之上:它修改了组的构成(加入 oracle)、基线的计算范围和 rollout 的保留策略,不理解 GRPO 就无法理解 advantage inversion 为何发生。
优势(Advantage)与基线(Baseline)
优势衡量某个动作/输出比平均水平好多少:奖励高于基线为正(应加强该行为的概率),低于基线为负(应抑制)。组相对方法里基线就是组内奖励均值。基线选取直接决定哪些样本被强化、哪些被惩罚,若基线被外来高分样本抬高,原本「好于平均」的样本会被错误地惩罚。
本文的核心失败模式 advantage inversion 正是基线被 oracle 抬高所致:奖励落在 $(\mu_{op}, \mu_{aug})$ 区间的正样本被赋予负优势。理解「优势符号由与基线的比较决定」是读懂第 3.2 节全部公式的前提。
On-policy rollout 与 CoT 生成
On-policy rollout 指用当前策略对 query 采样得到的输出序列,RL 更新后需重新采样(数据始终来自当前策略)。若先让模型生成思维链(chain-of-thought)再给答案,每条 rollout 的 token 数大幅增加,训练时每条样本都要算 log-prob、推理时要逐 token 解码,成本随推理长度线性增长。
视频 RL 的痛点是 on-policy 采样很难精确命中标注的时间区间或框,导致组内缺乏正样本;CoT 是已有方法的补救但代价高昂(本文实测 GRPO+CoT 步时 135.6s 对 93.9s,推理延迟 4.78s 对 0.13s)。OraRL 用 oracle rollout 替代 CoT,这条对比线贯穿全文。
细粒度视频感知的任务指标(tIoU/IoU、AO、cIoU/J&F)
时间定位用时间交并比 tIoU/mIoU 衡量预测区间与标注区间的重叠;空间定位与跟踪用框交并比 IoU,跟踪的 average overlap(AO)是对全部帧 IoU 取平均;分割用 cIoU(区域并集交比)和 J&F(区域相似度 J 与轮廓精度 F 的均值)。这些指标同时充当 RL 的任务奖励 $R(o,q)$。
OraRL 的 oracle rollout 之所以可行,是因为七大任务族都有可在 0 到 1 之间连续打分的标量奖励(tIoU、box IoU、AO、精确匹配等),标注经序列化后能直接按同一指标打满分。理解奖励设计才能理解 oracle 的奖励 $r_{gt}$ 如何进入优势计算。
PPO 裁剪目标与重要性比率
PPO 用重要性比率 $\rho_{i,t}(\theta) = \pi_\theta(o_{i,t}|q,o_{i,<t}) / \pi_{\theta_{old}}(o_{i,t}|q,o_{i,<t})$ 衡量新旧策略对同一 token 的概率变化,并通过裁剪 $\min(\rho A, \bar\rho A)$($\bar\rho$ 裁剪到 $[1-\epsilon_c, 1+\epsilon_c]$)限制单步更新幅度,保证训练稳定。序列级优势会广播到该序列的所有响应 token 上。
OraRL 保留 PPO 裁剪目标不变(式 14),只改组的构成、优势估计与 rollout 选择;同时它复用预更新前向的旧策略 log-prob 避免二次评估。论文还论证了优势反转无法用重要性加权修正,因为 on-policy 样本的比率恒为 1。
研究动机
统一视频感知(时间定位、空间定位与分割、跟踪、空间智能)是通向物理智能的关键能力,但通用视频 MLLM 在细粒度感知上仍显著落后于小得多的专用模型:GPT-5 在三个 TimeLens 时间定位基准上的 mIoU 仅为 40.5、42.9、56.8,均低于 10B 以下的开源专家模型 TimeLens2-8B(58.6/58.6/70.2),说明细粒度精度主要由任务对齐的后训练而非模型规模决定。现有两条后训练路线都有结构性缺陷:其一,SFT 把标注当作最大似然目标,只约束输出格式,无法区分「接近正确的预测」与「完全错误的预测」;其二,以 GRPO 为代表的组相对 RL 中,标注只充当评分参考,而 on-policy 采样几乎不可能精确命中标注的时间区间、框、掩码或轨迹,导致大量 rollout 组没有任何可靠的正样本锚点。引入 CoT 也无济于事:它只是把每条 rollout 拉长——实测 GRPO+CoT 每步训练时间从 93.9s 涨到 135.6s(+44.4%),十分钟视频推理的首 token 后延迟从 0.13s 涨到 4.78s——但时间定位平均分反而从 58.7 降到 58.5。更糟的是,单纯扩大训练数据在既有范式下只带来边际收益,样本效率才是核心瓶颈。
本文的目标是本文要构建一个统一、高效、可扩展的视频 MLLM 强化学习后训练范式,具体目标有三:(1)让每个 query 的 rollout 组内都存在一个可靠的正优化目标——直接利用本来就有的标注,而不依赖采样碰运气,也不依赖 CoT 的长推理;(2)该机制必须是任务无关的,用同一条更新规则覆盖时间定位、空间定位、时空定位、视觉跟踪、掩码感知分割、视频问答、空间智能七大任务族;(3)在效率上可扩展——训练步时间显著低于带 CoT 的 GRPO,推理保持 answer-only 的低延迟,并且增益随模型规模(0.8B 到 9B)和数据量(最高 100k prompts)持续增长,最终训练出在七类任务上同时领先的开源统一模型 Video-ORA。
与已有工作不同的是,本文的独特切入是对「标注角色」的重新定义。已有视频 RL 方法(Video-R1、VideoChat-R1、Seg-R1、R1-Track 等)中标注只做两件事:格式模板或奖励参考;本文提出 annotation-as-rollout——把标注经任务适配器序列化成模型响应格式,作为一条 oracle rollout 直接加入 on-policy 组,使每组的第 9 条样本是一个保证高奖励的正目标。这个看似简单的想法此前被忽视有其原因:把高奖励 oracle 混入组归一化会抬高基线,引发本文首次命名并量化的 advantage inversion(优势反转)——高于 on-policy 均值的正样本反而获得负优势。作者早期工作 Tempsamp-R1 曾用手工 reward shaping 绕过该退化,但依赖任务特定的奖励语义;本文则从优势估计层面根治:基线只用 on-policy 奖励计算,oracle-policy 差距通过方向增益和分离的 oracle 优势两个独立通道注入,一条规则适用所有任务,同时配合符号均衡剪枝把计算量压到 GRPO+CoT 的一半以下。
核心方法
直觉层面:与其指望策略采样恰好命中精确的时间边界或框,不如把已知正确的标注「装进模型的输出格式」,作为一条标准答案 rollout 放进每个 rollout 组里,让策略优化始终有可靠的正向锚点;但必须防止这条高分样本在组归一化时抬高基线、误伤其余好样本。技术路线分五步:(1)组构造——对每个 query $q=(v,x)$ 用当前策略采 $n=8$ 条 on-policy rollout,再把标注 $y$ 经变换 $T_{task}$ 序列化为第 9 条 oracle rollout $o_{gt}$,构成增广组 $O_{aug}$;(2)基线解耦——on-policy 优势只在自己的 $n$ 条内归一化,$A^{(0)}_i = r_i - \mu_{op}$,不做方差归一化,保证高于均值的样本优势必为正;(3)差距编码——用奖励分散度的有界增益 $g_q = \mathrm{clip}\left(\left(\tfrac{\sigma_{aug}}{\sigma_{op}+\epsilon}\right)^{1/4}, 1, 4\right)$ 只放大高于均值的 rollout,并用分离的 oracle 优势 $A_{gt}$(基于权重 $w_q$ 与最强正优势封顶)作为随差距闭合而衰减的锚点;(4)符号均衡剪枝——保留 oracle 加上绝对优势最大的正、负 rollout 各若干条($n=8, \kappa=0.5$ 时为 oracle+1 正+2 负),只对这 4 条做前向与反传,随后做矩校正恢复零均值并匹配 RMS;(5)用标准 PPO 裁剪目标在保留子集上更新。
核心创新是把标注从「被动评分器」升格为「主动优化目标」,并用解耦的优势估计消除随之而来的基线污染,这与三类已有方法都有本质区别。与 GRPO 相比:标注不再只用于打分,而是以 oracle rollout 身份入组,但 OraRL 刻意把它排除在基线统计之外——优势符号完全由 on-policy 内部比较决定,从构造上消灭反转区间(混合归一化的均值为 $\mu_{aug} = \mu_{op} + (r_{gt}-\mu_{op})/(n+1)$,凡是 $r_i \in (\mu_{op}, \mu_{aug})$ 的样本都会被错误惩罚,反转带宽度随 oracle-policy 差距线性增长)。与 SFT 相比:oracle 不替换采样,8 条 on-policy rollout 全部保留,探索不受抑制,oracle 只是「加进来」而非「抄答案」。与 LUFFY 式教师轨迹注入相比:oracle 直接来自配对标注,无需外部教师模型,且不依赖正则化重要性采样——论文证明重要性加权无法修正反转,因为 on-policy 样本的比率恒等于 1。oracle 信息通过 $g_q$(放大高于均值者)与 $A_{gt}$(封顶且随 $w_q = \mathrm{clip}\left(\tfrac{r_{gt}-\mu_{op}}{r_{gt}+\epsilon}, 0, 1\right)^2 \to 0$ 自动退出的锚点)两个独立通道进入更新,差距闭合时引导自然消失,实现从「模仿」到「自主」的平滑过渡。
方法步骤详情
完整流程分六步。第一步 oracle 构造:任务适配器把标注 $y$ 序列化为该任务的响应格式——答案选项或数值(QA/空间智能)、时间区间(时间定位)、框(空间定位)、区间加逐帧框(时空定位)、完整框轨迹(跟踪)、时间戳加框加正负点(分割),并校验格式有效性 $F_k(o)\in\{0,1\}$,总奖励 $R(o,q)=R_k(o,y)F_k(o)$,畸形输出计零分。第二步组构造与打分:每 prompt 采 8 条 rollout,加入 oracle 成 9 条,按任务指标打分(tIoU、box IoU、跟踪 AO、分割分数 $0.35\,\mathrm{IoU}+0.10\,\mathbb{1}[\hat t\text{ 有效}]+0.40\,\mathrm{In}+0.15\,\mathrm{Out}$ 并设防作弊上限、分类精确匹配、数值 MRA)。第三步优势估计:$A^{(0)}_i = r_i - \mu_{op}$;方向增益 $g_q$ 仅作用于高于均值者再去中心化;oracle 优势 $A_{gt} = \min\left(2w_q,\ \mathrm{clip}(1.2A^+_{\max}, 0.05, 1)\right)$,无正样本时封顶 0.05 提供微小自举信号。第四步符号均衡剪枝:按序列级优势正负分桶,保留 $S_q = \{o_{gt}\}\cup\mathrm{Top}_{K^+}\cup\mathrm{Top}_{K^-}$,$n=8,\kappa=0.5$ 时为 oracle+1 正+2 负。第五步矩校正:重定心 $z_i = a_i - \tfrac{1}{K}\sum_\ell a_\ell$,若 $z_{gt}<0$ 则投影到 $z_{gt}=0$ 并均匀分摊偏移,再按 $\lambda_q = \mathrm{clip}\left(\tfrac{\mathrm{RMS}_{op}}{\mathrm{RMS}_S+\epsilon}, 0.25, 1\right)$ 缩放。第六步更新:在保留子集上计算 PPO 裁剪目标,旧策略 log-prob 复用预更新前向结果以省一次评估。
技术新颖性
技术新颖性体现在三个层面。概念层面:annotation-as-rollout 首次把同一份标注同时用作奖励参考和组内正样本,且完全任务无关——从几何输出(区间/框/掩码)到文本答案(QA 选项、数值)都能统一处理,这一点由 Video QA 与空间智能任务(占 RL 混合 37%)上的增益(macro 61.9→66.8、VSI-Bench 73.1)直接验证。诊断层面:论文首次命名并系统量化 advantage inversion——基于 92,024 条 rollout、11,503 个组的统计显示,朴素混合使 22.4% 的 GRPO 正样本被翻转为负优势(跟踪任务高达 38.7%),42.5% 的组至少含一条反转,8.3% 的组(时间定位 17.5%)失去全部正样本,并给出反转带宽 $(r_{gt}-\mu_{op})/(n+1)$ 的解析式;这一失败模式此前被 reward shaping 掩盖而未被解释。算法层面:解耦设计(无 oracle 基线 + 独立 oracle 通道)替代了任务特定的手工 shaping——对照实验中 Tempsamp-R1 式 shaping 只恢复到 61.2 分且需按任务设计变换,OraRL 用原始奖励达到 62.7 分;符号均衡剪枝区别于 CPPO 的纯幅值剪枝(后者可能只保留单一符号、把所有样本往同一方向推),配合事后矩校正实现 1.48 倍加速仅损失 0.4 分。
实验结果
核心结果逐一分析。时间定位(Table 1):Video-ORA-9B 在三个 TimeLens 基准的 mIoU 为 61.8/63.6/72.5,全面第一,超时间定位专家 TimeLens2-8B(58.6/58.6/70.2)2.3 到 5.0 分,也全面超过 Gemini-2.5-Pro;ActivityNet 与 QVHighlights 上随重叠阈值收紧优势扩大,R1@0.7 差距达 6.7 分——正是 annotation-as-rollout 预测的模式:粗定位骨干本就会,精确边界才是采样难以产出的部分。跟踪(Table 4):GOT-10k AO 78.2 超 OneThinker-8B 5.2 分,R@0.7 优势从 0.2 扩大到 6.5。指代定位(Table 2):RefCOCO/+/g 全部 8 个 split 第一(领先 0.5~2.7 分),且在禁用绝对方位词的 RefCOCO+ 上优势最大,说明增益来自外观与关系理解。时空定位(Table 5):STVG 四指标全第一,sIoU 提升(+15.5/+11.9)远大于 tIoU(+3.0/+2.4),增益主要来自帧级空间定位。分割(Table 7):MeViS J&F 61.3(骨干仅 32.1,+29.2)、ReasonVOS 63.7,均第一。视频 QA(Table 3):macro 从骨干 61.9 提至 66.8,7 个基准中 5 个开源第一,VideoHolmes +15.2。空间智能(Table 6/8):VSI-Bench 73.1,超最强专有模型 GPT-5(55.0)与 Gemini-3-Pro(55.1)各 18.0 分,appearance order 子项 90.6;但 MMSI+MindCube 平均 47.7 仍低于 Grok-4 的 50.7。控制变量实验同样关键:同数据同预算下 OraRL 62.7 对 GRPO 60.3、Dr.GRPO 60.7、CPPO 60.5、LUFFY 54.7、继续 SFT 58.7(Table 12);朴素 oracle 注入反而掉到 55.4,shaping 只恢复到 61.2(Table 13);反转率从 22.4% 降至剪枝后 0.3%(Table 14);κ=0.5 剪枝把步时从 92.5s 压到 62.4s(1.48 倍)仅损失 0.4 分(Table 16);免 CoT 推理中位延迟 24.3s 对 CoT 骨干 29.0s,P90 为 25.15s 对 62.67s(Figure 7)。
查看结构化数据
| 任务 | 指标 | 本文 | 基线 | 提升 |
|---|---|---|---|---|
| 时间定位(Charades/ActivityNet/QVHighlights-TimeLens) | mIoU | 61.8 / 63.6 / 72.5(三榜全第一) | TimeLens2-8B 专用模型 58.6 / 58.6 / 70.2;GPT-5 仅 40.5 / 42.9 / 56.8 | 较最强专家 +2.3~5.0 分,ActivityNet R1@0.7 优势达 +6.7 分 |
| 视觉跟踪(GOT-10k) | AO(平均重叠) | 78.2(R@0.7 达 75.3) | OneThinker-8B 73.0;Qwen3.5-9B 骨干仅 46.0 | +5.2 AO,R@0.7 优势 +6.5 分 |
| 指代视频分割(MeViS) | J&F | 61.3 | OneThinker-8B 52.7;Qwen3.5-9B 骨干 32.1 | 较最强基线 +8.6 分,较骨干 +29.2 分 |
| 空间智能(VSI-Bench) | 宏平均(数值题 MRA + 选择题准确率) | 73.1(appearance order 90.6) | GPT-5 55.0、Gemini-3-Pro 55.1、最强开源 SpaceMind 69.6 | 较最强专有模型 +18.0 分,创已报道最佳 |
| 视频问答(7 基准 macro) | 平均准确率 | 66.8(VideoHolmes 65.5、VideoMME 76.7) | Qwen3.5-9B 骨干 61.9 | +4.9 分,其中 VideoHolmes +15.2、VideoMME +5.6 |
| 训练效率(Qwen3.5-9B,三任务协议) | 平均分 / 每步秒数 | 61.4 分 / 62.4 s(免 CoT) | GRPO 58.7 分 / 93.9 s;GRPO+CoT 58.5 分 / 135.6 s | +2.7 分且步时 -33.5%;相对 CoT 版本步时不到一半 |
| 推理延迟(10 分钟视频,2fps,H20 BF16) | 中位端到端延迟 / P90 | 24.30 s / 25.15 s(answer-only,中位 13.5 个答案 token) | Qwen3.5-9B 骨干(CoT,808.5 个推理 token)29.03 s / 62.67 s | 中位 -4.7 s,P90 尾延迟 -37.5 s;首 token 后延迟 0.13 s 对 4.78 s |
局限与改进
作者明确承认的局限:方法假设每条标注都能序列化为合法 oracle rollout 并由标量任务奖励评估,对模糊、部分缺失或带噪声的监督以及「学习型 oracle」的行为尚未评估;实验覆盖七大任务族与两个骨干族(Qwen3.5、Qwen3-VL),但需要复杂推理的空间任务仍落后于部分专有模型——MMSI-Bench 与 MindCube 平均 47.7,低于 Grok-4 的 50.7 与 GPT-5 的 49.1,VSI-Bench 的路径规划子项 47.4 也不及 Gemini-3-Pro(61.9)、Kimi-K2.5(52.1)和 GPT-5(50.2)。我自己的观察还有四点:其一,附录 F 的 ReVSI 复评暴露鲁棒性问题——从 VSI-Bench 到修正后的 ReVSI,Video-ORA-9B 掉了 14.9 分而骨干只掉 6.3 分,且相对方向任务上正向 91.5% 对反向仅 8.3%(骨干为 77.4% 对 18.4%),说明训练数据 VSI-590K 的前向模板造成了系统性方向偏置,聚合分数领先并不等于空间推理更稳健;其二,oracle 依赖使方法对标注质量高度敏感,标注错误会以 100% 置信度进入正目标,误差无法被组内竞争稀释,而分割奖励中那些防作弊 capping(无正点在掩码内封顶 0.1 等)暗示作者已在应对 oracle 操纵问题;其三,剪枝在 κ=0.75 时平均分掉到 60.2(-2.9),说明符号均衡在极小预算下脆弱,且梯度只来自 4/9 条样本,方差特性未做理论分析;其四,所有评估都处于奖励函数已知可计算的环境,开放式生成类任务(字幕、对话)无法直接套用该框架。
独立分析的弱点
独立分析可得以下弱点,每条附改进方向。(1)oracle 单点依赖:标注噪声或错误直接转化为高置信度错误监督,$A_{gt}$ 的封顶机制只限制幅度不修正方向;改进方向是引入 oracle 置信度加权(如多标注一致性、模型集成分数缩放 $A_{gt}$),或对标注做留出自检。(2)前向/后向方向偏置:ReVSI 分析显示相对方向任务前向 91.5% 对后向 8.3%,训练数据模板的偏置被 RL 放大;改进方向是合成后向视角问法做对照增强,或在前向/后向子集上施加优势再平衡。(3)极小剪枝预算下退化:κ=0.75 时只剩 oracle+1 条策略样本,符号对比骤减导致 60.2 分;改进方向是按组内奖励分散度自适应调度 κ,正负样本不足时自动回退到更大保留集。(4)answer-only 的推理天花板:路径规划等组合推理子项仍落后于带推理的专有模型,纯答案监督难以教会多步规划;改进方向是在 oracle 之外引入简短结构化推理轨迹作为「带过程的 oracle」,或让 CoT 长度自适应地只在难题上启用。(5)骨干泛化范围有限:仅在 Qwen3-VL-8B 与 Qwen3.5-9B 两族上验证(分别 +2.6 与 +1.4 优于 GRPO),对 InternVL、VideoChat3 等其他架构家族的适用性未测;改进方向是按骨干输出格式自动生成序列化适配器。(6)超参数敏感性:$g_q$ 的 1/4 次幂、$w_q$ 的平方、clip 边界(1、4、0.05、0.25)均为经验设定,缺乏消融外的理论支撑;可做敏感性分析或元学习这些标量。
未来方向
作者提出的方向:把框架扩展到更广泛的监督形式——模糊、部分、噪声标注下的鲁棒 oracle 构造,以及「学习型 oracle」(用模型而非人工标注提供目标);覆盖更多模型家族;以及引入推理能力(当前完全免 CoT)。基于本文成果可自然延伸的研究:(1)把 annotation-as-rollout 推广到开放式生成与具身智能——用构造的示范回答或专家动作序列充当 oracle,配合文本生成奖励;(2)多 oracle 与 oracle 不确定性建模:同一 query 存在多个可接受答案时,用加权 oracle 集合替代单一 oracle,理论上有望进一步降低方差;(3)解耦优势估计的收敛性分析——当前 $g_q$、$w_q$、$\lambda_q$ 的幂次与裁剪边界是经验值,可在两动作简化模型下证明无偏性或给出偏差上界;(4)反向空间推理数据合成与课程式方向增强,修复 ReVSI 暴露的前向偏置;(5)与课程学习结合:论文已用 SFT 检查点预打分做难度筛选(得分 ≥0.80 的样本限 15%),可进一步让 oracle 权重 $w_q$ 驱动自动课程——差距大的样本多引导、差距小的早放手;(6)把符号均衡剪枝与梯度方差估计结合,实现精度无损的更激进剪枝(κ>0.5);(7)将统一接口扩展到音频、3D 点云等更多模态的定位任务。
复现评估
复现条件总体良好。开源情况:代码在 GitHub(HVision-NKU/OraRL),模型权重与完整训练数据在 HuggingFace(OraRL/models、OraRL/datasets/OraRL-Data),论文给出项目主页 orarl.github.io;超参数在 Table 17 完整披露(RL 学习率 2e-6 恒定、prompt batch 64、采样温度 1.0/top-p 0.85、PPO clip 0.2、KL 系数 0、每 prompt 8 条 rollout、剪枝率 κ=0.5、响应上限 2048 token;SFT 学习率 1e-5 余弦退火、序列长 12,288),初始化采用 $\theta_{init}=(1-\alpha)\theta_{base}+\alpha\theta_{SFT}$ 插值(4B 用 α=0.7,9B 用 α=0.6),视觉塔全程冻结。数据全部来自公开训练集(TimeLens-100K、GOT-10k、TrackingNet、OneThinker 训练包、RefCOCO 系列、LLaVA-Video-178K、VSI-590K 等),并做了训练/评测重叠视频清洗。算力门槛较高:受控 4B 实验用 4 节点×8 张 NVIDIA H20(32 卡),完整 9B RL 用 8 节点×8 张 H20(64 卡)全参数分片;工程栈为 veRL + vLLM + FSDP,均为主流框架。综合评估:方法本身改动集中在优势估计与组构成,算法层面复现难度不高(中等偏下),但要复现论文级结果需要大规模 GPU 预算和完整的数据处理流水线(视频统一解码一次、帧共享、异步奖励评估等系统优化也有贡献),对普通实验室建议从 0.8B/2B 规模与三任务协议入手。
论文图表
七个任务族的代表输入与分数总览:Video-ORA-9B(免 CoT)在时间定位 mIoU 66.0、空间定位 R@0.5 90.9、分割 cIoU/J&F 70.4、跟踪 AO 78.2、时空定位 tIoU/sIoU 35.0、视频 QA 66.8、空间智能 macro 56.1,每个指标都超过图中展示的 LLaVA-OV2-8B、Qwen3-VL-8B、TimeLens2-8B、OneThinker-8B、Cambrian-S-7B 等基线。
一图概括论文最终成果:一个模型、单一训练配方、七大任务族全面领先,是理解论文动机与贡献的入口。
基于全部 92,024 条 rollout、11,503 个组的反转率统计:朴素混合翻转 22.4% 的 GRPO 正样本(跟踪 38.7%、时间 18.8%、分割 4.5%),42.5% 的组至少含一条反转、8.3% 的组失去全部正样本(时间定位组达 17.5%);reward shaping 降至 11.9%;OraRL 剪枝前 1.9%、剪枝后 0.3%。
对核心失败模式的定量画像:任务间差异(跟踪高发、分割低发)与组级灾难(17.5% 组无正样本)为理解稀疏奖励任务为何更需要 oracle 提供了数据基础。
组件消融(三任务平均 62.7 为基准):去掉方向增益 -1.5(跟踪 -2.7)、去掉分离 oracle 优势 -1.4(时间定位 -2.5)、去掉 reward-gap 权重 -1.1、去掉符号均衡 -0.6(时间定位反降 1.8)、去掉矩校正 -0.7;不做剪枝(κ=0)可达 63.1。三个 oracle 组件的任务效应互补。
逐一验证每个设计组件的贡献并揭示其互补性,是判断哪些部件在特定任务上可精简的依据。
剪枝率 κ 的权衡(9 条组):κ=0 保留 8 条、92.5s/step、62.4GB、63.1 分;κ=0.25 保留 6 条、75.0s、62.8 分;κ=0.5 保留 4 条、62.4s、50.9GB、62.7 分(性价比最优:每损失 1 分省 75.3 秒);κ=0.75 仅留 2 条、45.0s、60.2 分(符号对比被破坏)。
给出效率-精度的完整帕累托前沿,κ=0.5 的默认选择有明确的数据支撑,也是复现时最重要的单一超参数决策。