验证器诱导的在线策略优化支持重塑 Verifier-Induced Support Reshaping in On-Policy Optimization
RLVR 在提升当前任务的同时,会把未来任务的成功轨迹挤到固定预算内难以采样
前置知识
RLVR(可验证奖励强化学习)
RL with Verifiable Rewards 是一种后训练范式:策略从自身采样 rollout,由程序化验证器(数学题精确匹配最终答案、指令跟随约束检查器)给出确定性的 0/1 奖励,再用 GRPO 等 on-policy 算法更新参数。它不需要训练奖励模型,奖励可靠但稀疏,已成为数学、代码和推理后训练的主流方法。
全文的实验对象就是 Math-RLVR 与 IF-RLVR 两种验证器分支,理解 RLVR 的采样-验证-更新循环是读懂一切实验的前提。
有效可奖励支持(effective rewardable support)
本文提出的核心概念:指在给定 rollout 预算内仍能以足够概率被采样到的奖励为正的轨迹。on-policy RL 只能从当前策略采样到的轨迹中学习,一条成功轨迹即使仍然可能,也可能稀少到在 $k$ 次采样中一次都不出现,从而对后续训练不可见。
这是论文对'未来可训练性'的形式化定义,所有的度量(best@k、pass-count 分桶)和结论都围绕它展开。
pass@k 与 best@k
对同一 prompt 采样 $k$ 个随机 rollout 并用验证器打分:rollout 均值 mean@k 估计 pass@1(单次成功率);best@k 记录是否至少一次成功(预算内可解性);pass-count 把 prompt 分为 all-wrong(0 通过)、mixed(1–31 通过)、all-correct(32 通过)三桶。本文核心分析用 $k=32$。
pass@1 上升而 best@32 下降的背离是论文最关键的实证现象,必须理解这两类指标度量的是不同东西。
GRPO 与组内奖励方差
Group Relative Policy Optimization 对同一 prompt 采样一组 rollout,用组内奖励的相对优势(减去组均值)作为梯度信号,无需价值网络。这意味着只有'部分成功部分失败'的 mixed 组才提供非零的组内奖励方差;all-correct 和 all-wrong 组的优势为零,不产生更新。
论文发现 IF-first 训练后 mixed 桶从 33.6% 跌到 1.6%,直接解释了为什么后续 Math-RLVR 缺乏学习信号。
JS 散度与 teacher forcing 定位
Jensen–Shannon 散度衡量两个分布的差异。论文用 Base 策略采样的响应前缀做 teacher forcing(强制两个模型沿同一前缀解码),逐位置比较下一个 token 的分布并按位置聚合 JS,从而定位 RLVR 到底改变了哪些生成位置的分布。
首 token JS 与内部位置 JS 之比高达 9.8×–106.7×,是'支持重塑集中在响应开头'这一机制结论的直接证据。
在线策略蒸馏(OPD)
On-Policy Distillation 让学生在自己生成的 rollout 上逐 token 匹配教师模型的分布,用稠密的 KL 式监督替代稀疏的验证器奖励。相比一次性 SFT 先验,它提供持续监督,但效果依赖所选教师的状态。
OPD 是论文评估的两种缓解手段之一,其失败方式(教师-学生偏好偏移 Spearman $\rho=-0.594$)揭示了蒸馏在支持保留上的新限制。
研究动机
顺序后训练(对齐 SFT、数学 RLVR、指令跟随 RLVR 等)把基础模型训练变成了持续学习问题:每个阶段都必须既保留已有能力,又保住未来阶段的学习能力。已有研究确实发现 on-policy RL 在相同目标任务性能下比 SFT 更能保留非目标能力,但这些证据都是回顾性的——只问'适应之后还剩什么'。而 on-policy RLVR 有一个前瞻性需求:后续目标的成功行为必须仍然在当前策略的可采样范围内。本文指出此前被忽视的具体问题:Math-RLVR 在 IFEval 上(Qwen3-8B-Base)让 pass@1 上升 6.5 个百分点,best@32 却下降 9.8 个百分点——平均单次成功率提高的同时,能在 32 次采样内解出的 prompt 变少了;反过来 IF-RLVR 让 AIME 上从 $k=4$ 到 $k=32$ 的所有 best@k 一路下滑。这种'能力可能还在、但采样不到'的状态无法用传统的灾难性遗忘度量刻画,会导致顺序训练时后续任务的正样本枯竭、组内奖励方差消失,RL 无从学起。
本文的目标是本文的目标是把'未来可训练性'变成可度量的对象并系统刻画其被验证器重塑的方式。具体包括四个层次:(1) 定义有效可奖励支持——在固定 rollout 预算内仍可被采样到的奖励为正的轨迹,并用重复验证器打分采样($k=32$,pass-count 分桶)把它操作化;(2) 在 Qwen3-8B-Base 和 Qwen2.5-Math-7B 两个模型家族上做 Math↔IF 的双向对照:从同一 Base 分别训练两个分支测单阶段支持变化,再做 IF→Math 与 Math→IF 顺序训练检验第一阶段是否约束后续学习;(3) 用 teacher forcing + 位置聚合 JS 散度定位分布变化位置,用不更新参数的强制 token/前缀干预检验开头路由的因果作用;(4) 评估顺序训练、参考策略 KL 约束($\beta\in\{0,0.04,0.08,0.12\}$)、DRI 路由先验 SFT、在线策略蒸馏 OPD 四类缓解手段的极限,并用 MathIF/ReasonIF 检验联合行为。核心问题是:终点指标的改善是否保证未来的可训练性与联合能力。
与已有工作不同的是,本文的独特切入有三点。第一,视角上从回顾转向前瞻:持续学习、对齐税和奖励劫持研究都在事后测量性能残留,而本文问的是'当前验证器给下一个验证器留下了什么可学的',把支持集(支持空间)而非参数或性能作为分析对象。第二,粒度上与 token 级机制研究对接但不止步于相关性:已知 RLVR 只改变相对少量 token 的概率,本文进一步证明改动高度集中于首 token,区分了'重排序 Base 已支持的候选'(top-10 重叠 6.88–8.96,89.3%–99.4% 首选在 Base top-3 内)与'提升低概率开头'(IF-RLVR 在 AIME 位置 1 首选的 Base 排名仅 14.5/18),并用强制路由干预证明因果性。第三,把 mixed 桶与 GRPO 组内奖励方差联系起来,给出一条从'分布形状变化'到'训练信号饿死'的完整机制链,而 MathIF/ReasonIF 等先前工作只在评测时记录推理与指令跟随的冲突,没有触及训练时的支持损失。
核心方法
整体是一个双向受控对照设计。起点是两个模型家族:Qwen3-8B-Base 与 Qwen2.5-Math-7B,各自记 RLVR 前的 checkpoint 为 Base。Math-RLVR 分支在 7.5k 的 MATH 划分上训练,验证器做最终答案精确匹配;IF-RLVR 分支在 IFTrain 数据集上训练,确定性检查器要求所有显式响应约束全部通过。每个训练配置做一次固定种子运行,因此重复 rollout 度量的是策略内采样方差而非训练间方差。支持评估方面:数学用 AIME24、AIME25、MATH-500-128,指令跟随用 IFEval、IFBench;每个 prompt 采样 $k=32$ 个随机 rollout,按通过数分桶:0=all-wrong、1–31=mixed、32=all-correct,mean@32 估计 pass@1、best@32 记录预算内可解性。在此基础上做双向顺序训练(IF→Math 与 Math→IF,后者扫 KL 系数 $\beta\in\{0,0.04,0.08,0.12\}$)、分布定位(JS 散度)、因果干预(强制开头)与缓解实验(DRI 先验、OPD),最后用独立的 step-720 端点在 MathIF/ReasonIF 上做联合行为压力测试。
核心概念是'验证器诱导的支持重塑':优化一个验证器不仅改变当前分数,还会改变另一个验证器还能采样到、从而还能强化的成功行为的集合。它与灾难性遗忘有本质区别——遗忘回看已学任务的性能是否存活,支持重塑前瞻性地问未来任务的成功轨迹在优化当前任务之后是否仍然可发现,即使相关能力并未被抹除。第二个关键洞察把分布形状和训练信号连起来:在 GRPO 这类组相对更新下,只有 mixed 桶(同组内有成功有失败)提供组内奖励方差,因此 Math-RLVR 把 IF prompt 推向 all-correct 与 all-wrong 两端(极化),等价于抽走了后续训练的燃料,即使 pass@1 在涨。第三个关键洞察是空间定位:支持重塑集中在响应开头几个 token,RLVR 主要对 Base 已支持的候选做重排序,把生成入口从逐步推导(DRI)切到直接给答案(DAI),而开头路由选择被干预实验证明因果地影响数学可搜索性——这是'路线选择改变'而非'推理能力广泛消失'。
方法步骤详情
完整流程分八步。(1) 单阶段训练:从同一 Base 分别训练 Math-RLVR(MATH 7.5k,精确答案验证器)与 IF-RLVR(IFTrain,全约束确定性检查器)。(2) 支持度量:每个评估 prompt 重复采样 $k=32$ 个 rollout 并验证打分,输出 pass@1(mean@32)、best@32、pass-count 三桶占比及桶间转移图。(3) 顺序训练:从 IF-RLVR 端点继续 Math-RLVR,观察 all-wrong/mixed/all-correct 与 DRI 占比变化;从 Math-RLVR 端点继续 IF-RLVR 并扫 KL 系数 $\beta\in\{0,0.04,0.08,0.12\}$,输出 mean@32/std@32 曲线对比独立端点。(4) 定位:对 Base 采样的匹配前缀做 teacher forcing,逐位置算 Base 与 RLVR 的 JS 散度并按位置分组(开头、内部前 5%、内部、尾部),报告首 token JS 与内部 JS 之比。(5) 重排序分析:在 JS 最高的 10% 位置测 Base–RLVR top-10 重叠与 Base top-3 复用率,单独检查 AIME 位置 1 处 RLVR 首选 token 的 Base 排名与重归一化概率,并按可见开头把候选分为 DRI-like/中性/DAI-like 统计平均概率。(6) 因果干预:不更新参数,在 Base 解码下强制 IF 侧 token 或 DAI 前缀、在 IF-RLVR 解码下强制 Base 侧 token 或 DRI 前缀,比较 free decoding 的 best@32;再把同一 IF 侧 token 强制到位置 1–100 测位置特异性。(7) 缓解:用 50 条正确数学响应构造 Soft/Hard DRI 与 DAI/Random 四种 SFT 冷启动后接 100 步 IF-RLVR;OPD 学生在自身 rollout 上匹配 IF-RLVR 教师(step-100 端点及 20/40/60/80 快照),记录 MATH-500-128 mean@16、IFEval mean@16、捷径响应占比与教师/学生偏移的相关。(8) 联合测试:用独立的 step-720 Qwen3-8B-Base/Math/IF 端点在 MathIF 与 ReasonIF 各 290 prompts×16 rollouts 上测正确性 $C$、严格遵循 $F$ 与同响应合取 $J=C\wedge F$。
技术新颖性
技术新颖性体现在三处。其一,度量创新:把持续 RLVR 的评价对象从终点性能改为'预算内可采样支持',用重复验证器打分把它变成廉价可复现的指标(best@k、pass-count 桶),并首次把 mixed 桶占比与 GRPO 组内奖励方差直接挂钩,使'支持损失'与'训练信号损失'之间有了可计算的通道。其二,因果链设计:先以 teacher forcing + 位置聚合 JS 散度发现变化集中于首 token(比值最高 106.7×),再以 top-10 重叠区分重排序与新提升,最后用强制 token/前缀干预给出因果证据(强制 DRI 开头最高 +58.6% best@32),并把同一 token 移位扫描证明效应特异于开头位置——这排除了'整体推理能力被改写'的替代解释。其三,缓解手段的系统证伪与教师状态问题:证明一次性路由先验只延迟不阻止(step 100 时 DAI 率全部为 1),稠密监督的 OPD 也无法自动保留支持,且首次量化了教师-学生偏好偏移($\rho=-0.594$)、指出 OPD 的教师选择须同时考虑目标迁移、支持保留与响应质量三者。
实验结果
论文的核心发现可以按八组实验逐一梳理。(1) Math-RLVR 极化 IF 支持(Table 1、Figure 2):IFEval 上 Qwen3-8B-Base 的 $\Delta$pass@1=+0.065、$\Delta$best@32=-0.098,IFBench 为 +0.032/-0.067;Qwen2.5-Math-7B 上 IFEval +0.079/-0.114、IFBench +0.016/-0.037;桶转移图显示 mixed 桶的 prompt 同时流向 all-correct 和 all-wrong 两端,平均成功率和预算内可解性出现背离。(2) IF-RLVR 降低数学可搜索性(Figure 3):AIME 的 best@k 在 $k=4$ 到 32 的每个预算下都随训练单调下降,开头从 DRI 转向 DAI 且 DAI 最终占主导,DAI 占比与 best@32 的 Pearson 相关 $r=-0.85$。(3) IF→Math 顺序训练(Figure 4):切回 Math-RLVR 后 all-wrong 从 65.6% 降到 50.8%,但 mixed 从 33.6% 崩到 1.6%、all-correct 升到 47.7%,DRI 占比 20 步内不恢复(7.8% vs 单独 Math-RLVR 的 25.0%),组内奖励方差枯竭。(4) Math→IF 顺序训练(Figure 5):无约束 IF-RLVR 提 IF 但数学 pass@1 大跌,弱 KL 只是延迟下降,$\beta=0.12$ 基本保住数学但 IF 增益最小,无系数两全。(5) 机制定位(Figure 6/7、Table 2):首 token JS 与内部 JS 之比在 AIME 上为 9.8×–106.7×;高 JS 位置 top-10 重叠 6.88–8.96、89.3%–99.4% 的 RLVR 首选在 Base top-3 内;但 IF-RLVR 在 AIME 位置 1 首选 token 的 Base 中位排名仅 14.5/18、概率 1.9%/0.4%;Math-RLVR 把 DRI-like 首选('Alright' 0.045→0.997)推到顶端,IF-RLVR 把 DAI-like 的 'Answer' 推到 0.680/0.999。(6) 开头干预(Figure 8):从 IF-RLVR 强制 Base/DRI 开头使两模型在 AIME/MATH-500 上 best@32 上升(route token 最高 +57.8%/+58.6%);反向干预对 Qwen3 有害(-15.6%/-21.1% 等)而对 Qwen2.5-Math 中性或正面;IF 侧 token 只在开头位置抑制 DRI。(7) 缓解极限(Figure 9/10/11):Soft DRI 先验在 step 70 保持 AIME24 best@32=0.400、IFEval best@16=0.948、DAI 率 0.033,但 step 100 所有条件 DAI 率=1;收敛教师的 OPD 使 MATH-500-128 mean@16 从 0.3433 跌到 0.0879、捷径响应 4.5%→18.8%、教师-学生偏移 $\rho=-0.594$;教师快照扫描中 T2/40 的 IFEval mean@16 最高(0.814)而只有 T1/20 提升 MATH-500(+0.93pp)。(8) 联合支持(Table 3):Math-RLVR 使 $C$ 升 11.3/5.6pp 而 $J=C\wedge F$ 仅升 2.4/1.7pp;IF-RLVR 使 $F$ 升 18.1/15.3pp 而 $J$ 仅升 5.5/6.2pp(MathIF 0.148、ReasonIF 0.171)。
查看结构化数据
| 任务 | 指标 | 本文 | 基线 | 提升 |
|---|---|---|---|---|
| 指令跟随支持(Qwen3-8B-Base,Math-RLVR 后) | IFEval $\Delta$pass@1 / $\Delta$best@32 | +6.5pp / −9.8pp | Base 策略(RLVR 前) | 平均成功率升但预算内可解性降(支持极化) |
| 指令跟随支持(Qwen2.5-Math-7B,Math-RLVR 后) | IFEval $\Delta$pass@1 / $\Delta$best@32 | +7.9pp / −11.4pp | Base 策略 | 同样的极化模式,best@32 跌幅更大 |
| 数学可搜索性(IF-RLVR 训练过程) | AIME best@k(k=4–32) | 所有预算下单调下降;DAI 占比与 best@32 相关 $r=-0.85$ | Base 策略 / IF-RLVR 训练起点 | 负向:开头由 DRI 转向 DAI 后可搜索性持续流失 |
| 联合行为 MathIF(290 prompts × 16 rollouts) | 联合支持 $J=C\wedge F$ | IF-RLVR 0.148;Math-RLVR 0.118 | Base 0.094 | IF-RLVR +5.5pp,但远小于 $F$ 的 +18.1pp |
| 联合行为 ReasonIF(290 prompts × 16 rollouts) | 联合支持 $J=C\wedge F$ | IF-RLVR 0.171;Math-RLVR 0.126 | Base 0.109 | IF-RLVR +6.2pp,而 $F$ 升 15.3pp、$C$ 反降 |
| OPD 缓解(收敛 IF 教师,step-100) | MATH-500-128 mean@16 | 0.0879(捷径响应占比升至 18.8%) | 0.3433(Base 初始化学生) | −25.5pp:稠密蒸馏未能保留数学支持 |
局限与改进
作者明确承认的限制包括:结论限于两个模型家族(Qwen3-8B-Base、Qwen2.5-Math-7B)和数学/指令跟随两个任务域;DRI/DAI 标签只描述可见开头而非模型内部推理状态;IF→Math 的结论只适用于观察到的 20 步训练路径,并不意味着数学推理能力发生不可逆丧失;OPD 教师扫描只取了 20/40/60/80 四个粗粒度快照,无法定位全轨迹上的最优教师;每个配置只有一次固定种子运行,重复 rollout 只度量策略内采样方差而非训练方差。我自己的观察补充五点:(1) 有效支持依赖预算 $k$ 的选取,$k=32$ 的任意性没有敏感性分析,不同算力预算下极化的量化程度可能不同;(2) 反向干预在 Qwen2.5-Math-7B 上中性甚至正面,说明'开头因果'机制在不同模型上的强度不一致,论文对此未给出解释;(3) 联合测试使用独立的 step-720 端点,与受控轨迹脱节,外部效度与内部效度之间存在断层;(4) 缓解部分以证伪为主,论文没有提出任何正向的'支持感知'训练方法;(5) mixed 桶=组内方差的论证绑定于 GRPO 的组相对优势,能否推广到 PPO 等其他优势估计尚未验证。
独立分析的弱点
独立分析出五个弱点。第一,预算依赖性:'有效可奖励支持'的定义绑定了 $k=32$,当算力更大($k=1024$)时部分被判为丢失的支持可能仍可恢复,结论的定量边界模糊——改进方向是报告 best@k 随 $k$ 的完整曲线,或定义预算无关的支持半衰期。第二,单次固定种子:所有训练配置只有一次运行,桶转移(如 mixed 33.6%→1.6%)的幅度可能混入训练随机性——改进方向是关键对比至少跑 3 个种子并报告区间。第三,开头分类是启发式规则(DRI/DAI/Other),Other 类的占比与演化未充分披露,规则对模板敏感——改进方向是用模型判断或人工标注的子集校验分类一致性。第四,干预实验的混杂:强制 token/前缀会改变 KV 缓存与注意力上下文,best@32 变化未必完全归因于'路由语义'——论文用 token 位置扫描部分缓解,但可补一个长度匹配的无关前缀对照。第五,缓解研究只证伪不建设:DRI 先验和 OPD 失败后,更可能成功的方案(多验证器交替训练、按 pass-count 分桶的课程重放、对 DRI 开头做奖励塑形或探索加权)完全没有被尝试——这是后续工作最大的空白。每个弱点都指向一个可执行的实验补丁,而非根本性缺陷。
未来方向
作者提出的方向是:由于有效支持依赖 rollout 预算,未来应在跨验证器优化的全过程中估计并保持它。在此基础上可以延伸五条线。其一,支持感知的训练目标:把 mixed 桶占比、best@k 或 pass-count 分布的熵作为辅助正则或早停信号,在当前任务增益与支持保留之间显式权衡。其二,多验证器协同训练:交替或混合使用数学与 IF 验证器(以及预算调度),避免单一验证器垄断响应开头的路由入口,这可能比一次性的 DRI SFT 先验更持久。其三,探索机制而非先验:既然 RLVR 主要是对 Base 已支持候选做重排序,可用温度调度、奖励塑形或 DRI 路线的探索加权把采样概率持续分配回去,而不是一次注入后任其被覆盖。其四,OPD 教师选择的形式化:论文显示 T1/20 保支持、T2/40 保迁移,可以构造以'教师早期状态 + 支持度量'为准则的自动选点算法,甚至训练中途动态切换教师。其五,理论与外推:把支持重塑与模式坍缩、探索-利用权衡联系起来,给出预算-支持的相变刻画;并把实验推广到代码、agent 等其他可验证域,检验'开头路由决定可搜索性'这一假说的普适性。
复现评估
复现条件总体良好但算力门槛不低。开源情况:论文给出了 GitHub 页面(github.com/sylvain-wei/verifier-induced-support-reshaping),声明提供完整训练设置与缓解配方(Appendix A–G 包含解码设置、过滤规则、JS 近似细节等)。数据全部公开:MATH(7.5k 训练划分)、IFTrain、IFEval、IFBench、AIME24/25、MATH-500-128、MathIF、ReasonIF;模型 Qwen3-8B-Base 与 Qwen2.5-Math-7B 均为开源权重。验证器是确定性程序(精确答案匹配 + 约束检查器),没有神经奖励模型引入的噪声,评估可严格对齐。算力方面:需要在 7–8B 模型上做多条 GRPO 训练轨迹(100–720 步不等、双向顺序、KL 扫描四个系数、四个 SFT 冷启动、五个教师快照的 OPD),加上每个评估点 32 rollouts × 多个基准的重复采样,估计需要多卡 A100/H100 级别资源数周。固定种子单次运行降低了对齐成本,但缺乏种子方差意味着复现者需要自行检验桶转移幅度的稳健性。机制分析部分(teacher forcing JS、强制前缀干预)只需推理算力,成本低,适合作为复现切入点。综合评价:材料齐全、流程清晰的中高难度复现。
论文图表
概念总览图,分三栏。左栏对比'回看'的灾难性遗忘(度量旧任务性能残留)与'前瞻'的支持重塑(关注目标 B 的成功轨迹在训练任务 A 后是否可达):训练 A 使发起 token 的支持空间移位,B 的目标从可达变为不可达。中栏展示支持空间(发起空间)的移位与提示末尾隐状态的共享支持移位。右栏给出本文的双向实验设计:Math-RLVR 使深思熟虑推理(DRI)支持萎缩、未来增益被封顶;IF-RLVR 倾向直接答案发起(DAI),逐步给出满足用户约束的答案。
这张图定义了全文的核心概念框架:支持重塑与灾难性遗忘的区别,以及双向 Math/IF 实验的逻辑,是理解论文问题意识的入口。