从 RLVR 到 RLSVR:任务变换诱导自可验证奖励以实现开放式大模型自我改进 From RLVR to RLSVR: Task Transformation Induces Self-Verifiable Rewards for Open-Ended LLM Self-Improvement
用任务变换把开放式任务变成可验证的自我博弈环境,无需外部裁判即可规模化训练。
前置知识
RLVR(Reinforcement Learning with Verifiable Rewards,可验证奖励强化学习)
RLVR 是训练推理型大语言模型的主流范式,核心是存在一个确定性验证器 $V(x,y) \in \{0,1\}$(如答案检查器或单元测试执行器),对输出给出明确对错判断,优化目标为 $\max_\theta \mathbb{E}[V(x,y)]$。因为 $V$ 无偏、无限且几乎免费,RLVR 实现了大规模可扩展训练,催生了 OpenAI o1 和 DeepSeek-R1 等推理模型。但它本质上被锁死在数学和编程这类答案可被精确判定的领域。
本文的整个工作就是在突破 RLVR 的局限性,把它扩展到开放式任务。理解 RLVR 的工作机制和它为何无法处理开放任务是读懂本文的前提。
自监督学习(Self-Supervised Learning, SSL)
自监督学习在缺乏人工标注时构造“代理任务”(pretext task),让监督信号自动从数据本身产生。例如掩码语言建模(MLM)随机遮蔽 token 再预测,对比学习区分相关与不相关视图。代理任务虽与下游任务不同,却能诱导可迁移的表征和能力。其背后的原则是:当代理目标能自动产生监督、且与目标任务有足够能力重叠时,无需任务特定的人工标注即可学习。
本文的核心灵感正是把 SSL 的“任务变换”思想从标签层面迁移到奖励层面。理解 SSL 才能真正领会 RLSVR 范式的理论根基。
GRPO(Group Relative Policy Optimization,群组相对策略优化)
GRPO 是一种群组相对优势优化的策略梯度方法。它对同一问题采样一组(如 $n=5$ 个)响应,计算组内奖励的均值 $\mu$ 和标准差 $\sigma$,再归一化得到优势 $A_i = (r_i - \mu)/(\sigma + \epsilon)$。这种方式无需额外的 critic 网络就能获得低方差优化信号,被 DeepSeek-R1 广泛采用。本文在检测阶段和表演阶段都使用了 GRPO 风格的优势估计与截断目标。
SpyRL 的奖励归一化和策略更新都基于 GRPO 框架,理解它才能看懂两阶段耦合优化的数学细节。
自我博弈(Self-Play)
自我博弈指智能体通过与自身(或自身副本)对弈来提升能力的学习范式,围棋领域的 AlphaGo Zero 是经典案例。在 LLM 训练中通常表现为提议者-求解者框架:一个模型生成问题或提议,另一个模型求解并给出反馈,两者交替进化。已有方法如 R-Zero 和 Absolute Zero 都属此类,但它们依赖任务可验证性来动态调节难度,在开放式任务上效果有限。
SpyRL 是一种新颖的多人自我博弈框架,理解传统自我博弈及其局限,才能体会 SpyRL 信息不对称设计与群体决策的创新点。
角色优势估计(Role-Advantage Estimation, RAE)
在存在角色差异(如间谍与平民信息不对称)的自博弈中,不同角色的原始奖励分布结构上不可比。RAE 通过为每个角色单独减去角色特定的基线来校准这种偏差,确保优化器不会把间谍的信息劣势误判为策略质量差。本文在表演阶段优化中引入 RAE 修正信息不对称导致的系统性偏置。消融实验显示去掉 RAE 后七个基准平均准确率从 50.4 暴跌到 37.5,甚至低于骨干模型 41.4。
RAE 是 SpyRL 能稳定训练的关键技术之一,消融实验证明它不可或缺,是理解方法为何有效的重要组成部分。
研究动机
带可验证奖励的强化学习(RLVR)是当前训练推理型大模型的主流路径,催生了 OpenAI o1、DeepSeek-R1 等突破。但它的适用范围几乎被锁死在数学和编程这类答案可确定性判定的领域,因为在这些场景存在确定性验证器 $V(x,y) \in \{0,1\}$ 能给出明确对错。对于摘要、创意写作、研究报告等开放式任务,真实目标是潜在的质量函数 $Q(x,y)$,根本没有验证器存在。现有缓解方案——RLHF、DPO、LLM-as-a-Judge、自我奖励机制——用学习型奖励模型或外部裁判来近似 $\hat{V}$,但这会引入三大顽疾:评估偏差把策略能力上限锁死在裁判水平之下;每次 rollout 都要额外推理裁判模型,成本高昂;裁判本身存在能力瓶颈。这些方法的根本问题在于试图直接逼近不可验证的 $Q$,从而无法摆脱对人工标注或学习型评估器的依赖。
本文的目标是本文的目标是把 RLVR 的规模化、低成本、无偏监督优势延伸到开放式任务,让创意写作、文本摘要这类原本无法精确验证的任务也能享受可扩展的自我改进。具体而言,作者希望构造一种全新的奖励来源,使其同时满足三个硬性条件:奖励必须像数学验证器一样确定性可验证;无需人工标注也无需学习型奖励模型或外部裁判;且奖励信号要真正与任务质量挂钩而非脱钩。最终目标是证明“可验证性不必是任务的内禀属性,而可以通过任务变换来工程化构造”,从而为开放式能力的规模化、无监督自训练开辟一条全新路径。
与已有工作不同的是,独特的切入角度在于借鉴自监督学习(SSL)的“任务变换”原则。SSL 面对缺失标签时并不去逼近标签,而是把任务变换成代理目标,让监督信号从数据本身自动产生(如掩码恢复)。本文把这一思想从“标签”层面迁移到“奖励”层面:不是用外部裁判去逼近不可验证的质量 $Q$,而是通过任务变换 $\Phi$ 把开放任务改造成一个代理环境 $E$,环境内部注入的潜在变量 $z$ 成为可精确核对的“构造性真值”。这样一来,可验证性成为环境设计的产物而非任务的固有限制。这与所有依赖外部裁判的方法在哲学上根本不同——它把问题从“如何逼近 $Q$”转化为“如何让环境自己持有答案”。
核心方法
整体思路是“自监督学习版的 RLVR”。直觉上:既然开放式任务没有客观答案,那就把任务改造成一个博弈,博弈环境自己持有答案(潜在变量 $z$),智能体在博弈中的表现(如投票结果)可以与 $z$ 精确比对,从而把“输出好不好”这个不可验证的问题转成“投票对不对”这个可验证的问题。技术路线上,作者先提出通用范式 RLSVR:任务变换 $\Phi$ 把任务 $(\mathcal{D}, \tau)$ 映射到代理环境 $E$,环境经四步运作——潜在变量注入(采样 $x$ 和 $z$ 并记录真值)、条件化任务执行(构造观测 $o$ 让策略执行原始任务)、可验证交互(设计一个只能由任务输出回答的关于 $z$ 的问题)、规则奖励(核对交互结果得到 $R$)。随后作者给出具体实例 SpyRL,用信息不对称的多智能体博弈实现这套机制,训练采用 batch size 1024、100 epochs、组大小 $n=5$、最大生成长度 2048 tokens 的设置。
核心创新是把“输出质量评估”这个本质不可验证的问题,重构为“身份识别”这个可验证的问题。在 SpyRL 中,环境先采样一个实例 $x$ 和一个间谍索引 $u \sim \text{Unif}(\{1,...,n\})$,其中 $n-1$ 个平民拿到完整信息 $o_i = x$,而间谍拿到降级信息 $o_u = g(x)$(如连续遮蔽一段文本)。所有玩家执行同一目标任务生成 $y_i$,然后互相审视输出并投票指认间谍。因为间谍身份 $u$ 由环境预先指定,投票是否正确可确定性计算:$r_i^D = \mathbb{I}[v_i = u]$。关键在于,一个输出是否被怀疑与其信息缺陷暴露程度密切相关——质量差的输出更容易暴露间谍,于是质量被巧妙地编码进可验证的投票信号中。这与依赖点对点评判的传统方法本质不同,是一种多人集体决策机制。
方法步骤详情
方法分四步。信息分配:采样 $x \sim \mathcal{D}$ 和间谍索引 $u$,按 $o_i = x$(平民)或 $o_u = g(x)$(间谍)分配观测,$g(\cdot)$ 为信息退化算子(摘要/写作遮蔽 20%、数学遮蔽 40%)。表演阶段:每个玩家基于私有观测生成 $y_i \sim \pi^P_\theta(\cdot | o_i, \tau)$,平民和间谍都完成同一目标任务,输出全部公开。检测阶段:玩家基于状态 $s_i = (o_i, Y)$ 投票 $v_i \sim \pi^D_\phi(\cdot | s_i)$,检测奖励 $r_i^D = \mathbb{I}[v_i = u]$,GRPO 归一化得优势 $A_i^D$;表演阶段用零和奖励——间谍 $r_u^P = -\beta(m_u - \bar{m}_c)$,平民按比例分配并加组内一致性惩罚,总奖励为零以驱动共进化,再经 RAE 校正角色偏差。交替优化:两个带 KL 正则的 GRPO 截断目标轮流更新 $\pi^P_\theta$ 与 $\pi^D_\phi$,一固定时更新另一个,避免过早收敛。
技术新颖性
技术新颖性体现在多个层面。范式层面,首次把 SSL 的任务变换原则引入 RLVR,提出 RLSVR,让“自监督学习”从标签层扩展到奖励层,从理论上证明可验证性可被工程化构造。实例层面,SpyRL 首次用“谁是卧底”式信息不对称博弈实现开放式任务的自我改进,把质量评估转化为可验证的身份识别问题。机制层面,区别于 R-Zero、Absolute Zero 等单点提议者-求解者范式,SpyRL 采用多人竞争与集体决策,用群体投票抵消单个裁判的偏差放大,更鲁棒。优化层面,引入 RAE 校正信息不对称导致的角色偏置(消融显示去掉后七基准平均从 50.4 跌到 37.5),并设计两阶段交替优化打破固定自博弈的策略停滞(Math500 在 100 epoch 达 79.5 而非停滞在 72.3)。整个框架只需廉价的文档级信息,无需昂贵的问题级人工监督,便于跨场景迁移。
实验结果
核心发现在三类任务上一致且显著。摘要任务(Table 1)中 SpyRL 在所有基准和两个骨干上都取得最高 ROUGE-L,Qwen3-4B GovReport 从基线 30.2 提升到 36.7(Absolute Zero 仅 33.2),30 个 ABTest 单元全部胜出。创意写作(Table 2)中 SpyRL 在新颖性和情感维度优势最大,说明增益延伸到主观开放生成。数学推理(Table 3)中 SpyRL 在五个数学基准和 MMLU-Pro、GPQA-D 上全部最优,Qwen3-4B 七基准平均提升 8.97%、8B 提升 6.16%,AIME25 从 6.7 暴涨到 20.0。关键验证(Figure 4):怀疑票数与 GPT-4o 质量排名强正相关,证明奖励与真实质量对齐。成本上(Table 5),SpyRL 无需外部裁判即可与 GPT-4o-RaR(约 $900)竞争,并全面胜过 Qwen3.5-27B-RaR(约 $200)。泛化上(Table 6/7),PubMed 训练迁移到 arXiv/BillSum 平均涨 4.9 ROUGE-L,摘要与写作可双向正向迁移。
查看结构化数据
| 任务 | 指标 | 本文 | 基线 | 提升 |
|---|---|---|---|---|
| 文本摘要(GovReport, Qwen3-4B) | ROUGE-L | 36.7 | 30.2(Qwen3-4B 原始)/ 33.2(Absolute Zero) | 较骨干 +6.5,较最强基线 +3.5 |
| 数学推理七基准平均(Qwen3-4B) | 准确率平均提升 | SpyRL | Qwen3-4B 原始 | 平均 +8.97%(AIME25 6.7→20.0,GSM8K 84.5→93.4) |
| 数学推理七基准平均(Qwen3-8B) | 准确率平均提升 | SpyRL | Qwen3-8B 原始 | 平均 +6.16%(Math500 74.2→81.2,Minerva 49.3→56.3) |
| 创意写作(WritingPrompts, vs 骨干 Qwen3-4B) | GPT-4o 整体胜率 | 81.3% | 未训练骨干 | 全面领先,新颖性达 84.3% |
| 科学领域摘要迁移(PubMed 训练→arXiv/PubMed/BillSum 平均) | ROUGE-L 平均增益 | 38.1(平均) | 33.2(Qwen3-4B 平均) | 平均 +4.9,A/B 胜率平均 70.2% |
| 与外部裁判方法对比(写作 vs GPT-4o-RaR) | GPT-4o A/B 整体胜率 | SpyRL 48.9%/48.2%(竞争性) | GPT-4o-RaR(约 $900 裁判成本) | SpyRL 无需外部裁判,且在新颖性/情感上更优 |
| 消融:Math500 训练 100 epoch(完整 SpyRL) | 准确率 | 79.5 | 72.3(仅表演)/ 69.2(仅检测)/ 71.6(无间谍) | 两阶段耦合 + 信息缺不对称带来 +7.2 以上 |
局限与改进
作者承认的局限包括:方法目前只在摘要、写作、数学三类任务上验证,更复杂的开放式任务(多轮对话、长篇研究报告、代码之外的科研推理)尚未覆盖;信息退化算子 $g(\cdot)$ 虽对遮蔽比例不敏感,但仍需针对任务粗略设计。我额外观察到几点:训练成本高昂——batch size 1024、100 epochs、组大小 5 意味着每个实例要采样 5 个玩家输出再加 5 次检测投票,token 消耗是普通 RLVR 的数倍,普通团队难以完整复现;奖励有效性依赖“间谍因信息残缺必然生成劣质输出”这一假设,若模型足够强以至于间谍靠残缺信息也能生成高质量输出,投票信号可能退化失效;评估高度依赖 GPT-4o 作裁判,而作者恰恰在批评裁判方法,存在一定方法论循环依赖;此外跨任务迁移实验显示数学模型负向迁移到写作(40.9%),说明范式并非在任意任务间都通用。
独立分析的弱点
独立分析有五处弱点。第一,奖励信号脆弱性:投票奖励与质量对齐依赖“信息残缺必然导致输出劣化”的因果链,若任务本身冗余度高(间谍凭残缺信息也能蒙混过关)或检测器能力不足,信号会失效——改进方向是自适应调节遮蔽比例或引入多级信息退化,维持训练信号新鲜度。第二,计算开销大:相比单点提议-求解范式,SpyRL 每轮需 $n$ 次表演生成加 $n$ 次检测,token 成本约为 $2n$ 倍——可探索更小的候选生成或异步流水线优化。第三,任务覆盖窄:仅有三类文本任务——应扩展到代码生成、多模态、智能体决策等更广谱任务。第四,评估循环依赖:方法批评 LLM 裁判但主评估又用 GPT-4o——应引入更多人评或更稳健的参考无关指标。第五,理论保证缺失:未形式化证明变换后的代理目标与原质量 $Q$ 的收敛关系——需要补充理论分析,说明在何种条件下代理奖励与质量单调相关。
未来方向
作者明确提出的方向是把任务变换范式推广到更广泛的开放式能力,并探索除 SpyRL 之外的其他 RLSVR 实例(信息不对称只是潜在变量 $z$ 的一种形式)。基于成果可延伸的方向有:第一,设计自适应的 $g(\cdot)$ 算子,根据检测准确率动态调节信息退化强度,保持训练信号新鲜;第二,把 SpyRL 扩展到多轮对话和工具使用场景,潜在变量可编码为“隐藏的工具调用或缺失的上下文”;第三,研究更大的群组规模 $n$ 与稀疏投票的结合,平衡信号丰富度与计算开销(当前 $n=5$ 已是甜蜜点);第四,探索不同潜在变量类型(如条件扰动、隐藏约束)如何拓宽可构造的可验证任务边界;第五,结合过程奖励,让检测不仅看最终投票还审视推理链质量,进一步提升信号密度。
复现评估
复现性总体较好。作者明确声明模型和代码已开源(github.com/wangqinsi1/RLSVR/tree/SpyRL)。所用训练数据集(GovReport、WritingPrompts、Nemotron-CC-Math-v1、PubMed)及评估基准(Multi_News、QMSum、VCSum、SAMSum、WritingBench、GSM8K、Math500、AIME24/25、Minerva、MMLU-Pro、GPQA-D、arXiv、BillSum)均为公开数据集。关键超参数披露充分:batch size 1024、100 epochs、组大小 $n=5$、最大生成长度 2048、遮蔽比例 20%/40%、交替优化策略、RAE 与 GRPO 配置都在正文与附录给出。骨干模型 Qwen3-4B 和 8B 也是开源的。主要挑战在于算力:batch size 1024 的多智能体自博弈训练对 GPU 资源要求很高,普通团队难以完整复现主表实验;GPT-4o 裁判的 A/B 评估也带来 API 成本,人评环节(10 名博士生评 400 条样本)也非一般团队能轻松复制。
论文图表
三幅子图对比 RLVR、SSL 与 RLSVR。(a) RLVR 用已知正确答案给输出打分,提供精确规则奖励,但仅限存在标准答案的领域(如数学)。(b) SSL 构造代理任务,标签从数据本身自动生成。(c) RLSVR 把两者结合:把开放任务变成代理环境,环境预分配潜在变量作为可验证答案,奖励可与环境记录精确核对。
这张图是理解整篇论文哲学的钥匙,一图说清 RLSVR 如何融合 RLVR 的精确验证与 SSL 的构造性监督,奠定全文的理论定位。