Agon:基于隐式对手评分的竞争式跨模型强化学习 Agon: Competitive Cross-Model RL with Implicit Rival Grading of Reasoning
让两个模型互相当考官,竞争式RL隐式评估推理过程质量。
前置知识
GRPO(Group Relative Policy Optimization)
GRPO是当前推理模型训练的主流范式:对同一道题从当前策略采样一组G条rollout,用可验证奖励r(x,y)(如答案是否正确)打分,再算组相对优势A_i=(r(x,y_i)-μ)/σ,其中μ和σ是组内奖励的均值与标准差,据此提升高于平均的rollout的对数概率,并配KL正则约束在参考策略附近。全对或全错的零方差组因σ=0被丢弃。
Agon完全建立在GRPO之上且不改其优化核心,理解组相对优势和零方差组被丢弃,才能理解为什么共享对手草稿会让竞争奖励归零、以及为什么转换奖励必须乘以动作相关的c(b_i)。
可验证奖励强化学习与长度病态
基于可验证奖励的RL(RLVR,如R1配方、GRPO)只对最终答案打分,从不评估中间推理链。在难题上这诱发长度病态(overthinking):模型靠在单条轨迹里塞更多restart、case split、'let me reconsider'来增加撞对答案的机会,链路长度膨胀一个数量级而精度只缓慢上升。作者实测GRPO把Qwen3-0.6B轨迹从6.1k涨到8.1k token仅换+7pp。
长度病态是本文要根治的痛点,也是Agon通过'竞争让短链赢'获得3.5k短轨迹的动机来源;不理解它就无法理解为什么作者强调提升'每token信号密度'而非堆砌推理数量。
LoRA低秩适配
LoRA把权重更新约束为两个低秩矩阵的乘积Δ=BA,只训练少量参数(本文用rank 16,约10M参数)。Agon在同一个冻结基座上挂两个LoRA适配器πA=base+ΔA、πB=base+ΔB,第二个策略只多花约2%基座显存,而非训练第二个完整模型,共享基座还让两者处于兼容的表征空间。
理解LoRA才能理解Agon如何在'两个模型'的代价上做到近单模型开销,以及共享基座对将来隐空间交换的意义。
自博弈与多智能体协作
自博弈(SPIN、Self-Rewarding、Absolute Zero、R-Zero)让一个模型和自己或其过去版本对弈,形成闭环自我审计,因放大制造错误的同一盲区而触顶。协作式多模型方法(self-consistency、Mixture-of-Agents、多智能体辩论)把聚合做成趋向共识,成员实力不均时反而稀释质量。Agon刻意区别于两者:评分者是行为不同的另一个策略,且交互是竞争性的。
本文的全部新颖性都建立在'第二个不同的模型+竞争压力'这一对立面上,理解自博弈的闭环局限和协作的共识倾向,才能看清Agon为何有效。
研究动机
以GRPO为代表、基于可验证奖励的强化学习是当前推理模型的核心引擎,但它只对最终答案打分,从不评估中间推理链路。作者在自己跑的实验中观察到典型的长度病态现象:GRPO训练把Qwen3-0.6B的平均轨迹长度从零样本的6.1k token涨到8.1k token,却只换来+7pp的准确率提升,即模型学会'写更多'而非'想更好',链路里塞满'hmm''wait''let me reconsider'这类回溯填充。直接评估推理质量本是最直接的解法,却根本不可行:没有任何标签标明哪一步是关键洞察、哪一步是冗余填充,而学习式过程奖励模型又昂贵、脆弱且本身无法验证。结果就是推理轨迹长期处于无人评分的状态,长度病态持续恶化,策略在增加推理数量的同时每token的有效信号密度几乎不变。
本文的目标是本文的具体目标是在不引入任何过程标签、不依赖外部奖励模型、也不改动验证器的前提下,为推理链路本身补充一个内容层面的训练信号,从而让模型提升'每token有效信号密度'而非单纯堆砌推理数量。作者希望把推理质量的评估转化为一种关系式信号:让第二个策略模型尝试同一道题,并奖励每个模型'赢过'对手,从而间接对推理过程打分。同时作者要求整个方法在与vanilla GRPO相同的一次训练数据遍历、相同的生成预算(每问题2N条rollout、相同的15k token长度上限)下生效,并能像训练时一样以两阶段cascade的方式直接部署推理,最终在DeepMath-hard等难题基准上以更短的轨迹换取显著更高的pass@1。
与已有工作不同的是,本文的独特切入角度是把'缺失的评分者'从一个不可获得的标签,置换成一个实实在在的、正在被同时优化的对手模型。传统自博弈和自我改进方法(SPIN、Self-Rewarding、Absolute Zero、R-Zero)本质都是闭环的自我审计:策略在自己的rollout上算梯度,只会强化制造错误的同一个盲区,因此不可避免地触顶;而协作式多模型方法(self-consistency、Mixture-of-Agents、多智能体辩论)把聚合做成趋向共识,当成员实力不均时反而稀释质量。Agon与众不同之处在于:评分者必须是行为不同的另一个策略而非自身的副本,并且交互必须是竞争性的——奖励模型去'赢过'看过自己答卷的对手而非去'附和'它,从而把推理评估变成一场可被同时优化的对抗竞赛,对手随训练共同变强,提供单模型RL无法提供的渐进更强的对手。
核心方法
Agon的整体思路是训练两个策略πA和πB相互对抗。直觉上,一个有不同盲区的同伴能审计到策略自己看不到的错误;技术路线上,作者把两个策略实现为冻结基座之上的两个LoRA适配器(πA=base+ΔA、πB=base+ΔB),第二个策略只多花一个rank-16适配器,约占基座的2%显存开销,远非训练两个完整模型。每个优化步被设计成'draft-and-challenge':起草方从原始题目提示采样N条独立rollout{a_i}并按vanilla GRPO更新(独立流);挑战方则读入对手写完推理后的解题摘要(最终答案被刻意隐去以防照抄),针对每个对手各生成一条配对rollout b_i,并接受竞争性奖励。角色每隔一步轮换:偶数步A起草B挑战,奇数步反之,确保两个适配器既学会从零解题、又学会批判他人。整条流程跑在标准GRPO训练器上,不改动优化核心。
核心创新点是用一个'转换奖励'(conversion bonus)把对手难度转化为对策略本身有效的梯度信号。竞争性奖励定义为$R(b_i)=2c(b_i)+c(b_i)(1-c(a_i))+\lambda\varphi(b_i)$,其中$c(\cdot)$是答案正确性、$\varphi$是格式项、$\lambda=0.5$。关键洞察是:朴素的差分奖励$c(b_i)-c(a_i)$之所以无效,是因为$c(a_i)$对挑战方的动作而言是固定的(由配对草稿$a_i$决定),它只起每样本基线作用,在组相对标准化后梯度为零,等价于$3c(b_i)$再被组标准差归一。而转换奖励把动作相关的$c(b_i)$与对手失败项$(1-c(a_i))$相乘,使得'在对手做错的题上做对'的正确权重从2提到3,且因组内每条配对rollout面对不同难度的对手$a_i$,这个乘积项真正改变了梯度方向本身,把策略推向攻克更难的上下文。这正是与协作式、自精炼方法的本质区别:对手不是用来达成共识,而是用来制造可被梯度利用的难度差异。
方法步骤详情
单步流程见Algorithm 1。输入一批题目、适配器A/B、组大小N=8、步索引t、模式(coop/adv)。第一步按t奇偶决定角色:偶数步A起草、B挑战,奇数步反之。第二步起草方对每题x采样N条rollout{a_i},用$R(a_i)=2c(a_i)+\lambda\varphi(a_i)$做vanilla GRPO更新(独立流,训练从零解题)。第三步挑战方读入每个对手的解题摘要(答案隐去)生成N条配对rollout{b_i},按模式用协作式$2c(b_i)+\lambda\varphi(b_i)$或对抗式$2c(b_i)+c(b_i)(1-c(a_i))+\lambda\varphi(b_i)$打分。第四步分别在{R(a_i)}与{R(b_i)}组内按$A_i=(r(x,y_i)-\mu)/\sigma$算组相对优势,零方差组丢弃;第五步两适配器各自更新。超参:LoRA rank 16、学习率$5\times10^{-5}$3000题1个epoch、$\lambda=0.5$、$\gamma=0.5$仅5.6节用。推理为两阶段cascade、两方向取优。
技术新颖性
技术新颖性体现在四个层面。其一,把'推理质量'从不可标注的黑箱问题,重构成一场由竞争同伴隐式提供奖励的对抗博弈,无需任何过程标签或奖励模型,且不改验证器。其二,提出转换奖励的正确形式并给出严格理论解释:任何在$c(b_i)$上仿射、且组内系数为常数(如全组共享同一对手草稿使$c(a)$对所有N条相同)的奖励,在组相对标准化下都退化为与无对手项奖励等价、贡献零期望梯度,因此必须靠组内对手难度的变异才能让竞争项可训——这一结论被共享对手消融(32 vs 30)实证。其三,共享基座双适配器实例化把'两个模型'的代价压到约2%显存,并通过不同初始化(B加小高斯噪声)和角色轮换维持行为差异。其四,把训练和推理统一成同一套两阶段cascade,部署即训练形态,避免训练-推理不一致。与多智能体辩论、GAN式prover-verifier等角色固定的对抗方法相比,Agon是对称且轮换的,两个策略都不退化为纯批评者,共同作为解题者提升。
实验结果
核心发现见Table 3(Qwen3-0.6B/DeepMath-hard,匹配生成预算):信息交换单独(协作交换)把pass@1从GRPO的30提到46(+16pp);叠加竞争(Agon)进一步到61(+15pp)。未训练MoA控制只把GRPO从30提到34,而Agon到61,增益约为前者的8倍;最终阶段轨迹从8.1k降到3.5k token,短链是竞争副产品。Table 4置信区间Agon为[55.2,66.6]、GRPO为[25.0,35.4],delta均超区间宽度。Table 5跨尺度:增益随基座变大收窄(0.6B +31、1.7B +24、4B +12),在Qwen3.5-2B(+20)、Gemma4(+15)上同样成立,0.6B的Agon(61)甚至超过4B的GRPO(59)。Table 6在CodeContests复现同排序(24→29→34),Table 2迁移GSM8K(75)/MATH-500(64)保持次序。Table 7消融固定角色52、共享对手32、margin 49均逊于61;Table 8密度杠杆可把轨迹压到2.6k而精度不变(61→60)。
查看结构化数据
| 任务 | 指标 | 本文 | 基线 | 提升 |
|---|---|---|---|---|
| DeepMath-hard数学推理(Qwen3-0.6B,300题留出集) | pass@1 | 61(Agon) | 30(vanilla GRPO)/ 23(零样本) | 比GRPO +31pp,约为零样本的2.65倍;比未训练MoA +27pp |
| DeepMath-hard最终阶段轨迹长度 | avg. token数 | 3.5k(Agon) | 8.1k(vanilla GRPO)/ 6.9k(未训练MoA) | 约为GRPO的0.43倍、MoA的0.51倍,短链为竞争副产品 |
| CodeContests竞赛编程(Qwen3-1.7B,第二域) | pass@1 | 34(Agon) | 24(vanilla GRPO)/ 18(零样本) | 比GRPO +10pp,协作交换29居中,排序复现 |
| 跨尺度与跨模型族泛化(Table 5) | Agon相对vanilla GRPO的Δ | 0.6B +31 / 1.7B +24 / 4B +12 / Qwen3.5-2B +20 / Gemma-4-E4B +15 | — | 增益随零样本能力增强而收窄但恒为正,跨族成立 |
| 迁移泛化(Qwen3-0.6B,同checkpoint无再调参) | pass@1 | GSM8K 75 / MATH-500 64 | 零样本 GSM8K 62 / MATH-500 45;GRPO 68/52 | 比零样本分别 +13/+19pp,次序保持 |
| 消融:竞争vs协作、交换形式、角色(Table 7) | pass@1 | 完整Agon 61 | 协作46 / 共享对手32 / margin 49 / 固定角色52 | 竞争+15、转换奖励+12、轮换+9,每项均必要 |
局限与改进
作者承认的局限:Agon依赖干净的程序化验证器和参考题,只在数学和较小规模的代码上验证,噪声更重的领域可能表现不同;收益高度依赖两个模型实力相当但行为不同,差距太大会坍缩为蒸馏、太小则退化为自博弈,而本文的差异性是靠初始化+轮换启发式维持而非保证,互补性除了cascade胜率外没有量化。文本交换限定了信道带宽;推理是两阶段cascade、带来额外延迟,且报告的轨迹长度只覆盖最终阶段,更优的cascade方向是在留出集上事后选取的。最关键的是:每个训练数字都是单次训练、单次采样rollout,训练run间的方差未量化,且计算对等只对生成token成立,挑战方额外prefill对手摘要的算力未均摊。我的额外观察:作者承认'转换奖励'的增益也可解读为难度加权奖励塑形而非真正的博弈论竞争,实验无法区分这两种解释;同时'竞争但无可见交换'这一格被理论论证为惰性、未做诚实的per-rollout隐藏草稿消融,留作未来工作,使2×2设计的论证存在结构性缺口。
独立分析的弱点
独立分析弱点之一:互补性是整个方法的根基假设,却从未被直接度量。论文只通过cascade转换率间接暗示,没有报告两个适配器的错误相关性或互补覆盖率,建议引入基于错误分布的互补性指标并做对照实验。弱点之二:单次训练run、单次采样使所有结论受run间方差威胁,confidence interval只覆盖采样而未覆盖训练方差,建议至少跑3-5个种子并报告方差。弱点之三:双向cascade事后取优是在同一留出集上选的,存在轻微过拟合留出集的风险,应改用独立的方向选择集或交叉验证。弱点之四:文本摘要信道丢失了原始思考轨迹,作者自己承认这限定了带宽,改进方向是直接在隐空间(KV-cache注入或门控latent桥)交换信息。弱点之五:竞争增益与难度加权塑形无法区分,建议设计能解耦两者的对照(如固定组内对手难度但保留可见交换)。弱点之六:算力对等不彻底,挑战方prefill未均摊,建议显式报告总FLOPs或做prefill对齐的对照。弱点之七:跨族配对、不同初始强度配对未研究,泛化性边界不清。
未来方向
作者明确提出的未来方向:把交换从文本升级到隐空间,通过KV-cache注入或两个适配器之间的门控latent桥直接共享隐藏状态,绕开序列化瓶颈,传递模型无法口头化的信息;把密度杠杆扩展为完整的多目标优化,让压缩与正确性的权衡显式可调,使'信号密度'成为一阶可调目标;加入解法策略的多样性项,使配对足够互补以支持集成。基于成果可延伸的方向:其一,跨模型族配对——本文两个策略同源一个基座,最强模型彼此只差几分,是否存在行为差异足够大的跨族配对值得系统探索。其二,把'转换奖励'的博弈论解读与难度加权塑形解读做正式解耦实验。其三,把draft-and-challenge推广到三模型以上的循环赛或淘汰赛,研究对手数量与收益的scaling规律。其四,在代码之外扩展到有程序化或可验证奖励的领域(定理证明、形式化验证)。其五,研究推理时的动态级联——根据起草方置信度决定是否调用挑战方,以摊薄两阶段的延迟代价。
复现评估
复现评估:作者公开了奖励公式(式2-3)、全部超参(LoRA rank 16、学习率$5\times10^{-5}$、G=N=8、1个epoch、3000题、$\lambda=0.5$、$\gamma=0.5$)、训练数据(DeepMath-103K难度8、CodeContests easy)和评估协议(温度0.6、top-p 0.95、每阶段15k token、留出300题),并在Algorithm 1给出完整伪代码,使用vLLM与TRL,方法层面原则上可复现。但障碍明显:论文未提及代码或checkpoint是否开源;最关键的批评是每个方法都是单次训练run配单次采样rollout,run间方差完全未量化,而所有headline delta都建立在单点上,复现者极可能得到不同数值。更优cascade方向是在留出集事后选取,复现者用不同种子或不同切分可能漂移。算力虽未报告具体用量,两阶段cascade加双适配器对小团队仍是不小开销。综合判断:方法层面可复现,数值鲁棒性存疑,强烈建议补充多种子结果与开源checkpoint。
论文图表
左侧对比自博弈的闭环:单策略用自己的rollout算梯度,用制造错误的同一偏见再审计,导致触顶;右侧对比Agon的开环:两个不同盲区的策略互评、都被奖励去赢、且共同变强,评分者随被评者一起提升。
用最直观的方式阐明动机核心——为什么必须引入第二个不同的模型而非自我改进。
手工构造的示例:起草方A丢了一个符号、怀疑自己正确量级的结果、陷入约1.9k token的反复探索;其摘要复述了错误推导但隐去最终答案;挑战方B只看摘要、精确定位错误步骤、重推导、约4倍更短地给出正确答案1/3。
用一个完整算例展示摘要信道如何让挑战方以更少token纠错,是轨迹缩短机制的最佳注脚。
四组单因子消融:竞争(协作46/对抗61)、交换(共享对手32/per-rollout 61)、奖励形式(margin 49/转换奖励61)、角色(固定52/轮换61),每项均证明对应设计必要。
逐一隔离每个设计选择的贡献,是支撑方法各组件不可替代性的关键证据。