← 返回 2026-08-31

J-Zero:零数据下挑战者-求解者-裁判的统一协同进化 J-Zero: Unified Challenger--Solver--Judge Co-Evolution from Zero Data

Gyouk Chu, Myeongho Jeon, Eunho Yang 📅 2026-08-27 👍 37 2026-09-01 18:30
奖励模型 强化学习 自博弈 自进化 零数据

三方自博弈让裁判与解题者共同进化,突破固定裁判的自改进上限

前置知识

GRPO(组相对策略优化)

DeepSeekMath 提出的在线强化学习算法:对同一个提示采样一组(group)回答,把每个回答的奖励在组内做标准化(减去组均值、除以组标准差)得到优势估计,再套用 PPO 式的裁剪目标函数并附加与参考策略的 KL 散度正则来更新模型,全程不需要训练独立的值函数网络。它以组内相对比较替代绝对基线,实现简单、显存友好,已成为 LLM 后训练的主流 RL 算法之一。

J-ZERO 中 Challenger 和 Solver 的策略更新全部基于 GRPO:Challenger 以『生成的 N 个任务构成一个 GRPO 组』来最小化平均裁判奖励,Solver 则在每个任务内对 G 个回答做组内归一化来最大化奖励,不懂 GRPO 就无法理解第 3.1 节的核心训练流程。

Bradley–Terry(BT)损失与奖励模型

BT 模型假设人类偏好服从:回答 $y^+$ 优于 $y^-$ 的概率为 $\sigma(J(x,y^+)-J(x,y^-))$,其中 $J$ 是打分函数。最大化该似然等价于最小化损失 $-\log\sigma(J(x,y^+)-J(x,y^-))$,这是 RLHF 中训练奖励模型(Reward Model)的标准目标。奖励模型在不可验证域替代可执行验证器,为策略优化提供标量奖励信号。

本文的 Judge 就是一个从 Skywork-Reward-V2-Llama-3.1-8B 初始化的判别式奖励模型,它既为 Challenger/Solver 的 GRPO 提供奖励,又通过 BT 损失在闭环构造的偏好对上被持续更新——BT 损失是理解『裁判如何共进化』的数学基础。

Challenger–Solver 自博弈

从单一模型实例化出两个角色构成的零数据自进化范式:Challenger(出题者)生成越来越难的任务,Solver(解题者)学习解答这些任务,二者通过极小-极大对抗博弈相互促进(如 R-Zero、Absolute Zero)。整个训练闭环不依赖任何人类标注数据,任务由模型自己产生,奖励由验证器或投票机制给出。

J-ZERO 建立在 Challenger–Solver 对抗博弈之上,本文的贡献是把第三个角色 Judge 也拉进这个闭环,因此必须先理解传统两角色自博弈如何运转,才能看出三方共进化的增量。

可验证域与不可验证域

可验证域指存在客观判据的任务(数学题可对比标准答案、代码可执行测试),奖励可用规则自动计算;不可验证域指质量由人类偏好定义的开放式任务(写作、咨询、建议),没有唯一正确答案,必须用奖励模型或 LLM 裁判替代验证器提供学习信号。两类域的自进化难度差异巨大:前者已有成熟方案,后者进展寥寥。

本文的核心动机正是打通两类域:现有零数据自进化方法(R-Zero 等)靠多数投票只适用于可验证域,而不可验证域受制于固定裁判的天花板,理解这一二分法才能把握论文要解决的问题。

迭代放大

Christiano 等人 2018 年提出的对齐思路:把一个困难任务分解成若干个弱智能体也能可靠完成的简单子任务,分别求解后再把子答案聚合成对原任务的完整回答。由于每个子任务比原任务更容易被准确解决,聚合而成的回答质量往往超过智能体一次性直接作答的水平,即『分而治之超越单步能力』。

J-ZERO 借用该思想构造第二类裁判训练数据——子任务放大偏好对:Challenger 分解任务、Solver 逐个作答、Challenger 合成最终回答 $y^{amp}$,它按构造优于 Solver 的一次性回答 $y^S$,从而让裁判见识到超出 Solver 当前能力前沿的回答。

研究动机

自进化 LLM 的初衷是摆脱人工标注这一昂贵的监督瓶颈,但在两类任务域上的进展严重不均衡。可验证域(数学、代码等有客观答案的任务)已有 Absolute Zero、R-Zero 等成熟方案,靠执行器或多数投票提供廉价奖励即可闭环;而不可验证域(开放式写作、建议、规划等以人类偏好定义质量、无唯一正确答案的任务)几乎无人涉足。Kuba 等人 2025 年虽把数据免费自进化扩展到了不可验证域,但其方案依赖一个静态冻结的 Judge(奖励模型)替验证器打分,这引入了硬上限:Solver 一旦把 Judge 已能分辨的偏好差异全部学尽,奖励就失去区分度,继续训练不再产生信号——即自改进的天花板被 Judge 自身的评估能力锁死。同期 G-Zero 试图绕开 Judge 只训 Solver,但实验显示其在不可验证域几乎无增益(Qwen3-4B 上仅 +1.31 分),甚至不如不用 Judge 的 R-Zero(+3.08)。

本文的目标是本文要构建一个零数据、同时覆盖可验证与不可验证两类域的统一自进化框架,并解除固定裁判施加的性能天花板。具体目标是:让评估信号本身随训练持续变强——把 Judge 作为可训练组件纳入 Challenger–Solver 自博弈闭环,使其与出题者、解题者共同进化,从而在 Solver 能力前沿不断推进的过程中,奖励始终保有区分度,使自改进能够跨多轮迭代持续进行,而不是像现有方法那样两三轮就饱和回落。衡量标准是在 11 个可验证基准与 3 个不可验证基准上同时超越基座模型和 R-Zero、G-Zero 两个零数据基线,并验证改进的单调持续性。

与已有工作不同的是,让 Judge 也参与自进化面临一个看似循环的悖论:如果所有训练信号都来自同一个系统内部,Judge 凭什么能学到新的偏好信息?本文的独特切入点是从自博弈循环的结构性不对称中『免费』挖掘监督信号——某些响应对的优劣排序在构造上就已确定,完全不需要 Judge 自己打分。具体有两条:其一,角色不对称——Solver 被显式优化去答好生成的任务,Challenger 被优化去出难题而非答题,因此 Solver 的回答按构造优于 Challenger 的回答;其二,子任务放大——分而治之再聚合的回答按构造优于一次性回答。这使偏好标签既不依赖外部监督,也不依赖 Judge 自身的输出,规避了 self-rewarding 方法强化自身偏差的风险。与同期 G-Zero(用 Challenger 提示构造偏好对但只训 Solver、不训评估器)的本质区别在于:J-ZERO 直接进化评估能力本身。

核心方法

核心直觉很直白:既然自进化被冻结裁判的能力封顶,那就让裁判跟着一起涨。J-ZERO 的每次迭代分三阶段(图 1)。第一阶段冻结 Judge 训练 Challenger:它生成 N 个任务 $x_i$,Solver 对每题作答 M 次,Judge 打分取平均得 $\bar{r}_i$,难度奖励为 $1-\bar{r}_i$(专挑 Solver 答不好的题出),叠加基于 BLEU 距离聚类的重复惩罚 $r^{rep}_i$ 和格式检查(任务需包在 标签内),以 GRPO 极小化合成奖励更新 5 步。第二阶段冻结 Challenger,采样更大的候选任务池,按回答分数标准差 $s_i=\mathrm{std}\{r_{S,i,j}\}$ 选出 top-K 个最有信息量的任务(落在 Solver 能力边界附近),再用 GRPO 训练 Solver 最大化裁判奖励,更新 15 步。第三阶段在 held-out 任务上构造角色不对称与子任务放大两类偏好对,用 BT 损失更新 Judge 8 步,使评估标准始终略高于 Solver 当前水平。三者如此交替,滚动迭代 10 轮。

核心创新是『标签不依赖裁判自身打分的裁判共进化』。Self-rewarding 类方法(如 Yuan et al. 2024)用 Judge 给出的最高分/最低分回答构造偏好对,会把 Judge 的固有偏差自我强化;J-ZERO 则对裁判训练施加两条硬约束:偏好对必须完全在闭环内构造、标签必须与 Judge 自身的输出无关。它利用两个结构性事实保证排序先验正确:(1)角色不对称——Solver 专门练习答题而 Challenger 从不练习答题,故 $y^S \succ y^C$,且这种排序在 Judge 校准失准的区域也能重新注入判别信号;(2)子任务放大——分治聚合的回答 $y^{amp}$ 优于一次性回答 $y^S$,为 Judge 暴露了超出 Solver 当前一次性能力前沿的样本,防止进化被封顶在 Solver 现有水平。外部 LLM 裁判评估(图 2)证实二者互补:角色不对称对首轮胜率高达 87.9% 但随训练衰减到约 66%,子任务放大对首轮仅 21.1% 却在 Solver 成熟后升至 70–80%,两条曲线在中段交叉,保证裁判全程都有可靠的监督来源。

方法步骤详情

每轮四步。第一步 Challenger 更新:采样 N 个任务 $x_i$,Solver 对每题作答 M 次,Judge 打分取平均得 $\bar{r}_i$;难度奖励为 $1-\bar{r}_i$,叠加 BLEU 聚类重复惩罚 $r^{rep}_i$ 与格式检查,合成 $r^C_i=\max(0,1-\bar{r}_i-r^{rep}_i)$ 后以 GRPO 更新 5 步。第二步 任务筛选:冻结 Challenger,采样大池候选,按分数离散度 $s_i$ 选 top-K,依据是奖励方差决定学习潜力(Bae 2026)。第三步 Solver 更新:在 K 个任务上各采 G 个回答,以裁判奖励做组内归一化的 GRPO 更新 15 步。第四步 Judge 更新:在预留任务上构造角色不对称对 $\mathcal{D}_{role}$($y^S \succ y^C$)与子任务放大对 $\mathcal{D}_{amp}$(分解、逐个作答、合成 $y^{amp}$ 配 $y^S$),等比混合后以 BT 损失更新 8 步,自上轮热启动。

技术新颖性

与 R-Zero 的本质区别有三点:R-Zero 靠多数投票给出二值奖励,只适用于可验证域且没有裁判训练;J-ZERO 用连续裁判分替代投票,任务筛选从『中间难度准确率』推广为对连续分数的离散度筛选,并把裁判纳入进化闭环。与 Kuba et al. 2025 的区别在于其静态 Judge 会封顶,而本文的 Judge 随策略前沿共适应——消融显示冻结 Judge 变体最终在可验证/不可验证域分别落后 1.66 和 4.44 分。与 G-Zero 的区别在于 G-Zero 用偏好对只训 Solver(DPO)而无评估器进化,不可验证域增益极小。此外,任务筛选标准有严格理论支撑(奖励方差下界),这在自进化文献中少见。另一处新颖性是偏好信号的时间互补性设计:角色不对称对在早期可靠、放大对在后期接管,作者用外部裁判逐轮验证了这一『信号接力』现象(图 2),把『裁判永远有可用监督』从假设变成了经验事实。

An overview of J-ZERO, in which the Challenger, Solver, and Judge are jointly updated through iterative self-play.
Figure 1: An overview of J-ZERO, in which the Challenger, Solver, and Judge are jointly updated through iterative self-play.

实验结果

可验证域(表 1):Qwen3-4B 上 J-ZERO 总平均 54.38,较基座 44.91 提升 9.47,较 R-Zero 49.64 高 4.74;8B 上 58.55,较基座 50.67 提升 7.88;AIME24 8.96→16.15(4B),BBH 50.88→70.85。不可验证域(表 2)差距更大:4B 总平均 20.81(基座 9.58,+11.23;R-Zero 12.66),8B 23.41(基座 13.23,+10.18);AlpacaEval LC 胜率 6.22→28.56(4B)、12.93→33.53(8B),综合即摘要的 +4.2 / +8.0。迭代动态(图 3):J-ZERO 单调改进至第 10 轮,基线第 2 轮即见顶回落;冻结 Judge 变体前 3 轮紧随、随后停滞,最终落后 1.66 和 4.44 分。消融(表 3):去放大对掉 1.64 分,去角色对掉 0.97 分,全去掉 3.05 分(不可验证域 20.81→16.37)。裁判(图 4):独立 RM-Bench 上平均 92.61→93.95,Hard 对 +4.77,评估力反升。

Results across verifiable domains.
Table 1: Results across verifiable domains.
Results across unverifiable domains.
Table 2: Results across unverifiable domains.
Ablation results (disable one component at a time).
Table 3: Ablation results (disable one component at a time).
Full hyperparameter settings.
Table 4: Full hyperparameter settings.
Win rate of the chosen response for the two Judge-training pair types at each iteration.
Figure 2: Win rate of the chosen response for the two Judge-training pair types at each iteration.
Average score per iteration on the verifiable (left) and unverifiable (right) benchmarks.
Figure 3: Average score per iteration on the verifiable (left) and unverifiable (right) benchmarks.
Judge performance on RM-Bench per iteration.
Figure 4: Judge performance on RM-Bench per iteration.
查看结构化数据
任务指标本文基线提升
可验证域综合(数学+通用推理+指令遵循,Qwen3-4B) 11 个基准三组平均 54.38 基座 44.91 / R-Zero 49.64 / G-Zero 47.41 较基座 +9.47,较 R-Zero +4.74,较 G-Zero +6.97
可验证域综合(Qwen3-8B) 11 个基准三组平均 58.55 基座 50.67 / R-Zero 54.99 / G-Zero 53.07 较基座 +7.88,较 R-Zero +3.56
不可验证域综合(AlpacaEval+Arena-Hard+EQ-Bench,Qwen3-4B) 3 个基准平均 20.81 基座 9.58 / R-Zero 12.66 / G-Zero 10.89 较基座 +11.23,较 R-Zero +8.15
不可验证域综合(Qwen3-8B) 3 个基准平均 23.41 基座 13.23 / R-Zero 15.54 / G-Zero 15.31 较基座 +10.18,较 R-Zero +7.87
AlpacaEval 2.0(开放式指令跟随) Length-Controlled 胜率(%) 28.56(4B)/ 33.53(8B) 基座 6.22(4B)/ 12.93(8B) 4B +22.34,8B +20.60,为所有基准中最大单项增益
AIME24(竞赛数学) avg@32 准确率(%) 16.15(4B)/ 19.58(8B) 基座 8.96(4B)/ 10.52(8B) 4B +7.19,8B +9.06,且 R-Zero 仅 11.04 / 13.96
训练稳定性(10 轮迭代) 可验证/不可验证域平均分走势 单调提升至第 10 轮(+9.47 / +11.23) R-Zero 与 G-Zero 均在第 2 轮达峰后回落 唯一持续改进的方法;冻结 Judge 变体最终落后 1.66 / 4.44 分

局限与改进

作者明确承认两点:其一,受算力限制,实验只覆盖 4B/8B 基座模型加 8B 裁判,更大规模以及生成长思维链的后训练推理模型尚未验证,结论外推性存疑;其二,Judge 是判别式奖励模型,从现成的 Skywork-Reward-V2-Llama-3.1-8B 初始化,与 Challenger/Solver 共享生成式初始化的设定不对称,无法单模型扮演三角色,生成式裁判如何共适应留作未来工作。我的补充观察:角色不对称对的胜率从 87.9% 滑落到约 66%,这种标签可靠性衰减在超过 10 轮的长程训练中是否会累积成噪声,论文没有回答;chosen 侧永远来自 Solver 或放大回答的构造可能让裁判学到对回答来源与风格的隐性偏置,文中虽用 RM-Bench 排除了通用能力退化,但未系统排查来源泄漏;外部可靠性评估用的 Claude Opus 4.8 本身也是 LLM 裁判,其结论受同类方法局限约束;另外不可验证域评估使用 Qwen3.6-27B 和 gemma-4-31B-it 等非官方默认裁判模型,与社区协议有出入,横向可比性打折。

独立分析的弱点

弱点一:裁判分数的跨轮不可比性。每轮 BT 更新只修正当前前沿样本的排序,不同迭代轮次的分数尺度会漂移,而 Challenger 的目标恰恰是『最小化裁判分』——它可能通过利用裁判的校准误差而非真实任务难度来刷奖励,论文缺少分数锚定或跨轮校准机制。改进方向:引入固定锚样本集做分数归一,或把 Challenger 奖励改为与历史任务的相对比较。弱点二:角色不对称对信息量衰减(胜率 87.9%→66%),因为它只能教裁判区分低于 Solver 能力的回答,后期接近饱和;而放大对又依赖 Challenger 的分解质量,附录 D 的示例显示子任务偏流程化(如『定义角色外貌』),对强推理类任务分解的有效性存疑。改进方向:按轮次动态调整两类配比,并为分解质量增加过滤或用 Solver 求解反馈优化分解。弱点三:训练开销大——每轮 Challenger 5 步 + Solver 15 步 + Judge 8 步、10 轮迭代,需 4×B200 加 4×H200,且每轮包含多次生成-打分-训练循环。改进方向:研究每轮步数、任务池大小与最终收益的缩放规律,或用 LoRA 降低 Judge 更新成本。

未来方向

作者明确提出的方向是生成式裁判:用一个基座模型同时实例化 Challenger、Solver、Judge 三个角色,裁判生成的 critique 可以作为比标量分更丰富的闭环监督信号,如何让生成式裁判在自博弈中稳定共适应是开放问题。基于本文成果可以延伸的方向还有:(1)多裁判集成或辩论式裁判,缓解单裁判偏差并解决分数跨轮校准问题;(2)把三方共进化推广到多模态、工具调用、软件工程智能体等域(文中引用的 Tool-R0、SWE-RL 系列提示了可行性);(3)对偏好标签可靠性衰减做理论刻画,并把图 2 那样的在线胜率监控做成训练中的自动止损/换源信号;(4)验证 8B 以上规模与长思维链推理模型上的表现,特别是推理模型的长输出对判别式裁判上下文(8192 token)的压力;(5)研究共进化裁判在新任务域的零样本迁移能力——RM-Bench 上 Chat 域 +3.70 的结果暗示裁判并未过拟合到闭环分布,值得系统化探索;(6)与测试时计算扩展(如自一致性、搜索)结合,考察进化后的 Solver 与更强推理策略的叠加收益。

复现评估

开源条件较好:正文给出 Project Page、GitHub、Hugging Face 三个入口,代码与资源可循迹获取。关键组件全部公开:基座 Qwen3-4B/8B-Base、裁判 Skywork-Reward-V2-Llama-3.1-8B 均为开源权重;训练基于 verl;超参在表 4 完整给出(每轮 Challenger 5 步 / Solver 15 步 / Judge 8 步,批量 16/128/64,学习率 $1\times10^{-6}$ 与 $5\times10^{-7}$,KL 系数 0.01,温度 1.0、top-p 0.99);全部提示词在附录 C 原文披露,分解案例在附录 D。主要门槛在算力与评估:官方用 4×B200 加 4×H200 跑 10 轮迭代,每轮含大量生成与打分;不可验证域评估需外部 LLM 裁判(论文用 Qwen3.6-27B 和 gemma-4-31B-it 而非官方默认协议),严格对齐数字有摩擦。综合属中高难度复现:配方齐全,瓶颈是 GPU 预算与评估协议细节,小团队可先以 4B 模型少量迭代验证趋势。