← 返回 2026-08-20

Co-RL:多智能体强化学习中由多样化群体涌现的无监督推理 Co-RL: Unsupervised Reasoning Emerges from Diverse Cohort in Multi-agent RL

Yunhao Yang, Yuexin Bian, Yunjie Tian, Di Fu, Tianjin Huang, Yuanyuan Shi, Ziang Xiao, Nuno Vasconcelos, Yijiang Li 📅 2026-08-19 👍 92 2026-08-25 18:30
多智能体 大语言模型推理 强化学习 无标签RL 自奖励

让多个独立模型互为老师:以同伴多数票为奖励,无需标注即可涌现推理能力

前置知识

RLVR(可验证奖励的强化学习)

Reinforcement Learning with Verifiable Rewards,指用规则或外部验证器对模型回答打分后做 RL 训练的范式,例如数学题比对最终答案是否等于标准答案、代码题跑测试用例。奖励通常是二值的(对 1 错 0),配合 GRPO 等策略优化算法使用。

本文要解决的核心问题正是 RLVR 对真值标签的强依赖:标注昂贵且在推理能力超越人类评估范围后不可得。理解 RLVR 才能理解论文的出发点。

GRPO(组相对策略优化)

DeepSeek 提出的免 critic 强化学习算法:对同一 prompt 采样一组 $K$ 个回答,把每个回答的奖励在组内标准化为优势 $\hat{A}_k = (r_k - \mathrm{mean})/(\mathrm{std}+\epsilon)$,再用带裁剪和 KL 正则的代理目标更新策略。

Co-RL 的每个 agent 都用 GRPO 做策略更新,论文中的奖励 $r_k^n$ 正是代入 GRPO 的组内归一化流程,读懂方法部分必须熟悉它。

TTRL 与自奖励 RL(Self-rewarding RL)

无标签训练的一类方法:奖励信号完全来自模型自身行为。TTRL 用模型自身 $K$ 次采样的多数票答案当伪标签,回答与之一致就给奖励 1;Intuitor 用 token 级自确信度,RENT 用预测熵。优点是无需标注,缺点是信号与被优化策略同源。

自奖励方法是本文最主要的对比基线。论文指出它们会自我确认偏差、导致训练崩溃(Figure 4),Co-RL 的设计动机就是修复这一缺陷。

多数投票伪标签

对同一无标注问题让模型采样 $K$ 次、抽取最终答案后取众数 $\hat{a} = \arg\max_b \sum_j \mathbb{1}[a_j = b]$,把众数当作隐式真值标签给采样打分。其准确性依赖模型在该题上正确率过半,正确率低于一半时会把错误答案固化成标签。

Co-RL 的奖励构造完全建立在同伴多数票之上,只是关键区别在于投票者是被监督者的同伴而非自己,这是理解方法的第一步。

协同训练与视图独立性(Co-training)

Blum 与 Mitchell 在 1998 年提出的半监督学习思想:若样本有两个条件独立的特征视图,可以让两个分类器互相用对方的预测教对方。后续研究(Li 等 2023)进一步证明视图越相似,误差越相关,越容易在同一种错误上互相强化。

这是 Co-RL 多样性设计(异构家族、不同规模、改写输入)的理论根源:只有同伴的错误与自己去相关,跨 agent 监督才提供真正的纠错信号。

研究动机

RLVR 已成为提升大模型推理能力的主流范式,但其最强结果高度依赖真值标签:每个训练样本都需要标准答案或可执行验证器,标注成本高昂,而且当目标推理能力接近甚至超越人类可靠评估的范围时,标签会愈发稀缺。为了摆脱标注依赖,TTRL、Intuitor、RENT、Co-rewarding 等自奖励方法从模型自身生成中提取奖励信号,例如回答与自身多数票答案一致就给奖励 1。论文指出这类信号的致命缺陷:奖励与被优化的策略同源、缺乏外部参照,训练会不断放大模型既有偏差与次优行为、压缩响应多样性,最终走向输出同质化甚至训练崩溃。论文实验(Figure 4)显示,TTRL 在 Qwen2.5-7B、Llama-3.1-8B 等模型上长时间训练后出现奖励方差坍缩和生成长度退化甚至发散,说明单模型自监督的反馈回路在结构上就是不稳定的。

本文的目标是本文的目标是构建一个完全不需要真值标签、也不需要外部 LLM 裁判或学习式奖励模型的多智能体强化学习框架,让多个相互独立的模型在同一个训练过程中互为监督、同时提升推理能力。具体而言,论文希望在 7 个文本推理基准(GSM8K、MATH-500、AMC、HumanEval、GPQA、MBPP、LiveCodeBench)和 4 个多模态数学基准(MathVision、MathVerse、MathVista、We-Math)上,把参数量从 1.7B 到 12B、横跨 Qwen、Llama、InternVL、Gemma 四个家族的语言与视觉语言模型的准确率,提升到与真值奖励训练(GT-Reward)相当甚至更好的水平;同时在训练全程保持动态稳定,不出现自奖励方法常见的奖励方差坍缩、生成长度退化和发散现象。框架还必须足够轻量:agent 之间除奖励交换外零交互,从而与依赖辩论、裁判或共享奖励模型的多智能体方法形成鲜明区隔。

与已有工作不同的是,本文的独特切入角度是把协同训练(co-training)的经典洞察引入无标签 RL。1998 年 Blum 与 Mitchell 证明两个条件独立的视图可以互相教学,Li 等 2023 年进一步指出视图越相似越容易在同一错误上达成一致。Co-rewarding 虽引入了第二视图,但其 EMA 副本或改写视图均源自同一个模型,误差仍然强相关,只部分满足双视图独立性。真正的突破在于用参数完全不共享、预训练数据与架构都不同的独立模型作为同伴:它们犯错的模式天然去相关,一个模型答对的题恰好能提供另一个模型从自身生成中永远得不到的纠错信号。与 CoMAS、MAPoRL 等多智能体方法相比,Co-RL 不需要 LLM 裁判给交互打分也不需要学习奖励模型,agent 之间除奖励交换外零交互,框架轻量且对称——每个 agent 既是学习者又是监督源。

核心方法

Co-RL 的直觉是:模型要获得足够独立的学习信号,可以从错误模式与自己去相关的同伴那里拿。技术上设 $N$ 个策略 $\{\pi_{\theta_n}\}_{n=1}^N$ 参数完全解耦,对每个无标注问题 $x$,每个 agent 独立采样 $K$ 个补全 $y_k^n \sim \pi_{\theta_n}(\cdot|x)$ 并抽取答案 $a_k^n = g(y_k^n)$。agent $n$ 的监督目标完全来自编号 $n-1$ 的同伴(环状,agent 1 由 agent N 监督):$\hat{a}_{-n}(x) \in \arg\max_b \sum_{j=1}^{K} \mathbb{1}[a_j^{n-1} = b]$,每个 rollout 的奖励为二值匹配 $r_k^n = \mathbb{1}[a_k^n = \hat{a}_{-n}(x)]$。奖励在自己组内归一化为优势 $\hat{A}_k^n = (r_k^n - \mathrm{mean})/(\mathrm{std}+\epsilon)$ 后用 GRPO 更新,总目标 $J_{\text{Co-RL}}(\theta) = \frac{1}{N}\sum_n J_{\text{GRPO}}(\theta_n)$。也就是说,每个 agent 既当学生又当老师:它从同伴的多数票里学,同伴也从它的多数票里学,但参数与梯度完全隔离,训练耦合只发生在奖励交换这一处。理论上(Proposition 1),自奖励动态为 $\dot{p} = \eta p(1-p)\,\mathbb{E}_{C\sim\mathrm{Bin}(K,p)}[\mathrm{sign}(C - K/2)\cdot\frac{C(K-C)}{K}]$,而双 agent Co-RL 简化为 $\dot{p}_A = q_K(p_A)\phi_K(p_B)$、$\dot{p}_B = q_K(p_B)\phi_K(p_A)$,其中 $\phi_K(p) = 2V_K(p)-1$ 是多数票方向的符号——agent A 的更新方向完全由同伴 B 的信号决定,而非自己的历史偏好。

核心创新是跨 agent 监督打破自强化反馈回路,本质区别在于伪标签与被优化策略的解耦。Proposition 2 证明自奖励动态是自我确认的:对奇数 $K$,$\mathrm{sign}(G_K^{\text{self}}(p)) = \mathrm{sign}(p - 1/2)$,因此 $p(0) < 1/2 \Rightarrow p(t) \to 0$——模型在某题上的初始正确率一旦低于一半,训练只会进一步压制正确答案。Theorem 1 则证明 Co-RL 扩大了正确收敛域:双 agent 系统的内部分界线是 $p_A + p_B = 1$,只要 $p_A(0) + p_B(0) > 1$ 就收敛到正确共识 $(1,1)$。论文给出一个极端例子:若一半题目上 $(p_A, p_B) = (0.9, 0.2)$、另一半为 $(0.2, 0.9)$,两模型优势完全互补、平均精度都只有 0.55,自奖励训练最终各只能做对一半(精度 0.5),而 Co-RL 因每题都满足 $p_A + p_B = 1.1 > 1$ 可达精度 1.0。为了让同伴误差尽量去相关,作者把多样性推到框架允许的极限:异构模型家族(不同架构、分词器、预训练数据、视觉编码器)、不同规模、以及用 DeepSeek-V3 改写 prompt 的输入解耦。

方法步骤详情

训练流程(Algorithm 1):第一步,从无标注数据 $\mathcal{D}$ 采样一批 prompt(文本用 MATH 3-5 级,每 agent 有效批 128 个 prompt)。第二步,对批内每个 $x$,每个 agent 以温度 1.0 独立 rollout——文本模型 $K=12$、3072 token 上限,VLM $K=8$、1024 token 上限——并抽取最终答案 $a_k^n$。第三步,构造跨 agent 奖励:agent $n$ 计算同伴 $n-1$ 答案的多数票伪标签 $\hat{a}_{-n}(x)$,对自己的 $K$ 个 rollout 赋二值奖励 $r_k^n = \mathbb{1}[a_k^n = \hat{a}_{-n}(x)]$,自己绝不参与自己的监督目标;所有 rollout 和伪标签都在任何策略更新之前算完,保证奖励基于更新前的独立视图。第四步,组内归一化得优势 $\hat{A}_k^n$,各策略用 GRPO 独立更新一步,参数与优化器状态完全隔离,除奖励交换外无梯度传播。多样性通过三种手段叠加: 同家族也训练两个独立 agent(Same family); 跨家族配对如 Qwen2.5-3B + Llama-3.2-3B-Instruct(Different family); 数据解耦——用 DeepSeek-V3 把 MATH 题改写成不同情境但答案与顺序不变的版本,一个 agent 用原题、另一个用改写题(Different family+)。全部实验在单节点 8 张 H100 上进行,每 agent 4 张卡;Gemma-3 因 rollout 与策略分布漂移额外加了 token 级重要性采样校正。

技术新颖性

技术新颖性体现在四个层面。其一,这是把真正异构模型作为无标签 RL 奖励来源的首批工作:TTRL/Intuitor/RENT 的奖励都来自单一模型自身,Co-rewarding 的两个视图同源,CoMAS 需要自己的 agent 兼任 LLM 裁判,而 Co-RL 的奖励直接来自独立训练的同伴投票,无需任何裁判或奖励模型。其二,理论贡献:用简化的二值答案动态模型严格刻画了自奖励的自我确认性质与跨 agent 监督的收敛域扩大(分界线从 $p = 1/2$ 移到 $p_A + p_B = 1$),从动力学层面解释了互补优势为何能转化为净收益。其三,把 cohort 多样性当作可设计的训练维度系统消融,并用误差重叠率(Figure 2d)量化了异构家族误差去相关的程度,将 co-training 的旧思想落到 RL 训练上。其四,框架天然可扩展:$N > 2$ 时投票沿有向环传递,无需额外协调机制,三 agent 实验(Qwen2.5-3B + Llama-3.2-3B + Qwen3-1.7B)验证了这一可扩展性。

Comparison of Co-RL with prior label-free RL methods. Both TTRL and Co-rewarding derive rewards from self-generated agreement, and CoMAS scores multi-turn interactions with one of its own agents acting as judge. Co-RL instead derives rewards directly from peer votes. Beyond two agents, the votes pass along a directed ring (N=3 shown).
Figure 1: Comparison of Co-RL with prior label-free RL methods. Both TTRL and Co-rewarding derive rewards from self-generated agreement, and CoMAS scores multi-turn interactions with one of its own agents acting as judge. Co-RL instead derives rewards directly from peer votes. Beyond two agents, the votes pass along a directed ring (N=3 shown).
Overview of Co-RL with two agents. Each agent samples K responses to the same unlabeled question and generates a pseudo label with majority vote. Each rollout is then rewarded by agreement with the cohort's pseudo label, and updates its own policy, with no sharing parameters and no gradient exchange except the cross-reward process.
Figure 3: Overview of Co-RL with two agents. Each agent samples K responses to the same unlabeled question and generates a pseudo label with majority vote. Each rollout is then rewarded by agreement with the cohort's pseudo label, and updates its own policy, with no sharing parameters and no gradient exchange except the cross-reward process.

实验结果

文本推理上,Co-RL 在 7 个基准(GSM8K、MATH-500、AMC、HumanEval、GPQA、MBPP、LiveCodeBench)平均带来 3.0–8.6% 提升,超过最强自奖励基线 0.8–2.0%。以 3B 模型为例(Table 1):Qwen2.5-3B 从 Base 40.7 提升到 Co-RL(Different family+) 的 49.3,超过 GT-Reward 的 47.4 和 TTRL 的 47.3;最容易实现的 Same family(同底座两个独立 agent)也平均提升 8.0%;Llama-3.2-3B 从 38.7 提升到 43.9,超过 GT-Reward 的 43.0 和 TTRL 的 43.1。在 CoMAS 统一评测协议下(Table 2),Co-RL 平均 62.97%,超过 CoMAS 的 58.94%、MAPoRL 的 58.22% 和 TTRL 的 58.18%,且只用 CoMAS 一半数量的 agent、不需要裁判,7 个基准中 5 个领先,其中 MATH-500 的 68.6 对 55.8 差距最大。三 agent 扩展实验(Table 3)中,Qwen2.5-3B、Llama-3.2-3B-Instruct、Qwen3-1.7B 在单次联合训练中分别平均提升 7.8%、6.0%、8.2%,三者都达到或超过各自的 GT-Reward。多模态方面(Table 4),五个 2B–12B 的 VLM 在四个多模态数学基准平均提升 2.3–7.2%:Qwen2.5-VL-3B 在 open-r1 数据上从 Base 37.24 提到 43.89(GT-Reward 42.97、TTRL 42.54),InternVL3.5-2B 达 45.40(GT 45.20),Gemma-3-12B 上甚至超过 GT-Reward。训练动态上(Figure 4),Co-RL 在四个规模上保持稳定的奖励方差与生成长度,而 TTRL、RENT、Intuitor 出现奖励坍缩、长度退化甚至发散。附录 D.4 还控制了训练与推理预算:把两个模型各自 TTRL 训练再集成投票,Co-RL 仍全面更优,说明收益来自跨 agent 监督而非额外算力或纯集成。

Full performance across seven benchmarks for 3B models (%). The best label-free result is shown in bold and the second best is underlined. Co-RL (Same family) trains two agents initialized from the same base model; (Different family) pairs one agent from each of the two families; (Different family+) further decouples the training data.
Table 1: Full performance across seven benchmarks for 3B models (%). The best label-free result is shown in bold and the second best is underlined. Co-RL (Same family) trains two agents initialized from the same base model; (Different family) pairs one agent from each of the two families; (Different family+) further decouples the training data.
Comparison under the CoMAS multi-agent RL setting (%). All methods train Qwen2.5-3B-Instruct on the same prompt mixture and are evaluated following the CoMAS protocol.
Table 2: Comparison under the CoMAS multi-agent RL setting (%). All methods train Qwen2.5-3B-Instruct on the same prompt mixture and are evaluated following the CoMAS protocol.
Three-agent Co-RL with heterogeneous model families (%). Qwen2.5-3B, Llama-3.2-3B-Instruct, and Qwen3-1.7B are jointly trained in a single Co-RL run, compared against the base model, GT-Reward, and TTRL.
Table 3: Three-agent Co-RL with heterogeneous model families (%). Qwen2.5-3B, Llama-3.2-3B-Instruct, and Qwen3-1.7B are jointly trained in a single Co-RL run, compared against the base model, GT-Reward, and TTRL.
Vision-language results for the small pair, Qwen2.5-VL-3B with InternVL3.5-2B, trained separately on open-r1 and MMR1 (%). Base and GT-Reward serve as references and are excluded from the ranking.
Table 4: Vision-language results for the small pair, Qwen2.5-VL-3B with InternVL3.5-2B, trained separately on open-r1 and MMR1 (%). Base and GT-Reward serve as references and are excluded from the ranking.
Training dynamics at four scales, one column per backbone (Qwen2.5-3B, Llama-3.2-3B, Qwen2.5-7B, Llama-3.1-8B). (a) MATH-500 validation accuracy, (b) standard deviation of the reward, (c) mean completion length. Runs marked diverged leave the plotted range.
Figure 4: Training dynamics at four scales, one column per backbone (Qwen2.5-3B, Llama-3.2-3B, Qwen2.5-7B, Llama-3.1-8B). (a) MATH-500 validation accuracy, (b) standard deviation of the reward, (c) mean completion length. Runs marked diverged leave the plotted range.

局限与改进

作者承认的关键局限:伪标签质量完全取决于同伴,若整个 cohort 在某个知识点上系统性出错(共同盲区),跨 agent 监督同样无法纠错——理论分界线 $p_A + p_B > 1$ 本身就说明两个模型都太弱时仍会收敛到错误共识 $(0,0)$。我的补充观察:其一,理论模型过于简化,忽略了 GRPO 的裁剪项和 KL 正则、假设答案空间二值且 $K$ 为奇数(实验实际用偶数 $K=12$ 并确定性处理平票),与真实训练存在差距;其二,奖励是严格的二值答案匹配,依赖答案抽取函数 $g(\cdot)$,天然局限于有唯一答案的数学与代码任务,难以推广到开放式生成;其三,成本上需要同时托管和训练多个模型,虽然每 agent 只占 4 张 H100,但总显存与吞吐开销仍是单模型自奖励的数倍;其四,训练语料集中在数学(MATH 3-5、MMR1-Math、multimodal-open-r1),科学问答、代码 agent 等跨域泛化未验证;其五,数据解耦依赖 DeepSeek-V3 改写,引入了对外部强模型的隐性依赖,改写质量本身会影响结果。

独立分析的弱点

第一,奖励的环状拓扑(agent $n$ 由 $n-1$ 监督)是一个任意选择,论文未消融全对全平均投票、星型或动态配对等拓扑,不同拓扑下信号方差与错误传播特性可能差异显著——改进方向是做拓扑消融并允许每步根据历史互补性动态重配对。第二,多数票伪标签对所有同伴答案等权,未利用置信度信息,可引入 token 级自确信度或预测熵做加权投票,降低低置信同伴的干扰。第三,偶数 $K$ 平票采用确定性处理但未报告敏感性分析,平票时的奖励可能系统性偏向某个模型,可改用奇数 $K$ 或软奖励。第四,二值奖励丢弃了接近正确的部分推理信息,可结合过程奖励或部分得分缓解稀疏性。第五,VLM 增益(2.3–7.2%)整体小于文本(3.0–8.6%),部分设定相对 GT-Reward 优势很小(如 InternVL3.5-2B MMR1 上 45.15 对 44.65),说明视觉感知类错误难以靠答案级投票纠正,可探索视觉编码器层面的交叉监督。第六,cohort 成员固定,无法在训练中淘汰退化或发散的同伴,缺乏在线的质量控制机制。

未来方向

作者明确提出两个方向:理解 agent 数量、多样性与交互拓扑如何塑造跨 agent 学习;开发能更充分利用互补专长的自适应监督机制。基于本文成果还可以延伸出多条路线:把环状投票推广为可学习的注意力式聚合,让每个 agent 学会信任谁、信任多少;将 Co-RL 与测试时扩展结合——训练后的异构模型天然构成互补的多数投票集成,推理阶段收益可叠加;把框架迁移到代码执行反馈、科学推理等弱可验证领域,用同伴一致性替代真值标签;探索 cohort 的在线扩充与淘汰策略,在整个训练过程中维持误差去相关度;以及研究理论收敛域在连续答案空间和非对称能力配对(强弱搭档)下的推广——强弱配对时弱者会拉低伪标签质量,如何设计非对称的奖励分配或课程调度是开放问题。此外,改写输入目前依赖外部强模型,用同 cohort 中的模型互相改写可能让框架完全自包含。

复现评估

复现条件较好:代码已在 GitHub 开源(DrStranded/Co-RL),训练数据全部公开(MATH level 3-5、MMR1-Math、multimodal-open-r1),评测基准均为社区标准集,无需私有资源。算力需求为单节点 8 张 H100(每 agent 4 张);文本模型训 2 epochs(学习率 $3 \times 10^{-6}$、每 agent 有效批 128 prompts、$K=12$、温度 1.0、3072 token 上限),VLM 训 1 epoch(学习率 $1 \times 10^{-6}$、$K=8$、1024 token 上限),优化器 AdamW。需要留意的坑有两个:Gemma-3 的 rollout 与策略分布漂移需要额外的 token 级重要性采样校正,论文只在校正后才得到稳定结果;偶数 $K$ 平票的确定性处理规则需要从开源代码中确认细节,正文未完全说明。对没有多卡集群的团队,建议先用 Same family 配置加两个 3B 模型在消费级多卡机上小规模验证核心机制,再扩展到跨家族设定。总体复现难度中等偏上,瓶颈在多模型并行训练的基础设施而非算法本身,算法部分本身非常简单——核心只是交换多数票奖励。