← 返回 2026-08-12

智能体系统中的协同进化:迈向超越人类设计的自主进化 Co-Evolution in Agentic Systems: Toward Self-Directed Evolution Beyond Human Design

Qing Zong, Jiayu Liu, Junhao Shen, Zecong Tang, Linsi Wu, Yuxuan Liu, Rui Wang, Zhaowei Wang, Weiqi Wang, Cheng Qian, Xiusi Chen, Yangqiu Song 📅 2026-08-10 👍 130 2026-08-17 18:30
协同进化 多智能体强化学习 开放式学习 智能体系统 综述 自进化智能体

首篇以协同进化为核心的智能体系统综述,提出从智能体互适应到进化机制自主可进化的三阶段分类法

前置知识

自进化(Self-Evolution)

指智能体在部署后无需人工干预、仅凭自身经验、反馈与失败持续更新自己的范式。更新对象可以是模型骨干(微调)、外壳组件(记忆、技能、提示词)或工作流。与固定权重推理不同,自进化要求更改在多次运行间被保留,从而形成累积式改进。现有综述通常将其拆解为更新什么、何时更新、如何更新等维度。

本文把协同进化定义为自进化的耦合扩展形式,理解三阶段分类法的前提是先知道单实体自进化是什么、瓶颈在哪里。

智能体外壳(Harness)

指模型权重之外、支撑智能体运行的持久化组件,包括记忆、工具、技能库、提示词与工作流等。两个智能体可共享同一骨干却因外壳不同而承担不同角色。在论文的形式化记号中每个智能体写作 $a_i=(m_i,h_i)$,只要骨干 $m_i$ 或外壳 $h_i$ 发生变化即视为进化。

论文的形式化定义与『什么在进化』这条分类轴都建立在骨干/外壳/组织结构的分解之上,不懂外壳就无法理解分类标准。

红皇后效应(Red Queen Effect)

源自进化生物学的定律(Van Valen, 1973):在共同进化的种群中,一方的进步会抬高另一方的生存难度,因此持续进步需要各方相互适应,单方面适应一个不变的环境终将停滞。它描述了物种间军备竞赛式的共同进化动态。

这是全文动机的核心类比:单实体自进化面对静态任务与反馈会陷入平台期,正如红皇后效应所预言,这正是引出协同进化的根本原因。

自博弈与生成对抗(Self-Play 与 GAN)

自博弈指学习方与自身的副本或历史版本对弈,以自动产生难度递增的训练压力(如 AlphaGo Zero、AlphaStar 联赛训练);生成对抗网络(GAN)让生成器与判别器目标相反、互相提升。二者都是『让对手也变强』的经典机制。

第一阶段 Agent–Agent 协同进化的对抗分支正是从 GAN、RARL、AlphaStar 一路演化而来,不了解这条源流就难以理解综述的谱系梳理。

课程学习与无监督环境设计(CL 与 UED)

课程学习按学习进度调整智能体所见任务的采样权重,使其始终处在能力边缘;无监督环境设计(如 POET、PAIRED)则自动生成针对智能体弱点的新关卡,形成智能体与环境互相抬升难度的闭环。 regret-based 方法会优先生成智能体落后于参照水平的环境。

第二阶段 Agent–Environment 协同进化的任务空间与交互空间方法,大部分由这两条研究线扩展而来,是读懂第 4 节的背景知识。

开放式学习(Open-Endedness)

指系统持续产生新颖且可学习的结果、永不收敛到固定终点的性质,被 Stanley 等人称为『你从未听说过的最后一项大挑战』。数学上要求进化机制持续更新 $\Omega_{t+1}\neq\Omega_t$(连续新颖性),且自适应能力无界 $\lim_{t\to\infty}H(S_t,\Omega_t)=\infty$(无限分歧)。

论文把第三阶段元协同进化定位为通往开放式学习的可能路径,这是理解其终极愿景与研究价值的钥匙。

研究动机

当前的单实体自进化存在结构性天花板。智能体固然可以在无人工干预下从经验、反馈与失败中持续更新自身——例如微调骨干模型、更新记忆组件或积累技能库——但这类改进发生在静态学习情境中:训练任务池固定、反馈规则固定、对手与伙伴固定。以 LLM 安全对齐为例,若防御方只对着一小批预先写好的越狱攻击模板训练,很快就会过拟合这几种模式,对新型攻击毫无抵抗力;同样,在固定任务池上反复学习的工具使用智能体会耗尽池中剩余的学习信号而停滞。论文用图 1 直观展示了这一现象:单实体自进化的性能曲线初期快速上升后趋于平台期。作者引用红皇后效应解释根源:持续进步需要各方相互适应,而非单方面适应一个不变的环境——当学习情境中所有对手都被冻结时,智能体能遇到的新经验与新压力必然枯竭。

本文的目标是本文要填补的空白是:没有任何一篇综述以协同进化为核心议题来组织智能体系统文献。作者的具体目标是回答三个递进的问题:(1)哪些组件在共同进化——是只有智能体互适应,还是任务、反馈、交互空间等环境组件也在变,抑或进化机制本身都可变?(2)进化自由的边界如何随研究推进而扩张——从只能改智能体,到能改环境,再到能改进化规则本身;(3)这一过程的终极形态是什么——元协同进化能否成为通往开放式学习的路径。为此,论文建立了统一的形式化基础(系统 $S=(A,E)$、智能体 $a_i=(m_i,h_i)$、进化机制 $\Omega$),提出三阶段渐进分类法梳理了上百项工作,并系统讨论评估、扩展与治理三大开放挑战,为构建鲁棒、开放式的智能体系统提供统一基础。

与已有工作不同的是,与本文最接近的是自进化智能体综述(Gao et al. 2026;Xiang et al. 2026),但它们只把协同进化当子题而非组织主轴。更广泛的相邻综述各覆盖一块:LLM 多智能体系统综述(Guo et al. 2024 等)关注通信与协作架构;外壳工程综述(Meng et al. 2026;Xie et al. 2026)关注运行时基础设施;环境扩展综述(Huang et al. 2025c)只把协同进化列为未来方向;递归自我改进综述(Chen et al. 2026b)只在自博弈与评估器进化处零散提及。论文附录 B 的表 1 逐一对比了 9 篇相邻综述的原生分类法,结论一致:协同进化要么缺席、要么以散例/未来方向/单个分支的形式出现,没有任何一篇以其为收录标准与组织轴。这构成了本文独特的切入角度——用『什么被允许进化』作为一以贯之的分类轴,把散落在各领域的相关工作第一次拼成完整图景。

核心方法

论文先把智能体系统形式化为 $S=(A,E)$:智能体集体 $A$ 由带组织结构 $\Pi$(角色、通信拓扑、分工)的智能体组成,每个智能体 $a_i=(m_i,h_i)$ 包含模型骨干与外壳(记忆、工具、技能、提示词、工作流),任一组件变化即为进化;环境 $E$ 是智能体外部的一切;轨迹 $\tau^t$ 记录思维—行动—观察循环。进化机制 $\Omega$ 驱动状态转移 $S_{t+1}=\Omega(S_t,\tau^t)$,规定什么可进化、何时触发、如何产生变体、在哪里发生、如何评估质量。协同进化被严格定义为耦合的自进化:至少两个进化单元相互适应并持续重塑彼此的后续进化,形式化为存在 $x\neq y\in S_t$ 使 $x_{t+1}\neq x_t$、$y_{t+1}\neq y_t$,且 $x\leftrightarrow y$ 存在进化压力。在此之上提出三阶段渐进分类(图 2):阶段 1 Agent–Agent 协同进化固定环境、让智能体互相施压($A_{t+1},\Pi_{t+1}=\Omega(A_t,E,\tau^t)$);阶段 2 Agent–Environment 协同进化让环境也自适应($(A_{t+1},E_{t+1})=\Omega(A_t,E_t,\tau^t)$);阶段 3 元协同进化让进化机制本身通过自生成修订过程被修改($\Omega_{t+1}=\Gamma^t(S_t,\Omega_t,\tau^t)$,$S_{t+1}=\Omega_{t+1}(S_t,\tau^t)$)。从一阶段到下一阶段,人工设计的约束被逐步移除,进化自由边界逐级扩张。

本文的核心创新是把『进化自由的边界』作为组织文献的一级分类轴,而不是按技术类型或应用领域编排。每一阶段对应移除一层人类设计的约束:阶段 1 解冻对手——对手从静态变为可进化,如 GAN 的判别器、躲避猫鼠游戏、AlphaStar 的联盟训练;阶段 2 解冻环境——任务、反馈、交互空间随智能体行为而变,如 POET 共同进化环境—智能体种群、WebEvolver 共训网络世界模型;阶段 3 解冻进化规则本身——机制 $\Omega$ 成为自适应对象。与已有工作的本质区别在于对协同进化的严格界定:仅仅交换信息或交互不算协同进化,必须存在持久的、相互的重塑。尤其第三阶段被明确与孤立的元进化区分开——机制修订 $\Gamma^t$ 必须由下层共同进化生态系统的联合轨迹诱导产生,且修订后必须反过来改变该生态系统的后续进化条件;只改机制而不耦合下层生态的 PromptBreeder、哥德尔智能体等只能算前驱。论文进一步把元协同进化与开放式学习联系起来:机制持续更新($\Omega_{t+1}\neq\Omega_t$)保证连续新颖性,自适应能力无界($\lim_{t\to\infty}H(S_t,\Omega_t)=\infty$)保证无限分歧,这使元协同进化不只是又一个类别,而是从『设计规则下的适应』迈向『自我扩张系统』的一步。

方法步骤详情

三阶段的内部结构层层递进。阶段 1(Agent–Agent)分三支:对抗分支从成对压力扩展到多源压力——前者源自 GAN 与 RARL,经多智能体躲猫猫、猜词博弈 SPAG,到 LLM 安全领域的 ACE-Safety(MCTS 搜攻击)、AdvGRPO(稠密多通道奖励稳定联合 GRPO)、MAGIC(多轮攻防博弈)、TriPlay-RL(攻/防/评三角同训);后者以 AlphaStar 联赛训练(主智能体+exploiters+历史版本)为代表。协作分支分平行协作(MARS2 在共享搜索树上分摊测试奖励,CoMAS/MAPoRL 从讨论轨迹提取奖励,MAC-SPGG 用序列公共品博弈抑制搭便车,CORAL 靠共享记忆扩散经验)与角色分化协作(CORY 先锋—观察者定期换位,RL Tango/CoVerRL 从结果正确性或多数投票引导验证器进化,WaltzRL 联训对话与点评智能体);组织分支让角色与结构共同进化(R3DM 从行为发现角色,SkillMAS 联合更新技能与队伍结构,MetaAgent-X 联训工作流设计者与执行者)。阶段 2(Agent–Environment)按环境改变维度分三支:任务空间——从固定池按进度/后悔值选择任务,或生成式构造(把失败轨迹转成新任务、Socratic-SWE 从解题轨迹构建仓库修复任务);反馈空间——偏好驱动(PEBBLE/DAPPER/DUO)、结果驱动(RE-GoT/CURE 共进化奖励函数与单元测试)、一致性约束(ARCO/NLAC/ECHO);交互空间——POET/PAIRED/DEGen 演化可执行关卡,AI Economist 演化税制与社会规范,WebEvolver/COMAP/DreamGym 用世界模型替代真实环境。阶段 3(Meta)把机制 $\Omega$ 分解为五项自适应决策——what(进化什么)、when(失败/平台期/分布漂移触发)、how(训练/修订/结构编辑)、where(工具/网页/机器人,沙箱/仿真/真实)、how to evaluate(性能/新颖性/安全/鲁棒性)——并梳理前驱:PromptBreeder 进化变异提示词、哥德尔智能体与 HyperAgents 进化自我修改机制、MemEvolve 进化记忆架构、SIA 用轨迹反馈决定外壳或权重更新、RQGM 联合进化任务智能体与评估器并由元智能体引导后续进化,其中 RQGM 最接近完整的阶段 3 实现。

技术新颖性

技术新颖性体现在四个层面。第一,收录标准创新:这是第一篇以协同进化为唯一中心议题的综述,附录 A 用统一标准把协同进化与十余个相邻概念切开——多智能体交互可以只通信不改变;循环工程只管任务执行方式;进化优化只需评估与挑选候选、无需持久适应单元;持续学习的学习程序可以固定;自博弈中只有当前学习方改变也能成立;自进化允许任务与对手全部固定;元进化只改机制而不要求耦合下层生态;开放式学习是可能的结果而非进化形式。这些辨析使『协同进化』从模糊 buzzword 变成可操作的判定条件。第二,分类轴创新:以『什么被允许进化』而非技术或应用为轴,天然呈现研究的历时演进——图 3 时间线显示 2017–2020 是经典 RL 与博弈论自博弈,2024–2026 迎来 LLM 智能体浪潮,2025–2026 出现元进化萌芽。第三,证据综合创新:附录 C 设计了跨论文元分析方法——只在同骨干、同评估设置下比较静态与可进化对手,指标方向对齐、逐论文归一化后平均,避免了跨论文直接合并原始分数的陷阱。第四,问题提出创新:把动态评估、跨组件扩展与安全治理作为协同进化特有的开放挑战系统地提出,而非泛泛而谈。

The progressive taxonomy of co-evolution, which reflects an expanding boundary of evolutionary freedom.
Figure 2: The progressive taxonomy of co-evolution, which reflects an expanding boundary of evolutionary freedom.
Paper landscape of co-evolution in agentic systems.
Figure 3: Paper landscape of co-evolution in agentic systems.

实验结果

作为综述,本文的核心发现是综合性的而非新实验。发现一:协同进化普遍有效但存在收敛瓶颈。图 4 的跨论文元分析给出三组证据——Panel A 显示在匹配设置(同一骨干、同一评估)下,允许对手进化的条件在绝大多数设置中平均得分高于静态对手条件;Panel B 的气泡图以气泡面积表示各研究正改进设置的占比,整体占比很高,说明效应具有跨任务一致性;Panel C 把各论文随进化轮次的性能轨迹归一化后平均,发现增益在进化后期明显收窄、逼近平台期——这直接构成阶段 3 元协同进化的动机。发现二:领域正沿分类轴加速演进。图 3 时间线显示 2017–2020 只有经典 RL 前驱(GAN、RARL、AlphaStar、hide-and-seek、POET),2024–2026 LLM 智能体方法爆发(SPAG、MAGIC、ACE-Safety 等对抗安全,WebRL、SEAgent 等任务共进化,WebEvolver、DreamGym 等世界模型方法),2025–2026 才出现元层前驱(PromptBreeder、哥德尔智能体、MemEvolve、RQGM),阶段 3 目前仅有极少量完整实现。发现三:表 1 证实 9 篇相邻综述无一以协同进化为组织轴,本文是首个以之为中心的分类体系。发现四:作者识别出协同进化特有的失败模式——评估器被利用、伙伴过拟合、多样性坍缩——高任务成功率可能掩盖剥削性行为,因此评估需辅以历史交叉对弈、组件消融与留出评估器等过程级测试。

Comparison with surveys in adjacent areas. We retain each survey's original taxonomy and report where co-evolution appears in its organization.
Table 1: Comparison with surveys in adjacent areas. We retain each survey's original taxonomy and report where co-evolution appears in its organization.
Cross-paper evidence for the effect, consistency, and convergence of co-evolution. See Appendix C for data selection and aggregation details.
Figure 4: Cross-paper evidence for the effect, consistency, and convergence of co-evolution. See Appendix C for data selection and aggregation details.
查看结构化数据
任务指标本文基线提升
跨论文配对元分析:可进化对手 vs 静态对手(图 4 Panel A) 方向对齐后的归一化平均性能 可进化对手条件在绝大多数匹配设置中平均得分更高 冻结/静态对手条件(同骨干、同评估设置下的受控对照) 整体呈正效应;论文以逐论文归一化对比呈现,未给出跨论文统一数值
配对改进一致性(图 4 Panel B) 正改进评估设置占比(气泡面积) 各研究报告正改进的设置占比高,效应跨任务一致 同论文内的静态对照设置 多数设置正改进,支持协同进化普遍有效
进化收敛轨迹(图 4 Panel C) 归一化性能随进化轮次/训练检查点的变化 早期增益大,接近平台期后增益明显收窄 单实体自进化/局部共同进化回路 为阶段 3 元协同进化提供实证动机:需让进化机制本身可进化
与 9 篇相邻综述的覆盖对比(表 1) 协同进化是否为分类法核心组织轴 是:Agent–Agent / Agent–Environment / Meta 三阶段渐进分类 Gao 2026、Xiang 2026、Meng 2026 等 9 篇相邻综述 协同进化从零散例子或未来方向提升为中心收录标准与组织原则

局限与改进

作者承认的局限有两条。其一,元协同进化仍处早期:按其严格定义,目前只有极少量工作(如 RQGM)算得上完整阶段 3 实现,大部分讨论只能借用 PromptBreeder、哥德尔智能体等单实体元进化前驱,这些工作证明了机制可进化,却未把机制变化与下层共同进化系统耦合。其二,安全与治理未操作化:作者把评估器利用、伙伴过拟合、多样性坍缩列为协同进化特有的失败模式,把沙箱部署、持续监控、回滚、人工干预点列为治理需求,但都停留在 desiderata 层面,没有给出具体协议或工具。我的补充观察有三点。第一,图 4 的跨论文聚合在方法上有脆弱性:部分轨迹需从已发表图表近似数字化,再线性插值到统一进度网格、逐论文等权平均,样本异质性强,只能支持定性结论。第二,分类边界存在灰色地带:例如智能体生成的任务被归入环境进化(因为该智能体不是同一任务中的对等伙伴),这类判定在 LLM 时代会越来越难拿捏。第三,所引文献以 2025–2026 年 arXiv 预印本为主,同行评审状态参差,部分结论的时效稳定性有待检验。

独立分析的弱点

独立分析可指出四个弱点。第一,元分析证据强度有限:图 4 汇总各论文使用不同模型、基准与指标,从图表数字化加插值引入误差,且逐论文等权平均掩盖了强弱差异——改进方向是建立标准化的协同进化基准套件,统一『静态 vs 可进化对手』的对照协议,让效应量可直接比较。第二,定义的可操作性不足:判定『持久的、相互的重塑』往往依赖作者解释,例如单个模型同时扮演攻防两角是否算两个适应单元、智能体生成的任务何时算环境而非伙伴,都缺乏硬性测试——改进方向是给出可机械检查的判据,如更改是否跨运行持久、双方状态是否以对方轨迹为条件更新。第三,失败模式无检测指标:评估器利用、伙伴过拟合、多样性坍缩被点名但没有量化探测器——改进方向是设计交叉对弈矩阵熵、评估器迁移差距、行为多样性度量等可计算指标并纳入评估流程。第四,治理主张悬空:可审计、可中断、可回滚只有原则没有机制——改进方向是为机制变更建立类似账本的审计日志(何时、因何种轨迹、改动了五项决策中的哪项),并研究回滚到已验证状态的具体技术。

未来方向

作者明确提出的方向有三组。动态评估:现有基准只测最终能力(工具使用、网页浏览、软件工程、计算机操作、多智能体交互),PostTrainBench 迈出进化感知评估的第一步,但真正的协同进化评估必须判断所有组件是否都在进步、增益能否迁移到未见伙伴与环境、各组件对联合进步的贡献几何,并配合历史交叉对弈、组件消融与留出评估器等过程级测试。扩展协同进化:现有系统多为局部回路(攻防训练、策略—奖励适应、智能体—任务生成),未来要让智能体、外壳与环境同时变化,核心难题是决定哪些组件该变、更新如何相互影响、如何保持进化压力多产而非不稳定或被单组件支配。安全治理:沙箱化部署、持续监控、回滚到已验证状态、保留人工干预点,使日益自主的开放进化可审计可中断。在此基础上可延伸的方向包括:为协同进化建立稳定性理论(压力平衡、支配与循环支配的成立条件)、构建带未见伙伴迁移测试的标准基准、研究自发涌现通信协议与组织行为的安全性,以及把元协同进化应用于科学发现等长周期开放式任务。

复现评估

这是一篇综述,无需训练模型或运行实验,『复现』主要指检验其文献组织与元分析。可直接复用的资产很充足:图 3 的论文全景图按阶段与子类标注了上百篇论文的名称与发表时间,可作为研究地图;图 2 的三阶段分类法提供了对任何新工作快速归类的框架;附录 A 的概念辨析给出了判定协同进化的操作性标准。图 4 的构建细节在附录 C 中完整披露:仅在同骨干、同评估设置下纳入同时报告静态与可进化对手结果的论文,指标方向对齐后做逐论文归一化 $\hat{x}_t=(x_t-x_0)/(x_T-x_0)$、$\hat{y}_t=(y_t-y_0)/(\max_\tau y_\tau-y_0)$,线性插值到公共进度网格再逐论文等权平均。认真重做该元分析需要从原始图表数字化数据,工作量与难度均为中等。需要注意的是:所引大量 2026 年工作多为预印本,代码开源情况不一;论文自身不提供代码或数据集。总体而言,把分类法用于文献定位的门槛很低,复刻元分析为中等难度,在综述类工作中透明度较高。