基于技能与上下文支架协同进化的自演化具身智能体(SHAPER) Self-Evolving Embodied Agents via Skill-Harness Evolution
冻结模型参数,通过进化技能与上下文支架免训练适配具身智能体
前置知识
具身智能体系统分解
现代具身智能体很少是单一神经策略,通常由高层 VLM 规划器、底层执行器(VLA 模型或环境动作 API 封装)、提示词中的技能库与构造上下文的代码支架组成。规划器输出 $y_t$ 经执行器映射为动作 $a_t$,四者的组合才决定最终行为。
本文全部方法论建立在“冻结规划器与执行器、只优化技能与支架”这一分解之上,不理解该分解就无法理解 SHAPER 到底在优化什么。
VLA 模型(Vision-Language-Action)
把大规模视觉-语言预训练直接接到机器人控制的策略模型,如 RT-2、OpenVLA、Octo、π0 等,输入观察与语言指令或子目标,输出低层控制动作(常以动作块形式)。本文在 VLABench 中用官方微调的 π0 检查点经 OpenPI 服务作为执行器,接收文本子目标并按 5 步动作块执行。
SHAPER 把执行器视为冻结黑盒,理解 VLA 的输入输出形态(文本子目标到低层控制)是读懂实验设置与案例研究的前提。
Test-Time Scaling(测试时扩展)
不更新权重、靠推理时增加计算换性能的范式,典型做法包括多次采样后由验证器挑选(如 MG-Select)或轨迹投票(如 VOTE)。其代价随每次部署的采样量线性增长,收益依赖采样多样性。
TTS 是本文最重要的对照基线:实验显示在 VLABench 上采样聚合(MG-Select 21.38%、VOTE 22.00%)反而低于直接执行,凸显技能-支架进化是另一条价值路线。
文本梯度(Textual Gradient)
把环境交互的成败经验压缩成供 LLM 阅读的结论文本,替代反向传播的标量梯度,用于指导优化器修订提示词或代码工件。SHAPER 用回合级判定与回合总结器生成 $e^c(g)$,再与执行统计拼接为 $Γ(c)$,内含无益重复、指令漂移、解析错误等可执行改进模式。
文本梯度是 SHAPER 优化循环的信息载体,理解其构造(局部判定加非视觉元数据)才能明白方法为何能处理图像密集的具身轨迹。
束搜索与验证门控
保留 top-K 候选的启发式搜索:每轮由优化器从现有候选分支出新提案,先过沙箱验证(必须定义所需函数、禁 import、禁文件 I/O、限时),再在固定验证集按 $\hat{J}_{val}$ 打分,与旧候选合并后保留前 K。本文配置为 4 轮、宽度 3、分支因子 2。
束搜索加验证门控是 SHAPER 防止进化跑偏的机制,理解它才能明白为何仅凭 15 条训练回合也能稳定优化而不崩溃。
研究动机
当前具身智能体围绕基础模型构建,性能不仅取决于模型权重,还取决于外层的技能、上下文构造、动作接口与执行封装。主流适配手段是更新参数:SFT 与 RL 后训练需要模型权重访问权、任务示教或奖励信号以及额外训练轮次,论文在 VLABench 上的对照直接暴露了代价:仅用 15 条训练回合对 π0 执行器做同数据 SFT,成功率只从 23.25% 提到 24.00%,几乎无收益。另一条路测试时扩展同样不理想:VLA+MG-Select 仅 21.38%、VLA+VOTE 仅 22.00%,均低于不做任何扩展的直接执行,叠加到种子智能体上也只有 24.38%/23.50%,低于不加扩展的种子。而免训练的 code-as-action 路线(如 Code as Policies)依赖可编程机器人 API、调试钩子与执行监视器,在动作接口固定或受限的真实系统中往往不可用,形成“参数更新代价高、免训练方法不适用”的两难。
本文的目标是论文要回答的问题是:当一个强大的冻结具身智能体无法或不值得做参数更新时,如何仅通过模型外部的非参数组件把它适配到目标环境。具体而言,SHAPER 把智能体系统分解为冻结的 VLM 规划器 $M_\theta$、冻结的执行器 $A_\phi$ 与两个可优化文本工件——可复用技能 $s$(提示词中的程序性指导)和上下文代码支架 $h$(构造规划器上下文的 Python 函数),只优化 $c=(s,h)$,以最大化期望回报 $J(s,h)=\mathbb{E}_{g\sim\mathcal{D}}\,R(\tau^{(s,h)}(g))$,其中 $R\in[0,1]$ 为任务级成功信号。同时要求方法与底层动作接口解耦:在 VLABench 上对接 π0 VLA 执行器、在 ESI-Bench 上对接基准固定的动作 API 均可工作,且进化成本压到个位数美元(实测约 2.25 与 2.83 美元)。
与已有工作不同的是,已有免训练自演化工作的优化对象都只覆盖一半:SkillOpt 与 EmbodiSkill 只进化自然语言技能而保持执行支架固定;AutoHarness 只从环境反馈合成代码支架甚至完整代码策略,但局限于文本游戏且不共优化过程性指导;AgentSpec 只把具身支架表示为可组合类型用于受控分析。另一边,code-as-action 路线假设智能体能生成并调试调用机器人 API 的程序,这在固定动作空间中不成立。SHAPER 的独特切入是“技能+支架”联合优化:用同一次环境交互产生的文本反馈,同时修订提示词层面的技能与构造上下文的 Python 支架,让过程性知识与上下文工程协同适配,既不触碰模型权重,也不要求可编程底层 API。
核心方法
直觉上,具身智能体的失败很少只因模型不够强,更多来自“给模型看什么、让模型知道什么”这两件外部小事。SHAPER 把智能体分解为四个组件:冻结 VLM 规划器 $M_\theta$、冻结执行器 $A_\phi$、文本技能 $s$(提示词中的程序性指导,覆盖场景检查、任务分解、失败恢复与终止判断)与上下文代码支架 $h$(形如 build_context 的 Python 函数,决定哪些观察、历史动作与反馈进入规划器以及如何组织)。对指令 $g$ 与观察 $o_t$,智能体按 $y_t \sim M_\theta(\cdot\mid g,o_t,s,h(\tau_{<t}))$、$a_t=A_\phi(y_t,o_t)$ 运行,$\theta,\phi$ 全程冻结,只优化 $c=(s,h)$:在目标环境小批量 rollout 得到轨迹 $\tau^c(g)=(o_0,y_0,a_0,\ldots,o_T,R)$,把成败经验压缩为文本梯度,驱动束搜索进化。同一冻结模型复用为两个角色:交互时是规划器,进化时在单独提示词下充当工件优化器。
核心创新在于重新定义“适应改变的是什么”:SFT/RL 通过反向传播把示教或奖励写进权重,SHAPER 则把少量目标环境轨迹与结局转写为对技能 $s$ 和支架 $h$ 的文本修订,参数零更新。技术上由三个咬合的设计支撑。其一是分层非视觉诊断:具身 rollout 含大量前后帧图像,直接做批量级诊断会淹没上下文且难定位致错动作,SHAPER 先做回合级判定 $q_t^c(g)=\text{Judge}(o_t,y_t,a_t,o_{t+1})$,只对比动作前后局部观察,再由回合总结器结合命令、执行长度、运行错误等非视觉元数据 $m^c(g)$ 生成 $e^c(g)$,拼成文本梯度 $\Gamma(c)$。其二是两阶段调度:先固定种子支架只进化技能,再固定选出的技能只进化支架,避免两个工件同时漂移。其三是沙箱门控束搜索:无效支架直接拒绝并把报错回灌给优化器,验证集得分 $\hat{J}_{val}$ 决定 top-K 存活。
方法步骤详情
第一步,初始化:由种子技能 $s_0$ 与支架 $h_0$ 形成候选 $c_0$,维护宽度 3 的束。第二步,rollout:每轮把候选放到训练批(VLABench 15 回合、ESI-Bench 10 题)执行,记录动作、观察与奖励 $R\in[0,1]$。第三步,诊断:回合级判定 $q_t=\text{Judge}(o_t,y_t,a_t,o_{t+1})$ 识别错误子目标与执行器失配;总结器融合非视觉元数据与结局得 $e(g)$,拼接为文本梯度 $\Gamma$,暴露无益重复与解析错误。第四步,提案:优化器生成 $c'\sim O(c,\Gamma,L_{<r})$,先固定支架进化技能,再固定技能进化支架。第五步,沙箱验证:支架须定义所需上下文函数,禁 import、文件 I/O 与动态执行并限时,违规连同报错淘汰。第六步,束更新:在验证集(VLABench 24 回合、ESI-Bench 10 题)估计 $\hat{J}_{val}$,按 TopK 保留前 K;共 4 轮、分支因子 2、小批量 4,输出最高分 $c^\star$。
技术新颖性
与最接近的工作相比,新颖性体现在四个层面。第一,优化对象的完整性:SkillOpt/EmbodiSkill 只改技能、AutoHarness 只改支架(且在文本游戏里),SHAPER 首次在具身环境中用环境反馈联合进化“技能+上下文支架”这一对互补工件,并实证两者效果不可加——VLABench 上仅技能 33.50%、仅支架 30.50%、联合 34.50%,种子 28.25%。第二,模型角色的复用方式:同一冻结 VLM 靠提示词切换既做规划器又做优化器,零额外参数。第三,面向具身的诊断设计:回合级 Judge 只看动作前后局部观察,绕开图像轰炸,天然适配视觉密集的具身轨迹。第四,接口无关性:不依赖可编程机器人 API,在 VLA 执行器与固定动作接口两种底层上均验证有效,使方法可用于接口封闭的真实系统。
实验结果
VLABench(800 回合):直接 VLA 23.25%、同数据 SFT 24.00%;测试时扩展失效(MG-Select 21.38%、VOTE 22.00%),低于不加扩展的种子 28.25%。SHAPER 达 34.50%,比种子高 6.25 个百分点;消融为仅技能/仅支架 33.50%/30.50%。C1(同分布)42.5%(+2.5)、C2(未见类别)26.0%(+6.0)、C3(换任务形式)50.0%(+10.0)、C4(双移)19.5%(+6.5)。ESI-Bench(231 题):微平均 32.5%→49.8%(+17.3),宏平均 31.2%→42.9%(+11.7),超过 GPT-5 PS 参考 40.3%;镜面反射 10.0%→60.0%、空间关系 27.5%→54.9%、感知落地 53.1%→69.4%,枚举感知与动作排序回退(40.0%→20.0%,仅 5 题)。案例:取书任务中进化技能检测“无进展”切换命令,奖励 0.5→1.0;镜面罐任务进化支架保留反射关键帧,0.90 置信度答对,基线答“不确定”。进化一次性成本约 2.25/2.83 美元。
查看结构化数据
| 任务 | 指标 | 本文 | 基线 | 提升 |
|---|---|---|---|---|
| VLABench 具身操作(语义理解+常识,4 个 200 回合 held-out 切分) | 任务成功率 (%) | SHAPER 34.50% | Seed Agent 28.25%;同数据 SFT 24.00%;VLA+VOTE 22.00% | 对种子 +6.25 个百分点,对 SFT +10.50 个百分点 |
| ESI-Bench 具身空间智能(官方比例 231 题子集) | 微平均 / 宏平均准确率 (%) | SHAPER 49.8 / 42.9 | Seed Agent 32.5 / 31.2;仅技能进化 41.1 / 38.6;GPT-5 PS 宏平均 40.3(外部参考) | 对种子微平均 +17.3、宏平均 +11.7 个百分点,宏平均超过 GPT-5 参考值 2.6 点 |
| VLABench 工件消融(仅技能 / 仅支架进化) | 任务成功率 (%) | Skill Evolution 33.50;Harness Evolution 30.50 | Seed Agent 28.25 | 分别 +5.25 与 +2.25 个百分点,联合进化达 34.50%(效果不可加) |
局限与改进
作者明确承认两项局限:进化出的技能与支架尚未验证跨具身形态迁移,也缺少真实机器人实验,所有结论来自 VLABench 与 ESI-Bench 仿真。此外可见的局限还包括:其一,束搜索选择完全依赖任务级奖励 $R$,奖励稀疏或带噪的任务会削弱选择信号;其二,验证集极小(VLABench 24 回合、ESI-Bench 10 题),工件可能过拟合这批任务分布,作者自己也指出各配置效果不可加、应视为完整智能体配置而非独立效应估计;其三,GPT-5 参照是外部非配对比较(对方用完整评测集、本文用 231 题子集),只能作参考;其四,部分类别回退(枚举感知 -5.5、动作排序 -20.0 点)且进化过程中没有机制检测并阻止类别级退化;其五,规划器只有 Qwen3.6-27B 一个规模,技能-支架进化的收益随模型能力如何缩放未知;其六,回合与步数预算(10 回合/400 步、ESI 30 步)为人工设定,进化并不优化这些超参。
独立分析的弱点
独立分析若干弱点。第一,进化信号过弱:整条流水线只有标量奖励 $R$ 参与束排序,若环境只给稀疏成败(真实机器人常见),top-K 选择近似随机游走;改进方向是引入过程奖励或让 Judge 给回合打部分分参与选择。第二,小验证集过拟合风险:24 回合/10 题的验证集方差很大,选出的工件可能是验证集特定的;改进方向是交叉验证式多验证批或按类别分层评估后再入束。第三,无类别级保护:ESI-Bench 上枚举感知从 33.3% 跌到 27.8%,说明全局文本梯度会为多数类牺牲少数类;改进方向是维护每类别最优工件,或让优化器显式看到分类别回归警告。第四,优化器与规划器同源,可能继承同一模型的认知盲区——镜像推理本身弱时难以进化出正确的反射任务策略;改进方向是允许异构或更强的优化器模型。第五,技能与支架的作用不可加且含交互效应(仅支架把 C3 从 40.0% 提到 46.0%,联合也只 50.0%),缺乏何时该进化哪个工件的理论解释;改进方向是更系统的归因实验或引入元控制器决定进化顺序。第六,400 步预算固定,部分收益可能来自“更早止损低胜率回合”式隐性策略,需与同预算约束的基线再对照。
未来方向
作者提出的方向包括跨具身形态迁移与真实机器人验证,即检验进化出的技能/支架能否从仿真 VLA 执行器迁移到不同本体的实物平台。基于本文成果还可延伸:其一,把标量奖励替换为更丰富的过程性文本奖励,使方法适用于稀疏奖励的真实任务;其二,在线持续进化——部署期间用生产流量滚动进化并按环境漂移更新工件,配合回归检测防止灾难性遗忘;其三,扩展工件空间,把记忆库、自验证器、多候选采样策略也纳入共进化,与测试时扩展正交组合;其四,研究技能-支架交互效应,用元学习或 LLM 元控制器自动决定两阶段顺序与轮次预算;其五,跨任务复用:在多任务族上进化可组合技能库,检验技能在新任务形式(如 C3 式迁移)上的零样本复用边界;其六,把文本梯度思想推广到多智能体系统,让规划器-执行器分工本身也可被进化。
复现评估
复现门槛中等偏低,数据与协议均公开。基准为公开的 VLABench(可用官方 π0 检查点经 OpenPI 服务为执行器)与 ESI-Bench(按官方类别比例采样的 231 题子集),规划器为冻结的 Qwen3.6-27B。论文给出完整优化协议:VLABench 15 训练回合+24 验证回合、ESI-Bench 10+10 题,4 轮束搜索、宽度 3、分支因子 2、诊断小批量 4,全部与 800/231 题评测集不相交;沙箱约束(禁 import、禁文件 I/O、禁动态执行、限时)用常规 Python 沙箱即可实现。算力上以推理为主,无需训练 GPU 集群,主要成本是 VLABench 仿真与 π0 推理服务;API 等价成本每次进化约 2.25/2.83 美元。注意两点:正文未提及代码开源,judger/summarizer/optimizer 的完整提示词模板未附,需自行实现;C1–C4 是作者自定义切分而非官方划分,精确对表需按其描述重建切分。
论文图表
概念示意图:冻结的具身智能体(VLM 规划器加 VLA 或接口执行器)在少量目标环境 rollout 中积累经验,这些经验被分别转化为对可复用技能与上下文代码支架的修订,最终产出适配目标环境的更强智能体,全程不改模型参数。
一图看懂论文的问题设定与核心卖点:参数全冻结、只改模型外部工件、仅需少量交互即可完成适配,是读者进入方法细节前最好的总览。