← 返回 2026-08-13

基于技能与上下文支架协同进化的自演化具身智能体(SHAPER) Self-Evolving Embodied Agents via Skill-Harness Evolution

Peidong Wang, Zhiming Ma, Ying Chang, Xufang Luo, Xiaocui Yang, Shi Feng, Yuqing Yang, Dongsheng Li 📅 2026-08-11 👍 12 2026-08-18 18:30
LLM智能体系统 免训练适配 具身智能 机器人学习 自演化智能体

冻结模型参数,通过进化技能与上下文支架免训练适配具身智能体

前置知识

具身智能体系统分解

现代具身智能体很少是单一神经策略,通常由高层 VLM 规划器、底层执行器(VLA 模型或环境动作 API 封装)、提示词中的技能库与构造上下文的代码支架组成。规划器输出 $y_t$ 经执行器映射为动作 $a_t$,四者的组合才决定最终行为。

本文全部方法论建立在“冻结规划器与执行器、只优化技能与支架”这一分解之上,不理解该分解就无法理解 SHAPER 到底在优化什么。

VLA 模型(Vision-Language-Action)

把大规模视觉-语言预训练直接接到机器人控制的策略模型,如 RT-2、OpenVLA、Octo、π0 等,输入观察与语言指令或子目标,输出低层控制动作(常以动作块形式)。本文在 VLABench 中用官方微调的 π0 检查点经 OpenPI 服务作为执行器,接收文本子目标并按 5 步动作块执行。

SHAPER 把执行器视为冻结黑盒,理解 VLA 的输入输出形态(文本子目标到低层控制)是读懂实验设置与案例研究的前提。

Test-Time Scaling(测试时扩展)

不更新权重、靠推理时增加计算换性能的范式,典型做法包括多次采样后由验证器挑选(如 MG-Select)或轨迹投票(如 VOTE)。其代价随每次部署的采样量线性增长,收益依赖采样多样性。

TTS 是本文最重要的对照基线:实验显示在 VLABench 上采样聚合(MG-Select 21.38%、VOTE 22.00%)反而低于直接执行,凸显技能-支架进化是另一条价值路线。

文本梯度(Textual Gradient)

把环境交互的成败经验压缩成供 LLM 阅读的结论文本,替代反向传播的标量梯度,用于指导优化器修订提示词或代码工件。SHAPER 用回合级判定与回合总结器生成 $e^c(g)$,再与执行统计拼接为 $Γ(c)$,内含无益重复、指令漂移、解析错误等可执行改进模式。

文本梯度是 SHAPER 优化循环的信息载体,理解其构造(局部判定加非视觉元数据)才能明白方法为何能处理图像密集的具身轨迹。

束搜索与验证门控

保留 top-K 候选的启发式搜索:每轮由优化器从现有候选分支出新提案,先过沙箱验证(必须定义所需函数、禁 import、禁文件 I/O、限时),再在固定验证集按 $\hat{J}_{val}$ 打分,与旧候选合并后保留前 K。本文配置为 4 轮、宽度 3、分支因子 2。

束搜索加验证门控是 SHAPER 防止进化跑偏的机制,理解它才能明白为何仅凭 15 条训练回合也能稳定优化而不崩溃。

研究动机

当前具身智能体围绕基础模型构建,性能不仅取决于模型权重,还取决于外层的技能、上下文构造、动作接口与执行封装。主流适配手段是更新参数:SFT 与 RL 后训练需要模型权重访问权、任务示教或奖励信号以及额外训练轮次,论文在 VLABench 上的对照直接暴露了代价:仅用 15 条训练回合对 π0 执行器做同数据 SFT,成功率只从 23.25% 提到 24.00%,几乎无收益。另一条路测试时扩展同样不理想:VLA+MG-Select 仅 21.38%、VLA+VOTE 仅 22.00%,均低于不做任何扩展的直接执行,叠加到种子智能体上也只有 24.38%/23.50%,低于不加扩展的种子。而免训练的 code-as-action 路线(如 Code as Policies)依赖可编程机器人 API、调试钩子与执行监视器,在动作接口固定或受限的真实系统中往往不可用,形成“参数更新代价高、免训练方法不适用”的两难。

本文的目标是论文要回答的问题是:当一个强大的冻结具身智能体无法或不值得做参数更新时,如何仅通过模型外部的非参数组件把它适配到目标环境。具体而言,SHAPER 把智能体系统分解为冻结的 VLM 规划器 $M_\theta$、冻结的执行器 $A_\phi$ 与两个可优化文本工件——可复用技能 $s$(提示词中的程序性指导)和上下文代码支架 $h$(构造规划器上下文的 Python 函数),只优化 $c=(s,h)$,以最大化期望回报 $J(s,h)=\mathbb{E}_{g\sim\mathcal{D}}\,R(\tau^{(s,h)}(g))$,其中 $R\in[0,1]$ 为任务级成功信号。同时要求方法与底层动作接口解耦:在 VLABench 上对接 π0 VLA 执行器、在 ESI-Bench 上对接基准固定的动作 API 均可工作,且进化成本压到个位数美元(实测约 2.25 与 2.83 美元)。

与已有工作不同的是,已有免训练自演化工作的优化对象都只覆盖一半:SkillOpt 与 EmbodiSkill 只进化自然语言技能而保持执行支架固定;AutoHarness 只从环境反馈合成代码支架甚至完整代码策略,但局限于文本游戏且不共优化过程性指导;AgentSpec 只把具身支架表示为可组合类型用于受控分析。另一边,code-as-action 路线假设智能体能生成并调试调用机器人 API 的程序,这在固定动作空间中不成立。SHAPER 的独特切入是“技能+支架”联合优化:用同一次环境交互产生的文本反馈,同时修订提示词层面的技能与构造上下文的 Python 支架,让过程性知识与上下文工程协同适配,既不触碰模型权重,也不要求可编程底层 API。

核心方法

直觉上,具身智能体的失败很少只因模型不够强,更多来自“给模型看什么、让模型知道什么”这两件外部小事。SHAPER 把智能体分解为四个组件:冻结 VLM 规划器 $M_\theta$、冻结执行器 $A_\phi$、文本技能 $s$(提示词中的程序性指导,覆盖场景检查、任务分解、失败恢复与终止判断)与上下文代码支架 $h$(形如 build_context 的 Python 函数,决定哪些观察、历史动作与反馈进入规划器以及如何组织)。对指令 $g$ 与观察 $o_t$,智能体按 $y_t \sim M_\theta(\cdot\mid g,o_t,s,h(\tau_{<t}))$、$a_t=A_\phi(y_t,o_t)$ 运行,$\theta,\phi$ 全程冻结,只优化 $c=(s,h)$:在目标环境小批量 rollout 得到轨迹 $\tau^c(g)=(o_0,y_0,a_0,\ldots,o_T,R)$,把成败经验压缩为文本梯度,驱动束搜索进化。同一冻结模型复用为两个角色:交互时是规划器,进化时在单独提示词下充当工件优化器。

核心创新在于重新定义“适应改变的是什么”:SFT/RL 通过反向传播把示教或奖励写进权重,SHAPER 则把少量目标环境轨迹与结局转写为对技能 $s$ 和支架 $h$ 的文本修订,参数零更新。技术上由三个咬合的设计支撑。其一是分层非视觉诊断:具身 rollout 含大量前后帧图像,直接做批量级诊断会淹没上下文且难定位致错动作,SHAPER 先做回合级判定 $q_t^c(g)=\text{Judge}(o_t,y_t,a_t,o_{t+1})$,只对比动作前后局部观察,再由回合总结器结合命令、执行长度、运行错误等非视觉元数据 $m^c(g)$ 生成 $e^c(g)$,拼成文本梯度 $\Gamma(c)$。其二是两阶段调度:先固定种子支架只进化技能,再固定选出的技能只进化支架,避免两个工件同时漂移。其三是沙箱门控束搜索:无效支架直接拒绝并把报错回灌给优化器,验证集得分 $\hat{J}_{val}$ 决定 top-K 存活。

方法步骤详情

第一步,初始化:由种子技能 $s_0$ 与支架 $h_0$ 形成候选 $c_0$,维护宽度 3 的束。第二步,rollout:每轮把候选放到训练批(VLABench 15 回合、ESI-Bench 10 题)执行,记录动作、观察与奖励 $R\in[0,1]$。第三步,诊断:回合级判定 $q_t=\text{Judge}(o_t,y_t,a_t,o_{t+1})$ 识别错误子目标与执行器失配;总结器融合非视觉元数据与结局得 $e(g)$,拼接为文本梯度 $\Gamma$,暴露无益重复与解析错误。第四步,提案:优化器生成 $c'\sim O(c,\Gamma,L_{<r})$,先固定支架进化技能,再固定技能进化支架。第五步,沙箱验证:支架须定义所需上下文函数,禁 import、文件 I/O 与动态执行并限时,违规连同报错淘汰。第六步,束更新:在验证集(VLABench 24 回合、ESI-Bench 10 题)估计 $\hat{J}_{val}$,按 TopK 保留前 K;共 4 轮、分支因子 2、小批量 4,输出最高分 $c^\star$。

技术新颖性

与最接近的工作相比,新颖性体现在四个层面。第一,优化对象的完整性:SkillOpt/EmbodiSkill 只改技能、AutoHarness 只改支架(且在文本游戏里),SHAPER 首次在具身环境中用环境反馈联合进化“技能+上下文支架”这一对互补工件,并实证两者效果不可加——VLABench 上仅技能 33.50%、仅支架 30.50%、联合 34.50%,种子 28.25%。第二,模型角色的复用方式:同一冻结 VLM 靠提示词切换既做规划器又做优化器,零额外参数。第三,面向具身的诊断设计:回合级 Judge 只看动作前后局部观察,绕开图像轰炸,天然适配视觉密集的具身轨迹。第四,接口无关性:不依赖可编程机器人 API,在 VLA 执行器与固定动作接口两种底层上均验证有效,使方法可用于接口封闭的真实系统。

Overview of SHAPER. (A) A textual skill and context-code harness condition a frozen planner connected to a frozen executor. (B) Target-environment rollouts are diagnosed at the round and episode levels to form a textual gradient. (C) A frozen optimizer evolves the skill and then the harness, with sandboxed validation and top-K selection.
Figure 2: Overview of SHAPER. (A) A textual skill and context-code harness condition a frozen planner connected to a frozen executor. (B) Target-environment rollouts are diagnosed at the round and episode levels to form a textual gradient. (C) A frozen optimizer evolves the skill and then the harness, with sandboxed validation and top-K selection.

实验结果

VLABench(800 回合):直接 VLA 23.25%、同数据 SFT 24.00%;测试时扩展失效(MG-Select 21.38%、VOTE 22.00%),低于不加扩展的种子 28.25%。SHAPER 达 34.50%,比种子高 6.25 个百分点;消融为仅技能/仅支架 33.50%/30.50%。C1(同分布)42.5%(+2.5)、C2(未见类别)26.0%(+6.0)、C3(换任务形式)50.0%(+10.0)、C4(双移)19.5%(+6.5)。ESI-Bench(231 题):微平均 32.5%→49.8%(+17.3),宏平均 31.2%→42.9%(+11.7),超过 GPT-5 PS 参考 40.3%;镜面反射 10.0%→60.0%、空间关系 27.5%→54.9%、感知落地 53.1%→69.4%,枚举感知与动作排序回退(40.0%→20.0%,仅 5 题)。案例:取书任务中进化技能检测“无进展”切换命令,奖励 0.5→1.0;镜面罐任务进化支架保留反射关键帧,0.90 置信度答对,基线答“不确定”。进化一次性成本约 2.25/2.83 美元。

VLABench split design
Table 1: VLABench split design
VLABench success rates (%) on four 200-episode splits; best results are bolded.
Table 2: VLABench success rates (%) on four 200-episode splits; best results are bolded.
ESI-Bench accuracy (%) on the official-proportion 231-question subset. n denotes the number of evaluated questions. GPT-5 PS is the published Passive Single-view result on the full evaluation set.
Table 3: ESI-Bench accuracy (%) on the official-proportion 231-question subset. n denotes the number of evaluated questions. GPT-5 PS is the published Passive Single-view result on the full evaluation set.
Controlled VLABench case isolating skill evolution for the instruction “Fetch the Landmark Cases in Property Law book for tomorrow's class.” The planner, VLA executor, and raw harness are fixed. The seed skill repeats a retrieval command after partial execution, whereas the evolved skill detects no progress, changes the command, and completes retrieval.
Figure 3: Controlled VLABench case isolating skill evolution for the instruction “Fetch the Landmark Cases in Property Law book for tomorrow's class.” The planner, VLA executor, and raw harness are fixed. The seed skill repeats a retrieval command after partial execution, whereas the evolved skill detects no progress, changes the command, and completes retrieval.
ESI-Bench case isolating harness evolution for the instruction “You are given an image with a mirror and three noodle_jars. Based on the mirror reflection, which of the three noodle_jars in the same image corresponds to the reflected one: the left, middle, or right object?” The planner, action interface, and evolved skill are fixed. The raw harness drops the early reflection evidence, whereas the evolved harness retains the reflected target and a deterministic focus crop for cross-view matching.
Figure 4: ESI-Bench case isolating harness evolution for the instruction “You are given an image with a mirror and three noodle_jars. Based on the mirror reflection, which of the three noodle_jars in the same image corresponds to the reflected one: the left, middle, or right object?” The planner, action interface, and evolved skill are fixed. The raw harness drops the early reflection evidence, whereas the evolved harness retains the reflected target and a deterministic focus crop for cross-view matching.
查看结构化数据
任务指标本文基线提升
VLABench 具身操作(语义理解+常识,4 个 200 回合 held-out 切分) 任务成功率 (%) SHAPER 34.50% Seed Agent 28.25%;同数据 SFT 24.00%;VLA+VOTE 22.00% 对种子 +6.25 个百分点,对 SFT +10.50 个百分点
ESI-Bench 具身空间智能(官方比例 231 题子集) 微平均 / 宏平均准确率 (%) SHAPER 49.8 / 42.9 Seed Agent 32.5 / 31.2;仅技能进化 41.1 / 38.6;GPT-5 PS 宏平均 40.3(外部参考) 对种子微平均 +17.3、宏平均 +11.7 个百分点,宏平均超过 GPT-5 参考值 2.6 点
VLABench 工件消融(仅技能 / 仅支架进化) 任务成功率 (%) Skill Evolution 33.50;Harness Evolution 30.50 Seed Agent 28.25 分别 +5.25 与 +2.25 个百分点,联合进化达 34.50%(效果不可加)

局限与改进

作者明确承认两项局限:进化出的技能与支架尚未验证跨具身形态迁移,也缺少真实机器人实验,所有结论来自 VLABench 与 ESI-Bench 仿真。此外可见的局限还包括:其一,束搜索选择完全依赖任务级奖励 $R$,奖励稀疏或带噪的任务会削弱选择信号;其二,验证集极小(VLABench 24 回合、ESI-Bench 10 题),工件可能过拟合这批任务分布,作者自己也指出各配置效果不可加、应视为完整智能体配置而非独立效应估计;其三,GPT-5 参照是外部非配对比较(对方用完整评测集、本文用 231 题子集),只能作参考;其四,部分类别回退(枚举感知 -5.5、动作排序 -20.0 点)且进化过程中没有机制检测并阻止类别级退化;其五,规划器只有 Qwen3.6-27B 一个规模,技能-支架进化的收益随模型能力如何缩放未知;其六,回合与步数预算(10 回合/400 步、ESI 30 步)为人工设定,进化并不优化这些超参。

独立分析的弱点

独立分析若干弱点。第一,进化信号过弱:整条流水线只有标量奖励 $R$ 参与束排序,若环境只给稀疏成败(真实机器人常见),top-K 选择近似随机游走;改进方向是引入过程奖励或让 Judge 给回合打部分分参与选择。第二,小验证集过拟合风险:24 回合/10 题的验证集方差很大,选出的工件可能是验证集特定的;改进方向是交叉验证式多验证批或按类别分层评估后再入束。第三,无类别级保护:ESI-Bench 上枚举感知从 33.3% 跌到 27.8%,说明全局文本梯度会为多数类牺牲少数类;改进方向是维护每类别最优工件,或让优化器显式看到分类别回归警告。第四,优化器与规划器同源,可能继承同一模型的认知盲区——镜像推理本身弱时难以进化出正确的反射任务策略;改进方向是允许异构或更强的优化器模型。第五,技能与支架的作用不可加且含交互效应(仅支架把 C3 从 40.0% 提到 46.0%,联合也只 50.0%),缺乏何时该进化哪个工件的理论解释;改进方向是更系统的归因实验或引入元控制器决定进化顺序。第六,400 步预算固定,部分收益可能来自“更早止损低胜率回合”式隐性策略,需与同预算约束的基线再对照。

未来方向

作者提出的方向包括跨具身形态迁移与真实机器人验证,即检验进化出的技能/支架能否从仿真 VLA 执行器迁移到不同本体的实物平台。基于本文成果还可延伸:其一,把标量奖励替换为更丰富的过程性文本奖励,使方法适用于稀疏奖励的真实任务;其二,在线持续进化——部署期间用生产流量滚动进化并按环境漂移更新工件,配合回归检测防止灾难性遗忘;其三,扩展工件空间,把记忆库、自验证器、多候选采样策略也纳入共进化,与测试时扩展正交组合;其四,研究技能-支架交互效应,用元学习或 LLM 元控制器自动决定两阶段顺序与轮次预算;其五,跨任务复用:在多任务族上进化可组合技能库,检验技能在新任务形式(如 C3 式迁移)上的零样本复用边界;其六,把文本梯度思想推广到多智能体系统,让规划器-执行器分工本身也可被进化。

复现评估

复现门槛中等偏低,数据与协议均公开。基准为公开的 VLABench(可用官方 π0 检查点经 OpenPI 服务为执行器)与 ESI-Bench(按官方类别比例采样的 231 题子集),规划器为冻结的 Qwen3.6-27B。论文给出完整优化协议:VLABench 15 训练回合+24 验证回合、ESI-Bench 10+10 题,4 轮束搜索、宽度 3、分支因子 2、诊断小批量 4,全部与 800/231 题评测集不相交;沙箱约束(禁 import、禁文件 I/O、禁动态执行、限时)用常规 Python 沙箱即可实现。算力上以推理为主,无需训练 GPU 集群,主要成本是 VLABench 仿真与 π0 推理服务;API 等价成本每次进化约 2.25/2.83 美元。注意两点:正文未提及代码开源,judger/summarizer/optimizer 的完整提示词模板未附,需自行实现;C1–C4 是作者自定义切分而非官方划分,精确对表需按其描述重建切分。