← 返回 2026-08-20

Zetta ζ:面向自进化物理智能的高效闭环具身智能框架 Zetta ζ: An Efficient Closed-Loop Embodied Harness for Self-Evolving Physical Intelligence

Xin Ding, Liang Mi, Mingzhe Huang, Zixuan Wang, Chao Zhang, Zixu Hao, Fu Chen, Xiangyu Li, Yikai Zheng, Yaoyu Guo, Weijun Wang, Kun Li, Hao Wu, Yunxin Liu, Ting Cao 📅 2026-08-17 👍 145 2026-08-25 18:30
VLA 具身智能 推理基础设施 机器人操作 自进化Agent

冻结VLA策略,用自进化的代码Critic与恢复技能实现机器人闭环执行治理与持续提升

前置知识

VLA 模型(Vision-Language-Action)

视觉-语言-动作模型是端到端机器人策略:输入相机图像与自然语言指令,直接输出低层动作。代表如 $\pi_{0.5}$、GR00T N1.5,由 VLM 主干编码观察、动作专家以扩散或自回归方式解码动作。它们在大规模演示语料上训练,但推理时开环前馈,无法实时纠正打滑、碰撞等执行偏差。

本文核心设定是“冻结 VLA”($\nabla_\theta = 0$),所有提升都来自不改权重的 harness 层,理解 VLA 的开环脆弱性才能理解为何要外挂 Critic 做治理。

开环 vs 闭环执行(Harness 的核心矛盾)

开环指执行后不依环境反馈修正决策;闭环指持续监测机器人-环境状态并即时干预。论文指出现有具身 harness 实为开环:rollout 期间按固定技能或预规划轨迹执行,episode 结束才“反思”。物理交互的状态变化在毫秒级延迟预算内,大模型的秒级推理跟不上这个频率,事后反思无法治理正在发生的失败。

论文的问题定义、三循环的时间尺度划分、“高频代码 Critic + 固定 Orchestrator 裁决”的设计,全部围绕把开环的事后反思改造成动作频率的闭环治理。

Runtime Critic 与 Recovery Playbook

Runtime Critic 是代码实现的高频监控函数,扫描轨迹 $\tau_{0:t}$ 输出提案 $P_t = \langle e_t, \hat{\sigma}_t \rangle$($e_t$ 为可审计失败证据,$\hat{\sigma}_t$ 为建议模式);Recovery Playbook 是按失败机制索引的恢复策略库。二者与异构工具集 $\mathcal{T}$ 一起构成可进化的 harness $H$。

Critic 与恢复技能是本文“可学习的对象”——所有进化循环都在生产、验证和合并这两种代码技能,是读懂方法与 Aha 时刻的钥匙。

首个缺失里程碑 $m^*$ 与最早观测分叉 $t_{EOD}$

任务分解为有序里程碑序列 $M = \langle m_1, \ldots, m_{goal} \rangle$,$m^*$ 是轨迹中首个未观测到的里程碑,粗定位失败阶段;$t_{EOD}$ 是失败轨迹状态首次偏离成功参考分布 $I_{succ}$ 的时刻。两者把“整条轨迹失败”压缩为“何时、何阶段开始出错”,缩小诊断搜索空间。

失败聚类、medoid 种子选取和分层因果诊断都建立在这两个量之上,是理解 Phase I/II 进化管线的前提。

VLA 推理服务化(模型分区与量化)

$\pi_{0.5}$ 等 VLA 含 VLM 主干与动作专家两段,计算特性差异大。Z-Infra 将两段分进程部署、经 CUDA IPC 传激活,延迟降 53%、goodput 提 2.4×;再对前缀 MLP 做 W8A8 量化提速 1.18–1.32× 且成功率不降;配合动态批处理与异步调度服务突发异构请求。

环境是学习数据的来源,rollout 吞吐是自进化的限速器;Z-Infra 的 20.6× 吞吐提升与 11.1× 推理加速都来自这些系统技术。

LIBERO-Pro 与 RoboCasa 基准

两者都是基于 MuJoCo/robosuite 的操作仿真基准。LIBERO-Pro 加入指令重定向(T)与位置交换(S)扰动,用 $\pi_{0.5}$ 作基线;RoboCasa 含 18 个家庭原子任务,用 GR00T N1.5 作基线。协议:每任务 50 个开发种子进化,在严格隔离的 held-out 种子上报告最终成功率。

所有主实验数字(90.8%、93.6%、71.13% 等)都定义在这两个基准和该协议上,不清楚协议就无法判断结果含金量。

研究动机

物理智能的规模化目前沿两条路径推进,但都卡在“从演示到可靠执行”的鸿沟上。第一条是端到端策略模型(VLA/WAM):它们在 DROID、Open X-Embodiment 等大规模演示语料上训练,但具身数据稀缺,模型对真实部署中的分布漂移十分脆弱——推理时是开环前馈的,无法实时感知物体打滑、轻微碰撞等执行偏差,小扰动会级联成整个任务失败。第二条是用 LLM 具身 Agent 编排策略模型、代码与工具,希望从环境自探索中学习;但论文尖锐地指出这些 harness 实际上并未实现这种学习:执行开始后,Agent 不再根据不断变化的机器人-环境状态调整决策,而是按固定技能或预规划轨迹走完全程,直到 episode 结束才做事后反思。物理交互要求决策在毫秒级延迟预算内耦合当前状态,今天的大型 Agent 模型在真实系统里根本达不到这个频率。事后反思还有三个固有缺陷:无法在线试验替代动作来验证反思是否正确;对整条轨迹做 credit assignment 困难;回溯分析往往拿不到失败瞬间的精确状态。结果是总结出的经验难以复用、难以适应变化的真实世界动态。

本文的目标是本文的目标是构建一个闭环的具身 harness,在保持基础策略模型完全冻结($\nabla_\theta = 0$)的前提下,让运行时 Critic 与恢复技能随 rollout 经验在线自进化,使任务成功率随自探索经验持续提升。具体拆成三个可验证的子目标:其一,实现动作频率的闭环治理,让系统能在物理执行展开的过程中(而非结束后)发现并干预失败;其二,把每次 rollout 的失败经验转化为经过验证、可复用、可跨任务零样本迁移的代码化 Critic 与恢复技能,形成类似 SGD 的有界稳定的代码空间优化过程;其三,解决 rollout 吞吐这个“智能规模化的限速器”——环境是学习数据的唯一来源,更快的 rollout 意味着更快的进化,因此还需构建首个专门面向自进化具身 Agent 的 rollout 基础设施 Z-Infra,把 agent 逻辑与异构硬件资源解耦。

与已有工作不同的是,本文的独特切入角度有三点。第一,治理与学习按频率彻底分离:高频治理交给毫秒级、以纯代码实现的轻量 Critic(而非昂贵的大模型),低频学习交给离线进化的 Agent——在线 rollout 只跑冻结 VLA 加轻量 Critic,大模型仅在离线“反思与进化”阶段介入,这直接化解了“大模型跟不上物理频率”与“诊断需要大模型智能”的矛盾。第二,学习对象从模型权重转向可审计的代码技能:harness $H = \{C, R, \mathcal{T}\}$ 中的 Critic、恢复手册和工具都是显式代码,可版本化、可验证、可零样本迁移,绕开了具身数据稀缺下的策略微调困境。第三,把进化形式化为带验证门控的优化过程:只有同时通过历史回归(原失败簇 100% 修复)和 held-out 泛化评估的候选技能才被并入技能库,用有界更新避免“过拟合式修复”破坏基础策略的语义泛化能力。这与 Reflexion、Voyager 等 episode 级反思范式形成本质区隔。

核心方法

直觉上,Zetta 给一个冻结的 VLA 配了一位“随船安全员”和一本会自动增厚的“急救手册”:代码 Critic 以超过策略推理的频率盯着执行状态,一发现抓取丢失、接触异常等苗头就提交带证据的提案;固定的 Orchestrator Agent $A_{orch}$ 审核证据后批准切换到恢复技能,恢复完成且物理状态稳定后再把控制权交还 VLA 继续原任务。技术上,最终执行模式由裁决函数 $\sigma_t = A_{orch}(P_t, R, \mathcal{T}, K)$ 决定($\sigma_t = 0$ 表示继续用 VLA,$\sigma_t > 0$ 表示调用专用工具),$K$ 是含里程碑与成功准则的任务知识。自进化由三个时间尺度分离的循环驱动:Loop 1 在动作频率执行已学会的 Critic 并按需触发恢复;Loop 2 在每批 rollout 后聚类失败、做因果诊断、提出候选 Critic 与恢复;Loop 3 只把通过验证门控的候选并入技能记忆。第一个循环实现闭环执行,后两个实现自进化;底层由 Z-Infra 提供跨异构 CPU/GPU 资源的高吞吐并行 rollout。

核心创新是“可进化的代码 Critic 作为闭环治理载体”,与已有方法的本质区别有三。其一,治理频率:已有具身 Agent 的反思在 episode/轨迹层面,本文把治理下沉到动作频率——Critic 持续扫描轨迹生成结构化提案 $P_t = \langle e_t, \hat{\sigma}_t \rangle$,干预必须以通过验证的证据经 Orchestrator 批准为前提,是证据驱动的裁决而非盲目触发。其二,技能形态:已有技能学习要么改模型权重、要么存自然语言经验,本文技能是纯代码——论文坦承代码没有梯度,因此借鉴 SkillOpt 与 EmbodiSkill 构造 SGD 式代码空间优化:失败聚类相当于小批量、候选修复相当于更新量、验证门控充当接受准则,保证更新有界、可审计、可版本回滚。其三,修复位置:分层因果诊断强制“高层逻辑能解决的绝不改低层参数”的最小干预,保护冻结策略的语义泛化;VLA 重入契约 $\Psi(s_t) = \mathbb{1}(\text{FailureCleared}) \wedge \mathbb{1}(\text{Stability}(s_t) > \gamma)$ 确保只在失败证据清除且接触力学稳定后才交还控制,防止恢复引发二次失败。

方法步骤详情

进化分三阶段循环。Phase I(失败画像):在开发种子集上大规模采样冻结策略,采用确定性路由与有效性判定(基础设施失败强制原种子重跑);每条轨迹记录多模态序列 $\tau = \{(s_t, a_t, \mu_t, \phi_t)\}$($\mu_t$ 为里程碑完成状态,$\phi_t$ 为碰撞等物理信号),成功轨迹汇成参考索引 $I_{succ}$,失败轨迹写入清单并计算首个缺失里程碑 $m^*$ 定位阶段。Phase II 阶段一:按最早观测分叉 $t_{EOD}$ 把失败种子聚簇、每簇选 medoid 种子,遵守单视角锚定协议,自顶向下遍历六层 $\{L_{eval}, L_{crit}, L_{state}, L_{plan}, L_{recv}, L_{param}\}$ 找根因层 $L^*$;阶段二:修复 Agent 实例化最小补丁($C^*, R^*, \mathcal{T}^*$)并嵌入重入契约 $\Psi(s_t)$,经“诊断回放 + 全新 rollout”两步验证。Phase III:把补丁合并为版本化 harness 包 $H_{merged}$——Critic 触发条件取逻辑或、恢复手册抽象形态变化、工具集纳入新合成技能,打包为 SKILL.md/tools/plans/params;最后须通过原失败簇 100% 历史回归 + 严格隔离 held-out 集上的成功率增量 $\Delta SR$,若 held-out 暴露新失败机制则该种子降级为开发种子并换新 held-out 集重验。

技术新颖性

新颖性体现在四方面。其一,时间尺度架构:现有自进化 Agent(Reflexion、Voyager 等)工作在 episode 级且限于数字域,本文首个把学习拆解为动作频率(治理)、rollout 批次(提案)、进化迭代(门控合并)三个耦合循环,并声称首次实现通过可学习代码 Critic 的自进化具身 Agent。其二,无梯度优化的工程化:明确承认代码技能无梯度,显式构造带接受准则的有界更新而非含糊的“自我改进”叙事,使进化可审计、可版本管理、可回滚。其三,验证协议:历史回归 100% + held-out 增量 + 失败种子强制降级换新 held-out 的动态转换协议,直接针对 LLM Agent 研究中“在开发集上自我报告改进”的通病。其四,系统层面:Z-Infra 是首个面向自进化具身 Agent 的 rollout 基础设施,与 IMPALA/SEED RL 等 RL 系统不同,它需同时服务 VLA 推理、感知模型、MuJoCo 仿真与毫秒级工具调用;通过 worker 池解耦、mjModel 一次编译多 slot fork、释放 GIL 的 C++ 控制器、VLM/动作专家分进程加 CUDA IPC(延迟降 53%、goodput 提 2.4×)与 W8A8 选择性量化(再提速 1.18–1.32×),带来 20.6× 有效吞吐提升。

Overview of the Zetta evolutionary framework.
Figure 2: Overview of the Zetta evolutionary framework.
Three-layer architecture of the rollout infrastructure.
Figure 3: Three-layer architecture of the rollout infrastructure.

实验结果

实验在 8×RTX 4090 上进行(Z-Infra 评估另用 8×A100),LIBERO-Pro 用 $\pi_{0.5}$、RoboCasa 用 GR00T N1.5 作冻结基线,全程不微调权重。(1) SOTA 成功率:LIBERO-Pro 40 个任务-设定对宏平均 32.00%→71.13%(+39.13pp),Goal(T)/(S) 31.0%/38.0%→92.5%/89.0%,LIBERO-10(T)/(S) 50.0%/9.0%→63.0%/40.0%,32 升 8 平;RoboCasa 18 任务 73.56%→93.56%(+20.00pp),T4/T5/T15 提升最大(58→96、48→86、50→100);摘要的 90.8%/93.6% 为最优配置数字。(2) 缩放性:RoboCasa 四轮全局修复把宏平均逐轮推至 78.71%、84.85%、90.54%、93.56%。(3) 零样本迁移:PnP-Stove 的预抓取对齐、重抓取、稳定放置技能迁移到 Sink/Cabinet/Toaster,成功率 58→82、62→80、72→90(宏平均 64%→84%);铰链交互从 TurnOffStove 迁移 64%→80%;Goal-S3 借 Goal-T8 机制 9/20→20/20。(4) Aha 时刻:对症修复期停滞(Wine Bottle in Bowl 10%→15%),识别真正物理瓶颈后跳变至 95%、Cream Cheese on Bowl 5%→90%、SlideDishwasherRack 76%→94%。(5) 效率:在线推理较 RPent 延迟降 91%(11.1× 加速);Z-Infra 吞吐 1.7→35.1 ep/min(20.6×),并发 16 时为基线的 7.7×/12.8×,基线并发 16 即 OOM。

Core API primitives exposed to agents.
Table 1: Core API primitives exposed to agents.
Success rates (%) on 18 RoboCasa Atomic-Seen tasks.
Table 2: Success rates (%) on 18 RoboCasa Atomic-Seen tasks.
Success rates (%) on LIBERO-Pro.
Table 3: Success rates (%) on LIBERO-Pro.
Physical-intelligence “Aha” moments on LIBERO-Pro.
Figure 4: Physical-intelligence “Aha” moments on LIBERO-Pro.
Physical-intelligence “Aha” moments on RoboCasa.
Figure 5: Physical-intelligence “Aha” moments on RoboCasa.
Cumulative physical-intelligence scaling on LIBERO-Pro Goal.
Figure 6: Cumulative physical-intelligence scaling on LIBERO-Pro Goal.
Cross-task scaling from the Goal-T8 source task.
Figure 7: Cross-task scaling from the Goal-T8 source task.
Cross-task scaling from the Goal-S5 source task.
Figure 8: Cross-task scaling from the Goal-S5 source task.
Cumulative reflection scaling across 18 RoboCasa tasks.
Figure 9: Cumulative reflection scaling across 18 RoboCasa tasks.
Reflection-driven scaling and transfer on PnP tasks.
Figure 10: Reflection-driven scaling and transfer on PnP tasks.
Reflection-driven scaling and transfer on articulated interaction tasks.
Figure 11: Reflection-driven scaling and transfer on articulated interaction tasks.
A sequence of critic–recovery interventions during a PnP episode.
Figure 12: A sequence of critic–recovery interventions during a PnP episode.
Critic–recovery promotion progressively moves the failure frontier in LIBERO-Pro Goal-S5.
Figure 13: Critic–recovery promotion progressively moves the failure frontier in LIBERO-Pro Goal-S5.
Per-episode latency versus concurrency.
Figure 14: Per-episode latency versus concurrency.
Rollout throughput versus concurrency.
Figure 15: Rollout throughput versus concurrency.
查看结构化数据
任务指标本文基线提升
LIBERO-Pro(Goal T/S + LIBERO-10 T/S,共 40 个任务-设定对) 宏平均成功率 71.13% 冻结 $\pi_{0.5}$:32.00% +39.13 个百分点(40 对中 32 升 8 平);最优配置报告 90.8%
LIBERO-Pro Goal(T)(指令重定向,10 任务) 宏平均成功率 92.5% 31.0% +61.5 个百分点(四轮进化 31%→39.5%→89.5%→92%→92.5%)
LIBERO-Pro Goal(S)(交换/位置互换,10 任务) 宏平均成功率 89.0% 38.0% +51.0 个百分点(最终 178/200)
RoboCasa 18 个 Atomic-Seen 原子任务 宏平均成功率 93.56% 冻结 GR00T N1.5:73.56% +20.00 个百分点;单任务最大提升 T15:50→100
零样本迁移:PnP 任务组(Stove→Sink/Cabinet/Toaster) 宏平均成功率 84% 64% +20 个百分点,单任务 58→82(Sink)、62→80(Cabinet)、72→90(Toaster)
零样本迁移:铰链交互任务组(TurnOffStove→水龙头/柜门/微波炉) 宏平均成功率 80% 64% +16 个百分点,无目标任务适配
Rollout 吞吐(LIBERO Goal,8×A100,并发 64) episodes/min 35.1 无 Z-Infra:1.7;RPent:1.72(并发 16) 20.6×(并发 16 时为无 Z-Infra 的 7.7×、RPent 的 12.8×)
在线推理延迟(对比 RPent) 每 episode 延迟 降低 91% RPent 每个决策点调用 LLM API,392–513s/episode 11.1× 加速

局限与改进

作者承认的局限:所有实验都在 MuJoCo/robosuite 仿真中完成,真机部署、sim-to-real 迁移及把真实机器人作为 Z-Infra 一等 worker 被列为未来工作;结论也坦言自进化是把成功率“推向冻结策略的能力天花板”,而非超越它。我的补充观察:其一,LIBERO-10 上收益明显衰减——(T) 仅从 50.0% 到 63.0%,(S) 仅 9.0% 到 40.0%,且 Task 6(5%)、Task 8/9(0%)几乎无改善,说明当根因是策略自身的语义/感知能力缺陷而非执行偏差时,纯 harness 治理触及上限;其二,诊断管线依赖人工设计的有序语义里程碑 $M$ 与成功参考分布 $I_{succ}$,对缺乏清晰阶段性结构的长程任务如何自动构造里程碑未做讨论;其三,Aha 时刻展示的 v0/v1/v2 检查点是作者选定的代表性版本,存在选择性呈现可能,缺少全程无挑选的进化曲线统计;其四,每任务 50 开发种子 + 严格 held-out 的协议在仿真可行,真机上每次 rollout 都消耗真实时间与硬件磨损,进化成本会高出几个数量级;其五,Orchestrator 与三个进化 Agent 的基座模型、单轮进化的 LLM 调用成本与 wall-clock 时间均未披露。

独立分析的弱点

独立分析的弱点与改进方向:(1) 仿真中心假设——资源分享组、确定性种子、环境模板 fork 都依赖模拟器可复现性,真机无法 fork 环境也无法快速 reset;可为真机 worker 设计会话隔离与安全护栏,用标定后的可重复初始化近似种子语义,对不可逆操作引入离线预演。(2) 里程碑依赖——$m^*$ 与 $I_{succ}$ 需人工定义里程碑序列,在新任务上是新手工成本,也可能注入设计者偏见;可让进化 Agent 自动提议并用数据验证里程碑分解,或用成功轨迹的表示聚类替代显式里程碑。(3) Critic 组合膨胀——Phase III 对触发条件取逻辑或,随技能库增长误触发率会累积,多 Critic 同时触发的仲裁只在 Orchestrator 层粗粒度处理;可引入置信度校准、Critic 间冲突检测与定期“技能修剪”轮。(4) 冻结策略天花板——LIBERO-10(S) 停在 40% 说明有些失败需要更好的策略而非更好的监控;可把治理成功的“恢复后轨迹”筛选为演示数据回流策略微调,形成 harness + 微调混合缩放。(5) 评估成本——每轮全量 50+50 种子评估昂贵;可用自适应种子选择或重要性加权估计压缩评估预算。

未来方向

作者明确提出的方向:把 Zetta 与 Z-Infra 扩展到真实机器人,让真机环境作为 Z-Infra 中与仿真并列的一等 worker,实现真机上的大规模并行 rollout 采集与自进化,并弥合 sim-to-real 差距。基于本文成果还可自然延伸:其一,跨具身本体与跨技能族的迁移——目前零样本迁移限于同一基准内物理机制相似的任务,验证 Critic/恢复技能能否跨机械臂型号、跨夹爪、跨场景迁移是关键一步;其二,与世界模型结合——用 WAM 在恢复动作执行前做“想象验证”,把验证门控部分前移到在线阶段,降低物理试错成本;其三,harness 经验反哺策略——治理成功轨迹经筛选后接入 VLA 微调或 RL 系统,形成“冻结治理→数据回收→策略升级”的双循环缩放;其四,技能库生态——$H_{merged}$ 已是标准化包格式(SKILL.md/tools/plans/params),可发展成带版本管理、冲突消解、跨团队共享的机器人技能分发体系;其五,学习型 Critic——在代码 Critic 的证据流上训练小型神经验证器,兼顾动作频率与语义覆盖,弥补纯代码规则对未预见失败模式的盲区。

复现评估

复现评估:论文公开了项目页(air-embodied-brain.github.io/zetta),但正文未明确承诺完整开源;依赖的基准(LIBERO-Pro、RoboCasa)与基线模型($\pi_{0.5}$、GR00T N1.5)均为公开资源。算力门槛适中:主实验只需 8×RTX 4090,Z-Infra 评估用 8×A100,属学术界可负担规模。论文的确定性协议(固定种子、统一容器、失效强制重跑、同种子相邻轮对照)对复现友好,并给出了核心 API 表(Table 1)、policy_step 跨三层伪代码(Listing 1)和完整任务-种子映射(附录 A/B)。主要障碍:诊断/修复/泛化三个进化 Agent 的提示词、聚类距离与阈值 $\epsilon$、稳定性阈值 $\gamma$、W8A8 量化的模块划分等工程细节未完整披露;复现 Z-Infra 需要 Ray 分布式工程、释放 GIL 的 C++ 环境控制器、CUDA IPC 等系统能力。综合判断:复现“闭环治理 + 三循环进化”的概念验证难度中等,有机器人与系统背景的小团队数周可搭原型;完整复现 93.56%/71.13% 级别数字估计需系统与机器人工程师各 1–2 名、投入数月。