Zetta ζ:面向自进化物理智能的高效闭环具身智能框架 Zetta ζ: An Efficient Closed-Loop Embodied Harness for Self-Evolving Physical Intelligence
冻结VLA策略,用自进化的代码Critic与恢复技能实现机器人闭环执行治理与持续提升
前置知识
VLA 模型(Vision-Language-Action)
视觉-语言-动作模型是端到端机器人策略:输入相机图像与自然语言指令,直接输出低层动作。代表如 $\pi_{0.5}$、GR00T N1.5,由 VLM 主干编码观察、动作专家以扩散或自回归方式解码动作。它们在大规模演示语料上训练,但推理时开环前馈,无法实时纠正打滑、碰撞等执行偏差。
本文核心设定是“冻结 VLA”($\nabla_\theta = 0$),所有提升都来自不改权重的 harness 层,理解 VLA 的开环脆弱性才能理解为何要外挂 Critic 做治理。
开环 vs 闭环执行(Harness 的核心矛盾)
开环指执行后不依环境反馈修正决策;闭环指持续监测机器人-环境状态并即时干预。论文指出现有具身 harness 实为开环:rollout 期间按固定技能或预规划轨迹执行,episode 结束才“反思”。物理交互的状态变化在毫秒级延迟预算内,大模型的秒级推理跟不上这个频率,事后反思无法治理正在发生的失败。
论文的问题定义、三循环的时间尺度划分、“高频代码 Critic + 固定 Orchestrator 裁决”的设计,全部围绕把开环的事后反思改造成动作频率的闭环治理。
Runtime Critic 与 Recovery Playbook
Runtime Critic 是代码实现的高频监控函数,扫描轨迹 $\tau_{0:t}$ 输出提案 $P_t = \langle e_t, \hat{\sigma}_t \rangle$($e_t$ 为可审计失败证据,$\hat{\sigma}_t$ 为建议模式);Recovery Playbook 是按失败机制索引的恢复策略库。二者与异构工具集 $\mathcal{T}$ 一起构成可进化的 harness $H$。
Critic 与恢复技能是本文“可学习的对象”——所有进化循环都在生产、验证和合并这两种代码技能,是读懂方法与 Aha 时刻的钥匙。
首个缺失里程碑 $m^*$ 与最早观测分叉 $t_{EOD}$
任务分解为有序里程碑序列 $M = \langle m_1, \ldots, m_{goal} \rangle$,$m^*$ 是轨迹中首个未观测到的里程碑,粗定位失败阶段;$t_{EOD}$ 是失败轨迹状态首次偏离成功参考分布 $I_{succ}$ 的时刻。两者把“整条轨迹失败”压缩为“何时、何阶段开始出错”,缩小诊断搜索空间。
失败聚类、medoid 种子选取和分层因果诊断都建立在这两个量之上,是理解 Phase I/II 进化管线的前提。
VLA 推理服务化(模型分区与量化)
$\pi_{0.5}$ 等 VLA 含 VLM 主干与动作专家两段,计算特性差异大。Z-Infra 将两段分进程部署、经 CUDA IPC 传激活,延迟降 53%、goodput 提 2.4×;再对前缀 MLP 做 W8A8 量化提速 1.18–1.32× 且成功率不降;配合动态批处理与异步调度服务突发异构请求。
环境是学习数据的来源,rollout 吞吐是自进化的限速器;Z-Infra 的 20.6× 吞吐提升与 11.1× 推理加速都来自这些系统技术。
LIBERO-Pro 与 RoboCasa 基准
两者都是基于 MuJoCo/robosuite 的操作仿真基准。LIBERO-Pro 加入指令重定向(T)与位置交换(S)扰动,用 $\pi_{0.5}$ 作基线;RoboCasa 含 18 个家庭原子任务,用 GR00T N1.5 作基线。协议:每任务 50 个开发种子进化,在严格隔离的 held-out 种子上报告最终成功率。
所有主实验数字(90.8%、93.6%、71.13% 等)都定义在这两个基准和该协议上,不清楚协议就无法判断结果含金量。
研究动机
物理智能的规模化目前沿两条路径推进,但都卡在“从演示到可靠执行”的鸿沟上。第一条是端到端策略模型(VLA/WAM):它们在 DROID、Open X-Embodiment 等大规模演示语料上训练,但具身数据稀缺,模型对真实部署中的分布漂移十分脆弱——推理时是开环前馈的,无法实时感知物体打滑、轻微碰撞等执行偏差,小扰动会级联成整个任务失败。第二条是用 LLM 具身 Agent 编排策略模型、代码与工具,希望从环境自探索中学习;但论文尖锐地指出这些 harness 实际上并未实现这种学习:执行开始后,Agent 不再根据不断变化的机器人-环境状态调整决策,而是按固定技能或预规划轨迹走完全程,直到 episode 结束才做事后反思。物理交互要求决策在毫秒级延迟预算内耦合当前状态,今天的大型 Agent 模型在真实系统里根本达不到这个频率。事后反思还有三个固有缺陷:无法在线试验替代动作来验证反思是否正确;对整条轨迹做 credit assignment 困难;回溯分析往往拿不到失败瞬间的精确状态。结果是总结出的经验难以复用、难以适应变化的真实世界动态。
本文的目标是本文的目标是构建一个闭环的具身 harness,在保持基础策略模型完全冻结($\nabla_\theta = 0$)的前提下,让运行时 Critic 与恢复技能随 rollout 经验在线自进化,使任务成功率随自探索经验持续提升。具体拆成三个可验证的子目标:其一,实现动作频率的闭环治理,让系统能在物理执行展开的过程中(而非结束后)发现并干预失败;其二,把每次 rollout 的失败经验转化为经过验证、可复用、可跨任务零样本迁移的代码化 Critic 与恢复技能,形成类似 SGD 的有界稳定的代码空间优化过程;其三,解决 rollout 吞吐这个“智能规模化的限速器”——环境是学习数据的唯一来源,更快的 rollout 意味着更快的进化,因此还需构建首个专门面向自进化具身 Agent 的 rollout 基础设施 Z-Infra,把 agent 逻辑与异构硬件资源解耦。
与已有工作不同的是,本文的独特切入角度有三点。第一,治理与学习按频率彻底分离:高频治理交给毫秒级、以纯代码实现的轻量 Critic(而非昂贵的大模型),低频学习交给离线进化的 Agent——在线 rollout 只跑冻结 VLA 加轻量 Critic,大模型仅在离线“反思与进化”阶段介入,这直接化解了“大模型跟不上物理频率”与“诊断需要大模型智能”的矛盾。第二,学习对象从模型权重转向可审计的代码技能:harness $H = \{C, R, \mathcal{T}\}$ 中的 Critic、恢复手册和工具都是显式代码,可版本化、可验证、可零样本迁移,绕开了具身数据稀缺下的策略微调困境。第三,把进化形式化为带验证门控的优化过程:只有同时通过历史回归(原失败簇 100% 修复)和 held-out 泛化评估的候选技能才被并入技能库,用有界更新避免“过拟合式修复”破坏基础策略的语义泛化能力。这与 Reflexion、Voyager 等 episode 级反思范式形成本质区隔。
核心方法
直觉上,Zetta 给一个冻结的 VLA 配了一位“随船安全员”和一本会自动增厚的“急救手册”:代码 Critic 以超过策略推理的频率盯着执行状态,一发现抓取丢失、接触异常等苗头就提交带证据的提案;固定的 Orchestrator Agent $A_{orch}$ 审核证据后批准切换到恢复技能,恢复完成且物理状态稳定后再把控制权交还 VLA 继续原任务。技术上,最终执行模式由裁决函数 $\sigma_t = A_{orch}(P_t, R, \mathcal{T}, K)$ 决定($\sigma_t = 0$ 表示继续用 VLA,$\sigma_t > 0$ 表示调用专用工具),$K$ 是含里程碑与成功准则的任务知识。自进化由三个时间尺度分离的循环驱动:Loop 1 在动作频率执行已学会的 Critic 并按需触发恢复;Loop 2 在每批 rollout 后聚类失败、做因果诊断、提出候选 Critic 与恢复;Loop 3 只把通过验证门控的候选并入技能记忆。第一个循环实现闭环执行,后两个实现自进化;底层由 Z-Infra 提供跨异构 CPU/GPU 资源的高吞吐并行 rollout。
核心创新是“可进化的代码 Critic 作为闭环治理载体”,与已有方法的本质区别有三。其一,治理频率:已有具身 Agent 的反思在 episode/轨迹层面,本文把治理下沉到动作频率——Critic 持续扫描轨迹生成结构化提案 $P_t = \langle e_t, \hat{\sigma}_t \rangle$,干预必须以通过验证的证据经 Orchestrator 批准为前提,是证据驱动的裁决而非盲目触发。其二,技能形态:已有技能学习要么改模型权重、要么存自然语言经验,本文技能是纯代码——论文坦承代码没有梯度,因此借鉴 SkillOpt 与 EmbodiSkill 构造 SGD 式代码空间优化:失败聚类相当于小批量、候选修复相当于更新量、验证门控充当接受准则,保证更新有界、可审计、可版本回滚。其三,修复位置:分层因果诊断强制“高层逻辑能解决的绝不改低层参数”的最小干预,保护冻结策略的语义泛化;VLA 重入契约 $\Psi(s_t) = \mathbb{1}(\text{FailureCleared}) \wedge \mathbb{1}(\text{Stability}(s_t) > \gamma)$ 确保只在失败证据清除且接触力学稳定后才交还控制,防止恢复引发二次失败。
方法步骤详情
进化分三阶段循环。Phase I(失败画像):在开发种子集上大规模采样冻结策略,采用确定性路由与有效性判定(基础设施失败强制原种子重跑);每条轨迹记录多模态序列 $\tau = \{(s_t, a_t, \mu_t, \phi_t)\}$($\mu_t$ 为里程碑完成状态,$\phi_t$ 为碰撞等物理信号),成功轨迹汇成参考索引 $I_{succ}$,失败轨迹写入清单并计算首个缺失里程碑 $m^*$ 定位阶段。Phase II 阶段一:按最早观测分叉 $t_{EOD}$ 把失败种子聚簇、每簇选 medoid 种子,遵守单视角锚定协议,自顶向下遍历六层 $\{L_{eval}, L_{crit}, L_{state}, L_{plan}, L_{recv}, L_{param}\}$ 找根因层 $L^*$;阶段二:修复 Agent 实例化最小补丁($C^*, R^*, \mathcal{T}^*$)并嵌入重入契约 $\Psi(s_t)$,经“诊断回放 + 全新 rollout”两步验证。Phase III:把补丁合并为版本化 harness 包 $H_{merged}$——Critic 触发条件取逻辑或、恢复手册抽象形态变化、工具集纳入新合成技能,打包为 SKILL.md/tools/plans/params;最后须通过原失败簇 100% 历史回归 + 严格隔离 held-out 集上的成功率增量 $\Delta SR$,若 held-out 暴露新失败机制则该种子降级为开发种子并换新 held-out 集重验。
技术新颖性
新颖性体现在四方面。其一,时间尺度架构:现有自进化 Agent(Reflexion、Voyager 等)工作在 episode 级且限于数字域,本文首个把学习拆解为动作频率(治理)、rollout 批次(提案)、进化迭代(门控合并)三个耦合循环,并声称首次实现通过可学习代码 Critic 的自进化具身 Agent。其二,无梯度优化的工程化:明确承认代码技能无梯度,显式构造带接受准则的有界更新而非含糊的“自我改进”叙事,使进化可审计、可版本管理、可回滚。其三,验证协议:历史回归 100% + held-out 增量 + 失败种子强制降级换新 held-out 的动态转换协议,直接针对 LLM Agent 研究中“在开发集上自我报告改进”的通病。其四,系统层面:Z-Infra 是首个面向自进化具身 Agent 的 rollout 基础设施,与 IMPALA/SEED RL 等 RL 系统不同,它需同时服务 VLA 推理、感知模型、MuJoCo 仿真与毫秒级工具调用;通过 worker 池解耦、mjModel 一次编译多 slot fork、释放 GIL 的 C++ 控制器、VLM/动作专家分进程加 CUDA IPC(延迟降 53%、goodput 提 2.4×)与 W8A8 选择性量化(再提速 1.18–1.32×),带来 20.6× 有效吞吐提升。
实验结果
实验在 8×RTX 4090 上进行(Z-Infra 评估另用 8×A100),LIBERO-Pro 用 $\pi_{0.5}$、RoboCasa 用 GR00T N1.5 作冻结基线,全程不微调权重。(1) SOTA 成功率:LIBERO-Pro 40 个任务-设定对宏平均 32.00%→71.13%(+39.13pp),Goal(T)/(S) 31.0%/38.0%→92.5%/89.0%,LIBERO-10(T)/(S) 50.0%/9.0%→63.0%/40.0%,32 升 8 平;RoboCasa 18 任务 73.56%→93.56%(+20.00pp),T4/T5/T15 提升最大(58→96、48→86、50→100);摘要的 90.8%/93.6% 为最优配置数字。(2) 缩放性:RoboCasa 四轮全局修复把宏平均逐轮推至 78.71%、84.85%、90.54%、93.56%。(3) 零样本迁移:PnP-Stove 的预抓取对齐、重抓取、稳定放置技能迁移到 Sink/Cabinet/Toaster,成功率 58→82、62→80、72→90(宏平均 64%→84%);铰链交互从 TurnOffStove 迁移 64%→80%;Goal-S3 借 Goal-T8 机制 9/20→20/20。(4) Aha 时刻:对症修复期停滞(Wine Bottle in Bowl 10%→15%),识别真正物理瓶颈后跳变至 95%、Cream Cheese on Bowl 5%→90%、SlideDishwasherRack 76%→94%。(5) 效率:在线推理较 RPent 延迟降 91%(11.1× 加速);Z-Infra 吞吐 1.7→35.1 ep/min(20.6×),并发 16 时为基线的 7.7×/12.8×,基线并发 16 即 OOM。
查看结构化数据
| 任务 | 指标 | 本文 | 基线 | 提升 |
|---|---|---|---|---|
| LIBERO-Pro(Goal T/S + LIBERO-10 T/S,共 40 个任务-设定对) | 宏平均成功率 | 71.13% | 冻结 $\pi_{0.5}$:32.00% | +39.13 个百分点(40 对中 32 升 8 平);最优配置报告 90.8% |
| LIBERO-Pro Goal(T)(指令重定向,10 任务) | 宏平均成功率 | 92.5% | 31.0% | +61.5 个百分点(四轮进化 31%→39.5%→89.5%→92%→92.5%) |
| LIBERO-Pro Goal(S)(交换/位置互换,10 任务) | 宏平均成功率 | 89.0% | 38.0% | +51.0 个百分点(最终 178/200) |
| RoboCasa 18 个 Atomic-Seen 原子任务 | 宏平均成功率 | 93.56% | 冻结 GR00T N1.5:73.56% | +20.00 个百分点;单任务最大提升 T15:50→100 |
| 零样本迁移:PnP 任务组(Stove→Sink/Cabinet/Toaster) | 宏平均成功率 | 84% | 64% | +20 个百分点,单任务 58→82(Sink)、62→80(Cabinet)、72→90(Toaster) |
| 零样本迁移:铰链交互任务组(TurnOffStove→水龙头/柜门/微波炉) | 宏平均成功率 | 80% | 64% | +16 个百分点,无目标任务适配 |
| Rollout 吞吐(LIBERO Goal,8×A100,并发 64) | episodes/min | 35.1 | 无 Z-Infra:1.7;RPent:1.72(并发 16) | 20.6×(并发 16 时为无 Z-Infra 的 7.7×、RPent 的 12.8×) |
| 在线推理延迟(对比 RPent) | 每 episode 延迟 | 降低 91% | RPent 每个决策点调用 LLM API,392–513s/episode | 11.1× 加速 |
局限与改进
作者承认的局限:所有实验都在 MuJoCo/robosuite 仿真中完成,真机部署、sim-to-real 迁移及把真实机器人作为 Z-Infra 一等 worker 被列为未来工作;结论也坦言自进化是把成功率“推向冻结策略的能力天花板”,而非超越它。我的补充观察:其一,LIBERO-10 上收益明显衰减——(T) 仅从 50.0% 到 63.0%,(S) 仅 9.0% 到 40.0%,且 Task 6(5%)、Task 8/9(0%)几乎无改善,说明当根因是策略自身的语义/感知能力缺陷而非执行偏差时,纯 harness 治理触及上限;其二,诊断管线依赖人工设计的有序语义里程碑 $M$ 与成功参考分布 $I_{succ}$,对缺乏清晰阶段性结构的长程任务如何自动构造里程碑未做讨论;其三,Aha 时刻展示的 v0/v1/v2 检查点是作者选定的代表性版本,存在选择性呈现可能,缺少全程无挑选的进化曲线统计;其四,每任务 50 开发种子 + 严格 held-out 的协议在仿真可行,真机上每次 rollout 都消耗真实时间与硬件磨损,进化成本会高出几个数量级;其五,Orchestrator 与三个进化 Agent 的基座模型、单轮进化的 LLM 调用成本与 wall-clock 时间均未披露。
独立分析的弱点
独立分析的弱点与改进方向:(1) 仿真中心假设——资源分享组、确定性种子、环境模板 fork 都依赖模拟器可复现性,真机无法 fork 环境也无法快速 reset;可为真机 worker 设计会话隔离与安全护栏,用标定后的可重复初始化近似种子语义,对不可逆操作引入离线预演。(2) 里程碑依赖——$m^*$ 与 $I_{succ}$ 需人工定义里程碑序列,在新任务上是新手工成本,也可能注入设计者偏见;可让进化 Agent 自动提议并用数据验证里程碑分解,或用成功轨迹的表示聚类替代显式里程碑。(3) Critic 组合膨胀——Phase III 对触发条件取逻辑或,随技能库增长误触发率会累积,多 Critic 同时触发的仲裁只在 Orchestrator 层粗粒度处理;可引入置信度校准、Critic 间冲突检测与定期“技能修剪”轮。(4) 冻结策略天花板——LIBERO-10(S) 停在 40% 说明有些失败需要更好的策略而非更好的监控;可把治理成功的“恢复后轨迹”筛选为演示数据回流策略微调,形成 harness + 微调混合缩放。(5) 评估成本——每轮全量 50+50 种子评估昂贵;可用自适应种子选择或重要性加权估计压缩评估预算。
未来方向
作者明确提出的方向:把 Zetta 与 Z-Infra 扩展到真实机器人,让真机环境作为 Z-Infra 中与仿真并列的一等 worker,实现真机上的大规模并行 rollout 采集与自进化,并弥合 sim-to-real 差距。基于本文成果还可自然延伸:其一,跨具身本体与跨技能族的迁移——目前零样本迁移限于同一基准内物理机制相似的任务,验证 Critic/恢复技能能否跨机械臂型号、跨夹爪、跨场景迁移是关键一步;其二,与世界模型结合——用 WAM 在恢复动作执行前做“想象验证”,把验证门控部分前移到在线阶段,降低物理试错成本;其三,harness 经验反哺策略——治理成功轨迹经筛选后接入 VLA 微调或 RL 系统,形成“冻结治理→数据回收→策略升级”的双循环缩放;其四,技能库生态——$H_{merged}$ 已是标准化包格式(SKILL.md/tools/plans/params),可发展成带版本管理、冲突消解、跨团队共享的机器人技能分发体系;其五,学习型 Critic——在代码 Critic 的证据流上训练小型神经验证器,兼顾动作频率与语义覆盖,弥补纯代码规则对未预见失败模式的盲区。
复现评估
复现评估:论文公开了项目页(air-embodied-brain.github.io/zetta),但正文未明确承诺完整开源;依赖的基准(LIBERO-Pro、RoboCasa)与基线模型($\pi_{0.5}$、GR00T N1.5)均为公开资源。算力门槛适中:主实验只需 8×RTX 4090,Z-Infra 评估用 8×A100,属学术界可负担规模。论文的确定性协议(固定种子、统一容器、失效强制重跑、同种子相邻轮对照)对复现友好,并给出了核心 API 表(Table 1)、policy_step 跨三层伪代码(Listing 1)和完整任务-种子映射(附录 A/B)。主要障碍:诊断/修复/泛化三个进化 Agent 的提示词、聚类距离与阈值 $\epsilon$、稳定性阈值 $\gamma$、W8A8 量化的模块划分等工程细节未完整披露;复现 Z-Infra 需要 Ray 分布式工程、释放 GIL 的 C++ 环境控制器、CUDA IPC 等系统能力。综合判断:复现“闭环治理 + 三循环进化”的概念验证难度中等,有机器人与系统背景的小团队数周可搭原型;完整复现 93.56%/71.13% 级别数字估计需系统与机器人工程师各 1–2 名、投入数月。
论文图表
全系统概览:高频运行时 Critic 在执行中触发恢复;经验证的失败被蒸馏成可跨 rollout 复用的 Critic 与恢复技能;硬件解耦的 rollout 层把该过程扩展到异构环境、模型、CPU 和 GPU。由此支撑同任务持续改进、零样本技能迁移、机器人“Aha 时刻”与加速的 Agent 执行。
一图浓缩论文全部核心卖点与“闭环 + 自进化”的主张,是快速建立整体心智模型的最佳入口。