← 返回 2026-08-26

GigaBrain-0.7:以三系统架构将具身基础模型规模化至涌现能力 GigaBrain-0.7: Scaling Embodied Foundation Models to Emergent Capabilities with a Three-System Architecture

GigaBrain Team, Angen Ye, Axiang Sun, Can Jin, Chenxi Cheng, Chong Shi, Dengke Shang, Dingqian Zhang, Guan Huang, Guangqiang Wang, Guangqing Ding, Guo Li, Hangcong Li, Hengyu Zhong, Hongtao Lu, Jianbo Qin, Jiming Mao, Jing Zhu, Jindi Lv, Jingzhi Cui, Junjie Xie, Junyi Bao, Kai Liu, Lei Yuan, Limin Long, Lv Feng, Mingming Yu, Peng Li, Pengfei Yi, Qi Li, Qianli Zhang, Qingfang Li, Qitang Hu, Rui Zhang, Shaoyan Sun, Shibo Sun, Shiying Duan, Tenghui Chen, Tianze Liu, Weijie Ke, Wenyao Xue, Xiaofeng Wang, Xiaoyu Tian, Xinyu Liu, Xinze Chen, Yang Wang, Yankai Wang, Yejun Zeng, Yifan Li, Yifei Nie, Yilong Li, Yilong Liu, Yongchao Feng, Yumeng Wang, Yun Ye, Zhichao Liu, Ziheng He, Zonghai Yang, Zheng Zhu 📅 2026-08-16 👍 101 2026-08-30 18:30
VLA 世界模型 具身智能 强化学习 机器人基础模型 机器人操作

三系统架构+3.7万小时异构数据一阶段预训练,协同理解、预测与行动的具身基础模型。

前置知识

VLA(Vision-Language-Action)模型

在预训练视觉语言模型(VLM)基础上增加动作输出能力,把图像观测和语言指令直接映射为机器人可执行动作的通用策略模型,代表工作包括 RT-2、OpenVLA、π0 系列。按动作生成与 VLM 的耦合方式可分为三大家族:把动作离散成 token 的自回归式、VLM 只做编码再交给动作解码器的级联式、以及 VLM 与动作专家并行交替注意力的 Mixture-of-Transformers 式。

本文的 System 1 本质上就是一个 VLA,全文的架构消融、数据配方和训练范式都围绕「如何把 VLM 的通用理解能力与跨本体连续控制结合起来」展开,不懂 VLA 无法理解论文的问题定义。

流匹配(Flow Matching)

一类生成式建模方法:在真实动作块 $a_{t:t+H}$ 与高斯噪声 $\epsilon\sim\mathcal{N}(0,I)$ 之间构造线性插值路径 $a^\tau_{t:t+H}=\tau a_{t:t+H}+(1-\tau)\epsilon$,训练网络 $v_\theta$ 回归速度场 $(a-\epsilon)$,推理时从纯噪声出发沿预测速度场积分得到连续动作序列。相比离散动作 token 化,它能高效生成高维、高频的连续控制信号。

System 1 的连续动作通路、任务后训练乃至经验强化阶段的核心目标函数都是流匹配损失 $\mathcal{L}_{FM}$,论文公式 5、6、10 全部基于它。

Mixture-of-Transformers(MoT)双流耦合

把预训练 VLM 流与动作专家流做成两套并行 Transformer:VLM 流对自己的 token 做因果自注意力以保留预训练的自回归接口;动作专家流以拼接后的 [VLM, expert] 序列为键值做双向注意力,两流各自保留独立的 FFN 参数。相比只在 VLM 最后一层接交叉注意力,逐层联合注意力让动作专家持续读取完整的多层语义上下文。

论文公式 1-3 定义了这一耦合方式,Table 5 的消融证明双流 MoT 明显优于末层/多层交叉注意力,是 GigaBrain-0.7 的默认 System 1 配置。

世界模型与 World Value Model

世界模型是学习环境视觉动力学、能在「想象」中预测未来观测的生成模型。本文将其扩展为 World Value Model:同一个 GigaWorld-1 (5B) 骨干同时支持两条通路——生成与动作块等长的未来视频(取末帧作为子目标图像 $g_t$),以及估计任务进度标量 $V_t$,从而为策略同时提供预测性和评价性两类条件信号。

System 3 是本文三大系统之一,后训练期间的子目标图像条件与二值优势条件 $A_t$ 都由它产生,是理解本文与 π0.7、RAMP 等前身工作差异的关键。

知识绝缘与 Soft KI

VLA 联合训练时,连续动作损失的反向梯度可能破坏 VLM 预训练表征。原版 Knowledge Insulation 完全阻断动作梯度进入 VLM 主干;Soft KI 改为按系数衰减:$\nabla_{\theta_{VL}}\mathcal{L}=\nabla_{\theta_{VL}}\mathcal{L}_{NTP}+\alpha_{KI}\nabla_{\theta_{VL}}\mathcal{L}_{FM}$,其中 $0<\alpha_{KI}<1$,让主干在保持通用视觉语言能力的同时适度向具身控制适配。

这是本文能在单一预训练阶段同时优化语言理解与连续动作而不发生能力塌方的关键机制,也是相对 π0 硬隔离设计的直接改动点。

优势加权回归(AWR)与离线强化学习

从已收集的轨迹数据中估计优势 $\tilde{A}_t=G_t-\tilde{V}_t$(累计回报减价值估计),按优势大小给轨迹片段加权:高优势的成功片段获得更大模仿学习权重,失败或低进展片段被降权,从而在不与环境新增交互的情况下从失败和部分成功中提取学习信号。

GigaBrain-0.7 的经验驱动改进采用「离线 AWR 式加权 + 在线 actor-critic 与人工纠正」两阶段流水线,AWR 是理解第一阶段(Table 12 中 SFT 到 Offline RL 的提升)的基础。

UMI 与 EGO 人类数据

UMI(Universal Manipulation Interface)用便携式夹持器采集近手视角的人类操作演示,经时间对齐与重定向后可映射到不同机器人末端执行器;EGO 是第一人称人类操作视频(如 EgoDex、EgoVerse),与机器人肩装相机视角相近。二者为机器人轨迹补充近距手眼协调、接触关系和广泛的人类交互先验。

预训练语料中 UMI 占 22.15%、EGO 占 7.68%,Fig.8c 的消融证明这两类人类数据与真机数据互补且组合最优,是「数据金字塔」假设的直接证据。

研究动机

当前 VLA 主导范式是以「当前观测到动作」为中心的反应式策略:它们在结构化桌面任务上已能完成复杂长时程操作,但模型内部缺乏对未来的内隐预判(场景接下来会怎样)和对行为进展的评价(当前执行是否在推进任务)。这带来两类具体失败:其一,许多操作任务存在视觉相似但在时间上处于不同执行阶段的重复状态,单帧策略会陷入反复动作循环——论文 Fig.9 展示了一个策略在十个连续帧内反复回到几乎相同的交互构型而无法推进;其二,当物体实例、空间布局或任务组合发生分布外偏移时成功率骤降。同时,具身 scaling 远不止堆数据:机器人数据在不同本体、动作空间、执行条件之间差异巨大,缺乏对齐与上下文化时,更多样的数据会引入干扰而非可迁移知识。训练范式上,多数系统把目标拆到多个阶段——π0.5 预训练用离散动作 token、后训练才引入流匹配动作专家;Xiaomi-Robotics-0 先训 VLM 再冻结它训练流匹配 DiT——这种优化碎片化使理解、预测、行动与经验改进在整个生命周期中无法协同。

本文的目标是本文要构建一个统一的学习系统而非孤立策略:在单一预训练阶段内联合优化视觉语言理解、层次化任务规划、离散动作与连续动作生成;用专门预训练的世界价值模型提供未来状态预测与任务进展评价两类信号;并把数据策划、预训练、世界模型训练、任务后训练、离线与在线经验强化串成一个连续生命周期。最终目标是让同一个模型在 16 种机器人本体、家庭与工业场景中具备开箱即用的执行能力、语言跟随能力和分布外泛化能力,并能从自身部署经验与人类纠正中持续改进。

与已有工作不同的是,本文的独特切入是把具身智能显式拆解为三个系统并用结构化接口协调:System 2(PaliGemma2 3B VLM)负责视觉理解与子任务分解,System 3(GigaWorld-1 5B 世界价值模型)独立预训练、在后训练中冻结,提供子目标图像 $g_t$ 与二值优势 $A_t$ 两类条件,System 1(3.5B VLA)用双流 MoT 生成动作。与 π0.7 只用生成式视觉子目标、π*0.6 的 RECAP 依赖人工标注或 VLM 推理来评价动作、GigaBrain-0.5M* 的 RAMP 相比,本文的评价信号完全由世界模型自身的「想象」产生,更细粒度、更密集,且预测时域首次超出动作块长度;训练上则把语言、子任务、离散动作、连续动作四类目标全部压进一阶段预训练,用 Soft KI 的梯度衰减替代完全的知识绝缘。作者把这一定位为从「 scaling 孤立策略」走向「协调式学习系统」的尝试。

核心方法

直觉上,机器人基础模型需要「大脑」(理解与规划)、「预感」(预测与评价)和「小脑」(动作控制)各司其职又共享上下文。技术路线上,GigaBrain-0.7 以 PaliGemma2 为共同骨干组织三系统:System 2 是纯 VLM,接收当前观测与任务指令,输出链式思维描述(如观察到「there are hats, bags...」)加子任务指令(把「hang the item on the hanger」分解为「pick up the red hat」);System 3 基于 GigaWorld-1 (5B),输入当前观测、本体状态与子任务,输出与 System 1 动作块等长的预测视频(末帧即子目标图像 $g_t$)和任务进度值 $V_t$(离散化为 $A_t\in{0,1}$);System 1 是 3.5B 的 VLA(PaliGemma2 3B 主干 + 0.5B Action Expert),融合短期视觉记忆、System 2 的子任务、本体状态与 Robot ID、以及 System 3 的 $g_t$ 与 $A_t$,经流匹配生成动作块闭环执行。训练分四阶段:异构数据一阶段 VLA 预训练;世界模型两阶段预训练(机器人视频预训练 + 价值学习);冻结 System 3 的任务后训练;以及离线 AWR 加在线 actor-critic(含人工纠正)的经验驱动强化。

核心创新有三点。第一是三系统架构:与把一切塞进单个 VLA 或简单级联不同,预测与评价被拆成独立预训练、目标专一、部署时冻结的 System 3,通过语义(子任务文本)、视觉(子目标图像 $g_t$)、价值(优势 token $A_t$)三种接口注入策略,既保留各系统的专用目标又共享任务上下文。第二是一阶段多本体 VLA 预训练:语言/子任务/离散动作的下一词预测(NTP)与连续动作的流匹配(FM)在同一阶段联合优化,$\mathcal{L}_{VLA}=\mathcal{L}_{NTP}+\mathcal{L}_{FM}$,消除多阶段管线的优化割裂;用 Soft KI 让 FM 梯度以系数 $\alpha_{KI}$ 衰减后进入 VLM 主干,取代完全阻断,平衡通用能力保持与具身适配。第三是世界价值模型驱动的优势条件:行为评价不来自人工奖励或 VLM 评判,而是世界模型想象未来得到的进度差 $A_t=\mathbb{1}[V_{t+\delta t}-V_t>0]$,推理时恒以正进展为条件,把动作生成偏向「推进任务」的行为模式——这相当于把 RAMP 的优势条件思想移植到专门预训练的世界价值模型上。

方法步骤详情

第一步数据构建:汇聚 37,256.98 小时轨迹数据(真机 20,535.65 小时、16 种本体、1,810,101 条轨迹、20.8 亿帧;UMI 8,251.83 小时;EGO 2,862.36 小时;仿真 1,453.92 小时;世界模型生成 4,153.22 小时)与 271,976,674 条 VLM 图文问答样本;全部统一转换为 LeRobot v3.0 格式,按左臂-右臂-头-腰-底盘顺序建立统一状态/动作表示(缺失维度用掩码而非丢弃),用 GLM-5.1 重写规范化语言指令并标注时序对齐的子任务,再执行四级清洗:q01/q99 极值过滤、静止段检测剔除、末端执行器位姿一致性校正、以及用早期预训练损失定位并剔除时序错位或标注错误的异常样本。第二步 VLA 预训练:Systems 1+2 在全部异构语料上联合训练,NTP 通路监督语言、子任务与离散动作,FM 通路监督连续动作块;视觉编码器内插入 Temporal-Spatial Block 融合短期历史帧且训练时随机丢弃历史以适应可变上下文长度;层次化任务监督在「同时给出任务指令与子任务」和「只给任务级指令、由模型自回归推断子任务」两种模式间随机切换,并用因果掩码防止子任务与未来动作泄漏;本体感知投影层用有效掩码区分「维度缺失」与「合法零值」,旋转统一用连续 6D 表示,Action Expert 主体参数跨本体共享、仅输入输出投影按本体特化。第三步世界模型预训练:Stage I 在真机与仿真机器人视频上继续训练 GigaWorld-1,使其学会机械臂状态转移与接触交互;Stage II 把它扩展为 MoT World Value Model,用轨迹级完成度标注监督进度值 $V_t$,之后全程冻结。第四步任务后训练:对每个下游样本由 System 3 现算 $g_t$ 与 $A_t$,以增强上下文 $c^{post}_t=(c^{base}_t, g_t, A_t)$ 做流匹配微调,子目标图与价值条件分别以 0.50 和 0.15 的概率随机丢弃,迫使策略在四种条件组合下都可用。第五步经验强化:部署后采集成功、失败与纠正轨迹,用进度判别器与规则计算奖励并做 AWR 式离线加权训练;再将改进策略重新部署,在困难状态由人类操作员实时接管纠正,纠正片段进入训练流,用轻量 actor-critic 在线更新,循环执行 rollout-纠正-更新周期。

技术新颖性

与已有工作的本质区别体现在四个层面。架构上,π0/π0.5/π0.7、Wall-OSS-0.5、HyVLA-0.5 等虽同属 VLM+Action Expert 的 MoT 阵营,但把「预测+评价」提升为独立系统并配置专门接口的只有 GigaBrain 系列,0.7 版进一步把未来预测时域扩展到超过动作块长度并新增价值通路。训练范式上,π0.5 预训练只用离散动作 token、后训练才引入流匹配专家,Xiaomi-Robotics-0 采用「先训 VLM、再冻结训 DiT」的两步法,本文则在一阶段内同时优化多模态理解、层次化任务预测、离散动作与连续动作四类目标,Soft KI 提供了比硬隔离更平滑的梯度接口。评价信号上,π0.7 的视觉子目标不含价值估计,π*0.6 的 RECAP 优势条件依赖人工标注与专家纠正,GigaBrain-0.5M* 的价值来自世界模型但时域受限,本文的 $A_t$ 由专门两阶段预训练的 World Value Model 自动产生,免人工、更密集、泛化更稳。数据上,首次把真机、UMI、EGO、仿真、世界模型生成五源数据与 2.7 亿 VLM 样本纳入统一表示与统一损失联合训练,并用受控消融证明各源的互补性。整体而言,这是单点模型创新之上的「学习系统级」贡献。

Composition of the GigaBrain-0.7 training corpus
Figure 2: Composition of the GigaBrain-0.7 training corpus
Real-robot data processing pipeline
Figure 3: Real-robot data processing pipeline
UMI data processing pipeline
Figure 4: UMI data processing pipeline
EGO data processing pipeline
Figure 5: EGO data processing pipeline
Architecture of GigaBrain-0.7
Figure 6: Architecture of GigaBrain-0.7
Experience Reinforcement Pipeline
Figure 7: Experience Reinforcement Pipeline

实验结果

架构与规模结论先行:Table 4 显示骨干并非越大越好——PaliGemma2 (3.5B) 是唯一在衬衫折叠上取得非零成功率(30%)的骨干(水果抓取 88%、清理桌面 50%),而 Qwen3.5 (5B) 与 Gemma 4 (8.5B) 折叠成功率均为 0%;Table 5 显示双流 MoT(三任务 50%/88%/30%)显著优于末层交叉注意力(20%/40%/0%)与多层交叉注意力(20%/36%/0%)。数据 scaling(Fig.8)呈清晰正相关:预训练数据从 12.5% 扩到 100% 验证损失单调下降;真机成功率随机器人数据量上升,且混乱衣物折叠对数据规模的依赖远陡于水果抓取,作者视之为能力随规模涌现的证据;在 3000 小时机器人数据基础上叠加等量 UMI 与 EGO 得到最优组合,且优势在任务后训练后依然保持,说明人类数据改善的是预训练先验质量。System 3 消融(Fig.11)是全文最有说服力的实验:叠衣服(PiPER)四配置成功率均 100%,但平均分从 68.3%(Base)升至 81.7%/85.0%/88.3%(+SubImage/+Value/双条件),平均耗时从 107 秒降至 83/79/75 秒;礼物包装(PiPER-X)上 Base 完全失败(0%),+SubImage 20%、+Value 60%、双条件 80%,任务分从 61.1% 升至 71.4%/93.3%/96.7%,成功回合耗时从 65 秒降至 60/55 秒;方块分拣(H01)成功率 40%→50%/45%/55%,双条件平均分 55.0%→87.5%。零样本基础能力(Fig.12-15):预训练后免微调的同一策略在 AgileX PiPER 的 ID 语言跟随任务上最高达 100%(水果抓取)与 96.0%(桌面清理),Maker H01 的 ID 平均 55.8%(水果抓取 70.0%、桌面整理 55.6%、食物加热 41.7%);OOD 设置下普遍退化(H01 OOD 三任务 30.0%/20.0%/16.7%,PiPER 的 OOD 中最难任务跌至 0)。模型还能零样本折叠训练集中未出现的衣物并应对高度无序的初始形态(Fig.15),零样本复杂操作在 PiPER ID 平均 63.3%(折叠 80%、糖果抓取 70%、打包 40%)、OOD 平均 26.7%(礼物包装 0%),H01 ID 平均 58.3%、OOD 平均 13.3%。后训练对比(Table 6/7):语言跟随平均成功率 PiPER 91.5% 对 π0.5 的 88.8%、GigaBrain-0.1 的 76.1%;H01 上 84.2% 对 π0.5 的 75.2%;复杂操作 PiPER 平均 84.9%(π0.5 为 76.6%),H01 平均 74.1%(π0.5 仅 45.2%),其中 H01 洗碗清洁 100%、食物加热 85%、面团揉捏 79.2%。公开基准(Table 8-11):MiMo-Embodied 总分 0.4621 为对比模型最高(空间理解 0.5215),继续预训练后达 0.5704(作者注明属诊断性结果);RoboTwin 2.0 Co-Train 协议下 Easy 66.8%/Hard 67.9%/Overall 67.35%,是唯一 Hard 不降反升的模型,Hard 比 π0.5 的 46.0% 高 21.9 个百分点;EBench 成功率 33.30%、任务分 46.1 均居首位(π0.5 为 28.08%/42);RoboColiseum 四个维度全部第一(指令跟随 0.8166、空间推理 0.4729、鲁棒性 0.6800、通用操作 0.6092)。经验驱动 RL(Table 12):四个真机任务平均成功率从 SFT 的 30.0% 升至离线 RL 的 57.5%、在线 RL 的 100%——电缆扎带穿系 0%→40%→100%,轴承安装 20%→60%→100%,链接安装 20%→40%→100%,礼盒打包 80%→90%→100%。

Composition of the embodied trajectory corpus after cleaning
Table 1: Composition of the embodied trajectory corpus after cleaning
Composition of the UMI and EGO datasets after cleaning
Table 3: Composition of the UMI and EGO datasets after cleaning
Comparison of VLM backbones for System 1
Table 4: Comparison of VLM backbones for System 1
Comparison of VLM-action expert coupling architectures
Table 5: Comparison of VLM-action expert coupling architectures
Post-training multi-task language-following evaluation
Table 6: Post-training multi-task language-following evaluation
Post-training single-task complex manipulation evaluation
Table 7: Post-training single-task complex manipulation evaluation
Summary of embodied vision-language evaluation on MiMo-Embodied
Table 8: Summary of embodied vision-language evaluation on MiMo-Embodied
Evaluation on EBench among publicly available VLA models
Table 10: Evaluation on EBench among publicly available VLA models
Evaluation on RoboColiseum
Table 11: Evaluation on RoboColiseum
Task success rates at different training stages
Table 12: Task success rates at different training stages
Scaling GigaBrain-0.7 with heterogeneous embodied data
Figure 8: Scaling GigaBrain-0.7 with heterogeneous embodied data
Qualitative analysis of temporal context in repeated-state manipulation
Figure 9: Qualitative analysis of temporal context in repeated-state manipulation
Prediction and evaluation with the World Value Model
Figure 10: Prediction and evaluation with the World Value Model
Ablation of the prediction and evaluation interfaces in System 3
Figure 11: Ablation of the prediction and evaluation interfaces in System 3
Out-of-the-box multi-task language following of GigaBrain-0.7
Figure 12: Out-of-the-box multi-task language following of GigaBrain-0.7
Object, spatial, and compositional generalization of the pretrained GigaBrain-0.7 policy
Figure 13: Object, spatial, and compositional generalization of the pretrained GigaBrain-0.7 policy
Out-of-the-box complex manipulation with GigaBrain-0.7
Figure 14: Out-of-the-box complex manipulation with GigaBrain-0.7
Out-of-the-box garment-instance and deformable-state generalization
Figure 15: Out-of-the-box garment-instance and deformable-state generalization
Post-training multi-task language following
Figure 16: Post-training multi-task language following
Post-training language following on AgileX PiPER: color grounding
Figure 17: Post-training language following on AgileX PiPER: color grounding
Post-training language following on AgileX PiPER: spatial grounding
Figure 18: Post-training language following on AgileX PiPER: spatial grounding
Post-training language following on Maker H01: color grounding
Figure 19: Post-training language following on Maker H01: color grounding
Post-training language following on Maker H01: target grounding
Figure 20: Post-training language following on Maker H01: target grounding
Post-training language following on Maker H01: spatial grounding
Figure 21: Post-training language following on Maker H01: spatial grounding
Post-training complex manipulation
Figure 22: Post-training complex manipulation
Post-training complex manipulation on AgileX PiPER: play-dough manipulation
Figure 23: Post-training complex manipulation on AgileX PiPER: play-dough manipulation
Post-training complex manipulation on AgileX PiPER: tabletop sweeping
Figure 24: Post-training complex manipulation on AgileX PiPER: tabletop sweeping
Post-training complex manipulation on Maker H01: household-item organization
Figure 25: Post-training complex manipulation on Maker H01: household-item organization
Post-training complex manipulation on Maker H01: block sorting
Figure 26: Post-training complex manipulation on Maker H01: block sorting
Representative real-robot tasks for experience-driven reinforcement learning
Figure 27: Representative real-robot tasks for experience-driven reinforcement learning
Snapshot of the complete official EBench leaderboard
Figure 29: Snapshot of the complete official EBench leaderboard
Snapshot of the RoboColiseum Instruction Following leaderboard
Figure 30: Snapshot of the RoboColiseum Instruction Following leaderboard
Snapshot of the RoboColiseum Spatial Reasoning leaderboard
Figure 31: Snapshot of the RoboColiseum Spatial Reasoning leaderboard
Snapshot of the RoboColiseum Robustness leaderboard
Figure 32: Snapshot of the RoboColiseum Robustness leaderboard
Snapshot of the RoboColiseum General Manipulation leaderboard
Figure 33: Snapshot of the RoboColiseum General Manipulation leaderboard
查看结构化数据
任务指标本文基线提升
RoboTwin 2.0 双臂操作(Co-Train 50 任务,Hard 域随机化) 成功率 67.9% π0.5 46.0% +21.9 个百分点
RoboTwin 2.0 双臂操作(Co-Train,Overall) 成功率 67.35% π0.5 58.35% +9.0 个百分点
EBench 移动与长时程操作 总成功率 SR 33.30% π0.5 28.08% +5.22 个百分点
RoboColiseum 空间推理 得分 0.4729 π0.5 0.3560 +0.1169
RoboColiseum 指令跟随 得分 0.8166 ACoT-VLA 0.7570 +0.0596
MiMo-Embodied 具身视觉语言理解(13 基准) Overall 均分 0.4621 G0.5-base 0.3916 +0.0705
AgileX PiPER 六任务语言跟随(后训练) 平均成功率 91.5% π0.5 88.8% +2.7 个百分点
Maker H01 六任务语言跟随(后训练) 平均成功率 84.2% π0.5 75.2% +9.0 个百分点
Maker H01 七任务复杂操作(后训练) 平均成功率 74.1% π0.5 45.2% +28.9 个百分点
AgileX PiPER 五任务复杂操作(后训练) 平均成功率 84.9% π0.5 76.6% +8.3 个百分点
System 3 消融:礼物包装(PiPER-X) 成功率 80%(+SubImage+Value) Base 0% +80 个百分点
经验驱动 RL(四真机任务平均) 成功率 100%(在线 RL 后) SFT 30.0% +70 个百分点

局限与改进

作者承认的局限:ID 与 OOD 的差距仍然很大,当物体身份、场景配置与任务组合多个因素同时偏移时退化最严重(如 PiPER 零样本复杂操作 OOD 平均仅 26.7%、礼物包装 0%;H01 零样本语言跟随 OOD 最低 16.7%),说明基础能力迁移仍有明显边界;Gemma 4 骨干的清理桌面成绩是在受限位置泛化设置下取得的,骨干对比并非严格的模型缩放研究;MiMo 最终 0.5704 的分数因训练数据与评测集不再互斥只能视为继续预训练诊断;在线 RL 的完整人类干预协议与公式被留待未来报告。我自己的观察:其一,System 3 在后训练与推理时都要为每个样本生成未来视频,计算开销可观,且世界模型的「幻觉」子目标若偏离真实动力学会系统性误导动作专家,论文未量化 $g_t$ 预测质量与任务成功的相关性;其二,$A_t$ 被二值化为 {0,1},丢弃了进展幅度信息,条件表达力受限;其三,条件丢弃概率 0.50/0.15 是固定超参,缺少敏感性分析;其四,RL 验证仅 4 个任务、每配置 10-20 次试验、终点全部报告 100%,统计置信度和任务多样性都有限;其五,RoboTwin/EBench 对比基于 2026 年 8 月 15 日的榜单快照,InternVLA-A1 的数字还是从其他论文转引,时间对齐不严格;其六,真机数据 43.82% 的帧来自自研 Maker H01 平台,16 个本体中一半的帧占比不足 1%,跨实验室复现其数据分布并不现实。

独立分析的弱点

第一,二值优势信号表达力不足:$A_t\in{0,1}$ 只编码「进展是否为正」,在部分成功、缓慢推进或来回震荡的片段间无法区分,改进方向是把条件换成连续优势、进展分位数或学习到的价值嵌入,并配合推理时对多档条件做受控扫描。第二,System 3 全程冻结:预测与评价质量的上限在预训练时就已锁定,无法从策略改进带来的新分布中受益,而相关的 World-VLA-Loop 已证明世界模型与策略闭环互进可行,改进方向是周期性地用新 rollout 数据微调世界模型。第三,世界模型幻觉风险:子目标图像 $g_t$ 若与现实动力学不符(尤其长时域外推时),会被动作专家当作可靠视觉条件吸收,论文缺少对 $g_t$ 预测误差的度量与门控机制,改进方向是引入不确定性估计或在 $g_t$ 与当前观测不一致时自动降权。第四,长时程与移动操作远未饱和:EBench 总成功率 33.30% 说明移动、灵巧与精确交互仍有巨大空间,而三系统的验证集中在固定基座双臂平台,人形全身(腰、腿)控制虽有统一表示接口但缺少深度评测。第五,细粒度语言落地仍有短板:H01 勺子颜色抓取仅 56.3%,MiMo 的 Affordance 均分 0.3669 也低于其空间理解 0.5215,可供性推理是明确的弱项。第六,在线 RL 依赖人工实时纠正,扩展性受人力约束,改进方向是用学习型失败检测器自动定位干预点、或用世界模型替代部分人类纠正生成合成纠正数据。

未来方向

作者明确提出四个方向:继续扩大异构具身数据规模并改进跨源对齐;强化长时程预测建模与任务进展估计;发展更可扩展的、融合自主经验与人类纠正的闭环学习;并在专门的后续报告中给出完整的人类干预协议与在线 RL 公式。基于本文成果还可以延伸:把 System 3 与 System 1 做成联合进化的闭环(世界模型吃策略新 rollout,策略吃世界模型新评价),而非单向冻结;把二值 $A_t$ 扩展为连续优势条件并用于测试时搜索——用世界模型对候选动作块打分再选择,而非仅做正向条件;将世界模型的进展估计转化为自动稠密奖励,替代人工奖励设计以加速 RL 阶段;研究跨本体共享价值空间的度量学习,让 $V_t$ 在不同机器人之间可迁移;以及面向数十分钟级家庭任务引入分层记忆与子目标图规划,本文的 Temporal-Spatial Block 只覆盖短历史窗口。

复现评估

开源情况:论文承诺公开全部训练代码与预训练权重(GitHub 仓库 open-gigaai/giga-brain-0,项目页 gigaai.cc/blog/gigabrain07),实现还将集成进 XPolicyLab 提供 RoboTwin 2.0、RoboDojo 等基准的统一训练/推理/部署流程;三个仿真基准均为公开在线榜单(快照日期 2026-08-15),评测协议可对齐。数据方面,37,256.98 小时语料中大部分为自采(Maker H01/M01/U01/E01 与内部部署),仅部分来自公开数据集(EgoDex、EgoVerse、WiYH、Jianzhi 10K 等),因此完整预训练复现需要大规模机器人集群、数据管线与 GPU 算力,普通实验室不可行;数据清洗重度依赖 GLM-5.1 与 Qwen3.6-27B 做指令重写与标注,这部分提示词与细节未完全公开。现实的复现路径是「拿开源权重做下游」:在 RoboTwin 2.0 Co-Train 协议(50 任务、每任务 50 条演示)或自采示教上做后训练与 System 3 条件消融,单机即可尝试,难度中等;而从头复现预训练难度极高。另外需注意 MiMo 0.5704 分数含继续预训练泄漏,复现对比时应使用 0.4621 这一干净数字。