← 返回 2026-07-21

RynnBrain 1.1:迈向更强大、更通用的具身基础模型 RynnBrain 1.1: Towards More Capable and Generalizable Embodied Foundation Model

Kehan Li, Bohan Hou, Minghao Zhu, Tianyi Zhang, Zesen Cheng, Zhikai Wang, Sicong Leng, Xin Li, Xiao Lin, Biying Yao, Minghua Zeng, Jiangpin Liu, Ronghao Dang, Jiayan Guo, Siteng Huang, Haoyu Zhao, Heng Ping, Yaxi Zhao, Kexiang Wang, Tong Lu, Shengke Xue, Jiahao Tang, Yulei Wang, Zejing Wang, Jianwei Gao, Shijian Lu, Chengju Liu, Jianfei Yang, Mingxiu Chen, Deli Zhao 📅 2026-07-20 👍 196 2026-07-25 18:30
3D接地 MoE VLA 具身智能 基础模型 机器人操作 视觉语言动作模型

三尺度具身基础模型,新增3D接地与接触点预测,统一动作空间跨本体VLA。

前置知识

视觉语言模型(VLM)

VLM 是能同时处理图像/视频与文本的多模态大模型,典型如 Qwen-VL、GPT-5。它把视觉编码器输出的 token 与文本 token 拼接,喂给一个 decoder-only 的语言模型主干,统一用自回归目标训练。

RynnBrain 1.1 本质上是一个 VLM(基于 Qwen3.5),只是把输出空间从纯文本扩展到了包围盒、点、轨迹、3D 盒、动作等。理解 VLM 才能理解它为什么能用一套自回归接口同时做问答与空间接地。

视觉-语言-动作模型(VLA)

VLA 在 VLM 基础上再接一层'动作'输出,输入图像+指令+机器人状态,输出可执行的动作序列(如关节角或末端位姿)。常见做法是用 flow matching / diffusion 把 VLM 主干当作 DiT,逐步去噪预测一个动作块(action chunk)。

RynnBrain-VLA 正是这套范式。理解 action chunk、flow matching、KV cache 才能看懂它怎么做到低延迟控制,以及为什么'更强的具身基础模型→更好的 VLA'。

具身预训练(Embodied Pretraining)

指在通用 VLM 之上,用大量'接地'数据(物体定位、空间关系、affordance、轨迹、抓取、规划)做继续预训练,让模型学到结构化的空间输出能力,而不是仅靠隐式语言建模去'猜'坐标。

本文的核心论点之一:通用 VLM scaling 在推理密集型具身任务上是负向的(−39.2%),而具身预训练能把它转成正向(+38.6%)。这是全文最关键的科学发现。

Flow Matching / 扩散策略

把动作生成建模成从噪声到目标动作的去噪过程,模型预测一个速度场把简单分布(高斯)搬运到动作分布。相比分类 token,它能输出连续、多峰的动作分布,适合机器人连续控制。

RynnBrain-VLA 用 flow matching 预测 32 步动作块,再配合 Real-Time Chunking(每 5 步触发新推理、用上一块未执行部分引导 β=10.0)实现平滑低延迟。

3D 接地(3D Grounding)

给定语言指令,在三维空间中定位目标物体,通常输出 3D 包围盒(中心、尺寸、朝向)。本文用相机坐标系下的 9 维参数 $(c_x,c_y,c_z,w,l,h,\mathrm{pitch},\mathrm{yaw},\mathrm{roll})$ 表征。

机器人在三维空间操作,2D 像素接地不够用。RynnBrain 1.1 把 3D 接地作为'原生'能力融入预训练(而非后挂检测头),是其主要新增点之一。

混合专家(MoE)

MoE 把前馈层替换成多个'专家'子网络,每个 token 只激活其中少数几个(如 top-k),从而在参数总量大幅扩张的同时保持计算量可控。122B-A10B 表示总参 122B、每 token 激活约 10B。

RynnBrain 1.1 最大变体是 122B-A10B 的稀疏 MoE,训练需要专家并行与高效 token dispatch,理解 MoE 才能评估其训练/推理成本。

跨本体(Cross-Embodiment)

不同机器人形态(人形、双臂、灵巧手)有不同自由度与控制接口,动作空间维度差异巨大。跨本体训练指用一个策略同时学习多种形态的数据。

本文用 81 维统一动作空间 + 本体掩码解决维度不兼容问题,让 Unitree G1、Astribot-S1、Tianji-Wuji 共用一个 VLA,是部署泛化性的关键。

研究动机

现有具身基础模型(包括作者自己的 RynnBrain 1.0)虽然把视觉理解、空间接地、推理规划整合进一个 VLM,但离真正的机器人操作还差几层。其一,抓取任务沿用检测器式的'四角抓取矩形'表征,而一个物体通常有多个功能上等价的合法抓取——这种矩形没有规范的图像空间尺寸,宽高纵横比都依赖夹爪几何与数据集标注约定,用 IoU 评测可能惩罚功能等价的抓取,与执行成功率并不正相关。其二,RynnBrain 1.0 没有显式 3D 建模,而机器人在三维环境工作,缺乏 3D 输出会让空间接地停留在图像平面。其三,跨异构本体(人形/双臂/灵巧手)的 VLA 后训练价值未被验证。更关键的是,作者发现通用 VLM(如 Qwen3.5)在推理密集型具身任务上随规模扩大反而退化(−39.2%),说明纯语言先验无法替代显式空间监督,必须从基础模型预训练阶段就注入接地能力。

本文的目标是本文目标是构建一个更强大、更通用、并能直接迁移到真实机器人动作的具身基础模型家族。具体地:(1)通过新增接触点预测任务,让模型输出更贴近操作语义的接触中心 $(p,\theta)$(中心点+夹爪面内旋转角),取代依赖夹爪几何的抓取矩形;(2)通过原生 3D 接地(对 2B 与 9B 模型),让模型从单张图像+指令+相机内参直接预测相机坐标系下的 3D 包围盒;(3)构建 RynnBrain-VLA,用统一动作空间+本体掩码支持跨本体联合训练,部署到 Unitree G1、Astribot-S1、Tianji-Wuji 三种异构平台;(4)在统一训练框架下系统研究具身能力随规模(2B→9B→122B-A10B)的演化规律。

与已有工作不同的是,本文的独特切入在于把'操作对齐'当作基础模型预训练阶段的一等公民——不再把抓取/3D/动作当作下游任务后挂,而是直接融合到统一的自回归预测接口里:连续坐标离散化到 $[0,1000]$,让包围盒 $B$、点 $P$、轨迹 $T$ 都像文本 token 一样生成。并以此为基础,用一套 81 维、按身体部位分组的统一动作空间 + 本体掩码的极简机制解决跨本体训练的维度不兼容,让一个 VLA 同时吃下多本体数据而不强制对齐。同时把规模研究本身作为科学问题,首次揭示'推理密集型具身任务在通用 VLM 上存在负向 scaling、在具身预训练上才转为正向'这一反直觉现象,为后续具身基础模型设计提供直接方法论指引。

核心方法

直觉上,RynnBrain 1.1 认为'机器人需要的不只是看懂图、答对题,而是要能输出可被机器人直接使用的空间坐标与动作'。技术上,它沿用 Qwen3.5 的 decoder-only VLM 架构(视觉编码器 + 视觉-语言投影器 + LLM 主干),并采用 DeepStack 与 Interleaved MRoPE 整合多模态信息与长上下文时空建模。核心设计是'物理接地的输出空间':把连续图像坐标离散化到 $[0,1000]$,让包围盒 $B$、点 $P$、轨迹 T 都像文本 token 一样自回归预测,从而语义推理与空间定位共享同一套预测头而非各自独立的解码器。在此之上,新增两类任务——3D 接地(输入图像+指令+相机内参,输出 9 维 3D 包围盒 $(c_x,c_y,c_z,w,l,h,\mathrm{pitch},\mathrm{yaw},\mathrm{roll})$)与接触点预测(输出 $a=(p,\theta)$)。所有变体(2B/9B/122B-A10B)共享训练配方,统一用因果自回归目标 $\mathcal{L}=-\sum_{i=1}^{L}\log P(y_i\mid y_{<i},V;\Theta)$ 端到端优化,差异只在容量与数据混合。

与已有方法的本质区别有三点。第一,抓取表征从'检测器式四角矩形'换成'接触中心化的 $(p,\theta)$',剥离了夹爪几何与标注约定相关的冗余维度(宽高纵横比、边界放置),只保留与操作语义直接相关的锚点与面内朝向,规避了 IoU 评估的功能等价陷阱。第二,把 3D 接地作为'原生'能力融入预训练(而非后挂专用检测头),并通过混合两类互补数据——自动 lift 的 WildDet3D(噪声大但类别多、1.2 万类)与 FoundationPose 合成(类别窄仅 928 实例但几何精确、零深度歧义)——让模型同时获得类别多样性与正确的相机-世界投影归纳偏置。第三,VLA 侧的 81 维统一动作空间按身体部位分组(Arm-Joint 14D、Arm-EEF 18D、Gripper 2D、Hand 40D、Torso 4D、Head 3D),共享部分(如左右臂)跨本体接受监督、独有部分仅由对应数据更新,是一个工程极简的'软对齐'方案,无需强行对齐异构低层动作空间。

方法步骤详情

完整步骤如下:(1)数据准备——把通用 MLLM 数据、认知数据(物体/空间/计数/OCR/egocentric)、时空定位数据、3D 接地数据、抓取/接触点数据、规划数据,统一成'指令-视觉输入-混合文本/空间 token 输出'格式。接触点数据通过视角条件渲染+投影流水线:保留物体完全在图像内、尺度合适、抓取中心与朝向可见的视角,丢弃过近/过远/截断/歧义的视角,最终得到 2.6M 样本(来自 GraspAnything、Jacquard V2、GraspFactory、GraspNet-1B、GraspClutter6D)。3D 数据用 WildDet3D Essential(102,979 图/374K 标注/12,064 类)+ Synthetic(896,004 图/888K 标注/11,896 类,用微调 Molmo2 评分 6 个感知准则、保留阈值 >10)+ FoundationPose(1,849K 图/928 实例),并用 Qwen-VL 基于二维框与类别生成开放查询。(2)预训练——在 Qwen3.5-2B/9B/122B-A10B 上端到端因果自回归训练,2B 用学习率 $5\times10^{-6}$、batch 512,9B/122B 用 $2\times10^{-6}$、batch 1024,warmup ratio 0.03,AdamW 优化器,122B 用专家并行 MoE。(3)VLA 后训练——用 flow matching 把 RynnBrain 当成单流 DiT,预测 32 步动作块;动作放在对话格式末尾以启用 KV cache;用 Real-Time Chunking 每 5 步触发新推理,未执行部分以 $\beta=10.0$ 引导新块去噪。(4)部署——三层框架:模型层产 32 步动作块,控制层 30Hz 低频 + 200Hz 高频经共享内存通信,本体层分派标准动作;新增本体只需实现本体层。

技术新颖性

技术新颖性体现在多个层面。其一,把抓取、3D、动作都纳入'统一自回归预测'接口而非拼装多个专用头,这是架构层面的简洁统一。其二,接触中心 $(p,\theta)$ 表征既避开了 IoU 评估的功能等价陷阱,又为下游策略保留了动作相关的空间锚点。其三,3D 接地用'噪声多但多样 + 几何精确但类别窄'的互补混合策略,并用合成数据作为深度与朝向的正则项。其四,81 维统一动作空间 + 本体掩码是解决跨本体训练的极简且可扩展方案,比强行对齐动作空间更优雅。其五,Real-Time Chunking($\beta=10.0$)保证低延迟平滑控制。从科学价值看,本文最具新意的是揭示具身领域的'非均匀 scaling 律':推理密集型任务在通用 VLM 上负向 scaling(−39.2%),在具身预训练上正向 scaling(+38.6%),且具身定位任务上 Qwen3.5 最大规模仍不敌 RynnBrain 最小规模,这对后续具身基础模型的设计与资源分配有直接指导意义。

RynnBrain-VLA architecture and unified action space.
Figure 3: RynnBrain-VLA architecture and unified action space.

实验结果

核心发现可分四块。(1)认知与定位:122B-A10B 在 VSI-Bench 75.0、MMSI 52.0、MindCube 89.6、RefSpatial-Bench 79.1 等多个 benchmark 上超过所有评测的开源与闭源模型,包括 Gemini 3 Pro(VSI-Bench 48.8、MMSI 49.2、MindCube 70.8)、GPT 5.4(VSI-Bench 49.2)、Claude Sonnet 4.6、HY-Embodied 0.5(VSI-Bench 68.3)、Gemini Robotics-ER 1.5。RefSpatial-Bench 从 2B 的 58.5→9B 的 67.2→122B 的 79.1,体现关系型空间接地的强 scaling。(2)3D 接地:SUN RGB-D 上 2B 达 34.28 AP@15(超 Seed1.5-VL 33.5、Gemini 2.0 Pro 32.5),9B 达 41.12,逼近闭源 Gemini Robotics-ER 48.3;WildDet3D-Bench 上 9B 达 23.44 AP3D,反超使用域内数据的专门检测器 WildDet3D(22.6)。(3)Scaling:推理密集任务 RynnBrain 1.1 +38.6%,Qwen3.5 反而 −39.2%;具身定位上 Qwen3.5 在最大规模仍不敌 RynnBrain 最小规模,说明数据型空间监督比模型 scaling 更有效。(4)真机:RynnBrain-VLA 三个长时序任务平均过程分 91.28%/成功率 86.67%,显著优于 Qwen-Based-VLA(68.33%/60.00%)、GR00T N1.7(83.31%/73.33%)、π0.5(72.44%/65.00%);Grab the Spatulas 上 95% vs Qwen 的 50%;Unitree G1 Pull the Chair 90% vs GR00T N1.7 75%;联合多任务多本体训练(Generalist)进一步把平均成功率提到 91.67%、Pour the Wine 单任务过程分从 88 提到 97。

Hyperparameters of the pretraining stage for the RynnBrain model series.
Table 1: Hyperparameters of the pretraining stage for the RynnBrain model series.
Pretraining data mixture for RynnBrain 1.1.
Table 2: Pretraining data mixture for RynnBrain 1.1.
Comparison with lightweight (2B-scale) models on embodied cognition and localization benchmarks.
Table 3: Comparison with lightweight (2B-scale) models on embodied cognition and localization benchmarks.
Comparison with 4B–9B scale models on embodied cognition and localization benchmarks.
Table 4: Comparison with 4B–9B scale models on embodied cognition and localization benchmarks.
Comparison with large-scale open-source and proprietary models on embodied cognition and localization benchmarks.
Table 5: Comparison with large-scale open-source and proprietary models on embodied cognition and localization benchmarks.
Scaling analysis of RynnBrain 1.1 vs. Qwen3.5 from 2B to 122B-A10B.
Figure 4: Scaling analysis of RynnBrain 1.1 vs. Qwen3.5 from 2B to 122B-A10B.
Performance Comparison on SUN RGB-D and WildDet3D-Bench with RynnBrain 1.1-2B and 9B.
Figure 5: Performance Comparison on SUN RGB-D and WildDet3D-Bench with RynnBrain 1.1-2B and 9B.
Qualitative examples of language-conditioned 3D grounding by RynnBrain 1.1.
Figure 6: Qualitative examples of language-conditioned 3D grounding by RynnBrain 1.1.
Qualitative results of contact point prediction by RynnBrain 1.1.
Figure 7: Qualitative results of contact point prediction by RynnBrain 1.1.
Real-robot evaluation across all tasks considered in our experiments.
Figure 8: Real-robot evaluation across all tasks considered in our experiments.
查看结构化数据
任务指标本文基线提升
VSI-Bench(视频空间智能) Accuracy (%) 75.0 (122B-A10B) Gemini 3 Pro 48.8 / GPT 5.4 49.2 / HY-Embodied 0.5 68.3 超越所有开源与闭源对手,对 Gemini 3 Pro +26.2
MMSI(多视图空间智能) Accuracy (%) 52.0 (122B-A10B) Gemini 3 Pro 49.2 / GPT 5.4 37.5 超 Gemini 3 Pro +2.8,达评测第一
MindCube(多视图推理) Accuracy (%) 89.6 (122B-A10B) Gemini 3 Pro 70.8 / HY-Embodied 0.5 69.2 / SenseNova-SI1.5-8B 92.1 大规模上大幅领先,较 2B 的 61.7→122B 的 89.6 强 scaling
RefSpatial-Bench(关系型空间接地) Accuracy (%) 79.1 (122B-A10B) Qwen3.5-122B-A10B 69.3 / HY-Embodied 0.5 57.2 / Gemini 3 Pro 65.5 58.5→67.2→79.1 随规模单调强升
SUN RGB-D 3D 接地 AP@15 34.28 (2B) / 41.12 (9B) Gemini 2.0 Pro 32.5 / Seed1.5-VL 33.5 / Gemini Robotics-ER 48.3 2B 即超通用大模型,9B 大幅缩小与闭源 Robotics-ER 的差距
WildDet3D-Bench AP3D 17.36 (2B) / 23.44 (9B) WildDet3D 专门检测器 22.6(带域内数据)/ 3D-MOOD 30.7 9B 反超使用域内数据的专门检测器 +0.84
Sprinkle the Petals(Astribot 真机) 成功率 (%) 85.0 (单任务) / 85.0 (Generalist) Qwen-Based-VLA 65 / GR00T N1.7 75 / π0.5 60 较 Qwen-Based +20,较 GR00T +10
Pour the Wine(Astribot 真机) 成功率 (%) 80.0 (单任务) / 95.0 (Generalist) Qwen-Based-VLA 65 / GR00T N1.7 65 / π0.5 65 Generalist 较所有 baseline +30,跨本体训练收益最显著
Grab the Spatulas(Tianji-Wuji 灵巧手) 成功率 (%) 95.0 Qwen-Based-VLA 50 / GR00T N1.7 80 / π0.5 70 较 Qwen-Based +45,证明具身预训练对灵巧操作的价值
Pull the Chair(Unitree G1 人形) 成功率 (%) 90.0 GR00T N1.7 + 同款 SONIC 控制器 75 +15,全身人形协同任务上领先

局限与改进

局限性包括:(1)3D 接地目前只在 2B 和 9B 上做'预览'训练,122B-A10B 还没纳入显式 3D 监督,因此最大模型的 3D 潜力未被验证,也无法与 GPT 5.4 等同规模模型在 3D 上公平比较。(2)接触点预测缺乏标准化评测指标——像素级距离会惩罚功能等价的合法抓取,传统抓取盒指标又不适用于接触中心表征,作者只能给定性结果(Figure 7),难以量化横向对比。(3)3D 数据严重依赖单目 lift,WildDet3D Synthetic 子集虽用微调 Molmo2 按 6 个感知准则过滤(保留阈值 >10)但仍残留噪声,类别多样性与几何精度是权衡。(4)真机主任务只有三个做严格定量(每任务 20 次),统计样本偏小,且任务设计偏向桌面长时序操作,未覆盖可变形物体、高动态、户外等场景。(5)统一动作空间对完全不同形态(轮式、四足、软体)的可扩展性未验证,且 G1 的 64D SONIC token 游离在 81 维统一空间之外。(6)不少 baseline 是作者自行复现(带 *),公平性需谨慎;同时强 baseline(如 Gemini Robotics-ER)只在部分 benchmark 有数,缺乏全维对照。

独立分析的弱点

独立分析的弱点:(1)3D 接地的'预览'性质使其最大模型 122B-A10B 反而没有 3D 能力,与同规模 MLLM 的比较存在缺口——改进方向是在 122B 上完整复跑 3D 训练并报告。(2)接触点 $(p,\theta)$ 评估缺位是显著短板——建议构造'功能等价抓取容忍集'指标,对一组人工标注的多合法抓取算 recall@k 或基于下游抓取成功率的回归指标,让这一新表征真正可被社区采纳。(3)真机实验只覆盖三种本体,未涉及四足/轮式/软体机器人,统一动作空间对'完全异构本体'的可迁移性存疑——改进方向是把 Hand 组进一步细分为可拼接的子组,并引入形态无关的语义接口。(4)SONIC 64D token 是 G1 专用且在统一动作空间之外,破坏了'完全统一'的承诺,说明现有统一空间还不足以表达全身人形运动——可探索把全身运动 token 也纳入统一空间或设计层次化动作表征。(5)数据规模与训练 token 数明细未公开,部分'RynnBrain-XXX'自采数据是否开放不明确,影响可复现性。

未来方向

作者明确提出的方向:把 RynnBrain 扩展为统一多模态模型,融合感知、理解、生成、空间接地与动作于一个共同框架;发展成通用具身 agent 的认知核,集成长期记忆、世界模型、任务规划、主动感知与闭环交互,并能从跨任务跨本体的交互中持续习得新技能。基于现有成果可延伸的方向:(1)把 3D 接地扩展到 122B-A10B 并引入时序 3D(视频 3D 跟踪、动态场景);(2)建立接触点预测的功能化评测协议与抓取成功率回归基准;(3)把统一动作空间扩展到更多形态(轮式、四足、软体)并研究掩码稀疏度对梯度共享的影响;(4)结合 RTC 与 speculative decoding 进一步压低 VLA 推理延迟;(5)探索基础模型预训练与 VLA 后训练的联合优化而非两阶段,让接地能力与动作能力互相强化。

复现评估

复现评估中等偏上。开源情况良好:代码、模型权重(HuggingFace + ModelScope)、项目主页均开放,2B/9B/122B-A10B 三尺度模型都可下载。数据上,3D 用了公开的 WildDet3D 与 FoundationPose,接触点用了公开的 GraspNet-1B、Jacquard V2、GraspFactory、GraspClutter6D、Grasp-Anything 等,但也有大量'RynnBrain-Object/Spatial/Grounding/Area/Affordance/Trajectory/Planning/Thinking/Counting/OCR'等自采数据,是否开放不明确。算力上,122B-A10B 的 MoE 训练需要大规模专家并行集群,普通团队难以复现全尺度;9B/2B 相对可行。训练超参(Table 1:LR、batch、warmup、optimizer)与 VLA 微调配方(60k steps、LR $2\times10^{-5}$、batch 32、短边 384px、action chunk 32)披露较完整。真机评测协议清晰(20 trials、固定成功判据、过程分公式 $\frac{1}{20K}\sum_{i=1}^{20}\sum_{j=1}^{K}s_{i,j}$)。主要难点在于:接触点与 3D 的数据渲染/投影流水线工程量大、真机硬件(Unitree G1、Astribot-S1、Tianji-Wuji、RTX 4090 工作站)成本高、跨本体部署框架需自行适配本体层。