RynnBrain 1.1:迈向更强大、更通用的具身基础模型 RynnBrain 1.1: Towards More Capable and Generalizable Embodied Foundation Model
三尺度具身基础模型,新增3D接地与接触点预测,统一动作空间跨本体VLA。
前置知识
视觉语言模型(VLM)
VLM 是能同时处理图像/视频与文本的多模态大模型,典型如 Qwen-VL、GPT-5。它把视觉编码器输出的 token 与文本 token 拼接,喂给一个 decoder-only 的语言模型主干,统一用自回归目标训练。
RynnBrain 1.1 本质上是一个 VLM(基于 Qwen3.5),只是把输出空间从纯文本扩展到了包围盒、点、轨迹、3D 盒、动作等。理解 VLM 才能理解它为什么能用一套自回归接口同时做问答与空间接地。
视觉-语言-动作模型(VLA)
VLA 在 VLM 基础上再接一层'动作'输出,输入图像+指令+机器人状态,输出可执行的动作序列(如关节角或末端位姿)。常见做法是用 flow matching / diffusion 把 VLM 主干当作 DiT,逐步去噪预测一个动作块(action chunk)。
RynnBrain-VLA 正是这套范式。理解 action chunk、flow matching、KV cache 才能看懂它怎么做到低延迟控制,以及为什么'更强的具身基础模型→更好的 VLA'。
具身预训练(Embodied Pretraining)
指在通用 VLM 之上,用大量'接地'数据(物体定位、空间关系、affordance、轨迹、抓取、规划)做继续预训练,让模型学到结构化的空间输出能力,而不是仅靠隐式语言建模去'猜'坐标。
本文的核心论点之一:通用 VLM scaling 在推理密集型具身任务上是负向的(−39.2%),而具身预训练能把它转成正向(+38.6%)。这是全文最关键的科学发现。
Flow Matching / 扩散策略
把动作生成建模成从噪声到目标动作的去噪过程,模型预测一个速度场把简单分布(高斯)搬运到动作分布。相比分类 token,它能输出连续、多峰的动作分布,适合机器人连续控制。
RynnBrain-VLA 用 flow matching 预测 32 步动作块,再配合 Real-Time Chunking(每 5 步触发新推理、用上一块未执行部分引导 β=10.0)实现平滑低延迟。
3D 接地(3D Grounding)
给定语言指令,在三维空间中定位目标物体,通常输出 3D 包围盒(中心、尺寸、朝向)。本文用相机坐标系下的 9 维参数 $(c_x,c_y,c_z,w,l,h,\mathrm{pitch},\mathrm{yaw},\mathrm{roll})$ 表征。
机器人在三维空间操作,2D 像素接地不够用。RynnBrain 1.1 把 3D 接地作为'原生'能力融入预训练(而非后挂检测头),是其主要新增点之一。
混合专家(MoE)
MoE 把前馈层替换成多个'专家'子网络,每个 token 只激活其中少数几个(如 top-k),从而在参数总量大幅扩张的同时保持计算量可控。122B-A10B 表示总参 122B、每 token 激活约 10B。
RynnBrain 1.1 最大变体是 122B-A10B 的稀疏 MoE,训练需要专家并行与高效 token dispatch,理解 MoE 才能评估其训练/推理成本。
跨本体(Cross-Embodiment)
不同机器人形态(人形、双臂、灵巧手)有不同自由度与控制接口,动作空间维度差异巨大。跨本体训练指用一个策略同时学习多种形态的数据。
本文用 81 维统一动作空间 + 本体掩码解决维度不兼容问题,让 Unitree G1、Astribot-S1、Tianji-Wuji 共用一个 VLA,是部署泛化性的关键。
研究动机
现有具身基础模型(包括作者自己的 RynnBrain 1.0)虽然把视觉理解、空间接地、推理规划整合进一个 VLM,但离真正的机器人操作还差几层。其一,抓取任务沿用检测器式的'四角抓取矩形'表征,而一个物体通常有多个功能上等价的合法抓取——这种矩形没有规范的图像空间尺寸,宽高纵横比都依赖夹爪几何与数据集标注约定,用 IoU 评测可能惩罚功能等价的抓取,与执行成功率并不正相关。其二,RynnBrain 1.0 没有显式 3D 建模,而机器人在三维环境工作,缺乏 3D 输出会让空间接地停留在图像平面。其三,跨异构本体(人形/双臂/灵巧手)的 VLA 后训练价值未被验证。更关键的是,作者发现通用 VLM(如 Qwen3.5)在推理密集型具身任务上随规模扩大反而退化(−39.2%),说明纯语言先验无法替代显式空间监督,必须从基础模型预训练阶段就注入接地能力。
本文的目标是本文目标是构建一个更强大、更通用、并能直接迁移到真实机器人动作的具身基础模型家族。具体地:(1)通过新增接触点预测任务,让模型输出更贴近操作语义的接触中心 $(p,\theta)$(中心点+夹爪面内旋转角),取代依赖夹爪几何的抓取矩形;(2)通过原生 3D 接地(对 2B 与 9B 模型),让模型从单张图像+指令+相机内参直接预测相机坐标系下的 3D 包围盒;(3)构建 RynnBrain-VLA,用统一动作空间+本体掩码支持跨本体联合训练,部署到 Unitree G1、Astribot-S1、Tianji-Wuji 三种异构平台;(4)在统一训练框架下系统研究具身能力随规模(2B→9B→122B-A10B)的演化规律。
与已有工作不同的是,本文的独特切入在于把'操作对齐'当作基础模型预训练阶段的一等公民——不再把抓取/3D/动作当作下游任务后挂,而是直接融合到统一的自回归预测接口里:连续坐标离散化到 $[0,1000]$,让包围盒 $B$、点 $P$、轨迹 $T$ 都像文本 token 一样生成。并以此为基础,用一套 81 维、按身体部位分组的统一动作空间 + 本体掩码的极简机制解决跨本体训练的维度不兼容,让一个 VLA 同时吃下多本体数据而不强制对齐。同时把规模研究本身作为科学问题,首次揭示'推理密集型具身任务在通用 VLM 上存在负向 scaling、在具身预训练上才转为正向'这一反直觉现象,为后续具身基础模型设计提供直接方法论指引。
核心方法
直觉上,RynnBrain 1.1 认为'机器人需要的不只是看懂图、答对题,而是要能输出可被机器人直接使用的空间坐标与动作'。技术上,它沿用 Qwen3.5 的 decoder-only VLM 架构(视觉编码器 + 视觉-语言投影器 + LLM 主干),并采用 DeepStack 与 Interleaved MRoPE 整合多模态信息与长上下文时空建模。核心设计是'物理接地的输出空间':把连续图像坐标离散化到 $[0,1000]$,让包围盒 $B$、点 $P$、轨迹 T 都像文本 token 一样自回归预测,从而语义推理与空间定位共享同一套预测头而非各自独立的解码器。在此之上,新增两类任务——3D 接地(输入图像+指令+相机内参,输出 9 维 3D 包围盒 $(c_x,c_y,c_z,w,l,h,\mathrm{pitch},\mathrm{yaw},\mathrm{roll})$)与接触点预测(输出 $a=(p,\theta)$)。所有变体(2B/9B/122B-A10B)共享训练配方,统一用因果自回归目标 $\mathcal{L}=-\sum_{i=1}^{L}\log P(y_i\mid y_{<i},V;\Theta)$ 端到端优化,差异只在容量与数据混合。
与已有方法的本质区别有三点。第一,抓取表征从'检测器式四角矩形'换成'接触中心化的 $(p,\theta)$',剥离了夹爪几何与标注约定相关的冗余维度(宽高纵横比、边界放置),只保留与操作语义直接相关的锚点与面内朝向,规避了 IoU 评估的功能等价陷阱。第二,把 3D 接地作为'原生'能力融入预训练(而非后挂专用检测头),并通过混合两类互补数据——自动 lift 的 WildDet3D(噪声大但类别多、1.2 万类)与 FoundationPose 合成(类别窄仅 928 实例但几何精确、零深度歧义)——让模型同时获得类别多样性与正确的相机-世界投影归纳偏置。第三,VLA 侧的 81 维统一动作空间按身体部位分组(Arm-Joint 14D、Arm-EEF 18D、Gripper 2D、Hand 40D、Torso 4D、Head 3D),共享部分(如左右臂)跨本体接受监督、独有部分仅由对应数据更新,是一个工程极简的'软对齐'方案,无需强行对齐异构低层动作空间。
方法步骤详情
完整步骤如下:(1)数据准备——把通用 MLLM 数据、认知数据(物体/空间/计数/OCR/egocentric)、时空定位数据、3D 接地数据、抓取/接触点数据、规划数据,统一成'指令-视觉输入-混合文本/空间 token 输出'格式。接触点数据通过视角条件渲染+投影流水线:保留物体完全在图像内、尺度合适、抓取中心与朝向可见的视角,丢弃过近/过远/截断/歧义的视角,最终得到 2.6M 样本(来自 GraspAnything、Jacquard V2、GraspFactory、GraspNet-1B、GraspClutter6D)。3D 数据用 WildDet3D Essential(102,979 图/374K 标注/12,064 类)+ Synthetic(896,004 图/888K 标注/11,896 类,用微调 Molmo2 评分 6 个感知准则、保留阈值 >10)+ FoundationPose(1,849K 图/928 实例),并用 Qwen-VL 基于二维框与类别生成开放查询。(2)预训练——在 Qwen3.5-2B/9B/122B-A10B 上端到端因果自回归训练,2B 用学习率 $5\times10^{-6}$、batch 512,9B/122B 用 $2\times10^{-6}$、batch 1024,warmup ratio 0.03,AdamW 优化器,122B 用专家并行 MoE。(3)VLA 后训练——用 flow matching 把 RynnBrain 当成单流 DiT,预测 32 步动作块;动作放在对话格式末尾以启用 KV cache;用 Real-Time Chunking 每 5 步触发新推理,未执行部分以 $\beta=10.0$ 引导新块去噪。(4)部署——三层框架:模型层产 32 步动作块,控制层 30Hz 低频 + 200Hz 高频经共享内存通信,本体层分派标准动作;新增本体只需实现本体层。
技术新颖性
技术新颖性体现在多个层面。其一,把抓取、3D、动作都纳入'统一自回归预测'接口而非拼装多个专用头,这是架构层面的简洁统一。其二,接触中心 $(p,\theta)$ 表征既避开了 IoU 评估的功能等价陷阱,又为下游策略保留了动作相关的空间锚点。其三,3D 接地用'噪声多但多样 + 几何精确但类别窄'的互补混合策略,并用合成数据作为深度与朝向的正则项。其四,81 维统一动作空间 + 本体掩码是解决跨本体训练的极简且可扩展方案,比强行对齐动作空间更优雅。其五,Real-Time Chunking($\beta=10.0$)保证低延迟平滑控制。从科学价值看,本文最具新意的是揭示具身领域的'非均匀 scaling 律':推理密集型任务在通用 VLM 上负向 scaling(−39.2%),在具身预训练上正向 scaling(+38.6%),且具身定位任务上 Qwen3.5 最大规模仍不敌 RynnBrain 最小规模,这对后续具身基础模型的设计与资源分配有直接指导意义。
实验结果
核心发现可分四块。(1)认知与定位:122B-A10B 在 VSI-Bench 75.0、MMSI 52.0、MindCube 89.6、RefSpatial-Bench 79.1 等多个 benchmark 上超过所有评测的开源与闭源模型,包括 Gemini 3 Pro(VSI-Bench 48.8、MMSI 49.2、MindCube 70.8)、GPT 5.4(VSI-Bench 49.2)、Claude Sonnet 4.6、HY-Embodied 0.5(VSI-Bench 68.3)、Gemini Robotics-ER 1.5。RefSpatial-Bench 从 2B 的 58.5→9B 的 67.2→122B 的 79.1,体现关系型空间接地的强 scaling。(2)3D 接地:SUN RGB-D 上 2B 达 34.28 AP@15(超 Seed1.5-VL 33.5、Gemini 2.0 Pro 32.5),9B 达 41.12,逼近闭源 Gemini Robotics-ER 48.3;WildDet3D-Bench 上 9B 达 23.44 AP3D,反超使用域内数据的专门检测器 WildDet3D(22.6)。(3)Scaling:推理密集任务 RynnBrain 1.1 +38.6%,Qwen3.5 反而 −39.2%;具身定位上 Qwen3.5 在最大规模仍不敌 RynnBrain 最小规模,说明数据型空间监督比模型 scaling 更有效。(4)真机:RynnBrain-VLA 三个长时序任务平均过程分 91.28%/成功率 86.67%,显著优于 Qwen-Based-VLA(68.33%/60.00%)、GR00T N1.7(83.31%/73.33%)、π0.5(72.44%/65.00%);Grab the Spatulas 上 95% vs Qwen 的 50%;Unitree G1 Pull the Chair 90% vs GR00T N1.7 75%;联合多任务多本体训练(Generalist)进一步把平均成功率提到 91.67%、Pour the Wine 单任务过程分从 88 提到 97。
查看结构化数据
| 任务 | 指标 | 本文 | 基线 | 提升 |
|---|---|---|---|---|
| VSI-Bench(视频空间智能) | Accuracy (%) | 75.0 (122B-A10B) | Gemini 3 Pro 48.8 / GPT 5.4 49.2 / HY-Embodied 0.5 68.3 | 超越所有开源与闭源对手,对 Gemini 3 Pro +26.2 |
| MMSI(多视图空间智能) | Accuracy (%) | 52.0 (122B-A10B) | Gemini 3 Pro 49.2 / GPT 5.4 37.5 | 超 Gemini 3 Pro +2.8,达评测第一 |
| MindCube(多视图推理) | Accuracy (%) | 89.6 (122B-A10B) | Gemini 3 Pro 70.8 / HY-Embodied 0.5 69.2 / SenseNova-SI1.5-8B 92.1 | 大规模上大幅领先,较 2B 的 61.7→122B 的 89.6 强 scaling |
| RefSpatial-Bench(关系型空间接地) | Accuracy (%) | 79.1 (122B-A10B) | Qwen3.5-122B-A10B 69.3 / HY-Embodied 0.5 57.2 / Gemini 3 Pro 65.5 | 58.5→67.2→79.1 随规模单调强升 |
| SUN RGB-D 3D 接地 | AP@15 | 34.28 (2B) / 41.12 (9B) | Gemini 2.0 Pro 32.5 / Seed1.5-VL 33.5 / Gemini Robotics-ER 48.3 | 2B 即超通用大模型,9B 大幅缩小与闭源 Robotics-ER 的差距 |
| WildDet3D-Bench | AP3D | 17.36 (2B) / 23.44 (9B) | WildDet3D 专门检测器 22.6(带域内数据)/ 3D-MOOD 30.7 | 9B 反超使用域内数据的专门检测器 +0.84 |
| Sprinkle the Petals(Astribot 真机) | 成功率 (%) | 85.0 (单任务) / 85.0 (Generalist) | Qwen-Based-VLA 65 / GR00T N1.7 75 / π0.5 60 | 较 Qwen-Based +20,较 GR00T +10 |
| Pour the Wine(Astribot 真机) | 成功率 (%) | 80.0 (单任务) / 95.0 (Generalist) | Qwen-Based-VLA 65 / GR00T N1.7 65 / π0.5 65 | Generalist 较所有 baseline +30,跨本体训练收益最显著 |
| Grab the Spatulas(Tianji-Wuji 灵巧手) | 成功率 (%) | 95.0 | Qwen-Based-VLA 50 / GR00T N1.7 80 / π0.5 70 | 较 Qwen-Based +45,证明具身预训练对灵巧操作的价值 |
| Pull the Chair(Unitree G1 人形) | 成功率 (%) | 90.0 | GR00T N1.7 + 同款 SONIC 控制器 75 | +15,全身人形协同任务上领先 |
局限与改进
局限性包括:(1)3D 接地目前只在 2B 和 9B 上做'预览'训练,122B-A10B 还没纳入显式 3D 监督,因此最大模型的 3D 潜力未被验证,也无法与 GPT 5.4 等同规模模型在 3D 上公平比较。(2)接触点预测缺乏标准化评测指标——像素级距离会惩罚功能等价的合法抓取,传统抓取盒指标又不适用于接触中心表征,作者只能给定性结果(Figure 7),难以量化横向对比。(3)3D 数据严重依赖单目 lift,WildDet3D Synthetic 子集虽用微调 Molmo2 按 6 个感知准则过滤(保留阈值 >10)但仍残留噪声,类别多样性与几何精度是权衡。(4)真机主任务只有三个做严格定量(每任务 20 次),统计样本偏小,且任务设计偏向桌面长时序操作,未覆盖可变形物体、高动态、户外等场景。(5)统一动作空间对完全不同形态(轮式、四足、软体)的可扩展性未验证,且 G1 的 64D SONIC token 游离在 81 维统一空间之外。(6)不少 baseline 是作者自行复现(带 *),公平性需谨慎;同时强 baseline(如 Gemini Robotics-ER)只在部分 benchmark 有数,缺乏全维对照。
独立分析的弱点
独立分析的弱点:(1)3D 接地的'预览'性质使其最大模型 122B-A10B 反而没有 3D 能力,与同规模 MLLM 的比较存在缺口——改进方向是在 122B 上完整复跑 3D 训练并报告。(2)接触点 $(p,\theta)$ 评估缺位是显著短板——建议构造'功能等价抓取容忍集'指标,对一组人工标注的多合法抓取算 recall@k 或基于下游抓取成功率的回归指标,让这一新表征真正可被社区采纳。(3)真机实验只覆盖三种本体,未涉及四足/轮式/软体机器人,统一动作空间对'完全异构本体'的可迁移性存疑——改进方向是把 Hand 组进一步细分为可拼接的子组,并引入形态无关的语义接口。(4)SONIC 64D token 是 G1 专用且在统一动作空间之外,破坏了'完全统一'的承诺,说明现有统一空间还不足以表达全身人形运动——可探索把全身运动 token 也纳入统一空间或设计层次化动作表征。(5)数据规模与训练 token 数明细未公开,部分'RynnBrain-XXX'自采数据是否开放不明确,影响可复现性。
未来方向
作者明确提出的方向:把 RynnBrain 扩展为统一多模态模型,融合感知、理解、生成、空间接地与动作于一个共同框架;发展成通用具身 agent 的认知核,集成长期记忆、世界模型、任务规划、主动感知与闭环交互,并能从跨任务跨本体的交互中持续习得新技能。基于现有成果可延伸的方向:(1)把 3D 接地扩展到 122B-A10B 并引入时序 3D(视频 3D 跟踪、动态场景);(2)建立接触点预测的功能化评测协议与抓取成功率回归基准;(3)把统一动作空间扩展到更多形态(轮式、四足、软体)并研究掩码稀疏度对梯度共享的影响;(4)结合 RTC 与 speculative decoding 进一步压低 VLA 推理延迟;(5)探索基础模型预训练与 VLA 后训练的联合优化而非两阶段,让接地能力与动作能力互相强化。
复现评估
复现评估中等偏上。开源情况良好:代码、模型权重(HuggingFace + ModelScope)、项目主页均开放,2B/9B/122B-A10B 三尺度模型都可下载。数据上,3D 用了公开的 WildDet3D 与 FoundationPose,接触点用了公开的 GraspNet-1B、Jacquard V2、GraspFactory、GraspClutter6D、Grasp-Anything 等,但也有大量'RynnBrain-Object/Spatial/Grounding/Area/Affordance/Trajectory/Planning/Thinking/Counting/OCR'等自采数据,是否开放不明确。算力上,122B-A10B 的 MoE 训练需要大规模专家并行集群,普通团队难以复现全尺度;9B/2B 相对可行。训练超参(Table 1:LR、batch、warmup、optimizer)与 VLA 微调配方(60k steps、LR $2\times10^{-5}$、batch 32、短边 384px、action chunk 32)披露较完整。真机评测协议清晰(20 trials、固定成功判据、过程分公式 $\frac{1}{20K}\sum_{i=1}^{20}\sum_{j=1}^{K}s_{i,j}$)。主要难点在于:接触点与 3D 的数据渲染/投影流水线工程量大、真机硬件(Unitree G1、Astribot-S1、Tianji-Wuji、RTX 4090 工作站)成本高、跨本体部署框架需自行适配本体层。
论文图表
总览图:展示 2B/9B/122B-A10B 三个尺度变体 + RynnBrain-VLA,在 3D 接地、接触点预测、跨本体动作预测、认知/定位等多维度 benchmark 上的领先表现,以及与代表性竞品的对比雷达。
一图把握论文全貌与卖点,是理解贡献定位的入口。
架构图:vision encoder 输出 token 后接 Dense 或 MoE 解码器,输入支持单视图图像/多视图图像/视频(720px、1080px),统一输出文本、区域(bounding box/segmentation mask)、轨迹(motion path)、pointing sequence、3D 感知、接触点等,覆盖 egocentric 理解、时空接地、物理推理与细粒度动作规划。
帮助理解'统一输出空间'这一核心架构设计——所有空间输出共用一套自回归预测接口。
三个长时序任务的过程分/成功率。RynnBrain-VLA(单任务)Sprinkle 87.50/85、Pour 88.00/80、Grab 98.33/95,平均 91.28/86.67;Generalist 88.75/85、97.00/95、96.67/95,平均 94.14/91.67。对比 Qwen-Based-VLA 75/65、75/65、55/50(平均 68.33/60.00),GR00T N1.7 86.25/75、77/65、86.67/80(平均 83.31/73.33),π0.5 65/60、69/65、83.33/70(平均 72.44/65.00)。
真机核心定量结果,直接证明'更强具身基础模型→更好 VLA'与跨本体联合训练的收益。