RxBrain:联合语言-视觉推理与想象的具身认知基础模型 RxBrain: Embodied Cognition Foundation Model with Joint Language-Visual Reasoning and Imagination
统一语言推理与视觉想象,单模型端到端生成具身规划
前置知识
Mixture-of-Transformers (MoT)
一种模态感知的 Transformer 架构。输入 token 先按所属模态(文本、视觉理解、视觉生成等)被分流到专门的 Transformer 分支,再通过一个全局自注意力层实现跨模态信息交换。和把所有 token 混在一起的标准 Transformer 相比,MoT 让不同模态既能保留专属的计算路径(各自的 QKV 投影和 FFN),又能在共享注意力里互通信息,从而在单模型里同时建模理解与生成。
RxBrain 的全部能力(语言理解/生成、视觉理解/生成、动作生成)都构建在 MoT 之上,理解 token 如何按模态路由、专家如何共享注意力,是看懂本文架构图的前提。
Flow Matching(流匹配)
一种用于生成建模的训练目标。给定干净样本 $x_0$ 和高斯噪声 $\epsilon\sim\mathcal{N}(0,I)$,构造线性插值路径 $x_t=(1-t)x_0+t\epsilon$($t\in[0,1]$),模型学习速度场 $v_\theta(x_t,t,c)$ 去回归真实速度 $(\epsilon-x_0)$,损失为 $\mathcal{L}_{\text{flow}}=\mathbb{E}\|v_\theta-(\epsilon-x_0)\|_2^2$。推理时沿预测的速度场求解 ODE 完成去噪生成,相比扩散模型路径更直、采样更快。本文用它生成视觉潜变量和机器人动作。
RxBrain 的视觉想象和动作生成都依赖流匹配目标,且文本走自回归、视觉走流匹配的「双范式」是全文核心设计,也是其训练-推理不一致这一关键局限的来源。
VAE 潜空间(Latent Space)
变分自编码器(VAE)将图像压缩到低维潜表示 $z$,编码器 $E_{\text{VAE}}$ 把图像压成潜变量、解码器 $D_{\text{VAE}}$ 把潜变量还原为图像。在潜空间里做生成(而非像素空间)能大幅降低 token 数和计算量,FLUX 等主流生成模型都采用 16 倍下采样的 VAE。RxBrain 复用 FLUX 的冻结 VAE 作为视觉 token 编解码器,在 256px 分辨率下工作。
理解生成 token 始终在 VAE 潜空间中、且理解分支与生成分支共享同一个视觉塔但走不同 FFN,才能看懂为什么本文能做到理解与生成共享语义表示又不互相干扰。
世界模型(World Model)
世界模型指预测环境如何随时间演化的一类模型——给定当前观测和动作,预测未来视觉状态。它让智能体能「想象」执行某动作后世界会变成什么样,从而支持视觉规划、状态评估和闭环控制。具身世界动作模型(WAM)进一步把未来预测与动作生成耦合。RxBrain 的世界状态预测能力正是这一范式的体现。
本文最核心的卖点是把语言推理(VLM 擅长)和视觉想象(世界模型擅长)合并到一条规划序列里,理解世界模型在具身 AI 中的定位才能领会这种「互补」设计为什么重要。
VLA(Vision-Language-Action)策略
视觉-语言-动作模型把感知(图像)、指令(语言)和低层控制(机器人关节/末端位姿)统一进一个模型,端到端地输出可执行动作。典型方法(如 $\pi_0$、$\pi_{0.5}$)通过流匹配或扩散头生成动作块(action chunk),即未来若干步的动作序列。RxBrain 在第 7 章把动作生成为第 5 个模态接入主干,验证「认知先验可替代大规模动作预训练」的假设。
真机对比实验的基线 $\pi_0$、$\pi_{0.5}$ 都是 VLA 模型,理解动作块、流匹配动作头等概念才能看懂 RxBrain 的 87% 平均成功率如何取得。
研究动机
具身认知要求智能体不仅能想清楚「要做什么」,还要能想象「做完之后世界会变成什么样」。然而现有两条技术路线是割裂的:视觉-语言模型(VLM)擅长场景理解、任务分解、因果推理和高层决策,但其认知过程停留在语言层面,对「目标物理状态」只是隐式描述,缺乏对视觉目标态的显式想象;生成式世界模型则专注预测未来观测、模拟状态转移,却不擅长显式的因果推理、抽象任务理解和约束感知。结果是——在「摆盘」「折叠眼镜入盒」「开盖丢垃圾」这类多阶段操作任务中,单靠语言描述会漏掉关键的空间与状态细节(例如「把盘子放到餐垫的什么位置」),单靠视觉目标态又无法揭示背后的因果结构和中间决策。更接近的 Cosmos 3 虽然把理解、生成、仿真、动作塞进一个全能框架,但仍把它们当作「分离的能力」而非耦合的认知过程来组织。
本文的目标是本文要构建一个能把语言推理与视觉想象在「同一条规划序列」里耦合起来的具身认知基础模型 RxBrain。具体可量化的目标包括:在一个统一模型内同时保持通用文生图能力(GenEval 不输 Bagel 这类生成专家)和广泛的具身/空间理解能力(多视角 3D、机器人可达性等多个 benchmark 上取得最佳或次佳),并新设 RxBrain-Bench 来直接评测「联合文本-视觉规划」这一闭环能力;同时验证这种「认知先验」能否在不大规模预训练动作数据的前提下迁移到真机连续动作生成,达到与 $\pi_0$、$\pi_{0.5}$ 相当甚至更好的真实成功率。
与已有工作不同的是,作者的独特切入点是「互补而非同义」的语言-视觉关系。此前 BAGEL 这类交织生成模型里,文本和图像往往表达同一语义内容(描述同一张图);而具身规划需要的是「语言规定动作/约束/决策,视觉想象规定这些动作应达成的目标与中间世界状态」。这种互补耦合在数据上几乎不存在现成监督——手动标注「每一步该做什么 + 做完画面应该长什么样」极贵。因此本文真正的差异化贡献是一个全自动流水线:把海量具身视频拆解成对齐的「文本规划步 + 视觉状态转移」样本,并通过一个新基准强制模型在闭环 rollout 中交替生成文本和目标图,这正是被前人忽视的盲区。
核心方法
直觉上,RxBrain 像一个「边说边画」的规划者:先用语言说「第一步抓住布的右边缘」,紧接着画出抓完后世界应有的样子,再基于这张画好的图决定下一步、再画下一张,直到任务完成。技术路线上,RxBrain 基于 HY-Embodied-0.5,采用统一的模态感知 Mixture-of-Transformers 架构(总参 6.2B)。模型有三条核心生成路径:自回归文本生成(VQA、推理)、多帧视觉预测(一次生成 4 帧未来状态)、以及交错生成(interleave)——即 $\langle\text{assistant}\rangle r_1 \langle\text{Image}\rangle z_{1,1:N}\langle/\text{Image}\rangle r_2 \dots\langle\text{eos}\rangle$,其中 $r_i$ 是第 $i$ 步的推理文本、$z_{i,1:N}$ 是流匹配生成的潜变量。文本走因果注意力,视觉 token 帧内双向、帧间因果,从而既保留自回归结构又允许帧内全局信息交换。
全文最本质的创新是「在同一条规划序列里让语言与视觉扮演互补角色」:语言提供抽象结构(任务分解、规划原语、约束、时序、决策逻辑),视觉想象则把结构「接地」——预测每个规划步对应的中间与最终物理状态。与之配套的架构巧思是:视觉理解 token 与视觉生成 token 共用同一个视觉 Transformer 和 QKV 投影层,但通过模态条件路由分到不同 FFN 专家(生成专家的中间维度从 6144 加宽到 12288,约 2.4B 参数),让感知与想象在共享视觉塔内交互、又在专属计算里互不干扰;生成路径还移除了额外的 VAE 编码视觉输入 token,直接在 VAE 潜空间里做生成,简化了输入流水线。这种「共享注意力 + 专家分流」与 Cosmos 3 把理解和生成当作「分离任务模式」的做法形成鲜明对比。
方法步骤详情
数据构造分三阶段。Temporal Segment Annotation:在 LUV 颜色空间算帧间差分 $\delta_k$,用自适应阈值 $\theta_\delta=\max(Q_{0.8},Q_{0.5}+0.2(Q_{0.9}-Q_{0.5}))$ 选关键帧(封顶 50 帧再下采样到 $n=30$),由单一 MLLM $\Phi$ 一次过返回候选步 $c_i=(a_i,d_i,p_i,q_i)$,再双向边界精修——先在粗终点附近采 8 帧选「状态完成最早一帧」作结束锚,再反推起始锚。Quality Verification 按 0-5 分语义质量、视觉接地、文本-视觉一致性三项打分,保留 75.18%。Segment Structuring 产出 L0 段内状态预测、L1 步级规划、L2 子目标、L3 终态想象四级监督,共 50,177.2 小时、21,506,919 段。训练两阶段:Stage 1 联合预训练(文生图 60%、理解 40%,$\lambda_{CE}{=}0.25,\lambda_{FM}{=}1.0$,368 卡);Stage 2 具身微调(理解 34.6%、多帧 16.2%、交错规划 20.8%,$\lambda_{CE}{=}\lambda_{FM}{=}1.0$,312 卡)。推理感知构造:训练时把真值图经 VAE 编解码回灌 $\tilde I_i=E_{\text{vis}}(D_{\text{VAE}}(E_{\text{VAE}}(I_i)))$,使训练上下文与推理时「自生成图回灌」一致。
技术新颖性
技术新颖性集中在四点:(1) 首次在具身规划里把语言和视觉当作「互补功能」耦合在一条自回归序列里,而非像 BAGEL 那样让两者表达同一语义;(2) 共享视觉塔 + 专家分流的 MoT 设计,让理解与生成在 VAE 潜空间里共享语义、又通过加宽的生成 FFN 保留专属能力,无需为生成另起一个 Transformer;(3) 一套 source-agnostic 的全自动数据流水线(关键帧采样 → 全局解析 → 双向边界精修 → 三项质量门),把任意具身视频转成 L0–L3 多粒度监督,75.18% 通过率;(4) 推理感知(inference-aware)的视觉状态构造:训练时把真值图经 VAE 编解码再回灌 $\tilde I_i=E_{\text{vis}}(D_{\text{VAE}}(E_{\text{VAE}}(I_i)))$,使训练上下文与推理时的「自生成图回灌」一致,缓解交错 rollout 的误差累积。这些与 Janus(解耦视觉编码路径)、Transfusion(单 Transformer 双损失)等统一理解生成方案在「认知耦合」这一维度上有本质不同。
实验结果
实验沿四轴展开。通用文生图(GenEval):RxBrain 82.4,与生成专家 Bagel(82)持平、远超 Cosmos-3-Nano(71.68),证明统一模型未牺牲生成质量。具身与空间理解:19 个 benchmark 中 CV-Bench(88.59)、DA-2k(83.4)、3DRSBench(54.1)、MMSI-Bench(35.8)、MindCube(47.5)、SITE-Bench-Image(54.9)等多项拿下最优,Share-Robot-Trajectory 51.13、RoboSpatial-Home 配置 86.28 也是最佳;但细粒度指向/可达性是短板(Share-Robot-Affordance 仅 11.74,RoboBrain2.5 为 50.31)。自建 EVQA 总体 72.7(落后 Qwen3.5-4B 78.1),但成功检测 85.1、仿真规划 51.6 均最佳。世界状态预测 $S_{\text{gen}}=0.62$ 超过 Wan2.2-TI2V-5B(0.429)和专用 Cosmos3-Nano(0.591)。联合子目标规划 $S_{\text{plan}}=0.68$ 全面领先 Cosmos3-Nano agent(0.521)、BAGEL-7B-MoT(0.503)、Qwen-Agent(0.431),但观测理解 0.83、子任务规划 0.78 远高于目标图正确性 0.52——视觉想象是主瓶颈;rollout 从 2 步 0.69 衰减到 8 步 0.55。真机三任务平均 87%(97%/95%/68%),超过 $\pi_0$(68%)、$\pi_{0.5}$(82%),未做大动作预训练;三项无损优化使单帧延迟从 210ms 降到 143ms。
查看结构化数据
| 任务 | 指标 | 本文 | 基线 | 提升 |
|---|---|---|---|---|
| 通用文生图 GenEval | 整体得分 | 82.4 | Bagel 82 / Cosmos-3-Nano 71.68 | 与生成专家持平,领先 Cosmos-3-Nano 约 10.7 分 |
| RxBrain-Bench-JointPlan 联合子目标规划 | $S_{plan}$(加权 VLM-judge) | 0.68 | Cosmos3-Nano agent 0.521 | +0.159,全面领先所有基线 |
| RxBrain-Bench-WorldPred 世界状态预测 | $S_{gen}$ | 0.62 | Cosmos3-Nano 0.591 / Wan2.2-TI2V-5B 0.429 | 超越专用世界模型 +0.029,远超通用视频模型 |
| 真机三任务平均成功率 | 成功率(%) | 87 | $\pi_{0.5}$ 82 / $\pi_0$ 68 | 无大规模动作预训练即领先 $\pi_{0.5}$ 5 个百分点 |
| 多视角3D理解 3DRSBench | 准确率(%) | 54.1 | Cosmos-3-Nano 52.6 / RoboBrain2.5 52.1 | 列第一 |
局限与改进
作者承认三点:第一,模型规模偏小(6.2B),在复杂推理、细粒度视觉想象和长程规划上受限,需放大模型与数据;第二,完全分布外的环境、本体或任务域仍需微调;第三,交错生成混用了自回归(文本)与流匹配(视觉)两套范式,带来训练-推理不一致——虽通过训练期偏移真值 VAE 潜量缓解,但尚未引入强化学习或序列级优化来对齐。我额外观察到:EVQA 总分(72.7)落后 Qwen3.5-4B 约 5 个点,细粒度空间接地(Share-Robot-Affordance 11.74)与定点能力差距巨大;视觉想象质量明显落后于语言推理(目标图正确性 0.52 vs 子任务规划 0.78),Arctic 这类精细桌面场景只有 0.48;JointPlan 的评测高度依赖 GPT-5.5 作为 judge,存在评判者偏置与可复现性风险;真机 Pick Trash 仅 68% 暴露开盖-投放这类双阶段任务的脆弱性。
独立分析的弱点
第一,视觉想象是系统性短板。$S_{plan}$ 中目标图正确性仅 0.52、$S_{gen}$ 中时间合理性 0.53 都是最低项,长 rollout 下从 0.69 衰减到 0.55,说明自回归视觉生成的误差会沿规划链累积。改进方向:对视觉生成引入一致性/蒸馏式少步采样、或显式序列级奖励(如对生成图做目标达成判别)来抑制漂移。第二,细粒度感知薄弱。Share-Robot-Affordance 仅 11.74、RefSpatial 34.08,远低于专做指向的 RoboBrain2.5——场景:要求模型指出「抓握点坐标」时几乎失效。改进方向:加入高分辨率 crops 与坐标监督任务、或在视觉塔上接专门的指向头。第三,两套生成范式(自回归 vs 流匹配)的训练-推理鸿沟未被根本解决:交错生成时文本 token 与视觉潜量在上下文里拼接,但去噪步数、CFG 与文本采样温度难联合调优。改进方向:用 GRPO 等序列级优化直接对齐整条交错轨迹。第四,评测对外部 judge(GPT-5.5)依赖过重,难独立复现——建议开源 judge prompt 并补一套人工金标集做交叉验证。
未来方向
作者明确两条方向:把 RxBrain 放大到更大参数,预期更连贯的规划原语、更准的世界状态预测和更可靠的联合子目标规划;并增强其 agentic autonomy,使其能自主分解开放任务、监控进度、修正计划、与环境更自主地交互。基于本文成果可延伸的方向包括:把交错规划用作 VLA 策略的子目标条件信号(呼应 $\pi_{0.7}$ 的思路),用 RxBrain 生成的「目标图」指导低成本策略学习;将数据流水线扩展到第一人称活动、手术、装配等长程领域,覆盖更稀有的状态转移;以及引入逆动力学模型,让模型从「想象的目标态」反推可执行动作,进一步闭环「想象—执行—再想象」。强化学习对齐交错轨迹、跨本体迁移、以及把仿真(BEHAVIOR-1K、InternData-A1)作为可验证的「想象沙盒」也值得探索。
复现评估
可复现性整体较好但门槛高。代码与权重已开源(GitHub: Tencent-Hunyuan/Hy-Embodied-RxBrain-1.0;HuggingFace: tencent/Hy-Embodied-RxBrain-1.0),数据流水线、训练超参(Appendix E 的 Table 6–8)、评测协议(Appendix F judge rubric)都写得很细,含 368/312 卡 ZeRO-2+bf16 配置和 6:4、100:12:150:70:90 数据配比。但实际复现仍有难度:训练需 50,177 小时视频和 312–368 张 GPU,单次成本高昂;数据含 46 个 split(RoboMIND、DROID、BridgeData V2、Ego4D 等,部分需授权);自建 benchmark 依赖 GPT-5.5(Azure API)配额,DINO/CLIP/LPIPS 感知项需本地 CPU 跑;真机实验需 DOBOT X-Trainer 或 ARX 双臂平台、每任务 100 次试验。对个人研究者,复现文生图与理解部分较可行,完整重训或真机评测几乎不现实,更适合基于开源权重做下游微调或评测。
论文图表
展示 RxBrain 在统一模型内支持的三类具身能力:具身视觉问答(判断任务是否完成并给出理由)、多帧视觉生成(想象动作完成后的画面)、以及联合语言-视觉推理与想象(分步输出文本子目标 + 对应目标图)。两个示例分别是「折叠眼镜入盒」和「捡垃圾」。
这是理解全文的「门面图」,一图说清了语言与视觉如何互补——语言给动作逻辑、视觉给目标态,没有它读者很难建立对「联合规划」的直觉。