← 返回 2026-07-17

RxBrain:联合语言-视觉推理与想象的具身认知基础模型 RxBrain: Embodied Cognition Foundation Model with Joint Language-Visual Reasoning and Imagination

Haotian Liang, Mingkang Chen, Yufei Huang, Yuchun Guo, Xiaomeng Zhu, Xiangli Shi, Kaixuan Wang, Yunxuan Mao, Weijie Zhou, Ling Chen, Shirong Zeng, Yueyu Long, Yuchen Si, Yajuan Zhu, Xingyu Zhou, Minghui Wang, Wanjia He, Xin Yang, Lingzhu Xiang, Zhiqing Liu, Bohan Ma, Xiran Huang, Tianshuo Yang, Zhiheng Liu, Xuantang Xiong, Zisheng Lu, Ping Luo, Yao Mu, Han Hu, Zhengyou Zhang 📅 2026-07-15 👍 29 2026-07-22 18:54
Mixture-of-Transformers 世界模型 具身智能 多模态基础模型 流匹配

统一语言推理与视觉想象,单模型端到端生成具身规划

前置知识

Mixture-of-Transformers (MoT)

一种模态感知的 Transformer 架构。输入 token 先按所属模态(文本、视觉理解、视觉生成等)被分流到专门的 Transformer 分支,再通过一个全局自注意力层实现跨模态信息交换。和把所有 token 混在一起的标准 Transformer 相比,MoT 让不同模态既能保留专属的计算路径(各自的 QKV 投影和 FFN),又能在共享注意力里互通信息,从而在单模型里同时建模理解与生成。

RxBrain 的全部能力(语言理解/生成、视觉理解/生成、动作生成)都构建在 MoT 之上,理解 token 如何按模态路由、专家如何共享注意力,是看懂本文架构图的前提。

Flow Matching(流匹配)

一种用于生成建模的训练目标。给定干净样本 $x_0$ 和高斯噪声 $\epsilon\sim\mathcal{N}(0,I)$,构造线性插值路径 $x_t=(1-t)x_0+t\epsilon$($t\in[0,1]$),模型学习速度场 $v_\theta(x_t,t,c)$ 去回归真实速度 $(\epsilon-x_0)$,损失为 $\mathcal{L}_{\text{flow}}=\mathbb{E}\|v_\theta-(\epsilon-x_0)\|_2^2$。推理时沿预测的速度场求解 ODE 完成去噪生成,相比扩散模型路径更直、采样更快。本文用它生成视觉潜变量和机器人动作。

RxBrain 的视觉想象和动作生成都依赖流匹配目标,且文本走自回归、视觉走流匹配的「双范式」是全文核心设计,也是其训练-推理不一致这一关键局限的来源。

VAE 潜空间(Latent Space)

变分自编码器(VAE)将图像压缩到低维潜表示 $z$,编码器 $E_{\text{VAE}}$ 把图像压成潜变量、解码器 $D_{\text{VAE}}$ 把潜变量还原为图像。在潜空间里做生成(而非像素空间)能大幅降低 token 数和计算量,FLUX 等主流生成模型都采用 16 倍下采样的 VAE。RxBrain 复用 FLUX 的冻结 VAE 作为视觉 token 编解码器,在 256px 分辨率下工作。

理解生成 token 始终在 VAE 潜空间中、且理解分支与生成分支共享同一个视觉塔但走不同 FFN,才能看懂为什么本文能做到理解与生成共享语义表示又不互相干扰。

世界模型(World Model)

世界模型指预测环境如何随时间演化的一类模型——给定当前观测和动作,预测未来视觉状态。它让智能体能「想象」执行某动作后世界会变成什么样,从而支持视觉规划、状态评估和闭环控制。具身世界动作模型(WAM)进一步把未来预测与动作生成耦合。RxBrain 的世界状态预测能力正是这一范式的体现。

本文最核心的卖点是把语言推理(VLM 擅长)和视觉想象(世界模型擅长)合并到一条规划序列里,理解世界模型在具身 AI 中的定位才能领会这种「互补」设计为什么重要。

VLA(Vision-Language-Action)策略

视觉-语言-动作模型把感知(图像)、指令(语言)和低层控制(机器人关节/末端位姿)统一进一个模型,端到端地输出可执行动作。典型方法(如 $\pi_0$、$\pi_{0.5}$)通过流匹配或扩散头生成动作块(action chunk),即未来若干步的动作序列。RxBrain 在第 7 章把动作生成为第 5 个模态接入主干,验证「认知先验可替代大规模动作预训练」的假设。

真机对比实验的基线 $\pi_0$、$\pi_{0.5}$ 都是 VLA 模型,理解动作块、流匹配动作头等概念才能看懂 RxBrain 的 87% 平均成功率如何取得。

研究动机

具身认知要求智能体不仅能想清楚「要做什么」,还要能想象「做完之后世界会变成什么样」。然而现有两条技术路线是割裂的:视觉-语言模型(VLM)擅长场景理解、任务分解、因果推理和高层决策,但其认知过程停留在语言层面,对「目标物理状态」只是隐式描述,缺乏对视觉目标态的显式想象;生成式世界模型则专注预测未来观测、模拟状态转移,却不擅长显式的因果推理、抽象任务理解和约束感知。结果是——在「摆盘」「折叠眼镜入盒」「开盖丢垃圾」这类多阶段操作任务中,单靠语言描述会漏掉关键的空间与状态细节(例如「把盘子放到餐垫的什么位置」),单靠视觉目标态又无法揭示背后的因果结构和中间决策。更接近的 Cosmos 3 虽然把理解、生成、仿真、动作塞进一个全能框架,但仍把它们当作「分离的能力」而非耦合的认知过程来组织。

本文的目标是本文要构建一个能把语言推理与视觉想象在「同一条规划序列」里耦合起来的具身认知基础模型 RxBrain。具体可量化的目标包括:在一个统一模型内同时保持通用文生图能力(GenEval 不输 Bagel 这类生成专家)和广泛的具身/空间理解能力(多视角 3D、机器人可达性等多个 benchmark 上取得最佳或次佳),并新设 RxBrain-Bench 来直接评测「联合文本-视觉规划」这一闭环能力;同时验证这种「认知先验」能否在不大规模预训练动作数据的前提下迁移到真机连续动作生成,达到与 $\pi_0$、$\pi_{0.5}$ 相当甚至更好的真实成功率。

与已有工作不同的是,作者的独特切入点是「互补而非同义」的语言-视觉关系。此前 BAGEL 这类交织生成模型里,文本和图像往往表达同一语义内容(描述同一张图);而具身规划需要的是「语言规定动作/约束/决策,视觉想象规定这些动作应达成的目标与中间世界状态」。这种互补耦合在数据上几乎不存在现成监督——手动标注「每一步该做什么 + 做完画面应该长什么样」极贵。因此本文真正的差异化贡献是一个全自动流水线:把海量具身视频拆解成对齐的「文本规划步 + 视觉状态转移」样本,并通过一个新基准强制模型在闭环 rollout 中交替生成文本和目标图,这正是被前人忽视的盲区。

核心方法

直觉上,RxBrain 像一个「边说边画」的规划者:先用语言说「第一步抓住布的右边缘」,紧接着画出抓完后世界应有的样子,再基于这张画好的图决定下一步、再画下一张,直到任务完成。技术路线上,RxBrain 基于 HY-Embodied-0.5,采用统一的模态感知 Mixture-of-Transformers 架构(总参 6.2B)。模型有三条核心生成路径:自回归文本生成(VQA、推理)、多帧视觉预测(一次生成 4 帧未来状态)、以及交错生成(interleave)——即 $\langle\text{assistant}\rangle r_1 \langle\text{Image}\rangle z_{1,1:N}\langle/\text{Image}\rangle r_2 \dots\langle\text{eos}\rangle$,其中 $r_i$ 是第 $i$ 步的推理文本、$z_{i,1:N}$ 是流匹配生成的潜变量。文本走因果注意力,视觉 token 帧内双向、帧间因果,从而既保留自回归结构又允许帧内全局信息交换。

全文最本质的创新是「在同一条规划序列里让语言与视觉扮演互补角色」:语言提供抽象结构(任务分解、规划原语、约束、时序、决策逻辑),视觉想象则把结构「接地」——预测每个规划步对应的中间与最终物理状态。与之配套的架构巧思是:视觉理解 token 与视觉生成 token 共用同一个视觉 Transformer 和 QKV 投影层,但通过模态条件路由分到不同 FFN 专家(生成专家的中间维度从 6144 加宽到 12288,约 2.4B 参数),让感知与想象在共享视觉塔内交互、又在专属计算里互不干扰;生成路径还移除了额外的 VAE 编码视觉输入 token,直接在 VAE 潜空间里做生成,简化了输入流水线。这种「共享注意力 + 专家分流」与 Cosmos 3 把理解和生成当作「分离任务模式」的做法形成鲜明对比。

方法步骤详情

数据构造分三阶段。Temporal Segment Annotation:在 LUV 颜色空间算帧间差分 $\delta_k$,用自适应阈值 $\theta_\delta=\max(Q_{0.8},Q_{0.5}+0.2(Q_{0.9}-Q_{0.5}))$ 选关键帧(封顶 50 帧再下采样到 $n=30$),由单一 MLLM $\Phi$ 一次过返回候选步 $c_i=(a_i,d_i,p_i,q_i)$,再双向边界精修——先在粗终点附近采 8 帧选「状态完成最早一帧」作结束锚,再反推起始锚。Quality Verification 按 0-5 分语义质量、视觉接地、文本-视觉一致性三项打分,保留 75.18%。Segment Structuring 产出 L0 段内状态预测、L1 步级规划、L2 子目标、L3 终态想象四级监督,共 50,177.2 小时、21,506,919 段。训练两阶段:Stage 1 联合预训练(文生图 60%、理解 40%,$\lambda_{CE}{=}0.25,\lambda_{FM}{=}1.0$,368 卡);Stage 2 具身微调(理解 34.6%、多帧 16.2%、交错规划 20.8%,$\lambda_{CE}{=}\lambda_{FM}{=}1.0$,312 卡)。推理感知构造:训练时把真值图经 VAE 编解码回灌 $\tilde I_i=E_{\text{vis}}(D_{\text{VAE}}(E_{\text{VAE}}(I_i)))$,使训练上下文与推理时「自生成图回灌」一致。

技术新颖性

技术新颖性集中在四点:(1) 首次在具身规划里把语言和视觉当作「互补功能」耦合在一条自回归序列里,而非像 BAGEL 那样让两者表达同一语义;(2) 共享视觉塔 + 专家分流的 MoT 设计,让理解与生成在 VAE 潜空间里共享语义、又通过加宽的生成 FFN 保留专属能力,无需为生成另起一个 Transformer;(3) 一套 source-agnostic 的全自动数据流水线(关键帧采样 → 全局解析 → 双向边界精修 → 三项质量门),把任意具身视频转成 L0–L3 多粒度监督,75.18% 通过率;(4) 推理感知(inference-aware)的视觉状态构造:训练时把真值图经 VAE 编解码再回灌 $\tilde I_i=E_{\text{vis}}(D_{\text{VAE}}(E_{\text{VAE}}(I_i)))$,使训练上下文与推理时的「自生成图回灌」一致,缓解交错 rollout 的误差累积。这些与 Janus(解耦视觉编码路径)、Transfusion(单 Transformer 双损失)等统一理解生成方案在「认知耦合」这一维度上有本质不同。

Architecture overview of RxBrain
Figure 2: Architecture overview of RxBrain
Hybrid attention patterns in RxBrain
Figure 3: Hybrid attention patterns in RxBrain
Data construction pipeline
Figure 5: Data construction pipeline

实验结果

实验沿四轴展开。通用文生图(GenEval):RxBrain 82.4,与生成专家 Bagel(82)持平、远超 Cosmos-3-Nano(71.68),证明统一模型未牺牲生成质量。具身与空间理解:19 个 benchmark 中 CV-Bench(88.59)、DA-2k(83.4)、3DRSBench(54.1)、MMSI-Bench(35.8)、MindCube(47.5)、SITE-Bench-Image(54.9)等多项拿下最优,Share-Robot-Trajectory 51.13、RoboSpatial-Home 配置 86.28 也是最佳;但细粒度指向/可达性是短板(Share-Robot-Affordance 仅 11.74,RoboBrain2.5 为 50.31)。自建 EVQA 总体 72.7(落后 Qwen3.5-4B 78.1),但成功检测 85.1、仿真规划 51.6 均最佳。世界状态预测 $S_{\text{gen}}=0.62$ 超过 Wan2.2-TI2V-5B(0.429)和专用 Cosmos3-Nano(0.591)。联合子目标规划 $S_{\text{plan}}=0.68$ 全面领先 Cosmos3-Nano agent(0.521)、BAGEL-7B-MoT(0.503)、Qwen-Agent(0.431),但观测理解 0.83、子任务规划 0.78 远高于目标图正确性 0.52——视觉想象是主瓶颈;rollout 从 2 步 0.69 衰减到 8 步 0.55。真机三任务平均 87%(97%/95%/68%),超过 $\pi_0$(68%)、$\pi_{0.5}$(82%),未做大动作预训练;三项无损优化使单帧延迟从 210ms 降到 143ms。

Main comparison on embodied reasoning and image generation benchmarks
Table 1: Main comparison on embodied reasoning and image generation benchmarks
RxBrain-Bench-JointPlan: method comparison
Table 4: RxBrain-Bench-JointPlan: method comparison
RxBrain-Bench-JointPlan (BridgeV2) rollout
Figure 8: RxBrain-Bench-JointPlan (BridgeV2) rollout
Real-world robot evaluation on three manipulation tasks
Figure 10: Real-world robot evaluation on three manipulation tasks
查看结构化数据
任务指标本文基线提升
通用文生图 GenEval 整体得分 82.4 Bagel 82 / Cosmos-3-Nano 71.68 与生成专家持平,领先 Cosmos-3-Nano 约 10.7 分
RxBrain-Bench-JointPlan 联合子目标规划 $S_{plan}$(加权 VLM-judge) 0.68 Cosmos3-Nano agent 0.521 +0.159,全面领先所有基线
RxBrain-Bench-WorldPred 世界状态预测 $S_{gen}$ 0.62 Cosmos3-Nano 0.591 / Wan2.2-TI2V-5B 0.429 超越专用世界模型 +0.029,远超通用视频模型
真机三任务平均成功率 成功率(%) 87 $\pi_{0.5}$ 82 / $\pi_0$ 68 无大规模动作预训练即领先 $\pi_{0.5}$ 5 个百分点
多视角3D理解 3DRSBench 准确率(%) 54.1 Cosmos-3-Nano 52.6 / RoboBrain2.5 52.1 列第一

局限与改进

作者承认三点:第一,模型规模偏小(6.2B),在复杂推理、细粒度视觉想象和长程规划上受限,需放大模型与数据;第二,完全分布外的环境、本体或任务域仍需微调;第三,交错生成混用了自回归(文本)与流匹配(视觉)两套范式,带来训练-推理不一致——虽通过训练期偏移真值 VAE 潜量缓解,但尚未引入强化学习或序列级优化来对齐。我额外观察到:EVQA 总分(72.7)落后 Qwen3.5-4B 约 5 个点,细粒度空间接地(Share-Robot-Affordance 11.74)与定点能力差距巨大;视觉想象质量明显落后于语言推理(目标图正确性 0.52 vs 子任务规划 0.78),Arctic 这类精细桌面场景只有 0.48;JointPlan 的评测高度依赖 GPT-5.5 作为 judge,存在评判者偏置与可复现性风险;真机 Pick Trash 仅 68% 暴露开盖-投放这类双阶段任务的脆弱性。

独立分析的弱点

第一,视觉想象是系统性短板。$S_{plan}$ 中目标图正确性仅 0.52、$S_{gen}$ 中时间合理性 0.53 都是最低项,长 rollout 下从 0.69 衰减到 0.55,说明自回归视觉生成的误差会沿规划链累积。改进方向:对视觉生成引入一致性/蒸馏式少步采样、或显式序列级奖励(如对生成图做目标达成判别)来抑制漂移。第二,细粒度感知薄弱。Share-Robot-Affordance 仅 11.74、RefSpatial 34.08,远低于专做指向的 RoboBrain2.5——场景:要求模型指出「抓握点坐标」时几乎失效。改进方向:加入高分辨率 crops 与坐标监督任务、或在视觉塔上接专门的指向头。第三,两套生成范式(自回归 vs 流匹配)的训练-推理鸿沟未被根本解决:交错生成时文本 token 与视觉潜量在上下文里拼接,但去噪步数、CFG 与文本采样温度难联合调优。改进方向:用 GRPO 等序列级优化直接对齐整条交错轨迹。第四,评测对外部 judge(GPT-5.5)依赖过重,难独立复现——建议开源 judge prompt 并补一套人工金标集做交叉验证。

未来方向

作者明确两条方向:把 RxBrain 放大到更大参数,预期更连贯的规划原语、更准的世界状态预测和更可靠的联合子目标规划;并增强其 agentic autonomy,使其能自主分解开放任务、监控进度、修正计划、与环境更自主地交互。基于本文成果可延伸的方向包括:把交错规划用作 VLA 策略的子目标条件信号(呼应 $\pi_{0.7}$ 的思路),用 RxBrain 生成的「目标图」指导低成本策略学习;将数据流水线扩展到第一人称活动、手术、装配等长程领域,覆盖更稀有的状态转移;以及引入逆动力学模型,让模型从「想象的目标态」反推可执行动作,进一步闭环「想象—执行—再想象」。强化学习对齐交错轨迹、跨本体迁移、以及把仿真(BEHAVIOR-1K、InternData-A1)作为可验证的「想象沙盒」也值得探索。

复现评估

可复现性整体较好但门槛高。代码与权重已开源(GitHub: Tencent-Hunyuan/Hy-Embodied-RxBrain-1.0;HuggingFace: tencent/Hy-Embodied-RxBrain-1.0),数据流水线、训练超参(Appendix E 的 Table 6–8)、评测协议(Appendix F judge rubric)都写得很细,含 368/312 卡 ZeRO-2+bf16 配置和 6:4、100:12:150:70:90 数据配比。但实际复现仍有难度:训练需 50,177 小时视频和 312–368 张 GPU,单次成本高昂;数据含 46 个 split(RoboMIND、DROID、BridgeData V2、Ego4D 等,部分需授权);自建 benchmark 依赖 GPT-5.5(Azure API)配额,DINO/CLIP/LPIPS 感知项需本地 CPU 跑;真机实验需 DOBOT X-Trainer 或 ARX 双臂平台、每任务 100 次试验。对个人研究者,复现文生图与理解部分较可行,完整重训或真机评测几乎不现实,更适合基于开源权重做下游微调或评测。