Capek 0.5:面向具身智能的以执行为中心的视觉-语言模型 Capek 0.5: An Execution-Centric Vision-Language Model for Embodied Intelligence
用执行中心的能力分类法训练四类专家再合并蒸馏成统一具身VLM
前置知识
视觉-语言模型 (VLM)
以视觉编码器(通常是 ViT)加上语言解码器构成的端到端多模态模型,能够同时理解图像/视频和文本,输出自然语言回答或结构化坐标。本文用的是 Qwen-VL 系列,35B-A3B 版是 MoE 架构(总参 35B,每个 token 仅激活约 3B 参数)。
Capek 0.5 的全部工作都建立在 VLM 骨干之上,要理解它如何把通用 VLM 改造成具身「大脑」,必须先清楚 VLM 的输入输出接口。
GRPO(Group Relative Policy Optimization)
一种无需价值网络的策略梯度强化学习算法。对每个 prompt 采样一组 G 个回答,用组内奖励的均值和标准差做归一化得到优势 $\hat{A}_i=(r_i-?ar{r})/(\sigma_r+\delta)$,再配合 token 级别的裁剪目标与 KL 正则更新策略。本文对四类专家都用 token 级 GRPO 训练。
理解 Capek 0.5 的能力专家是怎么练出来的,必须懂 GRPO 的优势计算和裁剪机制,因为这决定了奖励设计如何转化为模型改进。
模型合并 / TIES
TIES(Trim, Elect, Disjoint Merge)是一种冲突感知的权重空间合并方法:先裁掉每个专家任务向量中幅度最低的 τ 比例参数,再按坐标选举出共识符号,只对符号一致的更新做平均。本文用 τ=0.8、合并尺度 λ=1.0 把四个专家的任务向量融合成一个初始化 $ heta_{ ext{TIES}}$。
TIES 是 Capek 0.5 合并阶段的第一步,决定了统一学生的起点,是后续蒸馏能否成功的关键。
多教师在线策略蒸馏 (MOPD)
由学生模型自己在线生成回答前缀,再让对应的专家教师对这些前缀打分,学生最小化与教师之间的反向 KL 散度。本文采用「路由式」MOPD:每个样本只查询其所属能力域的教师,教师全程冻结,蒸馏优势为 $\hat{A}^{ ext{MOPD}}_t= ext{clip}( ext{sg}[\log(q_r(y_t|h_t)/\pi_ heta(y_t|h_t))], -?arepsilon_{\max}, ?arepsilon_{\max})$。
MOPD 是合并的第二步,用来弥补单纯权重合并无法保证每个专家行为都被保留的缺陷,是「能力保持可审计」的核心机制。
具身执行循环 (Embodied Execution Loop)
机器人执行本质上是迭代的:感知场景→推理→执行动作→动作改变场景→重新感知验证。每一轮都需要判断空间关系、时序变化、动作落点和任务状态是否达成。Capek 0.5 正是按这个循环中的功能角色来组织能力的。
本文最核心的洞见就是把训练组织到执行循环的功能角色上,而不是按数据集或任务,理解这一点才能理解整篇论文的设计哲学。
研究动机
当前把视觉-语言模型当具身「大脑」用,主流做法是按单个任务或单个数据集做后训练(比如只做指代表达、只做时序定位、只做 affordance),把这些监督信号混在一起喂给一个模型。问题在于:机器人执行本质是迭代的——每个动作都会重塑场景和物理状态,需要不断重新感知、推理、验证。而空间推理、时序理解、动作引导、状态验证这几类能力的输出格式(结构化关系、时间区间、几何坐标、布尔谓词)和奖励几何差异极大,如果用一刀切的方式联合训练,会发生严重的优化干扰,而且训练完根本说不清模型到底掌握了哪些能力、合并后还保不保得住。另外,现有公开基准几乎从不评测「执行完之后世界状态对不对」「任务进度到了哪一步」这种状态验证能力。
本文的目标是构造一个单一的、可部署的统一具身推理模型,让它在一次推理(单个自回归 checkpoint)中就能同时具备空间推理、时序理解、动作引导、状态验证这四类执行循环中反复被调用的能力,并且每一类能力是否被获得、合并后是否被保留都可以被量化审计,而不是像现有方法那样训练完说不清到底掌握了什么。同时希望这套训练配方在不同容量规模(35B-A3B MoE 和 2B dense 两种骨干)上都通用、可迁移,并能与 scale-matched 的同行模型公平对比。最终目标是让模型不只在孤立基准上拿分,而是能真正迁移到闭环仿真环境里完成多步具身任务,证明四类能力能组合起来提升端到端任务成功率。
与已有工作不同的是,本文的独特切入角度是「执行中心的能力分类法」:不再按数据集或任务组织训练,而是按功能角色把所有监督数据归到四个能力家族里。更关键的是,它把「能力获得」和「能力整合」彻底解耦——先从同一骨干分别训练四个专家,再用 TIES 权重合并 + 路由式 MOPD 蒸馏整合成统一模型,并且专家本身就成了「应该保留什么」的可审计参照。同时作者还自建了 Capek-StateBench 来填补状态验证评测的空白。这种 specialist-to-unified 的可追溯范式是和以往「一个混合数据集训一个模型」最大的本质区别。
核心方法
整体思路可以分两步直觉地理解:第一步先让模型「分身」——从同一个骨干 VLM 各自练出一个空间专家、时序专家、动作专家、状态专家,每个专家只关心自己的能力域,用自己的数据、奖励和输出格式,互不干扰;第二步再让这些分身「合体」——先用 TIES 把四个专家的参数差值融合成一个初始化,再用路由式多教师在线策略蒸馏(MOPD),让学生在自己生成的前缀上被对应专家监督,最终把四种行为统一到一个推理时可用的 checkpoint。技术路线上:数据按能力家族重新归类(共 316,736 条候选 view,空间 84.0K/26.5%、时序 92.6K/29.2%、引导 95.9K/30.3%、状态 44.2K/14.0%),所有任务都统一成文本生成接口(点/框/轨迹输出归一化坐标、时间区间输出起止秒、状态判断输出结构化字段),训练用 token 级 GRPO,整合用 TIES+MOPD。
核心创新点是「执行中心的能力分类法」+「specialist-to-unified 的可审计整合范式」两条腿。和已有方法的本质区别有三:第一,分类维度换了,不再按 task/dataset 切分,而是按执行循环中的功能角色切分,这样同一类(比如 Action Guidance)下的指代定位、affordance、轨迹预测就被当成互补输出形式而非独立分支;第二,训练解耦,专家用各自的奖励几何独立优化,避免联合训练的优化干扰;第三,整合可追溯,standalone 专家就是「应该保留什么」的标尺,合并后的统一模型可以直接和专家对比,量化每种能力的损失。这种设计让能力获得和能力保持都能被单独分析和审计。
方法步骤详情
第一步【能力数据构造】:把 30+ 个数据集的样本按执行角色重新归类,统一序列化格式(坐标统一映射到 $[0,1000]^2$ 像素系,时间输出起止秒)。状态验证这块全部基于 BEHAVIOR-1K 家庭操作轨迹,锚定到执行相关的原语/技能/任务检查点上,分两个层面——物理层面 PSV 用局部转换窗验证物体状态谓词,任务层面 PVE 用因果任务前缀估计进度并预测下一步动作。第二步【专家训练】:四个专家都从同一骨干出发,用 token 级 GRPO(公式 1-2)训练,奖励结构统一为 $R=\lambda_{ ext{fmt}}R_{ ext{fmt}}+\lambda_{ ext{acc}}R_{ ext{acc}}$,具体到每个能力有专门的 verifier,比如时序定位用 temporal IoU(公式 4),轨迹用归一化后的离散 Fréchet 距离配指数核 $R=\exp(-\lambda_{ ext{traj}}C)$($\lambda_{ ext{traj}}=10$),进度用 25 个百分点截断的邻近度 $r_{ ext{value}}=\max(0,1-|\hat{p}-p|/25)$。还做了 rollout 样本筛选:组内奖励方差为 0 的 prompt 被下采样或审计。第三步【整合】:先用 TIES 算出 $ heta_{ ext{TIES}}= heta_0+\lambda\cdot ext{TIES}_ au(\{\Delta_e\})$($ au=0.8$,$\lambda=1.0$)作为初始化,再做路由式 MOPD(公式 7),学生先采样 $y\sim\pi_ heta(\cdot|x)$,对应教师 $q_r$ 给出 token 对数概率算蒸馏优势(公式 8,带 stop-gradient 和裁剪),用 token 均值策略梯度更新。训练时专家和路由只在训练用,推理只用单一 checkpoint。
技术新颖性
技术新颖性体现在三点。一是分类法的功能性:把异构输出(点/框/轨迹/时间区间/谓词/进度)按执行角色归并,而不是按输出形状归并,让同一专家内部能容纳多种互补格式,这降低了专家数量又保留了多样性。二是奖励体系的统一性:四个专家共享「格式奖励 + 任务准确率奖励」的二元结构,但每种输出格式都配了专门的规则化 verifier(temporal IoU、DFD 指数核、点 F1、目标掩码命中、最近邻对称分等),既统一又能精确反映任务对错。三是整合方法的选择性:单独用 TIES 会在 MindCube 和 StateBench-T 上退化,单独用 MOPD 时序能力保留得不够好,而 TIES+MOPD 组合取得最强综合权衡(7/8 项最佳或次佳),这种「权重合并给初始化 + 在线蒸馏做精修」的两阶段是经验上验证过的最佳配置。此外 Capek-StateBench(含 P/T 双 track,500 例)填补了状态验证评测空白。
实验结果
三个层面的评测各有核心发现。【整体基准】35B-A3B 相比 Qwen3.6 初始版本改进了 34 行中的 28 行,2B 改进 30/34。最亮眼的是 Action Guidance 全部 10 行都涨:PixMoPointsEval 点定位 62.42→74.06,Where2Place 57.61→73.52,NaviTrace 30.87→42.80,VABench-trace 轨迹 RMSE 从 139.28 降到 108.15(减少 31.13 像素),ShareRobot-Trajectory DFD 从 0.3518 降到 0.2390。时序 5 行全涨(Video-MME 71.33→74.19,EgoTempo 38.20→44.60),状态验证两行全涨(StateBench-P +11.0、StateBench-T +2.45),空间推理 6/9 行涨(VSI-Bench 60.83→70.69、MindCube 58.67→69.90、RoboSpatial-Home 63.46→72.80),通用能力 8 项里 5 项仍提升,说明没有破坏通用能力。【整合分析(Table 4)】专家相对骨干获得显著专项收益:MindCube +12.85、VSI-Bench +10.16、EgoTempo +12.60、StateBench-P +14.20、VABench-trace RMSE -38.85。Mix-RL 全面但增益有限,TIES 偏空间/时序但会在 MindCube 和 StateBench-T 上退化,MOPD 偏动作/状态但时序保留不足,TIES+MOPD 最均衡(7/8 最佳或次佳)。【闭环评测】EmbodiedBench 上 EB-HAB 平均成功率 46.0→63.0(+17.0)、EB-ALF 50.7→55.3(+4.6),长时程任务 EB-HAB +26.0、EB-ALF +6.0;VIGIL 上世界完成率 W 37.4→38.6、基准成功 B 28.8→32.2,像素 grounding 大幅提升 52.8→72.8,组合任务 approach-and-interact 从 18.4→28.8。这些证明离线学到的能力能组合到真实交互中。
查看结构化数据
| 任务 | 指标 | 本文 | 基线 | 提升 |
|---|---|---|---|---|
| 状态验证(物理)Capek-StateBench-P | 归一化精确匹配准确率 (%) | 76.80 | Qwen3.6-35B-A3B: 65.80 | +11.00 |
| 状态验证(任务)Capek-StateBench-T | 进度+下一步联合分 s_T (%) | 46.21 | Qwen3.6-35B-A3B: 43.76 | +2.45 |
| 点定位 PixMoPointsEval | 点级 F1 (%) | 74.06 | Qwen3.6-35B-A3B: 62.42 | +11.64 |
| affordance 放置 Where2Place | 原生任务分 (%) | 73.52 | Qwen3.6-35B-A3B: 57.61 | +15.91 |
| 导航轨迹 NaviTrace | 语义感知归一化分 | 42.80 | Qwen3.6-35B-A3B: 30.87 | +11.93 |
| VSI-Bench 空间推理 | 准确率 (%) | 70.69 | Qwen3.6-35B-A3B: 60.83 | +9.86 |
| EmbodiedBench EB-HAB(整体) | 任务成功率 (%) | 63.0 | Qwen3.6-35B-A3B: 46.0 | +17.0 |
| VIGIL 像素 grounding | 世界完成/基准成功 (%) | 85.6/72.8 | Qwen3.6-35B-A3B: 76.0/52.8 | B +20.0 |
局限与改进
作者承认的局限主要有三点:一是合并后仍存在量化损失,专家在签名基准上获得的增益(比如 MindCube 专家 71.52)合并后只能保留一部分(TIES+MOPD 69.90),时序能力尤其明显(EgoTempo 专家 50.80 合并后只剩 44.60),说明整合过程不是无损的;二是评测环境仍是仿真(AI2-THOR/ProcTHOR、Habitat、ALFRED),没有真实物理机器人的验证,sim-to-real 的 gap 没有触及;三是当前定位是「统一推理器」而非完整 agentic brain,还不具备工具调用、可执行代码编排、底层控制委派等能力。我自己观察到:(1)能力域之间互有取舍,TIES+MOPD 在 MindCube、EgoTempo 上其实低于专家,说明统一模型存在固有能力上限;(2)2B 轨上 Where2Place 反而退化(29.16→35.86 但仍远低于 RynnBrain1.1 66.46 和 RoboBrain 70.42),说明小模型上某些能力的迁移性有边界;(3)LiveCodeBench 在 35B 轨上从 77.31 退化到 72.91,说明具身后训练对代码能力略有侵蚀;(4)状态验证的提升幅度(尤其 StateBench-T 只有 +2.45)相对较小,这块新能力其实是最难啃的。
独立分析的弱点
第一个弱点是能力整合的固有损失,尤其时序类合并后损失最大(EgoTempo 从专家 50.80 跌到 44.60),改进方向是探索更细粒度的路由机制——比如推理时也用轻量路由器动态选择激活哪部分参数,而不是完全压扁成一个稠密策略。第二个弱点是状态验证能力偏弱且评测样本太少(Capek-StateBench 只有 500 例,T 轨 287 例),改进方向是把 StateBench 扩展到更多场景和物体类别,并引入更多失败/边界案例(如部分完成、错误顺序)。第三个弱点是评测停留在仿真且评测协议对自家 Qwen pair 严格、对外部模型用其推荐设置,比较不完全公平;改进方向是统一所有模型的解码配置(这点作者部分做了),并尽快上真机。第四个弱点是当前模型只输出中间推理结果(点、框、轨迹、谓词),并不直接闭环控制,下游控制器要把这些中间产物翻译成关节指令,这条翻译链路本身有误差累积;改进方向是把 Capek 扩展成 agentic brain,把工具调用、代码编排、动作技能都纳入执行循环(作者自己也在 Future Work 里提出了这个路线)。
未来方向
作者明确提出的方向是把 Capek 0.5 从「统一具身推理器」升级成「agentic 具身大脑」:让模型能调用三类工具——感知工具获取任务相关证据、可执行代码作为长时程分解与恢复的编排层、动作工具暴露机器人技能而把底层控制留给专门策略;工具调用本身成为执行循环里的一等公民,模型要决定何时调用哪个工具、把调用组合成可执行工作流、解读反馈并在结果偏离预期时重规划。作者计划用同样的 specialist-to-unified 协议(新专家→合并→蒸馏)来获得这些能力,并把评测延伸到更长时程的交互任务和真实物理机器人。基于现有成果我自己觉得可延伸的方向还有:把路由式 MOPD 换成动态专家混合(MoE 风格的推理时路由)以减少能力损失;把 Capek-StateBench 的思路推广到「错误诊断」而不只是进度估计;把四能力分类法扩展到多机器人协作场景,新增协作时序与共享状态验证能力。
复现评估
复现评估总体较好但门槛很高。有利因素:骨干 Qwen3.6-35B-A3B 和 Qwen3.5-2B 公开;评测用的是开源基准(多数公开,Capek-StateBench 作者也公开了 500 例和完整协议);关键超参都有交代(TIES τ=0.8、λ=1.0,GRPO ε 裁剪、KL 系数 β,轨迹 λ_traj=10,进度 25 点截断,MOPD ε_max 裁剪,推理用 vLLM、128K 上下文、≤64 视频帧、temp 0.7、top-p 0.95、top-k 20、≤16384 token、thinking 开启);评测用 DeepInsight 记录每次运行的配置、生成和分数,可审计。困难因素:(1)算力门槛极高,训练 35B MoE 专家 + 多教师蒸馏需要大规模 GPU 集群,普通团队难以复现;(2)数据工程量巨大,从 30+ 个数据集重新归类、过滤、统一坐标和序列化,工作量是论文的隐性大头;(3)BEHAVIOR-1K 仿真器和状态验证标注流程复杂;(4)部分数据源(如 SenseNova-SI-8M、RoboAfford++、OneThinker)是否完全公开需要核实;(5)论文未开源代码和最终 checkpoint(至少正文未明确给出 release 链接),想跑通要自己搭 TIES+MOPD 流水线。综合判断:方法学层面可复现(思路、公式、超参齐全),工程层面难复现(算力+数据+代码)。
论文图表
用一条 BEHAVIOR-1K 家庭操作轨迹(「把报纸和两块木柴放进壁炉、点燃、关掉打火机」)展示执行循环中四种能力如何反复重叠出现。从 t=0s 观察到 t=234s 验证,每个时间点都需要 Spatial(场景几何)、Temporal(事件顺序与定位)、Guidance(动作目标)、State Verification(谓词是否成立)四类信息,底部带颜色横条标出每个能力在不同时刻被触发。
这是理解整篇论文设计哲学的钥匙图:它直观论证了「四种能力在执行循环里是反复重叠被调用的功能角色,而不是互斥的阶段」,这是 execution-centric taxonomy 的立论基础。