← 返回 2026-08-04

WCM:用于视觉-语言-动作强化学习的世界评论家模型 WCM: A World Critic Model for Vision-Language-Action Reinforcement Learning

Senyu Fei, Xiaopeng Yu, Siyin Wang, Xianzhong Zhao, Jingjing Gong, Xipeng Qiu 📅 2026-07-31 👍 27 2026-08-09 18:30
世界模型 价值估计 强化学习 机器人操作 视觉-语言-动作模型

统一世界预测与价值估计的VLA强化学习评论家模型,149任务达SOTA

前置知识

视觉-语言-动作模型 (VLA)

VLA 模型把视觉图像、自然语言指令作为输入,直接输出机器人动作,是机器人操作的主流范式。它分两类:自回归(AR)模型用 next-token 预测生成动作(如 OpenVLA-OFT),流匹配(flow-matching)模型通过 ODE 从噪声学到动作分布(如 $\pi_0$、$\pi_{0.5}$)。模型先在大规模机器人演示上预训练,再做任务特定后训练。

本文正是在 VLA 骨干上做强化学习后训练,理解 AR 与流匹配两种范式以及 $\pi_0$/$\pi_{0.5}$/OpenVLA-OFT 这三个骨干,才能看懂为什么 WCM 要同时兼容 on-policy 和 off-policy、PPO 与 Flow-SDE 两套管线。

部分可观测马尔可夫决策过程 (POMDP)

POMDP 用元组 $(\mathcal{S}, \mathcal{O}, \mathcal{A}, \mathcal{T}, \mathcal{R}, \gamma)$ 刻画:智能体只能看到观测 $o_t \in \mathcal{O}$ 而非真实隐藏状态 $s_t \in \mathcal{S}$。机器人操作是典型 POMDP——单帧图像能呈现物体外观,但丢失运动、接触进度、未来演化等动态信息。经典理论表明最优决策依赖历史观测的充分统计量与对状态的预测性表示。

WCM 的全部动机建立在 POMDP 假设上:单帧观测不足以重建系统状态,因此基于单帧的评论家模型价值估计不准。理解这一点才能明白为什么要引入历史和世界预测目标。

评论家模型 (Critic) 与价值函数

在 Actor-Critic 强化学习中,评论家负责估计状态价值 $V_t$,给策略(actor)提供稠密监督,是样本效率与最终性能的关键。评论家通常回归回报(return),用 TD 误差或 GAE 优势函数更新。在 VLA-RL 中既有 on-policy 评论家(PPO/Flow-SDE)也有 off-policy 评论家(AWR/RECAP)。

WCM 本质上是一个新型评论家。本文核心论点就是传统评论家用单帧回归标量回报,监督信号过弱,无法学到跨时间动态,WCM 通过加入世界预测目标来增强评论家的表示能力。

JEPA 与 LeJEPA 架构

JEPA(Joint-Embedding Predictive Architecture)在表征空间而非像素空间做预测:编码器把观测映射到潜空间,预测器在潜空间预测未来表示,避免像素级重建的噪声。LeJEPA 是其轻量化变体,配合 SIGReg(Sketched-Isotropic Gaussian Regularization)正则防止潜空间特征坍缩,使潜表示趋近各向同性高斯分布。

WCM 直接以 LeJEPA 为骨架,用观测编码器+因果 Transformer 预测器+双解码头构建。理解 JEPA 的潜空间预测思想与 SIGReg 防坍缩机制,才能看懂为什么世界预测能与价值估计共享表示而不冲突。

流匹配与 Flow-SDE

流匹配模型用 ODE 从噪声连续演化到动作分布。由于 ODE 过程是确定性的,直接套用 PPO 这类随机策略 RL 算法不可行,需要 Flow-SDE 通过注入随机性(SDE)使能策略梯度估计。$\pi_0$/$\pi_{0.5}$ 属此类,其 RL 需 Flow-SDE 或 Flow-Noise。

本文在流匹配骨干上用 Flow-SDE 做 on-policy、用 RECAP($\pi^*_{0.6}$ 提出)做 off-policy。区分 AR 模型的 PPO/AWR 与流匹配模型的 Flow-SDE/RECAP,才能理解 WCM 在两套管线中如何充当评论家。

研究动机

VLA 模型的强化学习后训练已展现出对机器人操作的强大潜力,其中基于评论家的方法依赖价值估计器提供稠密监督。然而现有评论家几乎都只基于单帧观测或单帧 VLM 骨干的潜表示来回归价值,这与机器人控制固有的部分可观测性(POMDP)根本不匹配:单帧图像虽能揭示物体外观与场景布局,却丢失了运动、接触进度、可能的未来演化等对价值估计至关重要的动态信息。朴素地把历史堆叠(frame stacking)进评论家在高维视觉空间会带来指数级复杂度,仍会失败——因为纯标量回报回归对学习跨时间动态提供的监督太弱,评论家会把历史输入当成更大的静态特征向量,却不学环境如何随时间演化。作者把根因归结为状态逼近问题:缺少显式世界建模目标,评论家的表示无法捕捉准确价值估计所需的时间结构。具体表现是,即便用带位置编码的 ViT 时间评论家,性能仍难以提升,且 OpenVLA-OFT 在 ManiSkill 的 SFT 基线仅 28.1%,零样本仅 0.78%,说明现有评论家严重低效。

本文的目标是本文目标是设计一个能真正利用观测历史的评论家模型,使其表示被显式训练去捕捉环境的时间动态,而非仅仅回归标量回报。具体而言,作者希望构建一个统一架构,在给定历史观测时既能预测未来潜在动态、又能估计当前价值,让评论家表示逼近一个预测性状态(predictive state)——即对任务相关未来结果的紧凑可更新总结。该评论家还需无缝集成进 on-policy(PPO/Flow-SDE)与 off-policy(AWR/RECAP)训练管线,兼容 $\pi_0$、$\pi_{0.5}$、OpenVLA-OFT 等最先进 VLA 骨干,并在仿真与真实世界操作任务上同时带来性能与泛化提升,尤其是分布外(OOD)泛化。

与已有工作不同的是,本文的独特切入角度在于指出:缺失的关键成分不是历史本身,而是一个显式训练评论家表示去捕捉未来演化的目标。以往工作要么强行堆叠历史帧、要么用时间模型聚合,但都缺少让评论家理解帧间动态的显式学习信号,监督仍停留在稀疏的标量回报上。受大语言模型 next-token 预测学到可迁移表示的启发,以及'好的状态表示应能预测自身未来'的表征学习思想,作者把世界建模目标从脱离的辅助任务提升为与价值估计的联合优化——两者共享同一评论家表示。这与把世界建模当作旁路任务的 World Action Model 类方法本质不同,也区别于仅做价值回归的传统评论家,是从表示学习层面重新定义评论家该学什么。

核心方法

直觉上,WCM 把评论家重新表述为预测性状态编码器:要估准价值,评论家必须先理解世界会怎样演化。技术路线选用轻量级 LeJEPA 骨架,由观测编码器、世界预测器、价值解码头、未来潜态预测头四部分组成。给定从 $t-K+1$ 到 $t$ 的 $K$ 帧历史,编码器(实现为 ViT 或 VLA 的 VLM 骨干)独立把每帧编码为潜嵌入 $\mathbf{z}_{t-k}=\text{enc}_\epsilon(o_{t-k})$;语言指令 $\ell$ 由 CLIP 编码再经适配器映射到 WCM 潜空间。视觉历史先对指令 token 做交叉注意力,再用因果 Transformer 主干得隐表示 $\mathbf{h}_t$,分别送入价值头估 $\hat{V}_t$ 和世界头以残差方式预测 $\hat{\mathbf{z}}_{t+1}$。整体损失 $\mathcal{L}=\mathcal{L}_{value}+\lambda\cdot\mathcal{L}_{pred}+\eta\cdot\mathcal{L}_{SIGReg}$ 端到端训练,WCM 仅约 107.2M 可学习参数。

核心创新点是把世界建模与评论家学习统一进单一端到端架构,通过预测性动态与价值估计的联合优化,让评论家表示被显式训练去编码环境动态而非仅回归回报。与传统评论家的本质区别有三:第一,它同时预测未来潜态和估计价值,世界预测不是旁路辅助任务而是与价值估计共享表示的主任务;第二,价值头与世界头共享同一个经历史+指令条件化的隐表示 $\mathbf{h}_t$,世界预测损失 $\mathcal{L}_{pred}=\|\hat{\mathbf{z}}_{t+1}-\mathbf{z}_{t+1}\|_2^2$ 给评论家提供了稠密的跨时间监督,弥补了标量回报回归的稀疏性;第三,用 SIGReg 在潜空间施加各向同性高斯约束防止特征坍缩,使潜表示稳定可学。这种设计让评论家逼近预测性状态,从根本上解决 POMDP 下的状态逼近问题。

方法步骤详情

完整流程分四步。第一步编码:观测编码器把 $K$ 帧历史各自编码为 $\mathbf{z}_{t-k}$,语言指令经 CLIP 与适配器得 $\mathbf{u}_\ell=\mathcal{A}_{lang}(\text{CLIP}(\ell))$。第二步融合:视觉潜序列对指令 token 交叉注意力后过因果 Transformer,得 $\mathbf{h}_t=\text{Tr}_\phi(\text{XAttn}(\mathbf{z}_{t-K+1:t},\mathbf{u}_\ell))$。第三步双头预测:价值头 $\hat{V}_t=\mathcal{D}_{value}(\mathbf{h}_t)$;世界头用动作编码器+门控 FiLM 残差块预测 $\hat{\mathbf{z}}_{t+1}=\mathcal{D}_{world}(\mathbf{h}_t,a_t,\mathbf{z}_t)$。第四步联合更新:回报按成功/失败/中间步定义为 $r_t\in\{0,-C_{fail},-1\}$ 并 min-max 归一化到 $[-1,1]$,价值损失 $\mathcal{L}_{value}=\|\hat{V}_t-G_t\|_2^2$,预测损失用 teacher-forcing 比对真值下一潜态,三项加权端到端优化。on-policy 管线用 rollout 估价值与 GAE 优势做 PPO/Flow-SDE;off-policy 用 SFT+错误 rollout+失败案例统一缓冲区做 AWR/RECAP。

技术新颖性

技术新颖性体现在四方面。其一,首次系统识别并刻画了评论家 VLA-RL 的表示瓶颈:在部分可观测下,单帧输入或弱监督历史嵌入不足以恢复时间信息丰富的状态,这是对问题根因的诊断而非仅是工程改进。其二,提出统一评论家架构,将未来状态预测与价值估计联合优化,使评论家表示被显式训练去编码环境动态,区别于把世界建模当旁路任务的 World Action Model。其三,LeJEPA+SIGReg 的轻量骨架(107.2M 参数)让评论家可从零训练,且能与 VLM 骨干预训练表示协同,SIGReg 通过要求每个一维投影匹配标准高斯特征函数来同时惩罚维度坍缩与模式退化。其四,广泛兼容性:同一 WCM 即插即用到 on-policy(PPO/Flow-SDE)与 off-policy(AWR/RECAP),并适配 AR 与流匹配两类骨干($\pi_0$/$\pi_{0.5}$/OpenVLA-OFT),这是以往评论家改进少见的普适性。

Overview of the WCM method
Figure 2: Overview of the WCM method
Ablation study on critic architectures and observation history lengths
Figure 5: Ablation study on critic architectures and observation history lengths

实验结果

WCM 在 4 基准共 149 任务上全面领先。ManiSkill IND:OpenVLA-OFT 99.0(+70.9)、$\pi_{0.5}$ 91.9(+44.9)、$\pi_0$ 84.4(+46.0),相对 SFT(28.1/47.0/38.4)增幅巨大;OOD 平均 OpenVLA-OFT 77.9(+59.6)、$\pi_{0.5}$ 64.4(+38.0),超以 OOD 见长的 $\pi$-stepNFT。OpenVLA-OFT 从零样本 0.78% 训到 98.7%(相对+12551%)。MetaWorld $\pi_0$ 83.4、$\pi_{0.5}$ 78.1 超越 SFT 与 Flow 系列;CALVIN $\pi_{0.5}$ 平均长度 4.748、$\pi_0$ 4.652 体现更强长程能力。LIBERO-Plus 单样本 SFT 起步约250步 RL 后 $\pi_0$ 72.8、$\pi_{0.5}$ 73.7、OpenVLA-OFT 74.0,超过 20k 轨迹全样本 SFT(71.2~72.9),Δ +33.7~+44.7。真实世界 7 任务全面超 AWR/RECAP,如 $\pi_{0.5}$ 香蕉43/50、炉灶清洁33/50(vs SFT 34/4)。消融证明世界预测是关键:MLP 加历史反降、ViT 评论家($\lambda=0$)无效,加入预测才提升;历史 $K=3$ 最优,捕捉二阶动态。

Performance comparison on ManiSkill under IND and OOD settings
Table 1: Performance comparison on ManiSkill under IND and OOD settings
Detailed performance on LIBERO-Plus
Table 2: Detailed performance on LIBERO-Plus
Detailed real-world experiment results
Table 3: Detailed real-world experiment results
Results on MetaWorld and CALVIN
Figure 4: Results on MetaWorld and CALVIN
查看结构化数据
任务指标本文基线提升
ManiSkill 仿真操作(IND/OOD) 成功率(%) OpenVLA-OFT IND 99.0、OOD 77.9;$\pi_{0.5}$ IND 91.9、OOD 64.4;$\pi_0$ IND 84.4、OOD 51.5 SFT:OpenVLA-OFT 28.1、$\pi_{0.5}$ 47.0、$\pi_0$ 38.4;最强基线 PPO IND 97.7、$\pi$-stepNFT $\pi_0$ OOD 50.4 OpenVLA-OFT IND +70.9、$\pi_0$ IND +46.0;OOD 全面超过以泛化见长的 $\pi$-stepNFT($\pi_{0.5}$ OOD +5.0)
OpenVLA-OFT 零样本到 ManiSkill 成功率(%) 98.7±0.3 (IND),73.5 (OOD) 零样本 0.78% (IND) IND 相对提升 12551%,OOD +72.7,证明 WCM 能从极低起点稳定收敛
MetaWorld 多任务(含非抓放/接触类) 平均成功率(%) $\pi_0$ 83.4、$\pi_{0.5}$ 78.1 SFT $\pi_0$ 66.1、$\pi_{0.5}$ 70.7;Flow-SDE/Flow-Noise 略低于本文 在需稳定接触的任务上明显领先,得益于捕捉高阶状态信息
CALVIN 长程任务 平均完成长度(共5步) $\pi_{0.5}$ 4.748、$\pi_0$ 4.652 SFT 与 Flow 系列基线 3.766~4.318 更长平均长度反映更强长程规划与执行能力
LIBERO-Plus 泛化(7类干扰) 总分(%) One-SFT+WCM:$\pi_0$ 72.8、$\pi_{0.5}$ 73.7、OpenVLA-OFT 74.0 One-SFT:$\pi_0$ 39.1、$\pi_{0.5}$ 38.0、OpenVLA-OFT 29.3;Full-SFT(20k轨迹) 71.2~72.9 单样本起步约250步 RL 即超过全样本 SFT,Δ +33.7~+44.7,强泛化
真实世界 7 任务(WidowX-250S) 成功次数(/50) $\pi_{0.5}$+WCM 香蕉43、炉灶清洁33;OpenVLA-OFT+WCM 布料折叠38 SFT $\pi_{0.5}$ 香蕉34、炉灶清洁4;RECAP 33/27;AWR 布料折叠29 全部7任务超 off-policy 基线,炉灶清洁 +29,部署更平滑

局限与改进

作者承认的局限主要有三点。第一,历史长度并非越长越好:消融显示 $K=3$ 最优,超过后收益有限甚至略降,作者推测任务只需一阶(速度)与二阶(加速度)动态信息,但对需要更长记忆的任务(如长视野延迟奖励)未必适用。第二,off-policy 管线依赖 SFT+rollout 混合数据,首轮迭代 rollout 不可用,且价值估计的准确性依赖失败案例的覆盖。第三,真实世界验证受限于 7 个 WidowX-250S 任务与 100 条/任务 SFT、8 轮迭代、50 rollout/轮的规模,未覆盖双臂、灵巧手或更复杂接触。我额外观察到:评论家表示用 SIGReg 强制为各向同性高斯,可能过度约束了与任务强相关的方向;损失权重 $\lambda$、$\eta$ 与 $C_{fail}$ 的敏感性、各骨干间是否一致调参未充分披露;ManiSkill-OOD 仍以单/多帧视觉扰动为主,对真正剧烈的语义分布偏移未见评估。

独立分析的弱点

弱点一:固定历史长度 $K=3$ 与'三帧捕捉二阶动态'的启发式解释偏经验,对接触丰富、信息延迟的任务可能不足。改进方向是让 $K$ 自适应或引入可变长度注意力与记忆机制(如 RNN 状态或检索式记忆)。弱点二:SIGReg 把潜空间约束为各向同性高斯,可能压制对任务判别性强的方向,潜表示与下游价值/动作的对齐未必最优。改进方向是探索任务条件化或解耦的潜空间正则,保留判别方向。弱点三:价值监督仍是单步标量回报 min-max 归一化,对回报尺度与成功稀疏性敏感,$C_{fail}$ 需人工调。改进方向是引入分布/分位价值或多步 n-step、lambda-return 等更丰富监督。弱点四:真实世界规模小、单平台(WidowX-250S)、单相机设定,泛化到双臂、灵巧手、多视角未验证。改进方向是跨平台大规模真实实验与 sim-to-real 联合训练。弱点五:世界预测仅在潜空间,缺少显式不确定性建模,对高随机环境可能过自信。改进方向是引入概率世界模型或集成评论家估计认知不确定性。

未来方向

作者提出与可延伸的方向包括:扩展到更长历史与更复杂动态任务以验证 $K$ 自适应的必要性;把 WCM 思想迁移到双臂/灵巧手/移动操作等更多机器人形态;结合 World Action Model 类方法探索评论家与策略共享世界模型的统一框架。基于本成果还可延伸:其一,将世界预测目标用于更丰富的奖励信号(如潜空间内在奖励或课程),提升样本效率;其二,研究评论家表示的可解释性,把预测的潜态用于异常检测与失败诊断;其三,探索概率/集成版 WCM 在高随机环境下的不确定性估计,改善探索与安全;其四,把 WCM 与视频/世界基础模型结合,预训练可迁移的预测性状态表示,降低任务特定训练成本;其五,在多模态感知(触觉、力觉、深度)下扩展历史融合,进一步逼近完整 POMDP 状态。

复现评估

复现性较好。论文提供 GitHub 仓库(https://github.com/sylvestf/WCM)、项目主页与 HuggingFace 模型集合,并给出关键超参与算法伪代码(Appendix D 算法1/2/3)。方法基于公开骨干($\pi_0$、$\pi_{0.5}$、OpenVLA-OFT)与公开基准(ManiSkill、MetaWorld、CALVIN、LIBERO-Plus),损失 $\mathcal{L}=\mathcal{L}_{value}+\lambda\mathcal{L}_{pred}+\eta\mathcal{L}_{SIGReg}$、价值定义、GAE/AWR/RECAP 管线均有交代,WCM 仅 107.2M 参数降低实现门槛。困难在于:on-policy 流匹配 RL 与 149 任务跨四基准评测算力门槛高;真实世界实验需 WidowX-250S 硬件与遥操作采集(100 轨迹/任务、8 轮迭代、50 rollout/轮);部分超参($\lambda$、$\eta$、$C_{fail}$、$K$)的逐骨干取值需从代码确认。整体配方可复现,但完整跨骨干复训练与真实部署仍需相当工程投入。