← 返回 2026-08-06

WorldCycle:面向长程视频世界模型的自验证强化学习 WorldCycle: Self-Verifiable Reinforcement Learning for Long-Horizon Video World Models

Bohai Gu, Yueyang Yuan, Taiyi Wu, Dazhao Du, Jian Liu, Xiaoyi Pang, Jie Zhang, Xiaocheng Lu, Haobin Zhong, Xiaotong Zhao, Alan Zhao, Song Guo 📅 2026-08-05 👍 12 2026-08-11 18:30
CycleBench 动作一致性 可逆动力学 强化学习后训练 自监督 视频世界模型

用可逆动作闭环构造免标注长程监督,状态漂移最多降44%

前置知识

交互式视频世界模型 (Interactive Video World Model, IWM)

一种学习到的状态转移系统 $M_\theta=(\mathcal S,\mathcal A,f_\theta)$,给定初始观测和一连串用户/智能体动作 $a_t$,自回归地生成未来视频帧 $s_{t+1}=f_\theta(s_t,a_t)$。代表系统有 Genie、GameNGen、Oasis、WorldPlay 等,本质是把生成式视频模型变成可交互的模拟器。

本文所有问题的源头都在于「自回归」:每一帧既是输出又是下一帧的上下文,所以单步误差会被层层放大。

自回归误差累积 (Autoregressive Compounding Error)

当 $\hat T_a = T_a\circ E_a$ 且每步残差 $E_a\approx I$ 但不严格为恒等时,$\hat T_\gamma = (T_{a_T}\circ E_{a_T})\circ\cdots\circ(T_{a_1}\circ E_{a_1})$ 中的残差不会相消而是随 rollout 长度累积,长程上把物理与几何一致性逐步侵蚀掉。

这是论文要解决的核心病灶——理解了误差为何累积,才能理解为何短程奖励对它无能为力。

验证瓶颈 (Verification Bottleneck)

RL 后训练想惩罚长程轨迹误差,但对任意动作序列不存在「正确的未来状态」可作为参照,于是只能退而求其次地用局部可验证代理(如逐片段动作跟随、视觉质量偏好)。本文指出现有方法(WorldCompass、RLVR-World、RLIR)都受此瓶颈限制。

整个 WorldCycle 的动机就是「绕过验证瓶颈」,是论文最关键的概念创新。

DiffusionNFT 强化学习目标

一类用于扩散模型的负样本感知回归目标 $\mathcal L_{RL}=r\|v_\theta^+-v\|_2^2+(1-r)\|v_\theta^- - v\|_2^2$,其中 $r$ 是归一化奖励、$v$ 是采样速度。相比 DanceGRPO 等策略梯度法,它在长程优化下不会因逐步对数概率跟踪而塌缩 rollout 多样性,且只回传尾块即可控显存。

这是 WorldCycle 实际采用的优化器,理解它才知道为什么轨迹级奖励能被高效训练。

稠密点追踪 (Dense Point Tracking, CoTracker)

因为底层物理状态 $s$ 不可观测,论文用 CoTracker 在两帧间追踪 $N$ 个有效对应点 $p_i^n,p_j^n$,定义帧对差异 $d(o_i,o_j)=\frac{1}{N(H+W)}\sum_{n=1}^{N}\|p_i^n-p_j^n\|_2$ 作为状态一致性的可观代理。评测时则换成独立的 RoMa 估计器以避免训评同源偏差。

整篇论文的奖励与评测指标都建立在点追踪之上,是方法能否落地的工程基石。

研究动机

交互式视频世界模型采用自回归生成——每生成一帧观测就成为预测下一帧的上下文,于是哪怕单步只有微小残差,误差也会沿 rollout 累积,逐渐侵蚀下游长程任务所需的物理与几何一致性。例如 8B 的 WorldPlay 在 381 帧长程设置下端点状态闭合误差 ESC 高达 0.302,复合动作(边前进边转向)的准确率从简单动作的 0.635 直接崩塌到 0.136,出现 5× 精度崩溃。RL 后训练本是改善这一问题的方向,却撞上「验证瓶颈」:对任意动作序列不存在「正确的未来状态」可作为长程误差的参考,因此无法直接对轨迹级误差施加梯度。最强的现有工作 WorldCompass 只能用逐片段的反向姿态对齐加视觉质量偏好做代理奖励,这类指标只优化局部动作精度,对长程上的细粒度空间漂移完全无能为力,更谈不上纠正复合动作这种 OOD 行为。

本文的目标是本文要构建一个真正能在长程上自我验证的后训练框架,且完全不依赖任何标注真值视频。目标具体可量化:把状态闭合误差 ESC、反向路径对称性 RPS、重复循环稳定性 RCS 相对最强基线 WorldCompass 显著降低(短期 RPS 目标降幅约 40% 级);把 WorldCompass 难以处理的 OOD 复合动作准确率从基线 WorldPlay 的 0.136 拉升约 4 倍到 0.55 量级;同时要求视觉质量 HPSv3 不降反升(目标 +2%~+5%)。此外要交付首个面向「状态返回一致性」的诊断基准 CycleBench,让 IWM 第一次能作为状态转移模拟器而非短程生成器被评测。

与已有工作不同的是,作者抓住了一个被普遍忽视的事实:并非所有轨迹都没有参考状态。可逆动作(如相机前移再后退)构成的闭环 $\gamma_c=(a_1,\ldots,a_m,a_m^{-1},\ldots,a_1^{-1})$ 其复合变换 $T_{\gamma_c}=I$ 在物理上是恒等——终点必须等于起点,且这一约束完全由动作的代数结构决定,与场景内容、初始状态、中间观测统统无关。WorldPlay 和 WorldCompass 连这个最小合理性检查都通不过(Figure 1 既暴露空间闭合失败也暴露时间一致性失败)。WorldCycle 的切入角度正是:把这个内容无关、免标注的解析恒等约束,直接转化为长程轨迹级的稠密训练信号,从根上绕过验证瓶颈。

核心方法

直觉上,WorldCycle 让模型反复做「走过去再原路返回」的练习,并检查它能否精确回到原点——做得到就说明这一段动力学学对了,做不到就指出从哪里开始飘。技术路线分三层:先把任意动作序列 $a_{1..m}$ 拼上其精确逆序,构造闭可逆循环 $\gamma_c$;循环内每一对镜像相位(第 $i$ 步前进与第 $2m-i$ 步后退)都应指向同一底层状态,于是每一对都贡献一次「闭合检查」,把原本稀疏的端点信号铺成稠密的逐对监督(空间闭合奖励)。再把同一循环重复 $K$ 次(最多 $K=8$),比较同相位跨循环的帧,惩罚「同一个动作在不同 rollout 深度表现不同」的时间漂移(时间一致性奖励)。最后两组奖励与动作跟随奖励 $R_{act}$、视觉质量奖励 $R_{HPS}$ 加权组合,用 DiffusionNFT 风格目标对 8B 自回归扩散策略做轨迹级优化,仅回传尾块以控制显存。

核心创新是把「可逆闭环的恒等变换」这一物理先验直接当成监督信号,从而彻底绕开「长程无真值」的死结。形式上,若 $T_\gamma=I$ 则应满足 $f_\theta(s,\gamma)=s,\ \forall s\in\mathcal S$——这远比「逐步动作跟随」严格:模型可能每一步动作都跟对了,但累积残差 $\hat T_\gamma=\hat T_{a_T}\circ\cdots\circ\hat T_{a_1}$ 仍偏离恒等。为此 WorldCycle 同时引入空间闭合奖励 $R_{spatial}=\frac{1}{m+1}\sum_{i=0}^{m}\exp[-\alpha d(o_i,o_{2m-i})]$ 和时间一致性奖励(把循环重复 $K$ 次、以首循环为锚比较同相位帧 $o_i^k$ 与 $o_i^1$):前者用每对镜像帧定位循环内何时开始漂移、化解奖励稀疏,后者强制同一动作跨执行保持稳定、对抗 AR 时间漂移。两者合力把动作从「记下来的时序模式」逼成「一致的状态算子」,并天然外推到基座从未见过的复合动作。

方法步骤详情

(1) 状态度量:底层物理状态不可观测,用 CoTracker 追踪两帧间 $N$ 个有效点,定义帧对差异 $d(o_i,o_j)=\frac{1}{N(H+W)}\sum_n\|p_i^n-p_j^n\|_2$,低置信匹配剔除。(2) 镜像闭环:$m$ 个前进步接逆序后退步生成 $2m{+}1$ 帧,逐对比较 $o_i$ 与 $o_{2m-i}$ 得空间闭合奖励。(3) 循环重复 $K\le 8$ 次,以首循环为锚算时间一致性奖励。(4) 多尺度采样:给定 $H=n\cdot 2^Q$,构造 $2^k$($k\in\{0,\ldots,Q{-}1\}$)个长 $H/2^k$ 的层级循环,每步随机抽一层防位置捷径。(5) 暖启动-联合调度:前 $t_w=300$ 步仅空间奖励,之后两奖励联合优化,规避时间奖励在循环未闭合时引入噪声。(6) 组合奖励 $R=R_{cycle}+\lambda_a R_{act}+\lambda_v R_{HPS}$($\lambda_s{=}1,\lambda_t{=}0.5,\lambda_v{=}1,\lambda_a{=}2$),用 DiffusionNFT 负样本感知回归目标对归一化循环奖励 $r$ 做加权正负速度回归,仅回传尾块控显存,最长 16 个 clip。

技术新颖性

与 WorldCompass、RLVR-World、RLIR 等已有 RL 后训练方法本质不同:前者都只能对单片段或短段用外部打分器监督,对轨迹整体不加约束;WorldCycle 的奖励目标由可逆动作的代数恒等式固定,无需任何真值轨迹,且天然迁移到基座从未见过的复合动作(因为复合动作配其逆仍是闭环,闭环奖励照样成立)。与传统 cycle-consistency(图像/视频自监督里循环一致性用于特征空间对齐)也不同:这里约束的不是表征相似度,而是生成状态在像素空间经稠密点追踪后的实际位移,是真正像素级的状态返回检查。多尺度循环采样与暖启动-联合调度也是为长程扩散 RL 量身设计——前者防 reward hacking 与时间位置捷径,后者同时规避灾难性遗忘和梯度冲突。

Overview of WorldCycle(WorldCycle 方法总览)
Figure 2: Overview of WorldCycle(WorldCycle 方法总览)
Overview of CycleBench(CycleBench 基准总览)
Figure 3: Overview of CycleBench(CycleBench 基准总览)

实验结果

Table 1(47 轨迹、380 初始帧、四任务×四设置加权平均)显示,对比最强对手 WorldCompass,WorldCycle 短期 125 帧 ESC 由 0.038 降到 0.026(-32%)、RPS 由 0.034 降到 0.019(-44%)、RCS -23%,动作准确率 0.833 与 HPSv3 11.24 不降反升;中程 253 帧 ESC -21%、RPS -28%;长程 381 帧 RCS 暴跌 34%。HPSv3 最高的 14B Lingbot World v2 在 ESC/RPS/RCS 上反而差 1.4–8.3×,证明「单纯扩规模」解决不了状态返回。最亮眼是 OOD 复合动作:WorldPlay 准确率从 0.635 崩到 0.136(5× 崩溃),WorldCycle 拉到 0.553(约 4×、+11%、RCS -35%)。Table 2 消融佐证:去时间奖励长程 ESC 由 0.163 涨到 0.212,去空间奖励复合 Acc 仅 0.378;暖启动-联合调度中程 Acc 0.878 优于纯联合与顺序;完整模型 HPSv3 达 10.42(基线 8.98,+16%)。

CycleBench results (weighted average over four benchmark tasks)
Table 1: CycleBench results (weighted average over four benchmark tasks)
Ablation on CycleBench
Table 2: Ablation on CycleBench
Qualitative comparison on CycleBench (253 frames)
Figure 4: Qualitative comparison on CycleBench (253 frames)
查看结构化数据
任务指标本文基线提升
CycleBench 短期可逆循环 (125 帧) ESC↓ (端点状态闭合) 0.026 WorldCompass 0.038 -32%
CycleBench 短期可逆循环 (125 帧) RPS↓ (反向路径对称性) 0.019 WorldCompass 0.034 -44%(全文最大降幅)
CycleBench 长程重复循环 (381 帧) RCS↓ (重复循环稳定性) 0.049 WorldCompass 0.074 -34%
CycleBench OOD 复合动作 (125 帧) Action Accuracy↑ 0.553 WorldPlay 0.136 / WorldCompass 0.499 较基线约 4×、较 WorldCompass +11%
CycleBench 复合动作 (125 帧) HPSv3↑ 视觉质量 10.42 基座 WorldPlay 8.98 +16%(一致性不牺牲画质)

局限与改进

作者自承两点:方法仅在精确可逆轨迹上验证,近似可逆(带摩擦/能量耗散的真实物理)尚未覆盖;动作范围局限在相机自运动类,机械臂操作等其他模态留作未来工作。我额外观察到四点:其一,整套奖励依赖 CoTracker 在像素空间做点追踪,对剧烈外观变化(遮挡、大幅光照、大物体形变)不可靠;其二,复合动作准确率虽涨到 0.553,但绝对值仍不到 0.6,距「可用模拟器」还有距离;其三,可逆/闭环的动作结构是强假设,开放世界探索中大量动作本就不可逆,监督信号覆盖面有限;其四,CycleBench 的「正确状态」来自动作代数而非真实物理仿真,对非刚体场景该等式是否成立存疑——训练用 CoTracker、评测改用 RoMa 虽增强鲁棒性,但也引入训评不一致风险。

独立分析的弱点

弱点一:奖励仅在「可逆/闭环」动作上有定义。开放世界探索任务(破坏物体、不可逆状态变化)拿不到循环奖励,场景一换方法即失效;改进方向是把循环约束放松为「软可逆」,或用基于物理引擎的反事实生成近似逆轨迹。弱点二:稠密点追踪在长程上易失效(漂移、遮挡),论文用 16 帧切块缓解但 381 帧时 RCS 仍只到 0.049 量级;改进方向是引入 3D 几何先验(单目深度、NeRF/Gaussian 表征)做状态对齐,或用学习式关键点替代通用点追踪。弱点三:训练显存与 rollout 长度强耦合,最大仅 16 个 clip,限制了真正超长程(千帧级)的应用;改进方向是结合分层规划或潜在空间 rollout 把奖励计算从像素空间解耦。弱点四:只在 WorldPlay 单一基座上验证,未证明对 Genie/Oasis/HY-World 等不同架构泛化;改进方向是跨基座、跨模态复现。

未来方向

作者明确指向两个方向:把循环返回原理扩展到「近似可逆」动力学,以及机械臂操作等其他动作模态。基于成果可延伸出若干方向:其一,把空间/时间双奖励推广为更一般的「群作用一致性」——参考同期工作 Wang et al. 2026b《World Models as Group Actions》,凡动作构成群结构(平移、旋转、对称)都可解析约束,可用群作用约束做自监督后训练,覆盖远不止相机自运动的可逆类。其二,CycleBench 可继续扩到多物体交互、非刚性形变、光照变化等更难场景。其三,把循环奖励与基于物理引擎的可微仿真结合,处理「严格不可逆」事件。其四,把循环一致性思想迁移到机器人模仿学习的「往返任务」上,做无标注的技能质量评估与课程自动构造。

复现评估

关键超参全部公开:8B WorldPlay 基座、约 4000 张真实图像-字幕对、16 帧 clip、rollout group $G=16$、最多 $K=8$ 循环、暖启动 $t_w=300$、权重 $\lambda_s=1.0,\lambda_t=0.5,\lambda_v=1.0,\lambda_a=2.0$、AdamW 学习率 $1\times10^{-5}$、8×H200 跑约 3 天(约 576 GPU 时)。复现门槛主要在三处:一是 8 张 H200 的算力对个人或小团队偏贵;二是依赖 WorldPlay 权重,以及 WorldCompass 的 $R_{act}$ 评分模型与 HPSv3 质量模型;三是 CoTracker(训练)/RoMa(评测)的工程链路需要打通。论文未给出明确的代码与 CycleBench 开源链接,按惯例需等正式发布。整体属「中等偏难」复现:方法与超参描述足够清晰,但工程脚手架依赖较重,缺少官方仓库时凭描述复刻全套训练循环有一定工作量。