← 返回 2026-08-31

环形强制:为自回归视频扩散模型构建精确的长期记忆 Ring Forcing: Towards Precise Long-Term Memory for Autoregressive Video Diffusion

Bowen Xue, Brandon Y. Feng, Chenguo Lin, Yuchen Lin, Yujia Zeng, Lvmin Zhang, Maneesh Agrawala, Honglei Yan, Panwang Pan 📅 2026-08-27 👍 13 2026-09-01 18:30
客体永久性 扩散模型 自回归生成 视频生成 长期记忆

环形数据构造强制模型检索远期历史,实现分钟级长视频与客体永久性

前置知识

自回归视频扩散

长视频生成的主流框架:把视频切成若干短片段(如每段约5秒),先生成第一段,再把已生成内容作为条件逐段续写。每段内部用扩散/流模型逐步去噪生成,段与段之间靠注意力机制读取历史上下文。代表工作有 SkyReels-V2、CausVid、Self Forcing、FramePack 等。相比 Wan、HunyuanVideo 这类受注意力二次复杂度限制的双向扩散模型只能生成几秒短片,自回归方式理论上可无限延长,但会累积误差、且难以利用远期上下文。

Ring Forcing 本质上是改进自回归视频扩散的条件构造与训练方式,论文的方法、动机和全部对比实验都建立在这一框架之上。

客体永久性

借自认知科学的概念,指模型能'记住'曾出现在画面中、随后移出镜头或被遮挡的物体,并在其重新出现时精确复现其外观身份。典型失败模式:一个角色走出画面再走回来,模型生成了长相完全不同的'另一个人'。它是生成模型长期记忆能力最直观的试金石,本文用它作为核心评测维度,并据此构建了 A-D-R(出现-消失-重现)基准。

客体永久性是本文要解决的首要问题,论文的动机、基准设计和主要实验结果(Table 1)都围绕它展开。

Rectified Flow(整流流)

一种流匹配类生成范式:把干净数据 $Z_{tgt}$ 与高斯噪声 $\epsilon$ 用直线插值构造路径 $Z_t = (1-t)Z_{tgt} + t\epsilon$,训练网络 $G_\theta$ 预测从噪声指向数据的速度场。相比传统 DDPM,训练目标更简单、采样路径更直、可用更少步数生成。Wan 等现代视频模型普遍采用该目标,本文沿用并在此基础上加入自定义的条件构造。

论文 3.4 节的训练目标就是整流流速度预测损失 $\mathcal{L}_{Ring}$,理解它才能读懂环形策略与压缩策略如何被统一进一个损失函数。

RoPE 旋转位置编码

Rotary Positional Embedding:对注意力中 query/key 的特征维度做旋转变换,使注意力分数只依赖位置的相对偏移。视频模型用 3D RoPE 把时间、高、宽三个坐标编码进去,让模型感知时空相对结构并支持一定程度的长度外推。标准做法直接用 token 在网格中的离散索引作为位置。

本文提出 Sparse RoPE,把压缩后的历史 token 映射回原始连续物理时空坐标再编码,这是与标准索引式 RoPE 的关键区别,需要懂 RoPE 才能领会该设计为何能复用预训练先验。

扩散时间步的功能分工

扩散/流模型训练时随机采样时间步 $t$,模型在不同 $t$ 下学到的功能天然不同:高噪声时输入近乎纯噪声,模型主要预测全局结构、语义与运动;低噪声时输入已接近干净数据,模型专注于纹理、边缘等高频细节。这一'时间步分工'先验是许多加速与控制技巧的基础。

本文的时间步组合压缩正是利用该先验:高噪声区间喂时间稠密的全局流历史,低噪声区间喂空间保真的细节流历史,是方法三大组件之一。

LoRA 低秩适应

参数高效微调方法:冻结预训练模型全部权重,在每层旁挂一对低秩矩阵 $A \in \mathbb{R}^{d \times r}$、$B \in \mathbb{R}^{r \times d}$(秩 $r \ll d$),训练时只更新 $BA$。大幅降低显存与训练成本,推理时可合并进原权重,几乎零额外开销。本文用 $r=128$ 的 LoRA 微调 Wan 系骨干。

论文所有实验均以 LoRA 微调实现,理解它有助于评估方法的参数效率与复现成本。

研究动机

现有自回归视频扩散模型(SkyReels-V2、CausVid、Self Forcing 等)扩展到分钟级时长时暴露出长期记忆缺失的两大瓶颈:一是客体永久性缺失,物体移出相机视锥再重新进入时,模型常生成身份完全不同的物体——即使它几秒前刚被观察到;二是记忆容量不足,扩大感受野需增加序列长度,注意力的二次复杂度使成本难以承受,压缩序列又必然缩小感受野。更关键的是,长上下文本身解决不了问题:即便提供很长的历史,模型也把远处的观察当弱证据。作者诊断出根源是训练目标与推理需求的错位——训练视频存在'线性叙事'偏差,物体很少在短窗口内消失又重现,模型于是学成'近视'的转移概率(几乎只从 $x_t$ 推断 $x_{t+1}$),平滑续写眼前画面却从未学会从远期历史检索决定性信息。定量上(Table 1),SOTA 基线在仅 1 秒的消失间隔下纹理一致性就从 0 秒对照组的 0.58-0.74 跌到 0.18-0.25,几何一致性跌到 0.26-0.37,说明目标一消失就发生'灾难性遗忘'。

本文的目标是本文的目标是让自回归视频扩散模型同时具备'鲁棒构建长期记忆'与'精确利用长期记忆'两种能力,并明确论证二者缺一不可:只有客体永久性而上下文处理不足,时间范围受限;只有长上下文而没有永久性,身份照样丢失。具体拆成两个互补子目标:(1)客体永久性——物体经过从 1 秒到极端 60 秒的消失后重新出现时,在纹理、几何结构、语义三个层面都可度量地精确复现其身份,并把'从远期历史检索'从可选行为变成训练中误差最小化的必需行为;(2)记忆容量——在固定序列长度预算(注意力计算量与原模型几乎相同,140 秒历史的开销等同于 5.4 秒生成)下,把有效历史跨度扩展到分钟级并对全部历史形成完整感受野,同时不破坏预训练的生成先验,保持美学质量与运动丰富度。工程上还要求方法能部署在任何可运行基础 Wan 模型的硬件上,几乎不增加显存与计算。

与已有工作不同的是,本文的独特切入是把'教模型检索历史'变成一个可以自监督构造的训练问题,而不是靠加大窗口、外挂记忆模块或检索器。作者指出FramePack、TinyHistory、TTTVideo、LaCT 等已有工作停留在'扩展/压缩输入上下文'层面,缺少显式强迫模型利用并复现历史信息的训练目标。Ring Forcing 的核心技巧是'未来即历史':把视频与它的倒序副本拼接成环再展开,目标片段就自然成为嵌入在远期历史中的'隐藏真值',模型要降低训练误差就非检索它不可——长程检索从可选捷径变成了必需能力,图 2 的注意力可视化直接显示了这一转变。第二个独特角度是对'历史遵循 vs 生成多样性'这对矛盾的显式建模:用环形上下文随机丢弃(伯努利开关)控制模型在'严格复现历史'与'开放式续写'之间的行为。第三个角度是把扩散模型'高噪声管全局、低噪声管细节'的先验迁移到上下文管理,提出时间步组合的双流压缩,在固定 token 预算下同时保住全局结构与高频细节。

核心方法

直觉上,Ring Forcing 就是逼模型'翻开几页前的笔记答题':训练时把答案悄悄藏进很远的上下文,不给它偷看近处的机会。技术上由三个组件构成,统一在整流流目标下。组件一,环形结构训练:把视频 $V=\{v_1,\dots,v_N\}$ 与倒序副本 $V_{rev}=\{v_N,\dots,v_1\}$ 拼接成环 $V_{ring}=[V, V_{rev}]$,从正向部分采样目标片段 $x_{tgt}$ 以保持时间方向,展开后分解为含倒序目标('隐藏真值')的合成历史 $h_{syn}$ 与原始历史 $h_{org}$,条件取 $C_{full}=[h_{syn}, h_{org}]$;随机头部裁剪封死序列开头的信息泄漏捷径,再以 $b\sim\text{Bernoulli}(1-p_{drop})$ 随机丢弃合成历史以平衡遵循与多样性($p_{drop}=0.4$ 最优)。组件二,时间步组合压缩:压缩算子 $\Psi(Z; r_h, r_w, r_t)$ 与组合算子 $\Phi(Z_{hist}, t, \delta)$——高噪声时间步用空间压缩大、时间稠密的'全局流',低噪声时间步用空间保真、时间稀疏采样(循环移位 $\delta$ 保证全覆盖)的'细节流',在固定 token 预算下把 140 秒历史压到与 5.4 秒生成几乎相同的开销。组件三,稀疏 RoPE:把压缩 token 映射回原始连续时空坐标再做 3D RoPE,复用预训练先验。

核心创新是'环形数据构造 + 隐藏真值嵌入',与已有方法的本质区别在于改变训练信号的结构而非网络结构。标准训练中目标帧只出现在监督端、历史中不含答案,模型的最优策略就是近视地沿用最近帧;Ring Forcing 把真值以倒序嵌入远期历史,使最小化训练误差的唯一途径是执行真正的长程检索——检索从'锦上添花'变成'必需能力'。两个配套设计体现对'捷径学习'的理解:其一,随机头部裁剪针对环构造的天然漏洞——$h_{syn}$ 首帧 $v_{t+L_{tgt}}$ 与目标末帧 $v_{t+L_{tgt}-1}$ 时间相邻、视觉相似,模型不看上下文也能作弊,随机裁掉合成历史前缀即可封死捷径、同时保住远处可检索的答案;其二,环形上下文丢弃以 $p_{drop}$ 概率整体移除合成历史,防止模型过度依赖环结构而丧失开放式生成能力,消融(Table 3)显示 $p_{drop}=0.4$ 是保真(PSNR 24.22)与多样性(4.11/5)的最佳平衡。与检索式(Context-as-Memory、Memory Forcing)和压缩式(FramePack、TinyHistory)方法的根本区别:后者只扩大窗口,不提供显式的'利用并复现历史'训练目标。

方法步骤详情

分四步。第一步数据构造:取 UltraVideo-Long 过滤出单镜头视频 10,000 条(10-240 秒),统一 480×832、15 FPS;对每条视频构造 $V_{ring}=[V, V_{rev}]$,随机采样目标 $x_{tgt}=\{v_t,\dots,v_{t+L_{tgt}-1}\}$,分解出原始历史 $h_{org}=\{v_1,\dots,v_{t-1}\}$ 与含倒序目标的合成历史 $h_{syn}$,按 $C_{full}=[h_{syn}, h_{org}]$ 排列,使目标位于远期历史深处。第二步上下文净化:随机头部裁剪——移除 $h_{syn}$ 的随机前缀(保持倒序目标仍在)得 $C_{crop}$,切断首帧与目标末帧相邻的泄漏;再采样 $b\sim\text{Bernoulli}(1-p_{drop})$,$b=1$ 取 $C_{final}=C_{crop}$(环形模式),$b=0$ 取 $C_{final}=h_{org}$(标准模式)。第三步压缩与编码:$t>\tau$ 用空间压缩强、时间稠密的全局流,$t\le\tau$ 用空间保真、时间稀疏的细节流并以循环移位 $\mathcal{S}(\cdot,\delta)$ 轮转采样网格保证全覆盖;压缩 token 经稀疏 RoPE 映射回物理坐标 $(\tilde{t},\tilde{h},\tilde{w})$(空间项置于 patch 中心,时间项保证历史位于负相对时间域),默认配置 $2\times2\times8+1\times1\times32$。第四步训练:以 $\mathcal{L}_{Ring}=\mathbb{E}[\|\epsilon - G_\theta(Z_t,t,\tilde{C})\|^2]$ 联合优化 $b$、$t$、$\delta$ 的期望,$Z_t=(1-t)Z_{tgt}+t\epsilon$;用 $r=128$ 的 LoRA 微调 Wan2.1 1.3B 与 Wan2.2 A14B,A14B 用 32 张 H800 训 7,000 步约 30 小时,推理单卡即可。

技术新颖性

技术新颖性体现在四个层面。第一,训练范式层面:环形序列构造是全新的自监督信号来源。它与 Rolling Forcing、Self-Forcing++、Resampling Forcing 等'模拟推理误差'的思路正交——那些工作解决误差累积,Ring Forcing 解决检索缺失;与 RELIC 的时间反转构造有亲缘关系,但 Ring Forcing 把倒序视频用作条件中的隐藏监督信号而非单纯的数据增广。第二,防捷径机制层面:随机头部裁剪与上下文丢弃是对环构造自身漏洞的系统性封堵,Table 3 给出 $p_{drop}$ 从 0 到 1 的完整权衡曲线(PSNR 25.02 递减至 21.86,多样性 3.71 升至 4.23),这种对保真-多样性显式权衡的处理在长视频文献中少见。第三,压缩层面:时间步组合压缩把'高噪声管全局、低噪声管细节'的扩散先验转化为上下文管理的双流设计,图 7 的消融证明在不增加序列长度的情况下组合优于任何单流(SSIM 0.745 对全局流最好 0.729、细节流最好 0.690),并揭示'保留时间密度比空间分辨率更关键'的经验规律。第四,位置编码层面:稀疏 RoPE 把压缩 token 映射回物理时空坐标而非离散索引,Table 4 显示相同训练设置下 PSNR 从 19.05 提升至 24.22、LPIPS 从 0.27 降至 0.13,证实对齐预训练分布的价值。整体上三个组件相对独立、可插拔,且推理开销与基础模型几乎相同,这使方法具备很强的工程可用性。

Attention allocation of Predicted Frames to History Frames: (a) Standard Linear Training suffers from myopic attention bias; (b) Ring-Structured Training enables precise retrieval of historical frames.
Fig. 2: Attention allocation of Predicted Frames to History Frames: (a) Standard Linear Training suffers from myopic attention bias; (b) Ring-Structured Training enables precise retrieval of historical frames.
Overview of the Ring-Structured Training Strategy.
Fig. 3: Overview of the Ring-Structured Training Strategy.
Timestep-composed long-context conditioning.
Fig. 4: Timestep-composed long-context conditioning.

实验结果

核心发现有三。其一,A-D-R(出现-消失-重现)基准(64 用例,间隔 0/1/5/15/30/60 秒,SAM 3 分割后以 SIFT/LoFTR/DINOv3 度量纹理/几何/语义一致性)全面领先:1 秒间隔纹理 0.723(基线 0.181-0.252,约 2.9 倍)、几何 0.839(基线 0.287-0.368)、语义 0.823(基线 0.692-0.712);5 秒间隔纹理 0.515 仍显著领先;基线间隔超 5 秒即超出上下文窗口无法评测,本文 15/30/60 秒纹理依次 0.509/0.421/0.396、语义 0.802/0.822/0.793,60 秒极端间隔仍能恢复高频细节;0 秒对照组几何 0.997、指令遵循 24.642 全场最佳,未牺牲基本能力。其二,通用基准(64 提示词、60 秒视频)上美学 5.822、自然度 3.922、指令遵循 25.471、一致性 4.35、人类盲测综合 4.22 均为长视频基线最佳,动态 2.261 最高,打破'一致性 vs 动态性'折衷(LongLive 动态仅 1.056、趋于静态);与仅生成 5.4 秒的基础模型 Wan2.2-T2V-A14B(美学 5.825)几乎持平,生成先验完整保留。21 人盲测进一步支持。其三,消融验证:时间步组合同等长度下优于单流(SSIM 0.745 对全局流 0.729、细节流 0.690);$p_{drop}=0.4$ 是甜点(PSNR 24.22、多样性 4.11);稀疏 RoPE 把重建 PSNR 从 19.05 提到 24.22。

Quantitative results on the A-D-R Benchmark.
Table 1: Quantitative results on the A-D-R Benchmark.
Quantitative comparison on the General long-video generation benchmark (1 minute).
Table 2: Quantitative comparison on the General long-video generation benchmark (1 minute).
Ablation study on Ring Context Drop probability p_drop.
Table 3: Ablation study on Ring Context Drop probability p_drop.
Comparison of reconstruction capabilities between standard index-based RoPE and our sparse RoPE.
Table 4: Comparison of reconstruction capabilities between standard index-based RoPE and our sparse RoPE.
Qualitative results on the Appear–Disappear–Reappear (A-D-R) benchmark.
Fig. 5: Qualitative results on the Appear–Disappear–Reappear (A-D-R) benchmark.
Qualitative results of 60-second long video generation.
Fig. 6: Qualitative results of 60-second long video generation.
Effectiveness of Timestep Composition Strategy.
Fig. 7: Effectiveness of Timestep Composition Strategy.
查看结构化数据
任务指标本文基线提升
A-D-R 客体永久性基准(1 秒消失间隔) 纹理一致性 (SIFT) 0.723 FramePack 0.252 / LongCat 0.236 / LongLive 0.181 约为最强基线的 2.9 倍
A-D-R 基准(1 秒间隔) 几何一致性 (LoFTR) 0.839 LongCat 0.368 / LongLive 0.297 / FramePack 0.287 +0.471(约 2.3 倍)
A-D-R 基准(60 秒间隔) 语义一致性 (DINOv3) 0.793 基线超出上下文窗口,无法评测 唯一能处理 60 秒间隔的方法
通用长视频生成(60 秒) 人类盲测综合质量 (0-5) 4.22 LongCat 4.19 / FramePack 4.04 / LongLive 2.25 长视频基线中最佳
通用长视频生成(60 秒) 时空一致性 (Qwen3-VL, 0-5) 4.35 LongLive 4.12 / FramePack 3.71 / LongCat 3.59 +0.23
历史重建消融(128 样本) SSIM 0.745(时间步组合) 全局流 0.729 / 细节流 0.690 同等序列长度下最优
稀疏 RoPE 消融 PSNR (dB) 24.22 标准索引 RoPE 19.05 +5.17 dB,LPIPS 0.27→0.13

局限与改进

从论文数据可读出的局限:(1)长间隔下一致性明显衰减——纹理从 0 秒的 0.742 降至 60 秒的 0.396,几何从 0.997 降至 0.582,分钟级记忆可用但远未无损;(2)60 秒间隔时指令遵循降至 22.872、动态降至 1.809,长程一致性可能以牺牲运动丰富度与提示跟随为代价;(3)A-D-R 为自建 64 用例库,评测依赖 SAM 3 分割与提示词遵循(作者承认靠'精心设计提示词确保大多数用例符合 A-D-R 逻辑'),存在筛选偏差且未经社区检验;(4)训练数据为过滤后的单镜头视频(10,000 条),跨镜头场景缺定量验证,图 1d 的真实世界外推以定性为主;(5)结论全部基于 Wan 系骨干 + LoRA(r=128),对线性注意力、SSM 等架构适用性未知,也无全参数微调对比;(6)通用基准中运动平滑度 0.986 略低于基线(0.991),压缩历史可能引入轻微时间抖动;(7)推理需维护双流压缩缓存与移位调度,工程复杂度高于朴素自回归。

独立分析的弱点

独立分析四个弱点。第一,评测客观性依赖提示词遵循:A-D-R 的'消失'判定靠 SAM 3 检测排除异常样本,模型没按提示让物体消失时样本被剔除,指标可能被筛选污染,改进方向是构建带自动校验的更大规模公开基准或人工复核双盲流程。第二,压缩配置经验选定:默认 $2\times2\times8+1\times1\times32$、噪声阈值 $\tau$、token 预算 $B_{max}$ 与可支持时长的缩放规律未给出,任意长输入缺乏自适应指导,可改为按内容复杂度分配预算的可学习压缩器,或报告预算-时长缩放曲线。第三,环形构造的'倒序真值'隐含内容时间对称的假设:对燃烧、破碎、融化等强不可逆过程,倒序片段会呈现物理上不可能的画面,可能教模型生成违反物理的细节,改进方向是对不可逆片段退化为单向构造或用正向重复片段嵌入答案。第四,训练与推理一致性风险未讨论:稀疏 RoPE 与时间步组合引入 $\tau$、$\delta$ 调度,对不同去噪步数采样器的鲁棒性没有实验;且全部结论来自 LoRA 微调,缺规模效应验证,复现者难判断收益是否随模型规模增长。

未来方向

作者在结论中将 Ring Forcing 定位为'无限上下文生成建模'的基础范式,可延伸的方向包括:作者层面——把环形训练扩展到小时级历史与世界模型场景(结合 Context-as-Memory、WorldMem 的视场检索);探索与状态空间记忆(VideoSSM、LaCT)的混合,用环形监督训练记忆读写模块;研究跨镜头、跨场景的长程记忆迁移。基于本文成果可延伸的:(1)把'隐藏真值嵌入'思想迁移到语音、音乐、具身动作序列等其他自回归生成模态,治疗同样的'近视注意力';(2)把环形构造发展为注意力诊断工具,定量评测任意模型对历史的利用率;(3)用可学习/自适应压缩算子替代手工 $\Psi$,按信息量动态分配 token 预算;(4)把稀疏 RoPE 的物理坐标映射推广为任意压缩率下通用的'压缩感知位置编码';(5)结合 RLHF/DPO,以 A-D-R 式自动指标直接优化客体永久性;(6)在游戏引擎、数字人直播等流式交互场景验证分钟级以上的在线记忆维护与显存控制。

复现评估

复现评估:论文未提及开源代码或权重(项目页 ringforcing.com 以演示为主),这是最大复现障碍。可复现要素较充分:训练数据为公开的 UltraVideo-Long,过滤规则明确(单镜头、10,000 条、480×832、15 FPS);骨干为公开的 Wan2.1 T2V 1.3B 与 Wan2.2 T2V A14B;关键超参完整(LoRA r=128、7,000 步、32×H800 约 30 小时、$p_{drop}=0.4$、压缩配置 $2\times2\times8+1\times1\times32$);评测协议细致(A-D-R 64 用例结构、首帧故意不含目标、SAM 3、SIFT/LoFTR/DINOv3、X-CLIP、AMT、Qwen3-VL 五分制),但提示词库未公开,重建基准有随机性。算力门槛:1.3B 版消融单机或少量显卡可负担,A14B 需 32 卡 H800 级集群,个人建议从 1.3B 复现消融。总体难度中高:原理清晰、超参齐全,但需自行实现环构造、双流压缩缓存、稀疏 RoPE 三个模块并复刻评测管线,熟悉视频扩散训练的小团队估计需 2-4 周。