SANA-Video 2.0:用于高效视频生成的混合线性注意力与注意力残差 SANA-Video 2.0: Hybrid Linear Attention with Attention Residuals for Efficient Video Generation
混合线性与softmax注意力,单卡生成比全softmax视频DiT快3.2倍
前置知识
线性注意力(Linear Attention)
标准 softmax 注意力的计算复杂度为 $O(N^2)$,其中 $N$ 是序列长度。线性注意力通过将 query-key-token 的交互压缩到一个固定大小的状态矩阵 $S \in \mathbb{R}^{d \times d}$ 中,把序列复杂度降到 $O(Nd^2)$。具体地,状态由 $S = \sum_n v_n (\beta_n k_n)^\top$ 累积而成,输出为对状态的查询 $o_j$。这种做法让计算量随序列长度线性增长,非常适合长视频,但代价是状态矩阵的秩有限,无法表达任意 token 间的精确交互。
本文的核心动机就是用线性注意力替代昂贵的 softmax 来做长视频生成,但又要克服其表达力不足的问题,因此必须先理解线性注意力的权衡。
门控双线性线性注意力(Gated Bilinear Linear Attention)
本文采用的线性注意力变体。它对归一化后的 query/key 做 RoPE 旋转,并用 $\varphi(\cdot)=\mathrm{ReLU}(\cdot)$ 非线性。与因果的 delta-rule 递推不同,这里是双向的(适合扩散模型而非语言模型),并用两个门:写入门 $\beta$ 控制每个 token 写入状态的程度,输出门 $g$(经 sigmoid)控制读出。输出形式为 $o_j = W_o\,\mathrm{RMSNorm}\big[\sigma(g_j) \odot (\sum_n \varphi(k_n)^\top\varphi(q_j)+\epsilon)^{-1} S q_j\big]$。
这是混合骨干中占 75% 的主力算子,理解它的门控结构和双向性才能看懂为什么 softmax 锚点需要补足表达力。
流匹配(Flow Matching)
训练扩散/生成模型的目标。给定干净样本 $z$ 和噪声 $\epsilon$,构造线性插值的带噪潜变量 $z_t = (1-t)z + t\epsilon$($t \sim$ logit-normal),模型预测条件速度 $\epsilon - z$,损失为 $\mathcal{L}=\mathbb{E}\|v_\theta - (\epsilon - z)\|^2$。$t\in[0,1]$ 是归一化的流匹配时间步。本文还引入了与 token 数相关的 flow-shift,按对数空间从 480p/81 帧的 shift 3 到 720p/193 帧的 shift 6 线性插值。
SANA-Video 2.0 用流匹配从头训练,时间步采样策略(TQD、token-aware shift、分层验证)是训练配方的关键部分。
注意力残差(Attention Residuals / AttnRes)
标准残差连接 $h_l = h_{l-1} + f_l(h_{l-1})$ 让信息必须穿越中间每一层。注意力残差则用可学习的逐深度聚合 $h_l = \sum_i \alpha_{i\to l} v_i$,把较浅层的已完成表示直接路由到较深层。本文用的 Block AttnRes 变体把每 $S=8$ 层划为一组,每完成一组就冻结一个块摘要 $b_k$,组内维护一个累加的部分和 $p_l$。第 $l$ 层的路由源集合 $\mathcal{V}_l = \{b_0, b_1, \ldots, p_l\}$,路由权重 $\alpha_{i\to l} = \mathrm{softmax}((w^{(\tau)} + \varphi_\tau(t))^\top \mathrm{RMSNorm}(v_i))$。
AttnRes 是本文两大架构创新之一,负责把稀疏 softmax 锚点刷新的表示传播到深层,论文用有效秩提升约 12% 来验证其作用。
softmax 锚点(Softmax Anchors)与混合注意力
近期大语言模型(Qwen3-Next、Kimi-Linear、Kimi K3)的做法:保留一个以线性注意力为主的堆栈,但按固定比例(如 3:1)周期性插入少量全 softmax 层,这些层用双向 SDPA + QK 归一化 + RoPE + sigmoid 输出门。锚点周期性地恢复线性注意力因状态秩受限而丢失的、秩更宽松的 token 交互。本文把这一思想迁移到双向视频扩散,并通过代理实验把比例重新确定为 25%。
这是论文的核心机制——线性多数保证 $O(N)$ 扩展,softmax 锚点补回表达力,理解它才能看懂效率与质量的权衡。
研究动机
开放视频生成器(Wan 2.1 14B、HunyuanVideo 13B、CogVideoX、Open-Sora 等)普遍采用带 3D softmax 注意力的扩散 Transformer,但其 $O(N^2)$ 复杂度对视频极其不利:经 VAE 压缩后,单个 1080p 片段就跨越数万个潜变量 token。作者的生产级性能剖析显示,在全 softmax 与 25% 混合骨干各自用最优 kernel 编译后,full-softmax 在 1080p/121 帧下比 25% 混合慢 2.01×;问题在长视频(>10s)时更严重,二次注意力矩阵和激活 workspace 主导了开销。而纯线性注意力虽是 $O(N)$、可优雅扩展,却因固定大小的状态矩阵 $S \in \mathbb{R}^{d \times d}$ 无法表达所有 token-token 交互,会削弱精确的时空对应和细节质量。这造成了效率与表达力的两难。
本文的目标是本文要回答一个核心问题:一个以线性注意力为主的骨干,能否在保留 $O(N)$ 长序列扩展能力、并能在单卡上高效生成高分辨率(高达 720p)长视频的同时,恢复 softmax 注意力的表达力与生成质量?为此作者构建了 SANA-Video 2.0,一个 5B 和 14B 尺度、统一架构的视频扩散 Transformer,目标是在 VBench 质量上匹配全 softmax 视频扩散大模型,并以更低延迟在单卡 H100 上生成 720p 视频,且效率优势随视频时长增长而扩大。
与已有工作不同的是,已有做法如 Attention Surgery 是对预训练的 softmax 视频大模型做事后线性化,而本文选择从头训练整个混合骨干,使其直接学会线性+softmax 的协作而非继承自全 softmax 先验。同时作者没有直接照搬大语言模型(Qwen3-Next、Kimi-Linear)的 3:1 比例,而是用针对视频体制的短时长、降分辨率代理实验从 0% 到 100% 扫描 softmax 比例,重新确定 25% 是视频的 Pareto 拐点。此外,作者把 LLM 中的 Block AttnRes 适配到双向视频扩散:共享路由 query 跨深度复用、去掉冗余的扩散时间步输入,并用有效秩与路由探针验证了其机制。
核心方法
SANA-Video 2.0 是一个视频扩散 Transformer,骨干由混合序列注意力与跨深度的块残差注意力组成。直觉上:让便宜的线性注意力做绝大部分 $O(N)$ 的全局 token 混合,只在固定深度周期性地插入少量全 softmax 层来补回线性状态丢失的、秩更宽松的精确交互;再用块注意力残差把这些含 softmax 更新的已完成块摘要路由到后面的线性层复用,避免重复推导。技术上,模型在 LTX-VAE 2.3 的潜变量上运行,文本特征由 Gemma-2-2B-IT 经每层 cross-attention 注入;每个深度先由 AttnRes 把表示路由进自/cross-attention 分支,再路由进 SwiGLU FFN,分支内用 AdaLN 调制,最后聚合到输出头。5B 用 32 层、宽度 2560;14B 用 40 层、宽度 4096(14.25B 参数),在 384×B200 规模训练。整体路径全程无卷积,便于用现成 fused kernel 编译。
两大核心创新。其一是混合线性-softmax 注意力:以门控双线性线性注意力为主力(占 75%),在每 4 层插入一个门控 softmax 锚点(占 25%,3:1 比例),线性多数保留 $O(N)$ 长序列扩展,锚点周期性恢复线性状态无法表达的精确交互。线性与 softmax 路径分别用不同 head 维度和独立的 RoPE 张量与门控参数。其二是块注意力残差(AttnRes):把每 8 层划为一组,每完成一组就冻结一个块摘要,第 $l$ 层通过 $\alpha_{i\to l}=\mathrm{softmax}((w^{(\tau)})^\top\mathrm{RMSNorm}(v_i))$ 从初始嵌入、已完成块摘要和当前组内部分和中聚合表示。与逐层路由的 LLM 设计不同,本文用一个共享 query 跨深度复用,并去掉显式时间步输入(验证为与 AdaLN 冗余),在几乎不增参数(<0.001%)的情况下让深层有效秩提升约 12%。与事后线性化的本质区别是:整个混合骨干是从头训练的。
方法步骤详情
方法分四步。1) 架构:32 层(5B)/40 层(14B)骨干,每 4 层第 4 层为 softmax 锚点(共 25%),每 8 层为一个 AttnRes 块;线性层用 $\beta$ 写入门与 sigmoid 输出门,softmax 锚点用 sigmoid 输出门;FFN 为无卷积 SwiGLU,替换原时卷积 FFN 以避免大尺度下 20–29% 开销。2) 数据整理:原始视频经镜头切分、黑边/字幕清理、低质/静止/曝光缺陷过滤,按质量与运动多轴分别打分,形成选择性递增的剪辑池;描述从混合短长进展到密集结构化。3) 训练目标:流匹配+logit-normal 时间步;持续/SFT 阶段做尾部地板化并启用 token-count-aware flow-shift(4290 token 时 shift 3,23000 token 时 shift 6);预训练启用 TQD(±1.1 logit),持续阶段关闭;全程维护权重 EMA,预训练/持续阶段加 Self-Flow 辅助损失。4) 后训练:DPO(Gemini 离线排序形成偏好对,共享 $t$ 与 $\epsilon$)与在线 ReFL(首中末帧用 HPSv3++/DeQA-Score/UniPercept 4:4:1 联合奖励)。验证用 10 个噪声分桶,方差降 2.27×。
技术新颖性
技术新颖性体现在四点。第一,把 LLM 中(Qwen3-Next、Kimi-Linear、Kimi K3 万亿参数)的混合线性注意力与 AttnRes 思想,首次系统迁移到双向视频扩散,并对其做了视频化适配。第二,不假设语言模型的 3:1 比例,而是用从 0% 到 100% 的从零训练代理实验,确认 25% softmax 是视频体制的质量-效率 Pareto 拐点(50% 损失最低但 1080p/121f 比 25% 慢 1.29×,25% 仅落后约 1%)。第三,对 AttnRes 的视频化改造:共享路由 query 跨深度复用(与逐层路由损失几乎相同 0.495 vs 0.496,但内存开销 4×)并证明显式时间步输入冗余(去掉后损失 0.920 vs 0.962)。第四,从头训练整个混合骨干而非事后线性化预训练 softmax 模型,并报告了完整可复现的多阶段流水线(数据整理、课程、自蒸馏、DPO/ReFL),后者本身作为一项贡献。
实验结果
核心结果分五块。质量(Table 2):5B 在 480×832×81 下 VBench Total 84.30、Quality 85.61(表中最优),仅次 Bernini-R 14B(84.64),匹配设置下比其便宜 31.8×(13.2s vs 421s),比 Cosmos-3 Nano/LTX-2.3 快 3–4×,比 Wan 2.2-A14B 快约 50×。比例扫描(Fig.4):全线性 0.955 与全 softmax 0.945 均弱于混合;50% 最低 0.897 但代价高,25% 为 0.905 仅落后约 1%,故选 25% 为 Pareto 拐点。效率(Fig.5):编译后全 softmax/25% 加速比从 480p 1.16× 升到 1080p/121f 2.01×,720p 到 60s 达 3.17×;模型 1.2B→28.9B 混合始终更快。AttnRes(Fig.6):开关探针下深层有效秩升 11.7%,22/24 层非降;最深块已完成块质量达注意力 56%/FFN 50%。部署(Table 4):Sol-Engine 三阶段 B200 端到端 3.58×,5B 720p/5s 仅 13.06s,比 Wan 2.2-A14B 快 120×;QAT MXFP4-W/MXFP8-A 持平 BF16(83.25 vs 83.22)。
查看结构化数据
| 任务 | 指标 | 本文 | 基线 | 提升 |
|---|---|---|---|---|
| VBench 视频生成质量 | VBench Total(81 帧) | 84.30(SANA-Video 2.0 5B,Hybrid) | 84.64(Bernini-R 14B)/ 84.23(Wan 2.2-A14B)/ 84.17(SANA-Video 2B) | 以 5B(小约 3×)匹配 14B 质量,单卡便宜 31.8× |
| VBench 质量 | VBench Quality | 85.61(表中最高) | 85.59(Wan 2.1 14B)/ 85.42(Wan 2.2)/ 85.18(Bernini-R) | Quality 维度表中最优 |
| DiT 前向效率(编译,720p/60s) | 相对全 softmax 加速比 | 3.17×(720p/24fps/60s,1441 帧) | 匹配的全 softmax 骨干(同样最优 kernel) | 3.17×,且随时长扩大 |
| 单卡端到端生成延迟 | 720p/5s 流水线延迟(H100) | 13.06s(5B Sol-Engine) | Wan 2.2-A14B | 120× 更快 |
| 全栈部署加速 | 端到端加速比(B200,720p/8s,50 步) | 3.58×(17.52s) | 同模型 BF16 基线(62.65s) | Sol-Engine 三阶段累计 3.58× |
| 低精度量化 | VBench Total(81 帧) | 83.25(QAT MXFP4-W/MXFP8-A) | 83.22(BF16 基线)/ 82.87(PTQ) | QAT 持平 BF16,存储省 67.9% |
局限与改进
作者承认的局限主要有两点。其一,架构选择依赖短时长、降分辨率的代理研究(256p/81 帧的 depth-28、width-3072 骨干,以及 5B 家族检查点的探针),而非全部在大规模生产设置下消融;最长的时长结果(60s 等)是 tensor-shape 前向延迟剖析,而非真正端到端生成的长视频。其二,AttnRes 在晚期持续训练对比中与去掉它几乎相当(MSE 0.4851 vs 0.4855,17/20 桶略优),作者明确不从这个窄边距读出质量优势,仅因跨深度复用而采用。从我的观察补充:低精度收益有限(GEMM 仅占 BF16 运行 16.2%,延迟只省 5.8%),量化只覆盖线性 GEMM 而注意力算子仍是 BF16;Physical AI 仅展示定性对比而无量化基准;VBench 指标本身偏静态帧质量,对长时序一致性的评估有限;软注意力锚点+AttnRes 的可解释性虽好,但最优比例是否随尺度/分辨率变化未在大规模验证。
独立分析的弱点
第一个弱点是长视频实际生成证据不足。最长的 60s 结果是编译前向延迟剖析,而训练课程上限仅 8s,作者也承认分钟级训练才能把剖析的长序列扩展变成真实长视频生成。改进方向是把课程扩展到分钟级并系统评估时间一致性指标。第二个弱点是架构选择依赖降分辨率代理实验,比例 25%、块大小 $S=8$ 在大规模生产模型上未必最优($S\in\{4,8,16\}$ 短实验损失相近 0.962–0.965)。改进方向是用大模型做大规模消融。第三个弱点是低精度收益受限——量化只覆盖线性 GEMM,注意力算子仍 BF16,整体延迟仅省 5.8%。改进方向是为线性注意力/softmax 锚点定制低精度 kernel,探索 NVFP4。第四个弱点是因果/流式能力缺失,机器人/自动驾驶需流式动作条件 rollout。改进方向是引入因果 Gated DeltaNet(作者指出双向算子是其自然初始化)。第五个弱点是 AttnRes 质量增益不显著,可用学习式内容自适应的锚点放置与路由替代固定 3:1。
未来方向
作者明确提出的方向有两条主线。一是分钟级长视频:因骨干是 $O(N)$ 主导,效率优势随时长扩大,把课程从当前 8s 扩展到分钟级,能把剖析到的长序列扩展变成真实长视频生成,并考验锚点在更长上下文维持全局一致性的能力。二是因果/动作条件生成:把当前双向算子换成因果 Gated DeltaNet(与 Kimi-Linear/Kimi K3 同族),搭配同样的混合+AttnRes 布局,把这套从头训练、kernel 友好的配方带入因果生成和闭环世界模型,以补足 Physical AI 所需的流式能力。作者还列出进一步方向:锚点专用稀疏 kernel、校准的低精度(NVFP4)格式、few-step 蒸馏以补充训练无关的部署缓存、以及学习式内容自适应锚点放置与 AttnRes 路由。基于成果可延伸的还有:把混合注意力比例与 AttnRes 块大小在不同尺度上联合搜索;用更大的奖励模型组合改进 ReFL 后训练;探索锚点稀疏化与扩散缓存(diffusion cache)的协同。
复现评估
复现性中等偏上但完整复现难度高。作者提供了较完整的方法与训练配方描述:架构与训练设置在附录 B(Table 6 列出 5B/14B 配置)、数据整理六阶段流水线在附录 C(Table 7)、时间步采样密度与 TQD 偏移在附录 B.3、分层验证协议在附录 B.4。所有代理实验固定骨干维度、patch、head 维度、数据、优化器、seed 与配方,只改变 softmax 放置,并报告了置信区间,消融设计较严谨。部署侧给出 Sol-Engine 三阶段的具体延迟数字和 QAT 设置。但完整复现需要巨大算力:14B 在 384×B200 规模训练,5B 生产配方涉及约 30M+10M+约 10^4 剪辑的多阶段数据;数据为内部数据整理,未公开,数据整理细节部分依赖私有打分信号。论文未明确说明是否开源代码/权重(摘要仅给 Project Page/GitHub 占位)。综上,架构与中等规模代理实验可复现,但端到端 5B/14B 生产复现受限于算力与数据可获得性。
论文图表
图分三部分展示概览。(a) 文生视频示例(含具身和物理遵循场景,成组帧展开一个片段)。(b) 单卡 H100 上 720p/5s 生成流水线延迟对比,含最终 Sol-Engine 5B(13.06s)和 40 层 14B 结果,并用 VBench 标注 5B 与 Wan 2.2 的质量点。可看到 5B 流水线比 Hunyuan(1556s)、Wan 2.1 A14B(1545s)等快两个数量级。(c) 5B DiT 前向时间随时长变化,相对全 softmax 的加速比从 1.55× 扩大到 3.2×。
这张图用一组数字直观回答了论文的核心主张:5B 在质量(VBench 84.30)上匹配大 softmax 模型的同时,端到端延迟低一到两个数量级,且 DiT 前向优势随时长扩大。它是理解论文价值的最佳入口。