DreamX-Creator 1.0:普惠的 2K 分辨率原生音视频联合生成 DreamX-Creator: Democratizing Native Audio-Video Generation at 2K Resolution
7B 开源原生音视频联合生成模型:门控跨模态注意力+多模态 RL+一步 2K 精修
前置知识
原生音视频联合生成
指在同一个生成模型的一次去噪过程中同时产出时间同步的视频与音频,而不是先静默生成视频、再用独立的 V2A 模型事后配音。两个模态各自保留专用表示(token 率、位置编码、骨干网络),但在生成过程中双向交换信息,因此『可见事件』与『对应声音』是联合决定的,而非生成后对齐。
本文的核心定位就是 native joint 生成,理解它与级联/单向方案的本质区别,才能读懂架构设计(为何只在前半段独立、后半段融合)和 RL 奖励分解的动机。
流匹配(Flow Matching)
一类生成模型训练方法:把干净数据潜变量 $z_0$ 与高斯噪声 $\epsilon$ 线性插值得到 $z_\sigma=(1-\sigma)z_0+\sigma\epsilon$,训练网络预测速度场 $u^*=\epsilon-z_0$。相比 DDPM 采样轨迹更直、噪声调度更灵活,本文用 1000 步离散调度加 shift 5.0。
本文生成器和 2K 精修教师的训练目标都是流匹配;A2V/V2A/Joint 三种模式正是靠两个模态噪声水平 $\sigma_v, \sigma_a$ 的大小排序来定义的。
扩散 Transformer(DiT)与潜空间生成
把视频/音频先经 VAE 编码到低维潜空间,再用 Transformer 骨干在潜空间做扩散或流匹配去噪。视频按帧率、音频按 mel 帧率分词,两者 token 率不同,需要各自的位置编码方案。
DreamX-Creator 的视频流和音频流就是两个模态专用 DiT;跨模态注意力如何对齐不同 token 率(共享时间坐标系 + temporal RoPE)是本文架构的关键细节。
门控注意力(Gated Attention)
在注意力输出上乘一个可学习的门标量再做残差融合,让网络自己决定每条路径、每个头、每个 token 的信息交换强度。本文的门是 token×头粒度的 sigmoid 门,同时依赖目标隐藏状态和跨模态注意力输出本身,能按样本、层、头自适应调节融合强度。
Gated Cross-Modal Attention 是本文最核心的架构创新,读懂公式 (5) 需要先理解输出门控在注意力计算中的放置位置和调制方式。
GRPO 组相对策略优化
强化学习后训练方法:同一条件下采样一组(group)候选输出,用组内奖励归一化得到相对优势来更新策略,无需训练单独的价值网络。DanceGRPO、Flow-GRPO 等已把它推广到扩散与流匹配模型。
本文 AV RL 沿用这一范式:每个首帧-提示对生成 G 个音视频候选,组内归一化得到视频、音频、跨模态三路优势并分别路由。
DMD 分布匹配蒸馏
Distribution Matching Distillation:利用『真实分数减伪造分数』之差构造梯度,把多步教师定义的输出分布匹配到单步学生,而不是让学生模仿中间去噪状态;DMD2 加入 fake critic 等改进提升稳定性,可将多步扩散模型压缩到 1-4 步采样。
2K 精修器最终部署的是 DMD 蒸馏出的自回归单步学生,每个时间块只需一次去噪评估,这是 2K 输出能实用化、可本地部署的关键。
RoPE 旋转位置编码
通过把 query/key 向量按位置旋转,使注意力分数自然包含相对位置信息,常用于 Transformer 序列建模,可只施加在特定维度(如时间维)。
视频与音频潜序列 token 率不同,本文把两者位置映射到共享时间坐标系,并在跨模态 Q/K 上施加 temporal RoPE,实现时间感知的跨模态注意力而无需重采样任一序列。
研究动机
视频生成模型近年画面保真度、运动质量和时长进步飞快,但音频往往被直接省略,或放在独立的级联阶段事后合成。单向管线(Video-to-Audio 的拟音生成、音频驱动的说话人动画等)把一个模态当固定条件、另一个当输出,无法建模两个模态互相决定的场景:说话时的口型与语音、可见撞击与其声音、环境声/音乐与镜头运动的场景级关系。数据层面,原始音视频噪声很大:镜头切换和无关背景音会引入虚假跨模态关联,需要可靠的片段切分、模态特定质量过滤、同步性评估和联合标注。训练目标层面,流匹配/似然目标并不直接优化感知质量、提示遵从、跨模态语义一致性和细粒度音画同步。算力与可得性层面,许多同期系统参数量巨大(MAGI-2 总量 114B、MiniMax H3 33B、MOVA 32B/激活 18B、LTX-2.3 22B),且仅提供托管访问或只放基础版权重,开源社区缺少一个参数量可控、权重可下载、原生联合生成并支持 2K 级输出的完整系统。
本文的目标是本文目标是构建并开源一个紧凑的原生音视频联合生成系统 DreamX-Creator 1.0:以 7B 生成器为核心,给定首帧图像和文本提示,在同一个去噪过程中联合生成时间同步的视频与音频(含语音、音效、环境声),并配套一个自回归单步 2K 精修器,把低分辨率输出提升到 2K 分辨率而不破坏已生成内容、运动和音画同步时序。为此需要依次解决四件事:建立可信的音视频数据系统(切分、过滤、联合标注、能力分组);设计强度可控的双向跨模态交互机制;用多模态强化学习直接优化感知质量、提示遵从与同步;用低推理成本实现 2K 高分辨率输出。最终交付物是一个开放权重的完整系统,成为其对比表中唯一同时满足『权重可下载、原生联合 A/V 生成、官方支持 ≥2K 本地输出路径』三个条件的最小模型。
与已有工作不同的是,本文的独特切入是把『紧凑+开源+原生联合+高分辨率』作为一个系统问题整体解决,而非单点算法创新。具体独特之处有四点。第一,跨模态交互只放在网络后半段:前半段两个模态流完全独立处理,避免早期融合淹没模态专用表征;交互强度由 token 和注意力头双粒度的 sigmoid 输出门控制,且门值同时依赖目标隐藏态与跨模态注意力输出本身,比常见的 query-only 门控更细。第二,A2V、V2A、Joint 不是三个独立推理任务,而是训练期的内部条件配置:用两个模态噪声水平 $\sigma_v, \sigma_a$ 的大小排序决定方向掩码,并用 stop-gradient 阻断目标流损失向条件流骨干的回传,把三种模式统一进一个流匹配框架。第三,RL 阶段拒绝把所有标准压成一个全局奖励,而是把视频、音频、跨模态三路优势分解并路由到对应流,同步优势由两流共享,防止一个模态的改进掩盖另一个的退化。第四,2K 精修采用『双向多步教师→自回归多步→一步学生』的三段式适配与蒸馏链,并在蒸馏时用 self-rollout 对齐训练与推理分布,专门应对自回归误差累积。
核心方法
直觉上,模型让视频和音频各自拥有『专业大脑』,只在网络深处按需、按强度交换信息。技术上以首帧和文本提示为条件:视频、音频分别经各自 VAE 进入潜空间,由模态专用 DiT 联合去噪,保留各自的 token 率与位置编码,文本条件来自共享文本编码器。$N$ 个块中前 $N/2$ 块两流完全独立(self-attention、text cross-attention、FFN,无跨模态残差),后 $N/2$ 块加入成对的 A2V(视频 query 读音频 key/value)与 V2A 路径,即 Gated Cross-Modal Attention;两路径读取相同 pre-fusion 状态、并行计算残差。因 token 率不同,位置先映射到共享时间坐标系,跨模态 Q/K 施加 temporal RoPE。训练用流匹配:$z_\sigma^m=(1-\sigma)z_0^m+\sigma\epsilon$,目标速度 $u^*=\epsilon-z_0$,损失按 token 数与特征维归一化,$\mathcal{L}_{AV}=\lambda_v\mathcal{L}_v+\lambda_a\mathcal{L}_a$,两流独立采样噪声,基步取自 1000 步调度(shift 5.0)。整体分两个音视频预训练阶段加高质量微调,再接 AV RL 与自回归一步 2K 精修。
核心是 Gated Cross-Modal Attention 与『方向掩码+stop-gradient』的组合。门控:对目标 token $x_i$ 与跨模态注意力输出 $C_{i,h}$,$g_{i,h}=\mathrm{sigmoid}\big([W_x\mathrm{LN}(x_i)]_h+w_c^\top\mathrm{LN}(C_{i,h})+b_h\big)$,随后 $\Delta x_i=W_o(\mathrm{Concat}_h[g_{i,h}\odot C_{i,h}])$,$x_i'=x_i+\Delta x_i$。门位于 attention 之后、输出投影之前,逐头逐 token 调制——既看『谁在问』(目标隐藏态)又看『读到什么』(注意力输出),因此是输出调制机制而非路由或路径选择。方向:$\Delta h^v=m_{a\to v}\mathrm{Attn}(Q(h^v),K(h^a),V(h^a))$,V2A 反之;A2V 要求 $\sigma_v>\sigma_a$(视频更噪、音频作干净条件),V2A 相反,Joint 时 $\sigma_v=\sigma_a$ 双开。stop-gradient 加在条件流 key/value 投影之前:目标流损失不回传到条件流骨干,但注意力参数可训练,条件流由自身流匹配损失优化。与已有工作的本质区别:交互强度按层、头、token、样本自适应,双向依赖的方向由噪声排序显式定义,而非固定对称融合。
方法步骤详情
流程四段。数据系统:整合 Koala-36M、VGGSound、AudioSet、SpeakerVid-5M、Action-100M、Talker-T2AV 等公开数据与内部数据;PySceneDetect 场景切分、RMS 去静音、两端各去 3 帧;Q-Align(视觉)、UniMatch 光流(运动)、Audiobox Aesthetics(音频)过滤,Synchformer 做通用同步过滤、可见语音加 SyncNet 唇同步过滤;Qwen3-Omni-30B-A3B 联合视听理解、Qwen3-ASR-1.7B 转写、Qwen3.6-27B 融合为最终提示;按主导跨模态依赖分入四个能力池(语音 45.0%、事件声 33.4% 等)。渐进联合训练:Stage 1 冻结骨干前半部、后半部挂 rank-256 LoRA(lr $1\times10^{-4}$,跨模态模块 $2\times10^{-5}$);Stage 2 合并 LoRA 全参数训练(骨干 $1\times10^{-5}$);Stage 3 按同步指标、双模态美学、分辨率、时长筛选,用 OmniShotCut 剔除含转场片段,$\lambda_v=0.5,\lambda_a=0.1$;全程 AdamW、bf16、梯度裁剪 1.0。AV RL:1000 个首帧-提示对,每条件采 G 个候选,奖励分视频/音频/跨模态三路并组内归一化,优势按 $\tilde{A}_v=A_v+A_{av}$、$\tilde{A}_a=A_a+A_{av}$ 路由;用深层 V2A 响应给视频 token 加权($\alpha$ 从 0 渐升),A2V 路径做深度相关梯度缩放,目标含对基模型的正则项。2K 精修:先训双向多步教师(退化课程含时序相关退化),经 teacher forcing 变成自回归多步精修器,再按 DMD2 蒸馏为单步学生——在学生自身 rollout 上训练防曝光偏差,损失为分布匹配项加 DISTS 与 $\ell_2$(权重均 1);推理逐时间块一次去噪,音频不变。
技术新颖性
系统层面,它是对比表中首个同时满足权重可下载、原生联合 A/V、官方 ≥2K 本地输出路径三属性的最小模型(7B vs LTX-2.3 22B、MiniMax H3 33B)。技术上四个新颖点。其一,门控粒度:输出门为 token×头双粒度,且同时以目标隐藏态与注意力输出为条件,区别于此前只依赖 query 的门控,使融合强度按每样本每位置每头独立调节。其二,A2V/V2A/Joint 统一为一个训练框架:不训三个模型,而是用模态间噪声水平排序定义方向、用方向掩码和 stop-gradient 控制梯度流向,三种配置全阶段混用且不定义独立推理任务。其三,首帧条件下的音视频 RL:分解式三路优势路由,配合逐 token 同步区域加权与深度相关梯度缩放,回应『带双向交互模块的双流生成器如何稳定后训练』这一开放问题。其四,三段式精修蒸馏:在完整 LR 片段提前可得的离线设定下,双向教师经 teacher forcing 变自回归多步、再 DMD 单步蒸馏,并用 self-rollout 对齐训练与推理分布,缓解误差累积导致的闪烁与漂移。
实验结果
评估在 Verse-Bench(Set 1/2 通用音视频事件、Set 3 可见说话人)上进行。与研究基线对比(Table 3):Ours(Refiner) 的 VQ 最高达 0.6930(NAVA 0.6116、UniAVGen 0.6644、Ovi 0.6542);Ours(RL) 的 CU 6.0929 与 LSE-C 7.8361 表内最佳、DeSync 0.1351 显著最低(NAVA 0.2342、Ovi 0.4730);WER 0.1112 优于 NAVA 0.1574 与 UniAVGen 0.1661、略逊 Ovi 0.1053;CE 4.7463 与 IB 0.2677 分别低于 DaVinci 的 4.9361 与 NAVA 的 0.2853。与更大开源系统对比(Table 4):本文在 VQ(0.6930 vs 0.6429/0.6285)与 DeSync(0.1351 vs 0.2708/0.2412)领先、WER 与 LTX-2.3 持平(0.1112 vs 0.1113),但 CE、CU、PQ(6.4094 vs 7.0140)、IB、LSE-C(7.8361 vs 8.7354)落后,作者坦承是权衡而非全面超越。精修对比(Table 5):Ours 的 MUSIQ 0.7073 与 MANIQA 0.4382 最高(FlashVSR 0.7000/0.4180,LTX-2.5 Refiner 0.6200/0.3377),美学 0.4911 次高,且精修方法中 LSE-C 7.6979、IB 0.2675 最佳、DeSync 0.1731 最低。人类盲测(Figure 8):对四个研究基线全维度净胜,视频质量胜率 61.7%-73.7%;对 Wan2.7/Kling v3 视频质量仍净胜(45.5%/41.3%、48.8%/40.7%),但对三者的 AV-Align 与音频质量输多赢少。
查看结构化数据
| 任务 | 指标 | 本文 | 基线 | 提升 |
|---|---|---|---|---|
| 音视频联合生成(Verse-Bench Set 1-3) | DeSync 时间同步分数 ↓ | 0.1351(Ours RL) | NAVA 0.2342;UniAVGen 0.5371;Ovi 0.4730;LTX-2.3 0.2412;MiniMax-H3 0.2708 | 较最佳研究基线 NAVA 降低 42.3%,较 33B 的 MiniMax-H3 降低 50%,为全部对比模型中最低 |
| 音视频联合生成 | 视频质量 VQ ↑ | 0.6930(Ours Refiner) | Ovi 0.6542;UniAVGen 0.6644;NAVA 0.6116;LTX-2.3 0.6285;MiniMax-H3 0.6429 | 两组对比中均为最高,较 MiniMax-H3 提升 7.8%,较 Ovi 提升 5.9% |
| 语音生成(Verse-Bench Set 3) | LSE-C 唇同步 ↑ | 7.8361(Ours RL) | Ovi 7.3095;NAVA 7.7261;UniAVGen 4.9556;MiniMax-H3 8.7354 | 研究基线中最佳(较 Ovi 提升 7.2%),但仍落后 MiniMax-H3 约 0.9 |
| 语音生成(Verse-Bench Set 3) | WER 词错误率 ↓ | 0.1112 | Ovi 0.1053;LTX-2.3 0.1113;NAVA 0.1574;UniAVGen 0.1661;MiniMax-H3 0.1619 | 与 22B 的 LTX-2.3 基本持平,明显优于 NAVA/UniAVGen/MiniMax-H3,略逊 Ovi |
| 2K 视频精修 | MUSIQ ↑ / MANIQA ↑ | 0.7073 / 0.4382 | FlashVSR 0.7000 / 0.4180;SeedVR 0.6710 / 0.3586;LTX-2.5 Refiner 0.6200 / 0.3377;基线生成器 0.5895 / 0.3006 | 两项均为精修方法最优;MANIQA 较 FlashVSR 提升 4.8%,较未精修基线提升 45.8% |
| 2K 视频精修(语义与同步保持) | LSE-C ↑ / IB ↑ / DeSync ↓ | 7.6979 / 0.2675 / 0.1731 | FlashVSR 7.6772 / 0.2627 / 0.1604;SeedVR 7.3456 / 0.2640 / 0.1851;LTX-2.5 Refiner 7.6489 / 0.2670 / 0.2166 | 精修方法中 LSE-C 与 IB 均最佳、DeSync 最低,是唯一在提升清晰度的同时几乎不损失语义一致性的方法 |
| 人类偏好盲测(视频质量维度) | Win/Tie/Lose 胜率 | vs UniAVGen 73.7%/5.1%/21.2%;vs DaVinci 68.2%/12.9%/18.9%;vs Ovi 64.2%/9.4%/26.5%;vs NAVA 61.7%/11.4%/26.9% | 对 Wan2.7 45.5%/13.1%/41.3%;对 Kling v3 48.8%/10.6%/40.7%;对 MiniMax-H3 39.5%/18.7%/41.8% | 对四个研究基线全部维度净胜;对工业级系统视频质量仍小幅净胜,但音频质量与 AV-Align 落后 |
局限与改进
作者承认:相对 LTX-2.3(22B)与 MiniMax-H3(33B),7B 模型在音频美学(CE 4.7463 vs 5.2776、PQ 6.4094 vs 7.0140)与跨模态语义(IB 0.2677 vs 0.3119)差距明显,唇同步不及 MiniMax-H3(7.8361 vs 8.7354);VQ 与 DeSync 的领先是权衡而非全面优势;用户研究样本对高动态复杂场景覆盖不足。我的观察:其一,RL 有副作用——PC 从 2.1739 恶化到 2.4072、WER 从 0.1112 升到 0.1232,分解奖励并未完全消除维度冲突;其二,精修损害同步——DeSync 从 0.1351 回升到 0.1731、LSE-C 从 7.8361 降到 7.6979,而同步恰是本文卖点;其三,全文无消融实验,门控、stop-gradient、方向掩码、token 加权各自的贡献无从判断;其四,结论称 RL 与精修『作为设计陈述而非已完成的实证主张』,与评估表中 Ours(RL)/Ours(Refiner) 行存在表述张力;其五,训练预算仅说 comparatively modest GPU-day budget,推理分辨率/时长/显存未报告,democratize 的算力门槛难以量化;其六,RL 训练仅 1000 个首帧-提示对,泛化性存疑。
独立分析的弱点
第一,奖励冲突残留:RL 后 PC 恶化 0.2333、WER 上升 0.012,音频复杂度与语音正确性被同步/质量奖励挤压,可对语音子集引入 WER 专项奖励或做各维奖励权重调度与 Pareto 筛选。第二,精修与同步脱节:精修只改视频流,但高频纹理变化会改变 Synchformer/LSE-C 判定(DeSync +0.0380),系统已有 A2V 模块,可在精修训练中加入同步保持损失或以音频为条件。第三,音频能力受 7B 容量与配比限制:CE/PQ 落后 33B 模型约 0.5-0.6,且音乐类数据仅占 5.5%,可在不扩主干前提下加大音频专家容量或强化音频美学奖励。第四,缺乏消融:为何只在后半段融合、门控双输入是否必要、stop-gradient 作用多大均无数据支撑,应补齐逐组件消融与融合位置扫描。第五,RL 数据仅 1000 对且未公开,优势路由与 token 加权可能只在该小分布上成立,应扩展到十万级 prompt 并报告分布外评估。第六,Verse-Bench 统一提示由 Qwen3.6-27B 合成、与训练标注管线同源,存在自评偏置风险,需要第三方提示集与对抗性提示验证。
未来方向
作者明确提出的方向:加强音频后训练与跨模态对齐以缩小与大模型在 CE/CU/PQ/IB 和唇同步上的差距;在带双向交互模块的联合生成器上实现更稳定的模态感知后训练;评估上用受控同片段时移对照与 held-out 人类评估区分真实同步改进与奖励模型作弊。基于其成果可自然延伸的研究:利用首帧条件接口做交互式编辑与长视频续写(任意首帧+文本生成带音轨的长视频);把 AV RL 扩展到音乐-镜头运动、环境声叙事等更丰富的跨模态维度,并研究多奖励冲突的权衡理论;把『双向教师→自回归多步→单步学生』的三段式蒸馏迁移到 4K 精修(对标 LTX-2.3 的本地 4K 能力)或音视频联合超分;把能力池组织方式发展为按训练目标动态采样的自动化课程学习;在消费级 GPU 上实测 7B+单步精修的吞吐与显存,用数据支撑 democratization 主张;以及扩展多语言语音的口型同步能力。
复现评估
开源情况:论文明确公开发布 7B 生成器与 2K Refiner 权重、推理栈和评估工具(结论称 with explicit provenance),Table 1 标注 Open;这是相对 Seedance 2.5、Kling 3.0(不发布权重)、MiniMax H3(仅放 Base 版)的最大优势。数据:所列公开数据集(Koala-36M、VGGSound、AudioSet、SpeakerVid-5M、Action-100M、Talker-T2AV 等)可获得,但内部数据、RL 的 1000 首帧-提示对、高质量微调子集未说明是否开放;标注管线依赖 Qwen3-Omni-30B-A3B-Instruct、Qwen3-ASR-1.7B、Qwen3.6-27B 等公开模型,可部分复现。算力:论文只说 comparatively modest GPU-day budget,未给 GPU 型号/数量/天数,完整两阶段预训练+全参数微调+RL+三段蒸馏对学术实验室偏重,但 7B 推理加单步精修对单卡友好。难度评估:跑推理容易;用 Verse-Bench 与公开指标复现评估可行;从头复现训练属中等偏高难度,卡点在内部数据与 RL 提示集未公开、成本未披露、OmniShotCut 等组件可得性。
论文图表
首页概念图:左侧对比 2K 与 720P 两种输出分辨率,示意系统由三大组件构成——原生联合生成器(在一次生成中耦合视觉运动、语音、音效与环境声)、多模态后训练(音视频强化学习)、以及面向 2K 的视频精修阶段。
一图总览整个系统的定位与卖点:7B 紧凑模型即可原生联合生成并输出 2K,是理解论文『democratize』主张的最快入口。