← 返回 2026-07-17

视频 = 世界 + 事件流 Video = World + Event Stream

Lianghua Huang, Zhi-Fan Wu, Yupeng Shi, Wei Wang, Mengyang Feng, Cheng Yu, Chen Liang, Junjie He, Chen-Wei Xie, Yu Liu, Jingren Zhou, Ang Wang, Bang Zhang, Baole Ai, Chongyang Zhong, Jinwei Qi, Kai Zhu, Pandeng Li, Peng Zhang, Wenyuan Zhang, Xinhua Cheng, Yitong Huang, Yun Zheng, Yuxiang Bao, Yuzheng Wang, Zhiwei Lin, Zoubin Bi 📅 2026-07-16 👍 21 2026-07-22 18:54
VLA 世界模型 多模态 实时音视觉 流式交互 视频生成

Wan-Streamer v0.3 将视频分解为世界与事件流,实现通用预训练可迁移的实时音视频交互。

前置知识

原生流式生成 (Native-streaming generation)

一种端到端的视频/交互建模方式:用户与智能体的文本、音频、视频都活在同一条因果时间线上,由单个 Transformer 统一建模。感知、响应时机、说话、可见的倾听、同步视频被作为一个整体行为学习,而非由级联模块拼接。v0.1 提出该范式,以 160ms 为一个流式单元逐段生成。

本文所有讨论都建立在 v0.1/v0.2 已确立的这条原生流式框架之上。v0.3 只是对同一交错因果序列做重新命名与重新理解,不理解原生流式就无法理解'为什么 world-event 不是新架构'。

条件流匹配 (Conditional Flow Matching)

一种生成连续数据(如音频/视频潜变量)的方法:在给定干净上下文条件下,学习把噪声逐步去噪到目标潜变量的向量场(流),相比扩散可用更少步骤生成。本文用它生成连续的音频与视频潜变量,使语音、动作、外观、场景演化作为一个耦合响应被联合去噪。

论文明确说离散部分(语言、行为指令)用下一 token 预测,连续部分用条件流匹配。理解这条分工是理解模型如何把'文字指令'变成'同步音视频'的关键。

VLA (Vision-Language-Action)

一类多模态模型范式:把视觉/语言输入映射为动作输出,常用于机器人与具身智能。本文类比说明其多模态理解过程是 VLA-like——把用户的流式文本/音频/视频映射为语言形式的语音与行为动作,再条件化音视频生成。

理解 VLA 才能理解作者为什么强调'开放词表行为'与'语言形式动作'——行为不再是一个固定动作枚举,而是用自然语言描述、由模型自由生成的动作。

Ulysses 上下文并行 (Context-parallel performer)

一种用于长序列 Transformer 的上下文并行策略:将序列在注意力头/序列维度上切分到多卡并行计算(Ulysses 式),再聚合。v0.2 把昂贵的潜变量生成放进一个 Ulysses 式上下文并行 performer 中,以在保持低延迟的同时提升分辨率到 640×368。

v0.3 明确声明'服务拓扑沿用 v0.2 不变',即仍是 thinker + Ulysses 上下文并行 performer。理解它才能理解为什么 640×368、约200ms 延迟能同时成立。

自回归分解 (Autoregressive Factorization)

把序列联合分布分解为逐元素条件分布的乘积:$p(e_{1:K}\mid W,x_{1:K})=\prod_{k=1}^{K}p(e_k\mid W,x_{\leq k},e_{<k})$,每次只预测下一个单元并以历史为条件。

这是本文的核心数学表达(公式 3),v0.1 的因子分解是 W 被折叠进历史时的特例。理解它才能理解 world-event 分解是如何'优雅地包含'旧公式的。

研究动机

现有 Wan-Streamer v0.1/v0.2 都把'一个会说话、会反应的智能体'这种单一交互应用直接当作训练目标——也就是说,模型学习的就是给定用户流式输入,预测智能体的文本/音频/视频响应。这种把特定下游任务嵌入训练目标的做法存在两个问题:其一,监督信号局限于对话式音视频交互这一个领域,预训练数据与目标域高度耦合,难以迁移到其他实时任务(如世界模型控制、第一人称导航、具身操作);其二,每出现一个新应用就需要重新设计训练目标和数据组织方式,缺乏统一的预训练范式。从工程角度,v0.1(192×336)到 v0.2(640×368)都围绕同一个对话智能体反复打磨,但底层'模型到底在学什么能力'始终没有被显式定义。

本文的目标是本文的目标是回答一个根本性问题:在原生流式生成框架下,模型真正掌握的'底层能力'到底是什么?作者希望把这种隐含能力显式化为一个通用、可扩展的预训练任务,使其能从大规模普通视频中学到'世界如何演化'的一般性知识,再通过特化(specialization)迁移到一整族实时下游任务。具体到本文的实例化,目标是保留 v0.2 的建模契约(640×368、25 FPS、约 200ms 模型侧延迟、约 550ms 端到端延迟)的同时,扩大智能体可表达的'事件流'范围——从单纯的语音+隐式倾听,扩展为语音+开放词表(open-vocabulary)的自由形态行为,使智能体能用自然语言指令驱动开放的动作集合。

与已有工作不同的是,本文的独特切入点是'世界-事件分解'(world + event stream)。作者观察到,任何自然视频都可以被读成'一个持久的世界 W 加上一条随时间展开的事件流 e_k':世界刻画持久上下文(环境、布局、角色身份与外观、环境声场、嗓音特征等相对稳定的条件),事件流则刻画所有随时间变化的东西(角色行为、相机运动、环境变化、语音、声音)。关键在于把'持久条件'与'时变变化'在因果序列中显式命名而非混在一起——W 在推理时只提供一次,事件流则在线生成。这一视角让普通视频直接成为预训练素材,把'对话式智能体'从训练目标降级为众多下游特化之一,是从'以任务为目标'到'以能力为目标'的范式跃迁。

核心方法

整体思路可以分两步理解。直觉上,作者把视频看成'舞台(world)+ 演出(event stream)',舞台一旦搭好就相对稳定,演出则在舞台上随时间展开。技术路线上,这套分解并不引入新架构,而是对 v0.1 既有的交错因果序列做一次'重新命名':把序列里起持久条件作用的部分命名为世界 $W=\{w_j\}_{j\in S(W)}$(schema $S(W)$ 由片段或任务决定,而非全局固定),把时序局部的变化记为事件 $e_k=\langle \tau_k, c_k, d_k\rangle$($\tau_k$ 为活跃区间,$d_k$ 为自由形式描述,$c_k\in C(W)\cup\{\emptyset\}$ 关联到 W 中的某个角色或显式标记为与角色无关)。预训练目标就是在大规模真实视频上学习'给定世界和驱动输入,预测下一个事件单元',而连续音频/视频潜变量用条件流匹配生成,离散的语言与行为指令用下一 token 预测优化。

核心创新点是'把持久世界上下文从因果历史中显式分离出来作为一等条件对象'。与已有方法的本质区别在于:v0.1/v0.2 把世界 W 折叠进历史 $x_{\leq k}$ 里,模型只是隐式地用它;v0.3 把 W 命名为独立变量,得到分解式 $p_\theta(e_{1:K}\mid W,x_{1:K})=\prod_{k=1}^{K}p_\theta(e_k\mid W,x_{\leq k},e_{<k})$。这一改动看似只是记号上的调整,但带来三重后果:第一,预训练目标从'模仿对话'泛化为'预测世界如何流式演化',几乎所有自然视频都可纳入;第二,推理时 W 只预填一次,事件流在线生成,与 v0.2 的 prefill+stream 拓扑天然兼容;第三,下游迁移只需更换 W 的内容和驱动流 x,而保持同一套流式响应逻辑,从而支持世界模型控制、第一人称交互、具身操作等多种接口。

方法步骤详情

完整步骤如下。(1)预训练数据构造:对每个视频片段,按图 1 格式汇总持久世界记录 W(视觉上下文如环境/布局、声学上下文如环境声与嗓音、若干角色记录如身份/外观/人格/可见性),并把时间对齐的事件 $e_k=\langle\tau_k,c_k,d_k\rangle$ 标注到各自活跃区间,括号表示行为、引号表示台词。(2)建模:世界 W 被分词后在 prefill 阶段一次性注入;语言/音频/视频的输入与输出共享同一条因果时间线,由 block-causal attention 协调(见图 2)。每个 160ms 流式单元内,模型先把多模态用户输入编码,再预测智能体的语言形式动作(语音 + 括号化行为指令),如 "(takes a sip of water)"、"Thanks for the reminder."。(3)解码:预测的 token 条件化联合音频-视频潜变量生成,语音、动作、外观在解码前已同步对齐并写回历史。v0.3 相对 v0.2 唯一的关键改动是事件流从'语音+隐式倾听'扩展为'语音+开放词表自由行为',两者共享同一条 token 流,时序与交错由模型联合学习。

技术新颖性

技术新颖性体现在四个层面。第一,范式层面:首次把原生流式生成重新表述为 world + event stream 分解,让'对话智能体'从训练目标降级为预训练后的一种特化。第二,预训练层面:提出一个通用目标——'给定世界和输入,预测世界如何流式前移',由于几乎所有自然视频都是 world+event 的实例,监督信号在规模和多样性上都可扩展。第三,行为接口层面:采用 role-play 聊天格式,把括号化行为指令(如 "(frowning slightly) What did you say?")与口语文本塞进同一条 token 流,使智能体不再受限于 w/a/s/d 这类小固定动作集,而是能执行开放词表、立足世界语境的动作。第四,工程契约层面:在不引入新延迟关键路径的前提下,保留了 v0.2 的服务拓扑(thinker + Ulysses 上下文并行 performer)和全部延迟指标,证明概念升级可以做到'零代价兼容'。

通用预训练数据的两个示例:时间对齐的事件与持久世界上下文摘要配对
Figure 1: 通用预训练数据的两个示例:时间对齐的事件与持久世界上下文摘要配对
世界上下文在流式开始前被分词并预填一次;语言/音频/视频输入输出共享同一条因果时间线
Figure 2: 世界上下文在流式开始前被分词并预填一次;语言/音频/视频输入输出共享同一条因果时间线

实验结果

论文的实验部分相对单薄,但有几个可量化的核心发现。延迟与运行协议方面,v0.3 在与 v0.1/v0.2 相同的响应边界下评测:模型侧信号到信号延迟(从 160ms 用户流式单元到达 thinker 起,到对应音视频响应单元解码完成可发送止)保持在约 200ms;在 350ms 双向网络预算下,端到端交互延迟保持约 550ms,与 v0.2 完全一致。这意味着从 v0.2 到 v0.3 的概念升级没有付出任何延迟代价。生成质量方面,v0.3 仍产出 640×368、25FPS 的视频。行为表达方面,定性观察显示模型能在对话中实时执行开放词表行为:括号化行为指令被实现为连贯的面部表情、姿态变化、对声音的反应、与近邻物体的交互(如 "(takes a sip of water)"、"(sets down the glass and flashes a peace sign)"),且行为与语音保持同步、立足场景、与角色身份外观一致;在显式行为事件之间,智能体维持稳定的待机与倾听行为。表 1 给出了三版完整对比。

Wan-Streamer 各版本对比摘要(强调单元格表示 v0.3 的改动)
Table 1: Wan-Streamer 各版本对比摘要(强调单元格表示 v0.3 的改动)
查看结构化数据
任务指标本文基线提升
实时音视频交互(模型侧延迟) model-side signal-to-signal latency 约 200 ms (v0.3) 约 200 ms (v0.2) 持平——概念升级零延迟代价
实时音视频交互(端到端延迟) total interaction latency (350ms 双向网络预算) 约 550 ms (v0.3) 约 550 ms (v0.2) 持平,保留 v0.2 建模契约
流式视频生成分辨率 分辨率 × 帧率 640×368 @ 25 FPS (v0.3) 192×336 @ 25 FPS (v0.1) 相对 v0.1 分辨率大幅提升(沿用 v0.2)
智能体行为表达范围 行为词汇量(定性) 语音 + 开放词表自由行为 (v0.3) 语音 + 隐式倾听/待机动作 (v0.2) 从固定隐式动作扩展为开放词表自然语言行为

局限与改进

局限性相当明显。第一,作者本人承认:本文只研究了'实时全双工音视频交互'这一种特化,对世界模型控制、第一人称交互、具身操作等声称可支持的其他下游接口,'系统的适配与评估留待未来工作'——也就是说,通用预训练任务的迁移性目前只有理论论述,没有跨任务的定量证据。第二,实验部分几乎没有定量指标:行为质量只给出'定性观察',没有自动化的行为合理性评分、人类评估、对比基线的行为多样性指标,也没有与 v0.2 行为质量的并排盲评。第三,从我的观察看,world-event 的分解高度依赖事件标注质量(图 1 的事件标签是人工/半自动生成的自然语言),论文没有披露标注管线、成本和规模,预训练数据的真实可扩展性存疑。第四,'通用预训练'的可证伪性弱——没有展示去掉 world 显式分离时性能下降的消融实验。

独立分析的弱点

独立分析有三个弱点。弱点一:评测体系单薄。所有行为质量结论都是定性描述,缺少可控对比实验。改进方向:引入行为合理性评分(如动作-场景匹配度)、行为多样性指标、以及与 v0.2 的并排盲评,最好加上人类偏好数据。弱点二:通用性声称缺乏证据。论文把'世界模型控制/具身操作'列为可支持接口却不做实验。改进方向:至少在一个非交互任务(如给定动作序列的视频预测、第一人称导航)上做特化迁移实验,证明同一套预训练权重确实能迁移。弱点三:world 与 event 的边界模糊、标注成本不明。场景是'持久'还是'时变'在某些视频里并非泾渭分明(如缓慢光照变化、角色渐变)。改进方向:给出 world schema $S(W)$ 的自动推断方法、标注管线与成本,以及边界判定的鲁棒性分析;并做消融,证明显式分离 W 比把它折叠进历史确实更好。

未来方向

作者明确提出的未来工作是'对 world-event 框架在其他下游接口(世界模型控制、实时第一人称交互、具身操作)上的系统适配与评估'——这是论文最大的开放问题。基于本文成果可延伸的方向还有:第一,把 world 的 schema $S(W)$ 从手工定义走向自动学习/抽取,让预训练数据的构造可规模化;第二,扩展事件类型,目前事件主要是行为与语音,可纳入更细粒度的物理声、相机运动、环境状态变化,甚至多智能体协作事件;第三,研究行为指令的'可控性'——括号化自然语言行为的语义粒度如何控制、是否支持细到帧级别的动作编辑;第四,把这套框架与现有世界模型(如 Sora 类、GameNGen 类)做横向对比,论证 world-event 视角相对纯 next-frame 预测的优势;第五,安全性:开放词表行为指令可能被诱导生成有害动作,需要护栏机制。

复现评估

复现难度较高。开源情况:论文只给出项目主页 wan-streamer.com,未公开模型权重、训练代码或数据集,可复现性接近零。数据方面:预训练依赖大规模'世界+时间对齐事件'标注视频(图 1 形式),但论文完全没披露标注管线、标注规模、事件词汇表、world schema 的字段约定,外部研究者既无法重建数据也无法验证数据质量。算力方面:v0.2/v0.3 的服务拓扑是 thinker + Ulysses 式上下文并行 performer,生成 640×368@25FPS、约200ms 延迟的实时流式模型,训练和推理都显然需要多卡甚至多机的高端 GPU 集群,普通学术团队难以负担。难度方面:即使有权重,block-causal attention、条件流匹配潜变量生成、流式 prefill 等工程实现细节都没有公开,复现整套系统需要深厚的系统级工程能力。整体评估:这是一篇概念/范式论文,复现门槛极高。