视频 = 世界 + 事件流 Video = World + Event Stream
Wan-Streamer v0.3 将视频分解为世界与事件流,实现通用预训练可迁移的实时音视频交互。
前置知识
原生流式生成 (Native-streaming generation)
一种端到端的视频/交互建模方式:用户与智能体的文本、音频、视频都活在同一条因果时间线上,由单个 Transformer 统一建模。感知、响应时机、说话、可见的倾听、同步视频被作为一个整体行为学习,而非由级联模块拼接。v0.1 提出该范式,以 160ms 为一个流式单元逐段生成。
本文所有讨论都建立在 v0.1/v0.2 已确立的这条原生流式框架之上。v0.3 只是对同一交错因果序列做重新命名与重新理解,不理解原生流式就无法理解'为什么 world-event 不是新架构'。
条件流匹配 (Conditional Flow Matching)
一种生成连续数据(如音频/视频潜变量)的方法:在给定干净上下文条件下,学习把噪声逐步去噪到目标潜变量的向量场(流),相比扩散可用更少步骤生成。本文用它生成连续的音频与视频潜变量,使语音、动作、外观、场景演化作为一个耦合响应被联合去噪。
论文明确说离散部分(语言、行为指令)用下一 token 预测,连续部分用条件流匹配。理解这条分工是理解模型如何把'文字指令'变成'同步音视频'的关键。
VLA (Vision-Language-Action)
一类多模态模型范式:把视觉/语言输入映射为动作输出,常用于机器人与具身智能。本文类比说明其多模态理解过程是 VLA-like——把用户的流式文本/音频/视频映射为语言形式的语音与行为动作,再条件化音视频生成。
理解 VLA 才能理解作者为什么强调'开放词表行为'与'语言形式动作'——行为不再是一个固定动作枚举,而是用自然语言描述、由模型自由生成的动作。
Ulysses 上下文并行 (Context-parallel performer)
一种用于长序列 Transformer 的上下文并行策略:将序列在注意力头/序列维度上切分到多卡并行计算(Ulysses 式),再聚合。v0.2 把昂贵的潜变量生成放进一个 Ulysses 式上下文并行 performer 中,以在保持低延迟的同时提升分辨率到 640×368。
v0.3 明确声明'服务拓扑沿用 v0.2 不变',即仍是 thinker + Ulysses 上下文并行 performer。理解它才能理解为什么 640×368、约200ms 延迟能同时成立。
自回归分解 (Autoregressive Factorization)
把序列联合分布分解为逐元素条件分布的乘积:$p(e_{1:K}\mid W,x_{1:K})=\prod_{k=1}^{K}p(e_k\mid W,x_{\leq k},e_{<k})$,每次只预测下一个单元并以历史为条件。
这是本文的核心数学表达(公式 3),v0.1 的因子分解是 W 被折叠进历史时的特例。理解它才能理解 world-event 分解是如何'优雅地包含'旧公式的。
研究动机
现有 Wan-Streamer v0.1/v0.2 都把'一个会说话、会反应的智能体'这种单一交互应用直接当作训练目标——也就是说,模型学习的就是给定用户流式输入,预测智能体的文本/音频/视频响应。这种把特定下游任务嵌入训练目标的做法存在两个问题:其一,监督信号局限于对话式音视频交互这一个领域,预训练数据与目标域高度耦合,难以迁移到其他实时任务(如世界模型控制、第一人称导航、具身操作);其二,每出现一个新应用就需要重新设计训练目标和数据组织方式,缺乏统一的预训练范式。从工程角度,v0.1(192×336)到 v0.2(640×368)都围绕同一个对话智能体反复打磨,但底层'模型到底在学什么能力'始终没有被显式定义。
本文的目标是本文的目标是回答一个根本性问题:在原生流式生成框架下,模型真正掌握的'底层能力'到底是什么?作者希望把这种隐含能力显式化为一个通用、可扩展的预训练任务,使其能从大规模普通视频中学到'世界如何演化'的一般性知识,再通过特化(specialization)迁移到一整族实时下游任务。具体到本文的实例化,目标是保留 v0.2 的建模契约(640×368、25 FPS、约 200ms 模型侧延迟、约 550ms 端到端延迟)的同时,扩大智能体可表达的'事件流'范围——从单纯的语音+隐式倾听,扩展为语音+开放词表(open-vocabulary)的自由形态行为,使智能体能用自然语言指令驱动开放的动作集合。
与已有工作不同的是,本文的独特切入点是'世界-事件分解'(world + event stream)。作者观察到,任何自然视频都可以被读成'一个持久的世界 W 加上一条随时间展开的事件流 e_k':世界刻画持久上下文(环境、布局、角色身份与外观、环境声场、嗓音特征等相对稳定的条件),事件流则刻画所有随时间变化的东西(角色行为、相机运动、环境变化、语音、声音)。关键在于把'持久条件'与'时变变化'在因果序列中显式命名而非混在一起——W 在推理时只提供一次,事件流则在线生成。这一视角让普通视频直接成为预训练素材,把'对话式智能体'从训练目标降级为众多下游特化之一,是从'以任务为目标'到'以能力为目标'的范式跃迁。
核心方法
整体思路可以分两步理解。直觉上,作者把视频看成'舞台(world)+ 演出(event stream)',舞台一旦搭好就相对稳定,演出则在舞台上随时间展开。技术路线上,这套分解并不引入新架构,而是对 v0.1 既有的交错因果序列做一次'重新命名':把序列里起持久条件作用的部分命名为世界 $W=\{w_j\}_{j\in S(W)}$(schema $S(W)$ 由片段或任务决定,而非全局固定),把时序局部的变化记为事件 $e_k=\langle \tau_k, c_k, d_k\rangle$($\tau_k$ 为活跃区间,$d_k$ 为自由形式描述,$c_k\in C(W)\cup\{\emptyset\}$ 关联到 W 中的某个角色或显式标记为与角色无关)。预训练目标就是在大规模真实视频上学习'给定世界和驱动输入,预测下一个事件单元',而连续音频/视频潜变量用条件流匹配生成,离散的语言与行为指令用下一 token 预测优化。
核心创新点是'把持久世界上下文从因果历史中显式分离出来作为一等条件对象'。与已有方法的本质区别在于:v0.1/v0.2 把世界 W 折叠进历史 $x_{\leq k}$ 里,模型只是隐式地用它;v0.3 把 W 命名为独立变量,得到分解式 $p_\theta(e_{1:K}\mid W,x_{1:K})=\prod_{k=1}^{K}p_\theta(e_k\mid W,x_{\leq k},e_{<k})$。这一改动看似只是记号上的调整,但带来三重后果:第一,预训练目标从'模仿对话'泛化为'预测世界如何流式演化',几乎所有自然视频都可纳入;第二,推理时 W 只预填一次,事件流在线生成,与 v0.2 的 prefill+stream 拓扑天然兼容;第三,下游迁移只需更换 W 的内容和驱动流 x,而保持同一套流式响应逻辑,从而支持世界模型控制、第一人称交互、具身操作等多种接口。
方法步骤详情
完整步骤如下。(1)预训练数据构造:对每个视频片段,按图 1 格式汇总持久世界记录 W(视觉上下文如环境/布局、声学上下文如环境声与嗓音、若干角色记录如身份/外观/人格/可见性),并把时间对齐的事件 $e_k=\langle\tau_k,c_k,d_k\rangle$ 标注到各自活跃区间,括号表示行为、引号表示台词。(2)建模:世界 W 被分词后在 prefill 阶段一次性注入;语言/音频/视频的输入与输出共享同一条因果时间线,由 block-causal attention 协调(见图 2)。每个 160ms 流式单元内,模型先把多模态用户输入编码,再预测智能体的语言形式动作(语音 + 括号化行为指令),如 "(takes a sip of water)"、"Thanks for the reminder."。(3)解码:预测的 token 条件化联合音频-视频潜变量生成,语音、动作、外观在解码前已同步对齐并写回历史。v0.3 相对 v0.2 唯一的关键改动是事件流从'语音+隐式倾听'扩展为'语音+开放词表自由行为',两者共享同一条 token 流,时序与交错由模型联合学习。
技术新颖性
技术新颖性体现在四个层面。第一,范式层面:首次把原生流式生成重新表述为 world + event stream 分解,让'对话智能体'从训练目标降级为预训练后的一种特化。第二,预训练层面:提出一个通用目标——'给定世界和输入,预测世界如何流式前移',由于几乎所有自然视频都是 world+event 的实例,监督信号在规模和多样性上都可扩展。第三,行为接口层面:采用 role-play 聊天格式,把括号化行为指令(如 "(frowning slightly) What did you say?")与口语文本塞进同一条 token 流,使智能体不再受限于 w/a/s/d 这类小固定动作集,而是能执行开放词表、立足世界语境的动作。第四,工程契约层面:在不引入新延迟关键路径的前提下,保留了 v0.2 的服务拓扑(thinker + Ulysses 上下文并行 performer)和全部延迟指标,证明概念升级可以做到'零代价兼容'。
实验结果
论文的实验部分相对单薄,但有几个可量化的核心发现。延迟与运行协议方面,v0.3 在与 v0.1/v0.2 相同的响应边界下评测:模型侧信号到信号延迟(从 160ms 用户流式单元到达 thinker 起,到对应音视频响应单元解码完成可发送止)保持在约 200ms;在 350ms 双向网络预算下,端到端交互延迟保持约 550ms,与 v0.2 完全一致。这意味着从 v0.2 到 v0.3 的概念升级没有付出任何延迟代价。生成质量方面,v0.3 仍产出 640×368、25FPS 的视频。行为表达方面,定性观察显示模型能在对话中实时执行开放词表行为:括号化行为指令被实现为连贯的面部表情、姿态变化、对声音的反应、与近邻物体的交互(如 "(takes a sip of water)"、"(sets down the glass and flashes a peace sign)"),且行为与语音保持同步、立足场景、与角色身份外观一致;在显式行为事件之间,智能体维持稳定的待机与倾听行为。表 1 给出了三版完整对比。
查看结构化数据
| 任务 | 指标 | 本文 | 基线 | 提升 |
|---|---|---|---|---|
| 实时音视频交互(模型侧延迟) | model-side signal-to-signal latency | 约 200 ms (v0.3) | 约 200 ms (v0.2) | 持平——概念升级零延迟代价 |
| 实时音视频交互(端到端延迟) | total interaction latency (350ms 双向网络预算) | 约 550 ms (v0.3) | 约 550 ms (v0.2) | 持平,保留 v0.2 建模契约 |
| 流式视频生成分辨率 | 分辨率 × 帧率 | 640×368 @ 25 FPS (v0.3) | 192×336 @ 25 FPS (v0.1) | 相对 v0.1 分辨率大幅提升(沿用 v0.2) |
| 智能体行为表达范围 | 行为词汇量(定性) | 语音 + 开放词表自由行为 (v0.3) | 语音 + 隐式倾听/待机动作 (v0.2) | 从固定隐式动作扩展为开放词表自然语言行为 |
局限与改进
局限性相当明显。第一,作者本人承认:本文只研究了'实时全双工音视频交互'这一种特化,对世界模型控制、第一人称交互、具身操作等声称可支持的其他下游接口,'系统的适配与评估留待未来工作'——也就是说,通用预训练任务的迁移性目前只有理论论述,没有跨任务的定量证据。第二,实验部分几乎没有定量指标:行为质量只给出'定性观察',没有自动化的行为合理性评分、人类评估、对比基线的行为多样性指标,也没有与 v0.2 行为质量的并排盲评。第三,从我的观察看,world-event 的分解高度依赖事件标注质量(图 1 的事件标签是人工/半自动生成的自然语言),论文没有披露标注管线、成本和规模,预训练数据的真实可扩展性存疑。第四,'通用预训练'的可证伪性弱——没有展示去掉 world 显式分离时性能下降的消融实验。
独立分析的弱点
独立分析有三个弱点。弱点一:评测体系单薄。所有行为质量结论都是定性描述,缺少可控对比实验。改进方向:引入行为合理性评分(如动作-场景匹配度)、行为多样性指标、以及与 v0.2 的并排盲评,最好加上人类偏好数据。弱点二:通用性声称缺乏证据。论文把'世界模型控制/具身操作'列为可支持接口却不做实验。改进方向:至少在一个非交互任务(如给定动作序列的视频预测、第一人称导航)上做特化迁移实验,证明同一套预训练权重确实能迁移。弱点三:world 与 event 的边界模糊、标注成本不明。场景是'持久'还是'时变'在某些视频里并非泾渭分明(如缓慢光照变化、角色渐变)。改进方向:给出 world schema $S(W)$ 的自动推断方法、标注管线与成本,以及边界判定的鲁棒性分析;并做消融,证明显式分离 W 比把它折叠进历史确实更好。
未来方向
作者明确提出的未来工作是'对 world-event 框架在其他下游接口(世界模型控制、实时第一人称交互、具身操作)上的系统适配与评估'——这是论文最大的开放问题。基于本文成果可延伸的方向还有:第一,把 world 的 schema $S(W)$ 从手工定义走向自动学习/抽取,让预训练数据的构造可规模化;第二,扩展事件类型,目前事件主要是行为与语音,可纳入更细粒度的物理声、相机运动、环境状态变化,甚至多智能体协作事件;第三,研究行为指令的'可控性'——括号化自然语言行为的语义粒度如何控制、是否支持细到帧级别的动作编辑;第四,把这套框架与现有世界模型(如 Sora 类、GameNGen 类)做横向对比,论证 world-event 视角相对纯 next-frame 预测的优势;第五,安全性:开放词表行为指令可能被诱导生成有害动作,需要护栏机制。
复现评估
复现难度较高。开源情况:论文只给出项目主页 wan-streamer.com,未公开模型权重、训练代码或数据集,可复现性接近零。数据方面:预训练依赖大规模'世界+时间对齐事件'标注视频(图 1 形式),但论文完全没披露标注管线、标注规模、事件词汇表、world schema 的字段约定,外部研究者既无法重建数据也无法验证数据质量。算力方面:v0.2/v0.3 的服务拓扑是 thinker + Ulysses 式上下文并行 performer,生成 640×368@25FPS、约200ms 延迟的实时流式模型,训练和推理都显然需要多卡甚至多机的高端 GPU 集群,普通学术团队难以负担。难度方面:即使有权重,block-causal attention、条件流匹配潜变量生成、流式 prefill 等工程实现细节都没有公开,复现整套系统需要深厚的系统级工程能力。整体评估:这是一篇概念/范式论文,复现门槛极高。
论文图表