面向长复杂视频的全开源音视频大模型 Audio-Visual Flamingo Audio-Visual Flamingo: Open Audio-Visual Intelligence for Long and Complex Videos
全开源音视频大模型,专为长复杂视频设计,三阶段课程加时间接地链式推理
前置知识
音视频大语言模型(AV-LLM / Omni-Modal LLM)
音视频大语言模型是能够同时接收并联合理解图像、视频、音频(含语音、声音、音乐)和文本输入的多模态大模型。它通常由模态编码器(如视觉编码器、音频编码器)、投影适配器和文本大语言模型骨干组成,编码器把非文本信号转换为 token 嵌入,再送入 LLM 进行推理和生成。代表系统有 GPT-4o、Gemini、Qwen-Omni 系列和 OmniVinci。其核心难点在于跨模态对齐、时间同步以及处理多样的输入组合。
本文构建的 AV-Flamingo 本质上是一个 AV-LLM,理解这类模型的标准架构与融合方式是读懂论文方法部分和判断其创新点的基础。
链式思维推理(Chain-of-Thought, CoT)
链式思维推理指模型在给出最终答案前,先显式地产生一步步的中间推理过程(rationale),把复杂问题拆解为可验证的步骤。在视频/音频理解中,时间地地的 CoT 会把每一步推理锚定到具体的时间戳,让模型沿着长视频的时间轴导航并整合分布在不同时刻的证据。本文提出的 TAVIT 框架就是这种思路在音视频场景下的延伸。
本文的核心创新之一 TAVIT 是一种时间交错、锚定时间戳的音视频 CoT,理解 CoT 的基本机制才能领会它为何能提升长复杂视频的推理准确性和可解释性。
GRPO 强化学习
GRPO(Group Relative Policy Optimization)是一种基于组的相对策略优化强化学习方法,常用于大模型的推理后训练。它对同一提示采样多个回答,用组内相对优势作为奖励信号来更新策略,从而无需单独的 critic 网络。本文在 AV-Think 数据上先做监督微调鼓励结构化、锚定时间戳的推理,再用 GRPO 进一步强化推理质量,得到最终模型 AVF-Think。
本文的后训练阶段采用 GRPO 来增强链式推理,这是理解模型如何从 AVF-Instruct 进化为 AVF-Think 的关键技术,也是判断其推理能力来源的关键。
Whisper 音频编码器与滑动窗口机制
Whisper 是 OpenAI 提出的强大语音/音频编码器。本文沿用的 AF-Whisper 把音频重采样为 16kHz 单声道,转成 128 通道对数梅尔频谱图(25ms 窗、10ms 步长),再用滑动窗口把频谱切分为不重叠的 30 秒块分别编码后沿时间轴拼接。这种设计使其能处理任意长度音频(如整集播客或电影原声)而不截断或爆显存,输出特征记为 $h_a = f_a(A)$,$h_a \in \mathbb{R}^{N \times d_a}$,其中 $N$ 为 30 秒块数。
理解滑动窗口音频编码是领会 AV-Flamingo 如何处理长音频、以及其跨模态时间交错对齐如何成立的基础,因为对齐依赖于音频和视频块的时间同步。
跨模态时间交错对齐(Cross-modal Temporal Interleaving)
跨模态时间交错对齐指把投影后的视频 token 序列和音频 token 序列沿时间维切成多个同步块,再按时间戳交错排列,使同一时间窗口的视觉 token 紧邻同一窗口的音频 token。这样 LLM 的自注意力能自然地关注同时发生的视听事件。本文还用受约束旋转时间嵌入(CRTE)注入周期性绝对时间位置信息,让模型区分事件的顺序和相对时序。这是 OmniVinci 路线的核心融合机制。
时间交错对齐是 AV-Flamingo 架构的融合核心,也是 TAVIT 能够把推理锚定到音视频双流时间戳的前提,读懂它才能理解模型的跨模态推理能力从何而来。
研究动机
视频占全球互联网流量的 82%,用户日均观看超过 2.5 小时,且内容多为电影、电视、讲座、纪录片等中长篇,复杂地交织着画面、图形、语音、声音和音乐——这正是人类感知世界的方式。然而现有视频理解模型大多不把音频与画面联合处理;少数近期的全模态/音视频大模型虽有进展,却几乎只聚焦于短视频理解。更关键的是,长篇音视频理解面临数据匮乏:公开资源要么只有音频、要么只有视频、要么只覆盖带标注的短视频。基准评测也揭示了系统性退化——Video-MME 和 MMOU 表明,随视频时长增长性能显著下降:MMOU 上最强的闭源模型在长音视频推理上仅得 64.2% 准确率,开源模型更止步于 46.8%。此外,机理性分析指出模型深层网络存在偏向视觉、抑制音频潜在表征的视觉偏置,许多全模态模型实际上是分开训练音频和视觉、只能被动地隐式获得跨模态推理能力。最后,最强的音视频模型要么闭源、要么仅开放权重,训练数据、代码与方法学不公开,严重阻碍了开放进展与可复现性。
本文的目标是本文的目标是打造一个面向长复杂真实世界视频、完全开放的音视频大语言模型 Audio-Flamingo(AVF),把开放音视频智能从学术基准推向互联网规模的现实应用。为此作者提出三大技术支柱:第一,构建 Audio-Visual-Skills(AV-Skills)大规模数据集,包含约 7M 条字幕与问答训练实例(其中约 4.8M 条问答对),覆盖短到长视频并显式为跨模态学习而策划;第二,提出 TAVIT(时间交错音视频链式思维)推理框架,把中间推理步骤显式锚定到长音视频流中的时间戳;第三,设计三阶段训练课程(预训练、中训练、后训练),用不同数据配比让模型从短程感知逐步过渡到长视野多事件推理。作者还开源模型、训练与推理代码及配套技术,以支持未来开放音视频大模型研究。
与已有工作不同的是,本文的独特切入角度有三点本质区别。其一,在数据上,以往全模态模型严重依赖单模态语料、寄望模型隐式习得跨模态推理;而 AV-Skills 是被显式策划用于跨模态学习的,针对 13 类技能(如针在草堆、时间参照、子场景理解、音视频对应等)设计字幕与问答标注,弥补了现有音视频数据多为短片段、识别导向的不足。其二,在推理范式上,先前视频 CoT 工作要么只针对纯视觉、要么只是事后追加的浅层推理,且常局限于短视频甚至带来性能下降;TAVIT 首次把推理中间步骤同时锚定到音频和视觉双流的时间戳,把推理准确性与时间接地直接挂钩。其三,在开放性上,本文区别于闭源或仅开放权重的最强系统,完整开源数据、代码、模型与方法学,填补了可复现性空白。
核心方法
AV-Flamingo 的整体思路是以已有全模态模型 OmniVinci 为起点,通过显式策划的跨模态数据和分阶段课程,把短程感知扩展到长视野、多事件的音视频推理,并用时间接地的链式思维进一步提升。其架构含五大组件:(i) SigLip 视觉编码器经 Dynamic S2 多尺度编码再压缩,得 $h_v = f_v(V)$;(ii) AF-Whisper 以滑动窗口处理长音频,得 $h_a = f_a(A)$;(iii) 跨模态时间交错与 CRTE 对齐模块,把投影后 token(均为 2 层 MLP)按时间戳交错并注入绝对时间位置;(iv) 以 Qwen2.5-7B(36 层、每层 16 头)为推理骨干;(v) 流式 TTS 支持语音到语音交互。视觉特征记 $h_v \in \mathbb{R}^{HW \times d_v}$,音频 $h_a \in \mathbb{R}^{N \times d_a}$。训练用混合序列并行(Ulysses + Ring-Attention)加全分片数据并行,以承载最长 15 分钟、32K token 的长上下文。
核心创新点是 TAVIT 推理框架与显式跨模态数据策划的结合,这与已有方法有本质区别。已有音视频/全模态模型要么分开训练音视频、被动等待跨模态推理隐式涌现,要么 CoT 只针对纯视觉短视频、收益微弱甚至有害。AVF 则主张显式推理对长复杂真实视频最有价值,因为证据分散在多个重叠且时间分散的事件中;TAVIT 因此把音视频证据在带时间戳的推理步骤中交错,把推理准确性与时间接地处直接挂钩。配合被显式策划用于跨模态学习的 AV-Skills(针对 13 类长视频技能),以及分阶段课程(假设不同能力在不同训练阶段涌现:基础视听技能宜在短上下文数据上早期习得,而强跨模态对齐、长上下文与时间理解需要后期长数据专门化),三者共同构成了从数据到训练再到推理的完整可扩展配方。
方法步骤详情
方法分三阶段,每阶段用不同数据配比逐步增大上下文长度与任务复杂度。预训练含两子阶段:初始化阶段从预训练 OmniVinci 检查点加载(已对齐的视听语言表征为强起点);短上下文训练阶段全参微调,混合单模态数据(音/视觉分类、字幕、ASR、图文/视频问答)与新增 AV-Skills-Short,前者巩固继承能力、后者引入跨模态推理,音视频上限 5 分钟、上下文 16K token。中训练阶段引入 AV-Skills-Long(长字幕、需精确时间接地的时间感知标注、长上下文问答),并下采样保留部分 AV-Skills-Short 防遗忘,音视频上限升到 15 分钟、上下文扩到 32K token,所得模型称 AVF-Instruct。后训练阶段在 AVF-Instruct 上先用 AV-Think 做监督微调(鼓励结构化、锚定时间戳的逐步推理),再用 GRPO 强化学习进一步提升推理质量,最终模型称 AVF-Think。AV-Think 约 24K 样本、推理链平均 635.7 词。
技术新颖性
技术新颖性体现在四个层面。数据层面,AV-Skills 是首批被显式策划用于跨模态学习的大规模音视频数据集之一,覆盖短/长视频与 13 类超越识别的推理技能(如针在草堆、子场景理解、音视频对应、事件对齐),AV-Skills-Short 含 100K 小时视频与 3.8M 实例(1M 字幕、2.8M 问答),AV-Skills-Long 含约 140K 小时与 3.2M 实例(1.2M 字幕、2.0M 问答)。推理层面,TAVIT 是首个把中间推理步骤同时锚定到音视频双流时间戳的框架,区别于以往纯视觉或事后追加的浅层 CoT。训练层面,三阶段课程(16K→32K 上下文、5 分钟→15 分钟时长)系统验证了能力随阶段涌现的假设,并展示了 SFT+GRPO 组合对时间接地推理的增益。开放性层面,与闭源或仅开放权重的最强系统不同,AVF 完整开源模型、训练与推理代码、数据构建流程与方法学,为可复现的开放音视频大模型研究奠定基础。
实验结果
实验在 15+ 个音视频、全模态、音频与视觉基准上展开。长复杂音视频推理(论文重点)上,AVF-Think 在 MMOU 达 60.2%,略低于闭源 Gemini-2.5 Pro 的 64.2%,但大幅领先此前最强开源 Minicpm-o 4.5 的 46.8%,AVF-Instruct 也达 56.9%,在长复杂真实视频上同类最佳。联合视听感知上,WorldSense 51.6、DailyOmni 73.9(OmniVinci 66.5)、OmniBench 50.6(超 Gemini-1.5 Pro 47.6)。幻觉控制上,AVHBench 音→视/视→音方向 AVF-Think 达 79.0/85.9,远胜 Gemini-2.0 Flash 的 83.3/63.3。音频上虽训练为联合模型仍强迁移:MMAR 60.1、MMSU 61.5,MMAU 总均 73.49 为最佳(超 AF3 72.42)。视频上 Video-MME 70.7/71.2 双优;ASR 上 LibriSpeech 1.64 WER、SPGISpeech 2.8、VoxPopuli 5.8 均为最佳或接近最佳。
查看结构化数据
| 任务 | 指标 | 本文 | 基线 | 提升 |
|---|---|---|---|---|
| 长复杂音视频推理 (MMOU) | ACC↑ | AVF-Think 60.2 / AVF-Instruct 56.9 | Gemini-2.5 Pro 64.2(闭源最佳);Minicpm-o 4.5 46.8(此前开源最佳) | 相对此前最强开源 +13.4 个百分点,逼近闭源 SOTA |
| 联合视听感知 (DailyOmni) | ACC↑ | AVF-Think 73.9 / AVF-Instruct 72.4 | OmniVinci 66.5 | AVF-Think 较 OmniVinci +7.4 |
| 跨模态感知 (WorldSense) | ACC↑ | AVF-Think 51.6 / AVF-Instruct 50.3 | OmniVinci 48.2;Qwen2.5-O 45.4 | AVF-Think 较 Qwen2.5-O +6.2 |
| 音→视/视→音幻觉 (AVHBench) | ACC↑ | AVF-Think 79.0 / 85.9 | Gemini-2.0 Flash 83.3 / 63.3 | 视→音方向 +22.6 |
| 音频推理 (MMAU 均值) | ACC↑ | AVF-Instruct 73.49 | Audio Flamingo 3 72.42;OmniVinci 71.60 | +1.89(总均) |
| 视频理解 (Video-MME 无字幕) | ACC↑ | AVF-Instruct 70.7 | OmniVinci 67.3;NVILA 64.2 | +3.4 |
| ASR (LibriSpeech test-clean) | WER↓ | AVF-Instruct 1.64 | Phi-4-mm / Qwen2.5-O 1.67 / 3.4 | 最佳 WER |
局限与改进
作者承认三方面局限。其一,AV-Skills 由公开数据集与开放互联网视频构建,可能引入来源偏差以及与既有训练数据的潜在重叠。其二,对极长且信息高度密集的视频,推理仍有挑战,尤其当证据稀疏或时间分散时。其三,现有基准无法充分捕捉开放式的真实部署场景,评测与现实效用之间存在差距。从我的观察看,额外局限包括:MMOU 上 AVF-Think 仍落后闭源 Gemini-2.5 Pro 约 4 个百分点,说明在最长最难的视频上闭源大模型仍有优势;模型音视频时长硬上限为 15 分钟,对电影级超长内容力有不逮;后训练推理增益主要来自约 24K 的 AV-Think 样本,规模相对有限,泛化到全新推理模式可能不足;此外论文未提供训练数据完全去重与许可的细节,复现时可能受数据获取与版权约束。
独立分析的弱点
第一,超长内容上限不足。当前硬上限为 15 分钟音视频、32K 上下文,电影级或讲座级超长内容无法整体建模,证据稀疏时性能下降。改进方向是引入分块检索与外部记忆机制(如记忆库、检索增强),并扩展上下文窗口与上下文并行。第二,AV-Think 推理数据规模有限(约 24K,平均 635.7 词),后训练推理增益可能局限于特定推理模式,对全新任务的链式推理泛化存疑。改进方向是用自动化流水线大规模扩充时间接地推理数据,并引入多样化的推理结构。第三,数据来源偏差与潜在重叠。AV-Skills 来自公开数据集与开放互联网,存在领域偏置(如 vlog 类 talking-head 偏多)和与既有训练数据的重叠风险。改进方向是严格去重、领域平衡采样、并补充环境声、背景音乐等欠覆盖类别。第四,与闭源 SOTA 仍有差距。MMOU 上 AVF-Think 60.2 落后 Gemini-2.5 Pro 64.2,提示在最长最难视频上规模或数据质量仍有提升空间。改进方向是继续扩大模型与高质量长视频数据规模。
未来方向
作者明确提出的未来方向包括:把 AV-Skills 扩展到更广领域与更具挑战性的长篇设置;改进长上下文推理能力;开发更贴合真实部署的评测协议以衡量开放音视频系统的实际效用。基于本文成果可延伸的方向有:其一,把 TAVIT 的时间接地推理范式推广到超长视频(>15 分钟)乃至流式实时场景,结合检索与记忆;其二,将三阶段课程与显式跨模态数据策划的配方迁移到更多模态(如 3D、触觉、文档);其三,研究 AV-Skills 各技能类别对模型能力的解耦贡献,做更细粒度的课程设计与数据配比搜索;其四,探索更强的高效推理后训练(如更大规模 GRPO、过程奖励模型)以缩小与闭源 SOTA 的差距;其五,基于全开放的代码/模型/数据,构建社区驱动的持续评测榜单与真实任务基准,推动开放音视频智能的长期进步。
复现评估
复现性是本文的突出优势,也是其宣称完全开放的关键。作者开源了模型权重、训练与推理代码,以及数据构建流程和方法学(Code/Model/Project Page/Dataset/Demo 链接齐全),并配套发布 AV-Skills 数据集与 AV-Think 推理数据。训练细节(批大小、学习率、优化器、各阶段超参)放附录 C,训练配方在表 5,消融在表 6,定性示例在表 7。算力方面,预训练、长上下文训练与后训练在 512 块 NVIDIA H100 GPU 上完成,复现完整训练需工业级算力,对学术团队门槛较高;技术栈采用混合序列并行(Ulysses + Ring-Attention)与全分片数据并行承载 32K 长上下文,复现需相应分布式工程能力。潜在障碍在于 AV-Skills 涉及多个公开数据集(YouTube-8M、HD-VILA、InternVid、HarmonySet、LSMDC、MMTrail 等)及开放互联网视频,其许可、清洗与去重需额外投入,但整体而言在音视频大模型领域本文开放程度属于顶尖水平。
论文图表
图展示了 AVF 与当前 SOTA 模型在多个基准上的对比。通过雷达图/柱状对比的形式,AVF 在音视频、全模态、音频与视觉等多类任务上与闭源(Gemini、GPT-4o)、开源权重(Qwen-Omni 系列、OmniVinci)及专门化音频/视觉模型同台竞技,突出其在长复杂真实世界视频上的优势地位,以及在多数维度上对同级开源模型的明显领先。
这张图是论文价值主张的总览,一目了然地回答了 AVF 在多任务格局中的位置,是理解其宣称超越同级开源模型、且与更大闭源模型高度竞争力的核心证据,最适合放在 motivation 章节作为问题与目标的直观佐证。