LAION-BVD:面向多模态预训练的千万小时开放视频数据集 LAION-BVD: A 10-Million-Hour Open Video Dataset for Multimodal Pre-training
LAION 发布 1000 万小时开放视频数据集,一源三用验证视频、音频、图文预训练
前置知识
CommonCrawl 与 WAT 文件
CommonCrawl 是定期抓取全网并公开存档的非营利爬虫项目,累计存有数千亿网页。WAT(Web Archive Transformation)文件是其提供的元数据格式,包含每个存档页面的 HTTP 头、超链接等结构化信息,是 LAION-5B、DataComp 等超大规模数据集的标准原料。
本文的 13 亿条视频 URL 正是从 CommonCrawl WAT 文件中经 cc2dataset 加 Apache Spark 解析提取的,不理解这一数据源就无法理解数据采集的起点和规模。
CLIP 与对比学习
CLIP 用数亿图文对做对比学习:图像编码器与文本编码器把样本映射到共享嵌入空间,拉近配对样本、推远非配对样本,损失形如 $\mathcal{L}=-\frac{1}{N}\sum_i \log \frac{\exp(s_{ii}/\tau)}{\sum_j \exp(s_{ij}/\tau)}$,其中 $s$ 为相似度、$\tau$ 为温度。训练后即可零样本分类与跨模态检索。
本文用 CLIP 族对比模型(ViCLIP、CLAP 同属该范式)验证数据质量,论文中所有检索与零样本指标的解释都依赖对比学习框架。
ViCLIP
ViCLIP 是基于 CLIP ViT 骨干加视频适配器的视频-文本对比模型,原始论文在 InternVid 数据上训练,支持零样本动作识别(K400、UCF-101、HMDB51)与文本-视频检索(MSR-VTT、MSVD),是衡量视频数据集质量的常用载体。
本文沿用 InternVid 论文的 ViCLIP 训练配置,在完全相同的模型规模与样本量下与 InternVid 基线做受控对比,是视频模态验证的核心工具。
CLAP(对比语言-音频预训练)
CLAP 把音频编码器(如 HTSAT)与文本编码器(如 RoBERTa)做对比训练,形成共享的音频-文本嵌入空间,支持零样本音频分类(UrbanSound8K)与文本-音频检索(AudioCaps、Clotho 的 recall@5),LAION-CLAP 是其开源代表实现。
论文用四种 HTSAT 参数规模(158M-431M)的 CLAP 模型验证 LAION-BVD 音频流的价值,对比对象正是 LAION-CLAP 原始训练数据 LAION-Audio 与 AudioSet。
场景检测(Scene Detection)
把长视频按内容变化切成语义连贯片段的技术。PySceneDetect 基于相邻帧的颜色差异(如 HSV 通道)计算内容变化量,超过阈值(本文取 30)即判定场景切换;ffmpeg 的 scene 滤镜提供类似功能(本文帧提取阈值取 0.1)。相比固定长度切窗,能保证片段内部语义一致。
内容感知场景检测是本文片段提取流水线的关键步骤,直接决定 55M 片段与其配套音频段的粒度和质量,也是相对固定窗口切分的方法学差异点。
WiSE-FT(权重空间插值)
WiSE-FT 把微调后的模型与原始零样本模型的权重按插值系数 $\alpha$ 线性合并:$\theta_{merged}=\alpha\,\theta_{finetuned}+(1-\alpha)\,\theta_{zeroshot}$,通常无需重训即可在保持鲁棒性的同时提升下游精度。InternVid 官方报告的成绩即经过此合并。
InternVid 原论文报告的数字是 WiSE-FT 合并后的成绩,本文复现时发现差距后补做了该对比;不理解 WiSE-FT 就无法正确解读表 6 中基线数字的来历与公平性。
FID(Fréchet Inception Distance)
衡量两组图像分布距离的指标:分别用 Inception(本文用 CLIP-ViT-B/32)提取特征并假设服从高斯分布,计算两个分布均值与协方差之间的 Fréchet 距离,值越小说明两组图像分布越接近,广泛用于评估生成图像与数据集差异。
论文用 FID=33.92(同源两次采样仅 0.16)证明视频帧与 Re-LAION 网页图像是显著不同的视觉分布,这是「视频帧可作为新型图文数据源」这一论点的核心量化证据。
研究动机
开放多模态基础模型的训练高度依赖大规模可获取的数据集,但各模态的数据丰裕度极不均衡。文本与图文领域已经解决了规模问题:LAION-5B 的英文子集含 23 亿图文对,足以训练出 OpenCLIP、Stable Diffusion、KOSMOS-1 等有竞争力的开放模型,闭源数据集更达到千亿对级别。相比之下开放视频-语言资源明显滞后:迄今最大的 InternVid 仅含 710 万视频、76.03 万小时片段,比现代文本与图像语料低一个数量级以上。作者指出瓶颈不在于网络上的视频数量——网上有数以亿计的视频可用——而在于处理视频所需的巨大算力、内存和工程投入,且视频大多托管在 YouTube 等大型商业平台上、访问受限,规模化采集在实践中非常困难。音频-文本语料更小,最大的 LAION-Audio-630K 也只有 63.4 万个片段。这种不对称使开放社区难以在视频、音频模态上追平图文模型的进展。
本文的目标是本文的目标是构建并发布一个空前规模的开放视频数据集 LAION-BVD,并系统验证其对多模态预训练的价值。具体包括四件事:其一,从 CommonCrawl 提取 13 亿条平台视频 URL,下载 8000 万条视频、总时长 1000 万小时;其二,建立一条可扩展的多模态标注流水线,把视频按场景切分成片段并自动生成片段级视频描述、音频描述与帧描述三类合成标注;其三,发布 5500 万片段(BVD-V-55M)和 3 亿张场景变化帧(BVD-I-300M)两个带标注子集;其四,用同一数据分别训练 ViCLIP、CLAP、CLIP 三类对比模型,在零样本分类与检索基准上验证视频-文本、音频-文本、图像-文本三种模态的学习效果及其随数据量与模型规模的扩展规律,最终把数据与流水线完整开放给研究社区。
与已有工作不同的是,现有视频-文本数据集几乎都依赖间接监督来源:ASR 转写、字幕、alt-text 或图像描述迁移,且大多经过较强过滤(如 InternVid-FLT 用 CLIP 相似度筛选),片段切分多采用固定长度窗口;音频语料则来自与视觉完全分离的专门采集渠道。本文的切入角度有三点独特性。其一,像 LAION-5B 之于图文那样,直接从 CommonCrawl 按 YouTube、Vimeo、Dailymotion 三个平台的 URL 做最小过滤采集,靠规模与多样性而非精挑细选取胜。其二,同一个视频源经统一流水线同时产出视频、音频、图像三种模态的训练对,验证「一源三用」的数据组织方式。其三,首次系统地把视频中的场景变化帧当作独立的图像-文本数据源,并用 FID 定量证明其视觉分布与网页图像语料显著不同(FID=33.92),在图文扩展收益递减的背景下提供互补数据源。
核心方法
整体思路可以概括为「像抓图文一样抓视频,再用便宜的合成描述把三种模态转成可训练对」。技术路线分四步。第一步 URL 提取:使用 CommonCrawl 截至 2024 年 3 月的全部 WAT 文件,借助 cc2dataset 工具加 Apache Spark 集群快速解析页面元数据,用 yt-dlp 的平台提取器过滤出 YouTube、Vimeo、Dailymotion 链接,从 47 亿候选 URL 中得到 13 亿条视频链接。第二步分布式下载:用 Celery 集群调度 2000 台虚拟服务器,yt-dlp 配合住宅代理网络抓取,尝试下载 1.3 亿条、链接成功率约 60%,最终得到 8000 万条视频共 1000 万小时。第三步子集构建:随机采样视频并做场景切分与关键帧提取,形成片段、音频、帧三类子集。第四步标注与验证:三个小型开源模型分别为视频、音频、帧生成短描述,再训练 ViCLIP、CLAP、CLIP 验证数据质量。
核心创新是一条「一源三用」的最小过滤标注流水线,与依赖 ASR、字幕或人工强过滤的已有数据集本质不同,本文所有监督信号均由小型开源模型自动合成。具体做法:从 8000 万视频池中随机采样 240 万条,先用 PySceneDetect(阈值 30)做内容感知的场景检测切出 5500 万个片段,并在低分辨率采样上估计帧间运动、剔除无明显视觉变化的静态片段;视频描述由 Qwen3-VL-2B-Instruct 生成(vLLM 部署,每片段均匀采样最多 32 帧,提示「用 20 词以内描述视频」);音频段描述由 Audio Flamingo 3 生成(提示「用 10 词以内描述声音」,长度风格对齐 AudioCaps/Clotho);帧描述由 DeepSeek-VL2-tiny 生成。同一批片段的视觉流供 ViCLIP 训练、音频流供 CLAP 训练,另抽 3 亿张场景变化帧构成图文对。
方法步骤详情
(1) URL 提取:CommonCrawl WAT 元数据经 cc2dataset+Spark 解析、yt-dlp 过滤,得 13 亿条平台视频链接。(2) 分布式下载:Celery 调度 2000 台虚拟服务器经住宅代理下载,尝试 1.3 亿条、成功率约 60%,得 8000 万条视频、1000 万小时。(3) 片段提取:随机采样 240 万条视频,弃 10 秒以下与 30 分钟以上者,PySceneDetect 阈值 30 切场景并剔除静态片段,得 5500 万片段;音频段过滤 2-30 秒构成音频子集。(4) 帧提取:ffmpeg 抽关键帧、滤黑帧、场景阈值 0.1,累积 3 亿张。(5) 标注:Qwen3-VL-2B 生成不超过 20 词视频描述,Audio Flamingo 3 生成不超过 10 词音频描述,DeepSeek-VL2-tiny 生成帧描述。(6) 验证:分别训练 ViCLIP、CLAP、CLIP,与 InternVid、LAION-Audio、DataComp-1B、Re-LAION 对比。
技术新颖性
新颖性体现在四个层面。规模上,1000 万小时约为此前最大开放视频数据 InternVid(76.03 万小时)的 13 倍,把开放视频语料首次推到与图文语料可比的量级,且 720p 为主。模态组织上,「一源三用」是新的:同一网络视频语料同时支撑视频-文本、音频-文本、图像-文本三类训练,而此前三者分属互不相关的采集渠道(视频靠 ASR/字幕,音频靠专门录制,图像靠 alt-text)。数据源上,视频场景变化帧与 Re-LAION 网页图像的 FID 高达 33.92(Re-LAION 自身两次采样仅 0.16),证明其为全新的视觉分布,回应了图文扩展收益递减的问题。方法论上,实验证明「最小过滤+短合成描述」的数据在匹配模型与样本量下反而超过强过滤的 InternVid-FLT(综合指标高 2-4 个百分点),对「数据整理强度是否总是有益」这一社区争论给出了重要的反例证据。
实验结果
视频:ViCLIP L-14 在 BVD-V-50M 上平均 62.0(K400 63.3、UCF/HMDB 各 61.4、MSVD V2T 83.9),比 InternVid-10M-FLT 复评基线(58.0)高 4.0 个百分点、比 DataComp-1B 图像基线(53.2)高 8.8;WiSE-FT 合并后为 62.6 对 60.2,最小过滤数据仍领先约 2.1 个百分点,且模型从 B-32 到 L-14 平均分单调上升。音频:30M 样本下 BVD-A-10M 在四个 CLAP 规模得 42.9/44.8/45.9/46.8,全面超过 LAION-Audio(42.1-45.0),但低于含精选 AudioSet 的 LA+AS(约 56);431M 模型 110M 样本见次平均 48.7,158M 小模型退化到 40.0。图像:BVD-I-300M 训练的 CLIP ViT-B/16 在 COCO 检索 T2I/I2T R@5 达 0.63/0.80,超过 DataComp(0.52/0.70)与 Re-LAION(0.53/0.71),扩展斜率也最陡;但 ImageNet-1k 仅 0.28,明显低于 DataComp 的 0.58。
查看结构化数据
| 任务 | 指标 | 本文 | 基线 | 提升 |
|---|---|---|---|---|
| 视频零样本分类 Kinetics-400 | top-1 准确率 (%) | ViCLIP L-14 @ BVD-V-50M(50M 样本见次):63.3,WiSE-FT 后 64.3 | InternVid-10M-FLT 复评 61.8;DataComp-1B 图像平均帧基线 61.2 | +1.5pp(WiSE-FT 后 +2.5pp) |
| 视频-文本检索 MSVD | video-to-text recall@1 (%) | 83.9(WiSE-FT 后 84.6) | InternVid-10M-FLT 74.1;DataComp-1B 图像基线 63.3 | +9.8pp 对 InternVid-FLT,+20.6pp 对图像基线 |
| 视频综合指标(3 分类+4 检索均值) | Avg (%) | BVD-V-50M:62.0,WiSE-FT 后 62.6 | InternVid-10M-FLT:58.0,WiSE-FT 后 60.2 | 未合并 +4.0pp;合并后 +2.4pp(作者按 BVD-V-10M 口径总结为 2.1pp) |
| 音频零样本(UrbanSound8K 分类 + AudioCaps/Clotho 检索) | 分类与 R@5 检索的平均分 | BVD-A-10M,HTSAT-base-Roberta-large:46.8(110M 样本见次 48.7) | LAION-Audio 同模型 44.8;LA+AudioSet 56.6 | +2.0pp 对 LAION-Audio;仍落后 LA+AS 约 9.8pp |
| 图像-文本检索 MS-COCO(300M 样本,ViT-B/16) | text-to-image / image-to-text recall@5 | 0.63 / 0.80 | DataComp-1B 0.52 / 0.70;Re-LAION 0.53 / 0.71 | T2I +0.10/+0.11,I2T +0.09/+0.10,且扩展斜率最陡(0.35 对 0.15-0.16) |
| ImageNet-1k 零样本分类(300M 样本,ViT-B/16) | top-1 准确率 | 0.28 | DataComp-1B 0.58;Re-LAION 0.51 | 落后 0.30/0.23——检索强、分类弱的权衡,短合成描述不利于细粒度标签任务 |
局限与改进
作者承认四点局限:所有描述由小型模型自动生成且刻意简短(视频不超过 20 词、音频不超过 10 词),描述丰富度受限并可能引入描述模型自身的系统性偏差;验证只覆盖对比式训练(ViCLIP/CLAP/CLIP),未测试生成式任务如视频语言模型或扩散模型;三种模态各自独立训练,未做联合音视频建模,无法说明数据对视听同步任务的价值;最小过滤意味着偏见、刻板印象与语言/地区不均衡会保留在数据中(英语占 57%)。我的补充观察:音频实验中 LA+AS(含精选 AudioSet)仍大幅领先(约 56 对 46.8),说明原始网络音频与任务精选数据差距明显;实际带描述发布的只是 240 万条视频的标注子集,约占总库 3%,「1000 万小时」主体是无标注原始视频;ImageNet 大幅落后说明短合成描述不利于细粒度标签型任务;依赖住宅代理抓取主流平台在服务条款与法律层面存在争议。
独立分析的弱点
独立分析可见五个弱点。其一,可持续性风险:94% 视频来自 YouTube,下载依赖 2000 台服务器加住宅代理绕过平台限制,链接成功率仅 60%,且此前 WebVid10M 已因版权问题下架、LAION-5B 曾因不当内容撤回重建,本数据集长期可得性存疑;改进方向是与平台达成正式授权或转向版权友好来源。其二,描述信息瓶颈:20 词以内的短描述丢失细粒度判别信息,直接导致 ImageNet-1k 仅 0.28(DataComp 为 0.58);改进方向是引入两级描述(短描述用于对比训练、长描述用于生成式任务)或更强的描述模型。其三,标注覆盖低:5500 万片段仅来自 240 万条视频(约 3%),其余 7700 余万条无标注,主题与语言分布可能不均;改进方向是分层采样并逐步扩大标注池。其四,静态片段剔除基于低分辨率运动估计的启发式规则,可能误删慢镜头、渐变转场等有价值内容。其五,评估集中于零样本分类与检索,缺少时序定位、长视频问答等更能区分数据质量的任务。
未来方向
作者提出的方向包括:在生成式范式上验证数据价值,如训练视频-语言模型和扩散式视频生成模型;训练联合音视频表示模型,弥补本文未做视听同步学习的缺口;用更强的描述模型生成更丰富的标注。基于本文成果还可自然延伸:其一,约 6% 视频长于 30 分钟、平均时长 7.7 分钟,可用于长时序视频理解与记忆建模研究;其二,把 BVD-I-300M 帧对与网页图文语料混合训练,检验「检索强、分类弱」的互补性能否兼得;其三,用 Whisper 转写与音频描述对齐,在同一语料上构建语音-文本资源;其四,系统研究数据整理的扩展定律,例如描述长度、过滤强度与下游性能之间的定量关系;其五,对合成描述的偏见做量化审计与去偏训练,特别是占 43% 的非英语内容;其六,把 WiSE-FT 式权重合并作为这类合成描述数据的标准评估协议推广。
复现评估
复现条件总体友好但成本分层明显。开源情况:URL 列表、55M 片段描述、300M 帧描述已在 HuggingFace 集合 laion/bvd-big-video-dataset 发布,研究机构接受使用条款后可下载原始视频;流水线全部由公开工具构成——yt-dlp、cc2dataset、Apache Spark、Celery、PySceneDetect、ffmpeg、vLLM,以及 Qwen3-VL-2B-Instruct、Audio Flamingo 3、DeepSeek-VL2-tiny 三个开源标注模型,附录给出训练超参与描述流水线细节。复现难度:复用发布数据训练 ViCLIP L-14 或 CLAP 需要多 GPU 数天到数周,属中高难度但对实验室可行;完整重抓 1000 万小时视频需要 2000 台虚拟服务器加住宅代理网络,预算与合规门槛使个人或小实验室无法复制,这是最大的复现不确定性。总体而言,复用子集做下游研究容易,端到端重抓几乎不可行,建议以官方发布数据为准。
论文图表
左侧柱状图对比各视频数据集总时长:LAION-BVD 达 10M 小时,远超 InternVid 的 760.3k、HD-VILA-100M 的 371.5k、Panda-70M 的 167k 等;右侧上半部为 ViCLIP 在各数据集训练后的平均下游性能柱状图(BVD-V 优于多数竞品),下半部为 CLAP 随模型规模(平均准确率约 43-47)与数据规模的扩展曲线。
一图总览论文两个核心卖点:规模空前(10M 小时)以及由此带来的视频、音频两模态下游性能优势和清晰的扩展趋势。
六联统计图:来源平台 YouTube 94%、Vimeo 4%、Dailymotion 2%;内容类别 vlogs 20%、music 17%、entertainment 10%、news & politics 8% 等;语言英语 57%、俄语 9%、西班牙语 8%、日语/法语各 4% 等;时长均值 7.7 分钟、中位数 3.7 分钟;上传年份横跨 2006-2024。
展示数据集的多样性与固有偏向(平台高度集中于 YouTube、近半内容为非英语),是判断数据适用范围和潜在偏见的关键依据。