← 返回 2026-09-09

VidaForge:面向视频预训练数据配方的开源研究基础设施 VidaForge: Open Research Infrastructure for Video Pretraining Data Recipes

Yan Ma, Jiadi Su, Zhulin Hu, Ethan Chern, Linhao Zhang, Tiantian Mi, Pengfei Liu 📅 2026-09-06 👍 19 2026-09-12 18:30
数据基础设施 数据配方 数据集 自监督学习 视频生成 视频预训练

开源五阶段视频数据流水线,对照实验证明广覆盖配方的早期预训练效果优于高过滤配方

前置知识

数据配方(Data Recipe)

指从原始视频到最终训练集的整套处理决策组合:如何粗筛源视频、如何按场景切分、用什么阈值和去重规则挑选片段、如何生成镜头描述与字幕标签、最终打包成哪种训练格式。同一批原始素材在不同配方下会产出完全不同的训练数据集。

本文的研究对象就是可执行、可追溯的数据配方,全部实验都在系统比较不同配方对模型预训练的影响,不理解配方概念就无法理解论文要回答的问题。

Attribution-ready(可归因性)

流水线把每个阶段的输出、配方参数和样本级决策记录一并持久化,使任何最终训练样本都能回溯它经历了哪些处理步骤、被哪些规则接收或拒绝;修改某步决策时可复用之前步骤的缓存结果继续执行,快速生成对照数据集。

这是 VidaForge 区别于普通数据处理脚本的本质特性,也是论文中覆盖度与质量对照实验能严格控制变量、精确归因差异的前提。

Wan 2.1 与 V-JEPA 2.1

两种从头预训练的视频基础模型。Wan 2.1(1.3B)是基于扩散架构的文本条件视频生成模型,用 VBench 与损失函数评估;V-JEPA 2.1(1B)是自监督表征学习模型,通过掩码潜空间预测学习视频表征,用冻结注意力探针在 SSv2 上测 top-1 准确率。

论文同时在生成与表征两种截然不同的预训练目标上验证结论,理解这两个模型的训练与评估方式是读懂实验设计的基础。

PDQ 与 Cosmos-Embed 去重

PDQ 是感知哈希去重:对视频计算鲁棒哈希,哈希距离近的片段视为视觉重复,每组只保留 1 条;Cosmos-Embed 是语义嵌入去重:用嵌入模型把片段映射到语义空间并聚成重复组,每组保留 20%(每组 1 到 20 条封顶)。二者分别处理像素级与语义级重复。

去重是 Selection 阶段的关键决策,重复率是论文衡量数据集质量的核心指标之一,也直接决定了 Selected 与 Rejected 池的构成。

VBench 与 SSv2

VBench 是视频生成综合评测基准,含质量维度(成像质量、美学、主体一致性、时间闪烁等)与语义维度(对象、动作、镜头、场景等),总分越高生成越好;SSv2(Something-Something V2)是大规模动作识别数据集,本文在预训练模型上训练冻结探针,以 top-1 准确率衡量表征质量。

两个基准分别是生成式与判别式路线的下游指标,论文的关键结论(损失与下游指标偏好不同配方)正建立在这两类评估的交叉对比上。

研究动机

视频基础模型(HunyuanVideo、Wan 系列、Seedance、V-JEPA、DINOv3 等)的快速进步高度依赖大规模预训练数据,但领先模型背后的端到端数据流水线基本处于封闭状态。作者按技术报告中数据准备与处理内容的近似字数做了统计(Fig. 1):多数领先模型的报告对预训练数据的过滤、去重、字幕生成等具体决策要么只字不提、要么一笔带过,也几乎不提供受控训练消融来说明哪些配方决策在何种预训练目标下真正重要。结果是视频预训练数据这门科学事实上被少数前沿实验室垄断。对普通学术研究者而言,研究数据配方的第一道门槛不是提出假设而是基础设施:在检验任何一个聚焦假设之前,必须先从异构原始视频搭起一条完整流水线,把数据处理成训练仓库要求的精确格式,还必须保存每一步的中间资产与决策记录,使每个训练样本可以沿处理链回溯,否则不同训练 run 之间的差异无法归因到被研究的配方决策,这套工程的搭建与验证成本往往超过假设检验本身。

本文的目标是本文的具体目标有三层。第一,建造并开源 VidaForge:把视频预训练数据配方表示为从原始视频直达训练数据集的可执行五阶段工作流(摄取、切分、选择、标注、打包),保存各阶段输出、配方参数与样本级决策,使每个样本的处理历史可完整重建(attribution-ready),修改任一决策即可在复用已完成计算的前提下生成替代数据集并直接接入训练与评估,配套可运行配方、文档与完整视频教程。第二,用该基础设施回答一个此前缺乏受控证据的实际问题:在相同的早期预训练预算下,覆盖更广但质量参差的配方与过滤更严但覆盖更小的配方,哪个对早期预训练更有利?作者在 Wan 2.1-1.3B(视频生成)与 V-JEPA 2.1-1B(自监督表征学习)两种从头预训练目标上各跑 3 个随机种子做对照。第三,发布 VidaForge-3M:含 314 万场景级片段、共 6475 小时的开放数据集,附带细粒度标注与策展信号(四类过滤分、重复关系、镜头描述、多级字幕与语义标签),供社区构造替代配方继续开展数据配方研究。

与已有工作不同的是,已有工作的切入角度大致两类:一是发布成品数据集,只有最终数据、没有配方与决策记录,无法回答换个选择规则会怎样;二是通用视频处理框架,只解决能不能处理,不解决配方决策如何因果地影响模型。数据配方研究(哪些过滤、去重、标注决策重要)因此基本停留在前沿实验室的内部经验中。本文的独特之处在于把配方本身作为一等公民:配方被形式化为显式配置的处理步骤链,中间产物与样本级决策全部持久化,任何两个配方之间的差异都能精确归因到具体的决策变化,而非笼统的数据不同。此外,作者选择了一个被忽视但非常实际的问题——覆盖度与质量的权衡——并在生成式与自监督两种学习目标上做同预算受控对比,用训练损失、验证损失、下游基准三层指标交叉评估。这种同池构造对照配方、双目标、多层指标的实验设计在公开文献中此前基本空白,使基础设施论文同时产出了可靠的科学结论。

核心方法

直觉上,VidaForge 把做数据从一次性脚本变成可重放的实验仪器。形式化地,设 $D_0$ 为固定的原始视频快照,数据配方 $R$ 表示为五阶段变换链:摄取得到标准化视频 $D_1$,切分得到场景级片段 $D_2$,选择得到带选择结果的片段 $D_3$,标注得到已标注片段 $D_4$,打包得到训练数据集 $D_5$,整条链满足 $D_5 = R(D_0)$。每个箭头由一串带配置的处理步骤实现,修改任一步骤的决策即定义配方变体 $R'$,产出替代数据集 $D'_5 = R'(D_0)$。具体而言:Ingestion 用 Probe 检查媒体、Screen 粗筛、Transcode 统一编码;Segmentation 用 Detect 定位场景边界、Clip 抽取片段;Selection 用 Context 准备帧与音频、Filter 度量光学/运动/美学/可见文本质量、Dedup 去重、Select 综合取舍;Annotation 用 Camera/Caption/Tag 生成镜头描述、多级字幕与语义标签;Packaging 按目标系统格式打包。

核心创新是 attribution-ready(可归因)属性:每个步骤都把输出数据与处理记录一并落盘,记录产生它的运行以及供给输入的上游运行,因此其一,每个最终样本可以完整重建其处理历史;其二,在任意步骤修改决策后,只需从该步骤之前的缓存输出继续执行后续依赖步骤,无需重跑打分或去重等昂贵计算——例如已保存的光学、运动、美学、文本分数与重复关系,允许直接改选择阈值生成新配方。这与已有方法的本质区别在于:传统脚本或数据集发布只保留最终产物,决策不可回放、变体需从头重算、样本与决策无法对齐;VidaForge 把中间产物、参数与样本级决策作为数据集的一部分一起发布,使换一个配方做对照实验的成本从重建整条流水线降到改一个配置项。缩放设计上:Probe/Transcode/Clip 等媒体步骤用 FFmpeg 配合 Ray 在 CPU worker 间并行;GPU 过滤器与嵌入模型由 GPU worker 各加载一次模型批量处理;Camera/Caption/Tag 对推理服务器池发并发请求并限制在途数量;去重因需全库比对而拆成特征提取分片与并行匹配两阶段,再合并重复对成组。

方法步骤详情

以 Fig. 3 的执行为例:输入为 20 万条标准化视频(686 万原始视频粗筛至 676 万后采样)。Ingestion:Transcode 统一为 MP4/H.265/25fps。Segmentation:Detect 定位场景边界,Clip 切出 71.6 万条 2 至 10 秒片段。Selection:Filter 打光学、运动、美学、可见文本分数,阈值依次为 0.9、0.1、0.1、0.5;PDQ 每感知组留 1 条、Cosmos-Embed 每语义组留 20%;Select 得 35.2 万 Selected 与 36.4 万 Rejected,并留存决策记录。Annotation:Camera 用 Gemma-4-E4B-it 写镜头描述,Caption 与 Tag 用 Qwen3.6-27B-FP8 生成字幕与标签。Packaging:为 Wan 打包片段、字幕与预计算表征,为 V-JEPA 打包视频。验证集隔离后,Selected 与 Rejected 各约 29 万条训 2 epoch,Mixed 约 58 万条训 1 epoch,每次运行均处理约 58 万片段。

技术新颖性

技术新颖性体现在四点。第一,配方即程序:把数据配方形式化为带配置的五阶段变换链,配方变体 $R'$ 与原配方共享前缀执行结果、只重算被改动步骤之后的部分,这是数据版本管理思想在视频预训练领域的系统化落地。第二,样本级归因:决策记录与样本绑定发布,使训练集之间的差异可精确归因到具体决策,为消融式数据研究提供了基础设施。第三,面向两阶段的规模化执行:感知与语义去重因需全库比对而拆成特征提取(GPU 分片存储)与匹配(worker 各比对子集后合并重复组)两阶段,标注类步骤对推理服务器池做在途请求限流,这些执行模式直接支撑了从 80 万源视频构建 314 万片段的吞吐。第四,实验范式创新:在同一处理池上构造 Selected、Rejected、Mixed 三个配方,在 Wan 2.1-1.3B(32 块 H200、全局 batch 96)与 V-JEPA 2.1-1B(全局 batch 256)上各跑 3 个随机种子做受控对比,把覆盖度对质量的取舍从经验争论变成可复现的实证问题,并揭示了损失指标与下游指标系统性分歧这一新现象。

VidaForge overview.
Fig. 2: VidaForge overview.
VidaForge data flow for the coverage–quality study.
Fig. 3: VidaForge data flow for the coverage–quality study.
VidaForge 与相关基础设施的能力对比汇总:结合可扩展视频处理支持与端到端数据配方研究工作流。
Tab. 1: VidaForge 与相关基础设施的能力对比汇总:结合可扩展视频处理支持与端到端数据配方研究工作流。

实验结果

Selected 过滤分 0.994/0.408/0.230/0.987、重复率 0.0%/0.5% 三池最优;Rejected 全面最差(重复率 4.6%/23.4%);Mixed 介于其间(Fig. 4)。Wan 2.1-1.3B(3 种子):Rejected 训练损失最低,Selected 验证损失三集均最低,VBench 上 Mixed 第一:Total 60.64±0.83 对 59.74、59.42(Total† 64.95/64.04/63.73 同序);配对种子全胜 0.53–1.15 分(Tab. 10)。V-JEPA 2.1-1B:Rejected 损失最低,但 SSv2 探针 top-1 为 Mixed 16.26±0.15% > Selected 15.71±0.38% > Rejected 15.10±0.34%(Tab. 12)。核心发现:相同早期预算下,覆盖更广的 Mixed 在两类目标的全部种子上拿下最高下游基准分;而损失指标互相矛盾(训练损失选 Rejected、验证损失选 Selected、基准选 Mixed),低损失无法可靠指认更好的训练集。

Quality and coverage of three training sets.
Fig. 4: Quality and coverage of three training sets.
Wan 2.1-1.3B loss curves across 3 training seeds (mean ± std).
Fig. 5: Wan 2.1-1.3B loss curves across 3 training seeds (mean ± std).
Wan 2.1-1.3B VBench results across 3 seeds.
Fig. 6: Wan 2.1-1.3B VBench results across 3 seeds.
V-JEPA 2.1-1B evaluation across 3 training seeds (mean ± std).
Fig. 7: V-JEPA 2.1-1B evaluation across 3 training seeds (mean ± std).
VBench Total 逐种子配对比较:Mixed 在全部 3 个匹配训练种子上优于 Selected,增益 0.53 至 1.15 分。
Tab. 10: VBench Total 逐种子配对比较:Mixed 在全部 3 个匹配训练种子上优于 Selected,增益 0.53 至 1.15 分。
Wan 2.1-1.3B VBench 各维度得分(3 种子,均值±标准差)。
Tab. 11: Wan 2.1-1.3B VBench 各维度得分(3 种子,均值±标准差)。
V-JEPA 2.1-1B 在 SSv2 上的逐种子 top-1 准确率:Mixed 在全部 3 个匹配训练种子下排名第一。
Tab. 12: V-JEPA 2.1-1B 在 SSv2 上的逐种子 top-1 准确率:Mixed 在全部 3 个匹配训练种子下排名第一。
查看结构化数据
任务指标本文基线提升
视频生成(Wan 2.1-1.3B,VBench 总分) VBench Total(3 种子均值±标准差) Mixed 60.64±0.83 Selected 59.74±0.55;Rejected 59.42±1.06 Mixed 对 Selected 提升 0.90 分,且在全部 3 个配对种子上获胜(增益 0.53–1.15 分)
视频生成(Wan 2.1-1.3B,VBench 分项) Quality / Semantic / Total†(剔除 Dynamic Degree) Mixed:71.65 / 16.60 / 64.95 Selected:70.61 / 16.28 / 64.04;Rejected:70.25 / 16.08 / 63.73 Mixed 在三个聚合分上全部第一,剔除不稳定维度后排序不变
自监督表征学习(V-JEPA 2.1-1B,SSv2 冻结探针) Top-1 准确率(3 种子均值±标准差) Mixed 16.26±0.15% Selected 15.71±0.38%;Rejected 15.10±0.34% Mixed 对 Selected 高 0.55 个百分点,对 Rejected 高 1.16 个百分点,3 个种子下全部第一
早期预训练损失对比(两模型) 训练/验证损失排序 Wan:训练损失 Rejected 最低、验证损失 Selected 最低;V-JEPA:Rejected 全部最低 下游基准(VBench/SSv2)均选 Mixed 揭示损失与下游指标系统性分歧:低损失不能可靠指认更好的训练数据

局限与改进

作者承认的局限:研究只覆盖早期预训练,Wan 在此阶段生成动作仍不稳定,不得不在 Total† 中剔除 Dynamic Degree 维度再比较;结论只在 1.3B 与 1B 小模型、约 58 万片段预算、3 个种子下成立,规模放大后覆盖度优势是否保持未知;SSv2 top-1 仅 15% 到 16%,冻结探针对早期模型可能不够灵敏,且掩码预测损失上升与准确率上升并存的分歧机制只在附录讨论。我自己的观察:其一,Mixed 训 1 epoch 而 Selected 与 Rejected 训 2 epoch,虽然处理片段总量同为约 58 万,但单样本曝光次数不同,覆盖度与重复曝光未被完全分离;其二,四个过滤阈值与去重保留比例是手工设定,未做敏感性消融;其三,过滤分数与下游基准的相关性未量化,质量完全由四个分数和重复率代理,未覆盖字幕质量、水印等退化因素;其四,数据源单一(LLaVA-OneVision-2 视频部分),向其他分布的泛化存疑;其五,VBench 总分差距与种子间标准差同量级,部分对比未做显著性检验。

独立分析的弱点

第一,预算混淆:Mixed 训 1 epoch、Selected 与 Rejected 训 2 epoch,处理片段总量虽同为约 58 万,但单样本曝光次数不同;若改为 Mixed 采样 29 万条训 2 epoch 严格配对,可更干净地隔离覆盖度变量。第二,评估单点化:VBench 只在最终 checkpoint 评估(V-JEPA 有 SSv2 随步数曲线,Wan 的 VBench 没有),无法判断 Mixed 的领先在更长训练中会扩大还是反转。第三,质量定义狭窄:四个过滤分加重复率无法刻画字幕质量、事实一致性、水印与叠加文字等退化因素,Rejected 在下游落败也可能只因包含真正低质样本,而非证明精细过滤无益;应补充字幕质量盲评或对抗性子集分析。第四,统计功效不足:每配方仅 3 个种子,VBench 总分差距(0.5 至 1.2 分)与种子间标准差(±0.55 至 ±1.06)同量级,配对比较未做显著性检验。第五,Tab. 1 对相关工作只是能力清单式对比,缺少与 DataComp、Data-Juicer 类框架在吞吐、成本、易用性上的定量基准,基础设施贡献因此较难被独立评估。

未来方向

作者提出的方向:把选择阶段的研究扩展到切分与标注阶段,追踪这些决策在整个训练过程中的影响;依托开放的工作流支持对单个配方决策及其模型级效应的研究。基于本文成果可以延伸的方向包括:其一,把对照实验从早期预训练延伸到完整预训练与下游微调之后,检验覆盖度优势的持久性与规模效应;其二,利用 attribution-ready 的样本级决策记录做反事实数据归因,对单个生成样本回溯其贡献训练样本,走向训练数据问责与影响函数的工程化;其三,学习式选择:以下游基准信号为奖励训练数据选择策略,替代手工设定的过滤阈值与保留比例;其四,在 VidaForge-3M 的 314 万片段上系统扫描过滤阈值曲面,给出分数与下游性能之间的剂量响应曲线,回答过滤强度的边际收益;其五,把五阶段链推广到图文交错或多模态音频数据,检验结论的跨模态普适性;其六,系统比较不同标注模型与字幕级别(如 Camera 与 Caption 分别用 Gemma-4-E4B-it 与 Qwen3.6-27B-FP8 的组合)对生成与表征两条路线的差异化影响,这也是作者明确留给后续工作的配方决策之一。

复现评估

复现友好度较高但门槛不低。开源方面:论文承诺开源 VidaForge 基础设施,含可运行配方、文档与覆盖安装到使用的完整视频教程,并发布 VidaForge-3M(314 万场景级片段、6475 小时,来自 80 万源视频),数据集自带四类质量分数、PDQ 与语义重复关系、镜头描述、四级字幕与语义标签等策展信号,Rejected 池及全部决策记录也一并保留,选择阈值类实验可在零训练成本下重放,可归因设计本身就是对复现研究的巨大支持。算力是主要门槛:Wan 2.1-1.3B 每配方每种子需 32 块 H200,3 配方乘 3 种子仅生成侧就是 9 次运行;V-JEPA 2.1-1B 全局 batch 256 同样需要多机;标注需要 Gemma-4-E4B-it 与 Qwen3.6-27B-FP8 推理服务器池。中等资源的研究者可以复现:下载 VidaForge-3M、修改 Selection 阈值构造替代配方、复现 Fig. 4 的分布分析、在冻结探针层面做小规模验证;完整的从头训练对照实验则需要工业级算力支持。