← 返回 2026-08-20

VA-Judger:基于人类偏好反馈的音视频联合生成奖励模型 VA-Judger: Reward Modeling from Human Preference Feedback for Joint Video-Audio Generation

Yinming Huang, Shuyuan Tu, Xi Yan, Zihan Yang, Jianhua Han, Xu Hang, Yu-Gang Jiang, Zuxuan Wu 📅 2026-08-19 👍 11 2026-08-25 18:30
GRPO 人类偏好对齐 奖励模型 强化学习后训练 音视频联合生成

首个用人类反馈训练的音视频联合生成思维链奖励模型,取代易被hack的专家指标

前置知识

奖励模型(Reward Model)与 RLHF

奖励模型是从人类偏好数据中学出的判别器:给定两个生成结果,预测人类更偏好哪一个,其输出随后作为强化学习的奖励信号去微调生成模型。经典 RLHF 流程为「人类标注偏好 → 训练奖励模型 → 用 PPO/GRPO 等算法优化策略」,OpenAI 的 InstructGPT 和图像领域的 ImageReward 都遵循这一范式。

本文全部贡献围绕这条流水线展开:构建 VAPref-10K 偏好数据、训练 VA-Judger 奖励模型、再用它后训练 LTX-2。不理解 RLHF 就无法理解「奖励与人类对齐」为何是本文的核心卖点。

GRPO(Group Relative Policy Optimization)

DeepSeekMath 提出的在线强化学习算法:对同一输入采样一组 G 个回答,用组内奖励的均值和标准差把奖励归一化为优势 $A_i=(R_i-\bar{R})/(\sigma_R+\epsilon)$,再以带裁剪和 KL 惩罚的代理目标更新策略,省去了 PGO/PPO 中额外的价值网络,训练更稳定省显存。

本文第三阶段提出 Dimension-wise GRPO,把「二选一对错」的稀疏奖励扩展为逐维度可验证奖励,但整体仍建立在 GRPO 框架之上,看不懂 GRPO 就读不懂公式 (2)。

奖励 hacking(Reward Hacking)

当奖励函数与真实目标(人类满意)存在系统性偏差时,策略会钻空子:把奖励分数刷得很高,却生成人类觉得糟糕的内容。文中实证:OmniNFT 优化 DeSync 等独立指标后同步分确实变好(0.430→0.226),但三方人类评测中仅获 27.63% 偏好,远低于用整体奖励的 62.30%。

这是论文的立论动机:分维度专家指标与人类判断的一致率只有 50.43%–56.88%,拿它们当奖励必然被 hack,VA-Judger 的存在意义就是提供难以被 hack 的整体奖励。

思维链(Chain-of-Thought, CoT)

让模型在给出最终答案前先输出结构化推理过程。VA-Judger 在 标签内按五个维度(提示对齐、音画一致性、音频质量、视频质量、完整性与连贯性)给两个候选各打 1–10 分并附理由,再汇总总分,最后在 标签输出「video k is better」。

CoT 让奖励模型可解释,也是「逐维度奖励」能成立的前提:只有模型显式输出各维度分数,第三阶段才能对每个维度的评分排序施加可验证奖励;三阶段训练都在打磨这种结构化输出。

拒绝采样与课程学习

拒绝采样:让强模型(Gemini 3.1 Pro)生成推理答案,只保留最终选择与人类标注一致的样本用于 SFT,从而把不可靠的模型监督过滤为可靠监督。课程学习:先用质量差距明显的「简单对」教会模型输出格式与粗判别,再上「困难对」(同模型同提示、不同随机种子)学习细粒度比较。

Stage 1/2 的核心技巧:Gemini 在简单对上与人类一致率 80%,在困难对上仅 60%,这个落差决定了何时必须引入人类标注 + 拒绝采样(蒸馏出 4.5K 可靠样本),是理解训练管线的关键。

音视频联合生成(Joint Video-Audio Generation)

从文本提示同时生成视频画面与同步音频(对白、环境声、音乐)的任务,代表模型有闭源的 Sora 2、Veo 3.1、Kling,开源的 LTX-2、Ovi、OmniNFT 等。核心难点是跨模态语义一致性:声音要对应画面事件、口型要匹配对白、情绪要协调。

本文是该任务上第一个用人类反馈做奖励建模的工作;此前图像/视频领域的偏好数据与奖励模型(Pick-a-Pic、VideoReward)都观察不到音频流,原理上无法迁移,理解任务特性才能体会填补的空白。

研究动机

用强化学习后训练音视频联合生成模型时,奖励信号是最大瓶颈。现有做法(如 OmniNFT)把一批单维度专家指标加权拼成奖励:视频质量用 VideoAlign/HPSv3,音频质量用 Audiobox Aesthetics,文本-音频对齐用 CLAP,音画同步用 DeSync/Synchformer。问题有两个层面。第一,这些指标各自只观察一种属性甚至一个模态——VideoAlign 根本收不到音频流,SynchFormer 只估计时间偏移而不判断同步的声音语义是否正确——无法刻画文本、视频、音频之间的整体语义与时间一致性;一个同步分很高的样本可能演的是完全错误的事件。第二,它们与人类判断严重脱节:在本文构建的 1,150 对 VA-Judger-Bench 上,七类代表性指标的总体准确率仅 50.43%(AudioBox)到 56.88%(Javis Score),VideoAlign 在域外闭源模型数据上更是从 62.39% 跌至 48.35%,接近随机猜测。拿这样的信号做 RL 会系统性诱导 reward hacking:模型刷高单项分数,产出在人类看来割裂、不忠实的内容。

本文的目标是本文要为音视频联合生成打造一个与人类偏好对齐、可解释、可直接用作 RL 奖励的评估信号,并配套补齐数据和评测两个前置缺口。目标分解为四步:(1)构建 VAPref-10K——首个面向音视频联合生成的大规模人类偏好数据集,含约 9K 提示和 10.3K 细粒度成对比较,标注者从同一提示的两个生成结果中选出偏好方,并勾选支撑决策的质量维度;(2)提出 VA-Judger-Bench,含 400 简单对、250 域内对、500 域外对(域外来自 Kling 2.6、Wan 2.6、Veo 3.1 Fast/Quality、Sora 2 等闭源模型的输出),专门检验奖励模型与人类的对齐度及跨模型泛化力;(3)训练 VA-Judger:一个基于 Qwen3-Omni 的思维链全模态奖励模型,按五维评分表给出结构化、可解释的判断;(4)把 VA-Judger 作为奖励对 LTX-2 做后训练,验证改进能同时体现在自动指标和 20 人三方人类评测中。

与已有工作不同的是,切入角度的独特性有三点。其一,任务真空:图像领域有 Pick-a-Pic/ImageReward,视频领域有 LiFT/VideoReward,但没有任何偏好数据或奖励模型观察过音频流,也就无法判断「声音是否匹配画面事件」;而音视频偏好本质上是跨模态、不可分解的——先单独评估各模态再加权,原理上就无法恢复人类对完整体验的整体判断,本文是第一个直接对文本-视频-音频整体做人类偏好建模的工作。其二,数据构造的「难度感知」设计:训练对刻意分成两个池——4.4K 对质量差距明显的跨模型对(OVI vs LTX-2 等)与 9.8K 对同模型不同种子的细差距对,前者学格式与粗判别,后者逼模型细看微妙音画缺陷,避免全简单对导致的表层过拟合或全困难对导致的训练不稳。其三,监督信号的粒度:标注不只记录「选哪个」,还记录「哪些维度支撑了这个选择」,使第三阶段能对逐维度评分排序施加可验证奖励,比单一二元偏好标签密集得多。

核心方法

直觉上,VA-Judger 把「哪个视频更好」这个原本由一堆互不相通的小模型分数近似的问题,交给一个能同时看视频、听音频、读文本的多模态大模型,让它像人类评审一样按固定评分表逐维度比较后再下结论。技术上,任务形式化为带结构化维度推理的成对偏好预测:输入为文本提示 $p$、两个音视频片段 $x_1=(v_1,a_1)$ 与 $x_2=(v_2,a_2)$,模型在 中对五个维度——(A) 提示对齐、(B) 音画一致性、(C) 音频质量、(D) 视频质量、(E) 完整性与连贯性——各给 1–10 分并写明理由,汇总总分后在 中输出偏好。训练分三阶段递进:Stage 1 用 Gemini 3.1 Pro 在 4.4K 简单对上生成评分表格式的 CoT 做冷启动 SFT(Gemini 在 200 对试点中与人类一致率 80%);Stage 2 在困难对上做人类校验的拒绝采样 SFT(Gemini 一致率仅 60%,故只保留最终选择与人类标注一致的 4.5K 样本);Stage 3 提出维度 GRPO,用「答案对错 + 逐维度评分排序是否支持人类决定」的复合可验证奖励做在线强化学习。底座为 Qwen3-Omni-30B-A3B-Instruct,冻结视觉与音频编码器,语言骨干全参微调。

核心创新是「从人类偏好中学习奖励」这一范式在音视频联合生成上的首次落地,以及对稀疏二元偏好标签的维度分解。与 OmniNFT 等把 VideoAlign、Audiobox、CLAP、Synchformer 等独立专家分拼接成奖励不同,VA-Judger 的奖励是从整体人类比较中学出的单一模型,天然捕捉「声音语义是否匹配画面事件」「情绪是否协调」这类跨模态交互,而这正是单模态指标在原理上无法覆盖的盲区。第二个关键设计是维度级可验证奖励:作者观察到只有「最终答案对不对」一个二元信号太稀疏,模型可能蒙对赢家却给出互相矛盾的维度分,学到捷径而非真实跨模态推理。于是对每个 rollout,奖励由两部分组成:$r_{ans}(o)=\mathbb{1}[\hat{y}=y^\star]$ 验证最终偏好是否正确,$r_{dim}(o)=\frac{1}{|D_h|}\sum_{d\in D_h}\mathbb{1}[s_{d,y^\star}>s_{d,3-y^\star}]$ 检查每个人类指定维度 $d$ 上的评分排序是否与人类决定一致,总奖励 $R_i=\frac{1}{2}(r_{ans}(o_i)+r_{dim}(o_i))$。靠编造维度分蒙对的回答只能拿一半奖励,这迫使模型发展忠实的跨模态推理而非表面捷径。

方法步骤详情

Step 0(数据):从 YouTube、Bilibili、电影、剧集收集 10,173 条真实音视频,剪成 5–10 秒并归入六类(多人对话 27.2%、音乐 24.5%、环境事件 15.5% 等);用 Qwen3.5-Omni 打多模态字幕,再用 Qwen LLM 去时间戳、改写为生成可用的提示,得 10,083 条;交给 OVI、LTX-2、DaVinci-MagiHuman 生成候选,构建 4.4K 简单对(跨模型、差距大)与 9.8K 困难对(同模型同提示、不同种子)。Step 1(简单冷启动):Gemini 3.1 Pro 为简单对生成五维评分 CoT,SFT 教会模型评分表格式与粗粒度判别。Step 2(困难对齐):人类标注者为每个困难对选出偏好方并给出支撑维度;Gemini 生成 CoT 后做拒绝采样,仅保留最终选择与人类一致的样本,得 4.5K 条人工校验数据继续 SFT。Step 3(维度 GRPO):从困难 SFT 检查点出发,每对采样 8 个回答(温度 1.0),按 $A_i=(R_i-\bar{R})/(\sigma_R+\epsilon)$ 组内归一化优势,以带裁剪和 KL 惩罚的目标更新;漏掉任何维度分的回答记零奖励。训练配置:SFT 用 8 卡 BF16 + ZeRO-3,学习率 $5\times10^{-6}$,有效批 128,每视频最多 12 帧×128 视觉 token;GRPO 用 Adafactor,学习率 $1\times10^{-6}$。

技术新颖性

技术新颖性体现在四点。(1)首个音视频偏好奖励模型:把 RLHF 式奖励建模从图像/视频扩展到音视频联合生成,填补了「音频流不可观察」造成的评估真空。(2)难度感知的课程化数据构造:明确论证全简单对会过拟合表层模型特征、全困难对学不动评分格式,用跨模型易对 + 同模型种子间难对的组合应对,并给出 Gemini 一致率从 80%(易)跌到 60%(难)的实证来说明何时必须引入人类监督——这种「一致性阈值驱动的数据分层」本身是可复用的方法论。(3)维度级 GRPO:把人类标注的支撑维度集合 $D_h$ 变成可验证奖励的一部分,使 RL 不只优化答案正确率,还约束推理过程与人类理由一致,区别于 VideoReward 等只回归标量偏好、UnifiedReward 等只覆盖单模态的工作。(4)奖励即裁判的可插拔性:在 OmniNFT 的 RL 框架中原样替换五个专家奖励——每个 prompt 生成 8 个候选构成 28 对,VA-Judger 两两评判后,把维度 C 的均分路由为音频奖励、维度 D 路由为视频奖励、A/B/E 平均作为共享跨模态奖励——证明结构化 CoT 评分可直接分解为模态级 RL 信号。

Overview of the VA-Judger training pipeline. Stage 1 cold-starts the model on easy preference pairs. Stage 2 aligns the model on harder pairs through human rejection sampling. Stage 3 performs GRPO using answer-level and dimension-level rewards grounded in human reasons.
Figure 2: Overview of the VA-Judger training pipeline. Stage 1 cold-starts the model on easy preference pairs. Stage 2 aligns the model on harder pairs through human rejection sampling. Stage 3 performs GRPO using answer-level and dimension-level rewards grounded in human reasons.
Overview of VAPref-10K construction and the raw data distribution.
Figure 6: Overview of VAPref-10K construction and the raw data distribution.
Distribution of the source videos across the six categories in VAPref-10K.
Figure 7: Distribution of the source videos across the six categories in VAPref-10K.

实验结果

实验分三块。第一块,奖励模型评测(Table 1,1,150 对):七类专家指标总体准确率仅 50.43%–56.88%,VideoAlign/AudioBox 从简单集的 62.39%/58.70% 跌至域外的 48.35%/44.00%,接近抛硬币;底座 Qwen3-Omni(CoT)为 57.83%。VA-Judger 三阶段逐级提升:简单冷启动 62.35% → 困难 SFT 65.91% → 维度 GRPO 68.43%(简单 76.25 / 域内 66.00 / 域外 63.40),比底座高 10.60 个百分点,证明课程设计与维度奖励各自有效。第二块,生成后训练(Table 2,JavisBench 随机 200 prompt,LTX-2 底座、冻结骨干只训 LoRA):在 13 项 JavisBench 指标中 11 项、7 项补充指标中 6 项排第一;相比原版 LTX-2,VQ 2.248→3.942、运动质量 0.697→1.183、音频质量 4.767→5.610,JavisScore 0.074→0.230、AVHScore 0.091→0.261。与 OmniNFT 对比:后者在其优化的 DeSync 上更好(0.226 vs 0.592,越低越好),但人类整体偏好大幅落后——典型的 reward hacking 证据。第三块,人类评测(Figure 4,20 名被试、200 组三方强制选择):VA-Judger 版本获 62.30% 偏好,OmniNFT 27.63%,原版 LTX-2 仅 10.08%,约为基线的 2.3 倍与 6.2 倍,说明自动指标的提升确实转化为人类可感知的质量。

Accuracy (%) against human pairwise preferences. Single-dimension evaluation metrics and reward models are both evaluated on the 1,150-pair VA-Judger-Bench and report Total Acc / Parsed Acc.
Table 1: Accuracy (%) against human pairwise preferences. Single-dimension evaluation metrics and reward models are both evaluated on the 1,150-pair VA-Judger-Bench and report Total Acc / Parsed Acc.
Results on the randomly sampled 200-prompt JavisBench subset. Best results are highlighted in green and second-best results are underlined.
Table 2: Results on the randomly sampled 200-prompt JavisBench subset. Best results are highlighted in green and second-best results are underlined.
Category distributions of the full JavisBench pool and the random evaluation subset.
Table 3: Category distributions of the full JavisBench pool and the random evaluation subset.
Human preference accuracy (%) of video-quality metrics.
Table 4: Human preference accuracy (%) of video-quality metrics.
Human preference accuracy (%) of audio-quality metrics.
Table 5: Human preference accuracy (%) of audio-quality metrics.
Human preference accuracy (%) of text-video and text-audio consistency metrics.
Table 6: Human preference accuracy (%) of text-video and text-audio consistency metrics.
Human preference accuracy (%) of audio-video semantic-consistency metrics.
Table 7: Human preference accuracy (%) of audio-video semantic-consistency metrics.
Human preference accuracy (%) of synchronization and aggregate audio-video metrics.
Table 8: Human preference accuracy (%) of synchronization and aggregate audio-video metrics.
Qualitative comparisons of LTX-2, OmniNFT, and our VA-Judger post-trained model. VA-Judger better follows the requested temporal actions in both examples.
Figure 3: Qualitative comparisons of LTX-2, OmniNFT, and our VA-Judger post-trained model. VA-Judger better follows the requested temporal actions in both examples.
Human preference rates over 200 three-way comparisons. For each prompt, participants select the best video-audio output among LTX-2, LTX-2 post-trained with OmniNFT, and LTX-2 post-trained with VA-Judger.
Figure 4: Human preference rates over 200 three-way comparisons. For each prompt, participants select the best video-audio output among LTX-2, LTX-2 post-trained with OmniNFT, and LTX-2 post-trained with VA-Judger.
查看结构化数据
任务指标本文基线提升
奖励模型与人类偏好一致率(VA-Judger-Bench 全量 1,150 对) Total Acc(%) 68.43 最佳专家指标 Javis Score 56.88;底座 Qwen3-Omni CoT 57.83 较最佳指标 +11.55pp,较底座 +10.60pp
域外泛化(500 对闭源模型:Kling 2.6/Wan 2.6/Veo 3.1/Sora 2 输出) Total Acc(%) 63.40 VideoAlign 48.35 +15.05pp
LTX-2 后训练生成质量(JavisBench 随机 200 prompts) 视频质量 VQ(↑) 3.942 LTX-2 原版 2.248 +1.693
同上 JavisScore(音画整体一致性,↑) 0.230 LTX-2 原版 0.074 +0.156
同上 AudioBox CE(音频质量,↑) 5.136 LTX-2 原版 3.957 +1.179
人类三方评测(20 人 × 200 组强制选择) 人类偏好率(%) 62.30 OmniNFT 27.63;LTX-2 原版 10.08 约为 OmniNFT 的 2.3 倍、底座的 6.2 倍

局限与改进

作者承认与可观察的局限如下。(1)绝对精度仍有限:即便经过 GRPO,域外对准确率也只有 63.40%,整体 68.43%,意味着约三成判断与人类相左;作为 RL 奖励时这些错误信号仍可能被策略放大。(2)CoT 生成依赖闭源 Gemini 3.1 Pro:Stage 1/2 的推理链全部由它离线生成,作者也明确说明其付费 API 无法承担在线奖励调用,因此奖励推理虽是开源底座,数据管线无法在纯开源环境复现。(3)评测规模偏小:人类评测仅 20 人、200 组三方比较;VA-Judger-Bench 共 1,150 对,统计置信区间不窄。(4)我观察到的额外问题:后训练模型的 DeSync 从 0.430 恶化到 0.592(数值越高越不同步),尽管人类总体更偏好,说明整体偏好奖励可能以牺牲精确的口型/事件同步为代价;Table 2 中 AB-CU 指标相比 OmniNFT 也微降 0.031。(5)困难对几乎全部来自「同模型不同种子」,生成器间系统性风格差异覆盖不足,域内基准仅 250 对。(6)五维等权求和的总分制与人类真实决策过程(维度间可补偿/不可补偿的权衡)的等价性未被验证,总分是离散值且易受个别维度支配。

独立分析的弱点

独立分析的弱点与改进方向:(1)奖励调用成本高——每 prompt 8 候选需 28 次成对评判,是 O(G²) 次多模态前向,且每次都生成完整 CoT,推理开销远高于直接回归标量的奖励头,大规模 RL 训练时奖励服务会成为吞吐瓶颈;可先训练一个蒸馏自 CoT 的轻量打分头做初筛,只对分差接近的对跑完整推理。(2)维度奖励只检查 $s_{d,y^\star}>s_{d,3-y^\star}$ 的方向而不校准幅度,模型可能学会在「人类在意的维度」上打极端分来讨好奖励函数,产生新的、更隐蔽的 reward hacking;可引入维度重要性加权或分数校准回归。(3)训练对只由 OVI/LTX-2/DaVinci-MagiHuman 三个开源模型生成,域内基准也来自同分布,面对快速迭代的闭源模型(论文域外准确率仅 63.40% 即为证据),奖励的时效性存疑;可建立持续收集人类反馈的飞轮,用 DPO 式离线更新而非重跑三阶段。(4)五维评分表是人工设定的,维度完备性未经验证——长时一致性、角色身份保持、音乐情绪匹配等均未显式建模;可让标注者自由填写理由中的维度再聚类归纳,数据驱动地演化评分表。(5)总分等权求和与人类「不可补偿」式否决行为不符(音频刺耳时画质再高也可能被直接否决),可在 RL 奖励中学习维度间的非线性聚合。

未来方向

作者提出方向之上的延伸:(1)把 VA-Judger 奖励扩展到长时程生成(如 JoyAI-Echo 类长视频),5–10 秒对上学到的评判标准需要升级以处理跨镜头叙事一致性与分段劣化的累积;(2)与 Baton 等语义蓝图方法、JavisDiT++ 等偏好优化方法结合,探索奖励模型反过来指导生成端中间表示的构造;(3)论文只在 LTX-2 一个策略模型上验证,考察奖励的多底座、多分辨率可迁移性是自然下一步。基于本文成果可延伸的方向:(4)过程奖励——VAPref-10K 已含支撑维度标注,可进一步收集维度内的时序定位信息,训练能指出「哪一秒发生音画失配」的定位式奖励模型;(5)在线反馈闭环——把 62.30% vs 27.63% 的人类评测流程产品化,让真实用户偏好持续回流更新奖励模型,缓解其随生成器迭代而过时的问题;(6)奖励模型集成与不确定性估计——对高争议对输出弃权信号交回人类仲裁,降低 RL 中错误奖励被策略放大效应;(7)把「结构化可验证奖励优于二元偏好」这一结论带回纯视频/纯图像领域做对照实验,检验其普适性。

复现评估

复现评估:代码已开源(github.com/ShareLab-SII/VA-Judger),底座 Qwen3-Omni-30B-A3B-Instruct 与 LTX-2 19B 均开源;论文给出了 VAPref-10K 与 VA-Judger-Bench 的完整构建管线、类别分布与训练超参,若数据随仓库发布则数据侧复现性较好,但源视频来自 YouTube/Bilibili/影视,存在版权与下架风险。算力门槛中高:SFT 用 8 卡(BF16、DeepSpeed ZeRO-3、优化器卸载、有效批 128、最长序列 24,576),GRPO 从困难 SFT 检查点继续,LTX-2 后训练需 6 卡 FSDP 训练加 2 卡 VA-Judger 批量推理服务器,涉及 30B 级 MoE 全参微调与 19B 扩散模型 LoRA RL(rank 32)。主要难点有三:(1)Stage 1/2 的 CoT 依赖 Gemini 3.1 Pro 付费 API,且 10.3K 对的人类偏好与支撑维度标注成本无法规避,论文也未报告标注者间一致性系数,偏好噪声水平难以估计;(2)奖励服务吞吐——8 候选 × 28 对 × 完整 CoT 生成的多模态推理需要 vLLM 级工程优化;(3)扩散模型 RL 的训练稳定性对超参敏感。总体属「有代码有数据即可复现主结果、完整管线复现需预算与标注团队」的中等偏难级别;仅复算评测表格(Table 1)则门槛低得多。