← 返回 2026-08-27

FIRM-Video:先核查再打分的可靠文本到视频奖励建模 FIRM-Video: Check Before You Score for Reliable Text-to-Video Reward Modeling

Peiyuan Zhang, Xiangyu Zhao, Hongbo Liu, Xiaoxing Hu, Mingxin Liu, Shuran Ma, Yunhang Shen, Jian Hu, Haihan Gao, Haoyu Cao, Xue Yang 📅 2026-08-22 👍 4 2026-09-01 18:30
奖励模型 数据构造 文本到视频 清单验证 视频评估

清单驱动先核查后打分,蒸馏出与人类判断最一致的端到端视频奖励模型

前置知识

奖励模型

奖励模型是学习人类偏好、为生成结果自动打分的模型。在视觉生成中,它接收提示词和生成的图像或视频,输出反映质量高低或与提示一致程度的分数,可用于模型评测、数据过滤、Best-of-N 候选选择,以及强化学习对齐中的奖励信号来源。其可靠性完全取决于训练监督的质量。

本文的全部工作围绕如何构造可靠监督来训练一个 T2V 奖励模型展开,理解奖励模型的定位和用途才能明白数据构造框架为何是论文的核心贡献。

Best-of-N 采样

Best-of-N 采样指对同一提示词生成 N 个候选视频,再用奖励模型给每个候选打分、选出得分最高者。它把奖励模型的绝对打分能力直接转化为最终生成质量的提升,是衡量奖励模型实用价值的标准手段,N 越大对排序质量的要求越高。

论文用 Best-of-8 与 N=2 到 16 的缩放实验在 VBench 上验证 FIRM-Video-8B 的候选选择能力,这是三大实验之一。

点对评估与偏好评估

点对评估给单个样本打出绝对分数(如五分制),偏好评估只判断两个样本哪个更好。点对评估用 MAE(平均绝对误差)、准确率和 SRCC(斯皮尔曼等级相关系数)衡量与人类判断的一致性;偏好评估用成对偏好准确率衡量。点对分数信息量更大,可直接用于 Best-of-N 与强化学习。

论文对比的 UnifiedReward-Flex 只能输出成对偏好,而 FIRM-Video 输出可追踪的点对分数,这是理解其贡献差异的关键。

指令遵循、世界一致性与感知质量

T2V 视频质量的三个互补维度:指令遵循(IF)衡量视频是否准确完整地实现提示词要求的主体、属性、动作、场景与事件顺序;世界一致性(WC)衡量内容是否符合常识与物理规律,如运动自然、结构不变形;感知质量(PQ)衡量分辨率、清晰度、闪烁、压缩伪影等底层观感。

FIRM-Video 的清单按这三个维度分别构建,公式、数据集和实验全部围绕该三维体系展开,必须先掌握这一划分。

流水线蒸馏

蒸馏指让小模型模仿大模型或复杂系统的输出。本文的流水线蒸馏是:用多个大模型(Qwen3-32B、Qwen3-VL-235B、专有评委)离线生成高质量标注,再用这些标注全参微调一个 8B 模型,使其推理时单次前向即可复现流水线的评估质量,无需再调用任何流水线组件。

FIRM-Video 的核心卖点就是把昂贵的多阶段清单流水线蒸馏进高效端到端模型,理解这一点才能看懂方法设计与实验的动机。

研究动机

可靠评估文生视频(T2V)生成结果很困难:一条满意的视频需要忠实执行提示词、保持实体与运动的物理合理性、并提供高质量观感,对应指令遵循(IF)、世界一致性(WC)与感知质量(PQ)三个互补维度。现有评估走两条极端路线:复杂的多阶段推理流水线能提升质量但计算昂贵、难以规模化;端到端奖励模型高效,但可靠性完全取决于训练监督质量。而现有监督普遍依赖固定量规的整体评委或开放式推理(如 VideoScore2 依赖昂贵人工标注与主观的模型扩写解释,UnifiedReward-Flex 只输出成对相对偏好而非点对分数,图像版 FIRM 未处理视频时序质量),缺乏样本级、可显式验证的评估契约,导致三类缺陷:其一,检查不完整,评委只关注显著全局属性,忽略提示特定属性、物体间关系、短暂动作、时序顺序与局部视觉缺陷;其二,论证不忠实,开放式理由可能只是为已预测的分数编造的马后炮解释,而非真实反映证据与决策;其三,归因纠缠,同一开放式推理在不同维度被复用,一个瑕疵会同时被算作语义不匹配、物理不一致和感知缺陷,造成重复扣分。

本文的目标是本文的目标是构造可靠的监督数据,训练既准确又高效的端到端 T2V 奖励模型。具体包括三件事:其一,提出基于 check-before-score 原则的统一清单驱动数据构造框架 FIRM-Video,覆盖 IF、WC、PQ 三个维度:先构建维度专属清单,再对照时序视觉证据逐条核验,最后只聚合已核验的决策,得到可追溯的分数。其二,用该流水线离线合成 FIRM-Video-90K 数据集:数据来自 20 多个生成模型(含 Sora2、Veo3、HunyuanVideo、Pika2.2、Wan2.1)的 29,348 个视频、3,012 个提示词,产出 88,044 条维度级的自然语言分析加五分制分数监督。其三,构建专家逐点标注的 FIRM-Video-Bench(250 个视频、750 条五分制标注,各分数档均衡、无单档超过 30.4%),据此训练基于 Qwen3-VL-8B 与 InternVL3-8B 的 FIRM-Video-8B,目标是在人类一致性上超越 GPT-5、Gemini-3.1-Pro 等闭源模型,并在 Best-of-N 采样中提供可靠的候选排序。

与已有工作不同的是,本文的独特之处在于不改进评委架构、也不堆叠更多推理算力,而是重造训练监督的生成方式。核心洞察:可靠性瓶颈在监督数据而非推理时策略——与其让模型自由推理后自圆其说,不如离线把评估分解为可验证的是非题,让分数先于、独立于自然语言解释确定,从源头保证忠实与可追溯。三个维度的清单来源按各自本质定制是关键设计:IF 清单由提示词分解而来,同一提示生成的所有视频共享清单以保证公平;WC 清单来自不看提示词的视频接地,避免把有意的幻想与风格化误判为违规,提示词仅在解读阶段引入以区分创作意图与真实缺陷,并用目标级聚合防止内容丰富的视频被过度惩罚;PQ 采用人工策划的通用视觉缺陷分类法,提示词只用来区分有意风格。最后把结构化核验结果转写成自然语言分析,蒸馏进单一 8B 端到端模型,推理时单次前向即可完成评估,同时兼顾可靠性与效率。

核心方法

直觉上,FIRM-Video 像一位严格的审片人:不凭整体印象打分,而是拿着检查单逐条对照视频证据核验,再据核验结果汇总成分数。技术上,给定提示词与生成视频,三个维度各自执行构建清单、证据核验、分数聚合三步。指令遵循(IF):Qwen3-32B 先把提示词分解为原子是非题并赋重要性 $m_i\in\{1,...,5\}$,多模态评委逐题给出 0/1 判定 $z_i$,分数为重要性加权满足率 $s_{IF}=\sum_i w_i z_i$,$w_i=m_i/\sum_j m_j$。世界一致性(WC):Qwen3-VL-235B-A22B-Instruct 先不看提示词做视频接地,产出实体与动作目标清单,再转成核验问题,得分按重要性加权的目标级干净比例聚合 $s_{WC}=\frac{\sum_t \alpha(m_t)c_t}{\sum_t \alpha(m_t)}$。感知质量(PQ):评委按人工策划的通用缺陷清单直接给出理由与分数。三个维度的结构化结果随后转写为自然语言分析与五分制评分,构成 88,044 条监督数据,用于全参微调 Qwen3-VL-8B 与 InternVL3-8B;推理时模型单次前向输出理由与分数,无需再运行清单规划、接地和核验模型,实现了可靠性与效率的兼得。

核心创新是 check-before-score 原则:分数由已核验的清单决策聚合而成,先有分数后有解释,自然语言理由只是把已确定的决策转述成文字,从机制上杜绝了马后炮式论证。与已有工作的本质区别在于:VideoScore2 生成详细的多维评估但依赖昂贵人工标注和难以验证的主观扩写;UnifiedReward-Flex 按输入自适应准则却只给成对偏好;图像版 FIRM 未处理视频特有的时序质量。FIRM-Video 让每条判断都绑定视觉证据、输出可追踪的点对分数,并新增 WC 维度处理时序与物理合理性。两个精巧设计:其一,WC 的目标级干净比例 $c_t=1-\sum_{j\in Q_t}b_j/|Q_t|$ 提供部分得分,避免内容丰富的视频因核验问题更多而被过度惩罚;其二,清单来源按维度定制——IF 同提示共享清单、WC 无提示接地减少偏差、PQ 固定分类法保证维度纯净,从数据层面化解归因纠缠。消融显示重要性加权聚合将 WC 的 MAE 从均匀平均的 0.86 降至 0.80,验证了这些设计的必要性。

方法步骤详情

第一步,数据收集:从 Rapidata Text2Video-Human Preferences(约 3K 对)与 VideoFeedback2(约 27K 对)过滤得到约 30K 提示词-视频对,覆盖 20 多个生成模型,分辨率 256×256 至 1980×982,帧率 8–30fps。第二步,IF 两阶段:Qwen3-32B 将提示词分解为原子是非题(排除音频要求),每题重要性 $m_i\in\{1,...,5\}$,同提示视频共享清单;专有多模态评委逐题输出是/否加简短证据,无法核验视为不满足,按 $s_{IF}=\sum_i w_i z_i$ 计分,经阈值 0.35/0.70/0.85/1.00 映射为五分制。第三步,WC 三阶段:Qwen3-VL-235B-A22B-Instruct 不看提示词接地出实体与动作目标(重要性 $m_t$);Qwen3-32B 把目标转成核验问题,提示词仅用于区分有意幻想;评委判定违规 $b_j$,$c_t=1-\sum_{j\in Q_t}b_j/|Q_t|$,权重 $\alpha(m)$ 依次为 1.0/1.5/2.5/3.5/5.0,聚合后按 0.20/0.58/0.78/0.89 映射。第四步,PQ:评委按人工策划的通用缺陷清单直接产出理由与分数。第五步,数据合成:Qwen3-32B 把 IF/WC 结构化结果转写为自然语言理由(分数在此之前已确定),PQ 理由直接使用,每视频每维度一条 JSON,共 88,044 条。第六步,训练:全参微调 Qwen3-VL-8B 与 InternVL3-8B,均匀采样 8 帧,batch size 2、梯度累积 32,学习率 5×10^-6,cosine 衰减,warmup 0.05,2 个 epoch,LLaMA-Factory。

技术新颖性

从技术新颖性看,本文的创新在数据构造层面而非模型架构层面。第一,把评估契约显式化:每条判断是可验证的是非题加视觉证据,分数可逐条追溯到核验结果,这与让大模型自由推理后自行圆场的做法有本质区别。第二,重要性加权聚合经消融验证有效:WC 的 MAE 从 0.86 降至 0.80、SRCC 从 0.61 升至 0.63,IF 的放宽准确率从 0.88 升至 0.90 且误差标准差更低。第三,目标级干净比例 $c_t$ 的部分得分机制与无提示接地设计,分别解决了过度惩罚与提示偏差两个此前未被同时处理的痛点。第四,三模型协作流水线(Qwen3-32B 规划、Qwen3-VL-235B-A22B 接地、专有评委核验)只需离线执行一次,随即蒸馏进 8B 端到端模型,推理阶段单次前向完成评估,实现可靠性向效率的转化。第五,分数先于理由生成的顺序约束,直接针对开放式推理方法中论证不忠实的问题,是监督设计上的巧妙安排。

Statistics of the FIRM-Video-90K dataset.
Figure 2: Statistics of the FIRM-Video-90K dataset.
Overview of the FIRM-Video data construction framework and reward model training.
Figure 3: Overview of the FIRM-Video data construction framework and reward model training.
Human annotation interface for FIRM-Video-Bench.
Figure 5: Human annotation interface for FIRM-Video-Bench.

实验结果

在 FIRM-Video-Bench(250 视频、750 条专家标注)上:FIRM-Video-8B(Qwen3-VL)总体 MAE 0.78 全场最优,严格/放宽准确率 0.42/0.84,SRCC 0.51;基座 Qwen3-VL-8B 为 1.33,降幅约 41%;InternVL3 版 0.85(基座 1.56)。闭源中 GPT-5 总体 1.08、IF 最低 0.62;Gemini-3.1-Pro 总体 1.16;Doubao-Seed-2.0-Lite PQ 最低 0.80;流水线直接打分(表 1 带 † 行)总体 0.73,验证监督本身高质量。在 MJ-Bench-Video(2,170 视频)成对偏好准确率上:InternVL3 版 Alignment 31.93、C&C 35.35 均第一,Overall 31.06 第二,远超 GPT-5 的 26.09;Qwen3-VL 版 C&C 30.41、Fitness 32.10 均第二。Best-of-8 于 VBench,三个生成器的 Total/Quality/Semantic 全部第一:LaVie-Base Total 80.72(较次优 InternVL3-8B 80.45 提升 0.27)、Semantic 75.06;CogVideoX-2B Total 79.68(提升 1.01)、Semantic 74.28(提升 2.11);Wan2.1 Total 82.36(提升 0.66)、Semantic 72.19(提升 1.41)。N=2 至 16 缩放实验中 N≥4 后全程领先,N=16 达 80.97,超随机 1.03、超 Qwen3-VL-8B 0.33。消融确认重要性加权使 WC MAE 从 0.86 降至 0.80。

Performance comparison on FIRM-Video-Bench across three evaluation dimensions: Instruction Following (IF), World Coherence (WC), and Perceptual Quality (PQ).
Table 1: Performance comparison on FIRM-Video-Bench across three evaluation dimensions: Instruction Following (IF), World Coherence (WC), and Perceptual Quality (PQ).
Preference accuracy on MJ-Bench-Video across Alignment, C&C, Fitness, and Overall.
Table 2: Preference accuracy on MJ-Bench-Video across Alignment, C&C, Fitness, and Overall.
Best-of-N performance comparison of FIRM-Video-8B and other sampling strategies on VBench.
Table 3: Best-of-N performance comparison of FIRM-Video-8B and other sampling strategies on VBench.
Aggregation ablations on FIRM-Video-Bench.
Table 4: Aggregation ablations on FIRM-Video-Bench.
Score distributions of FIRM-Video-90K and FIRM-Video-Bench.
Table 5: Score distributions of FIRM-Video-90K and FIRM-Video-Bench.
Dimension mapping from VBench dimensions to FIRM-Video reward dimensions.
Table 6: Dimension mapping from VBench dimensions to FIRM-Video reward dimensions.
Best-of-8 results on the video-quality subdimensions of VBench.
Table 7: Best-of-8 results on the video-quality subdimensions of VBench.
Best-of-8 results on the video–condition consistency subdimensions of VBench.
Table 8: Best-of-8 results on the video–condition consistency subdimensions of VBench.
Qualitative evaluation case of FIRM-Video-8B, illustrating its improved alignment with human judgments.
Figure 1: Qualitative evaluation case of FIRM-Video-8B, illustrating its improved alignment with human judgments.
Best-of-N scaling results on VBench using LaVie-Base as the video generation model.
Figure 4: Best-of-N scaling results on VBench using LaVie-Base as the video generation model.
Qualitative example of FIRM-Video-8B evaluation (1)
Figure 6: Qualitative example of FIRM-Video-8B evaluation (1)
Qualitative example of FIRM-Video-8B evaluation (2)
Figure 7: Qualitative example of FIRM-Video-8B evaluation (2)
Qualitative example of FIRM-Video-8B evaluation (3)
Figure 8: Qualitative example of FIRM-Video-8B evaluation (3)
Qualitative example of FIRM-Video-8B evaluation (5)
Figure 10: Qualitative example of FIRM-Video-8B evaluation (5)
查看结构化数据
任务指标本文基线提升
FIRM-Video-Bench 三维评估(人类对齐) 总体 MAE 0.78(FIRM-Video-8B,Qwen3-VL;严格/放宽准确率 0.42/0.84,SRCC 0.51) 基座 Qwen3-VL-8B 为 1.33;最强闭源 GPT-5 为 1.08 较基座降低 0.55(约 41%),较最强闭源模型降低 0.30
MJ-Bench-Video 域外偏好评估(C&C 维度) 成对偏好准确率 35.35(FIRM-Video-8B,InternVL3 版,排名第一) GPT-5 为 24.54;基座 InternVL3-8B 为 22.96 较 GPT-5 提升 10.81,较基座提升 12.39
VBench Best-of-8 候选选择(LaVie-Base) Total Score 80.72(Quality 82.14,Semantic 75.06 均第一) 次优策略 InternVL3-8B 为 80.45;随机采样 79.42 较次优提升 0.27,较随机提升 1.30
VBench Best-of-8 候选选择(CogVideoX-2B) Semantic Score 74.28(Total 79.68 亦第一) 次优策略 VideoScore2 为 72.17 Semantic 提升 2.11,Total 提升 1.01
分数聚合方式消融(WC 维度) MAE 0.80(重要性加权) 0.86(均匀平均) 降低 0.06,同时准确率 0.37→0.41、SRCC 0.61→0.63

局限与改进

作者明确承认的局限:本研究只通过人类对齐评估与 Best-of-N 采样验证了 FIRM-Video-8B 作为可靠奖励信号的能力,尚未用它直接优化 T2V 生成器,未来需要结合强化学习或偏好优化。我补充几点观察:其一,数据构造依赖专有多模态评委与 Qwen3-VL-235B-A22B、Qwen3-32B 两个大模型,构造成本高,且专有评委是黑盒,其系统性偏差会原样进入监督数据。其二,PQ 维度分布严重右偏:FIRM-Video-90K 中 62.5% 样本为 4 分、仅 3.0% 为 1 分,低质量样本稀缺可能限制模型对劣质视频的判别力。其三,训练与推理只用 8 帧均匀采样,而论文自己强调短暂动作、时序顺序是易被忽略的失败模式,固定稀疏采样与之存在张力。其四,分数映射阈值(IF 的 0.35/0.70/0.85/1.00、WC 的 0.20/0.58/0.78/0.89)为经验设定,缺乏理论依据。其五,FIRM-Video-Bench 仅 250 视频 750 标注,规模较小;Best-of-N 实验采用人工设计的 VBench 维度映射逐维选优,而非统一分数,落地时需要额外工程。

独立分析的弱点

独立分析后,我认为有五个值得注意的弱点。第一,专有评委不可复现也不可审计:若它在某类内容(如快速运动、非真实风格)上有系统性盲区,这些偏差会被蒸馏进 FIRM-Video-8B 并固化;改进方向是替换为多个开源评委投票加一致性过滤,或至少公开评委提示与人工抽检协议。第二,IF 清单的原子性与重要性 $m_i$ 完全由 Qwen3-32B 主观决定,错误分解(遗漏或合并要求)会直接扭曲加权分数;改进方向是用少量人类标注校准权重,或让分解与核验两个阶段迭代互检。第三,8 帧均匀采样叠加无法核验视为不满足的规则,会系统性低估含快速动作或长时序事件的视频,而这恰是 IF 定义中强调的要素;改进方向是自适应关键帧采样,或先做时序定位再针对性核验。第四,WC 的覆盖面受接地模型召回率制约,漏检的实体或动作根本不会进入清单,检查不完整问题只是被缓解而非根除;改进方向是多接地模型取并集加召回导向的补全。第五,三个维度的分数如何融合成单一奖励用于强化学习并未给出,VBench 实验靠维度映射表回避了这一问题;改进方向是学习分数融合函数或维度条件化奖励。

未来方向

作者提出的方向:把 FIRM-Video-8B 接入强化学习或偏好优化,在生成过程中直接改进指令遵循、世界一致性与感知质量。基于其成果还可以延伸:其一,用该奖励模型对视频 DiT 做 GRPO 类训练,并研究清单式奖励的可利用性——策略是否学会逐条满足清单而整体不自然,即奖励黑客问题,这正好检验 check-before-score 的鲁棒性;其二,把三个维度的点对分数扩展为可微奖励或学习到的融合函数,支撑端到端强化学习;其三,扩展到长视频、音频一致性、多轮迭代编辑,以及与图像版 FIRM 的统一;其四,流水线全开源化,研究监督质量随视频数量、维度数、评委能力的缩放规律;其五,让模型在推理时自生成清单再自评(测试时自我核验),把离线蒸馏获得的可靠性转化为在线推理时扩展的收益;其六,扩充 FIRM-Video-Bench 至更大规模,加入多语言与对抗性提示,检验跨分布的人类对齐。

复现评估

复现条件评估:代码开源于 github.com/VisionXLab/FIRM-Reward,模型与数据发布在 HuggingFace 的 VisionXLab/firm-reward 集合;三个源数据集(Rapidata Text2Video-Human Preferences、VideoFeedback2、VideoPhy2)公开可得,附录 D 还完整给出推理提示词。训练门槛较低:8B 模型全参微调,每视频均匀采样 8 帧,batch size 2 加梯度累积 32,学习率 5×10^-6,2 个 epoch,LLaMA-Factory 框架,8 卡 A100 量级即可完成,输入为文本加帧图像,显存友好。主要障碍在数据构造:需要调用 Qwen3-32B、Qwen3-VL-235B-A22B-Instruct 与一个未公开的专有多模态评委,对 29,348 个视频逐维执行多阶段核验,API 与算力成本可观;此外重要性赋值、分数映射阈值等细节依赖对论文的忠实执行。综合判断:复现 Bench 评测与模型训练难度中低,完整复现 90K 数据构造难度中高,建议按此顺序推进。