← 返回 2026-07-31

RefCaptioner:多参考图锚定的视频描述生成 RefCaptioner: Multi-Reference Image-Grounded Video Captioning

Tengfei Liu, Yang Shi, Yuran Wang, Xiaohan Zhang, Yuqing Wen, Yuqi Tang, Qixun Wang, Zhuoran Zhang, Xuanyu Zhu, Weihong Lin, Xinlei Yu, Yujie Wei, Xinwei Long, Fengxiang Wang, Xinlong Chen, Yue Ding, Jialu Chen, Haotian Wang, Yuanxing Zhang 📅 2026-07-30 👍 30 2026-08-05 19:06
GRPO强化学习 参考图锚定 多模态大模型 视觉定位 视频描述

提出多参考图锚定的视频描述新任务,用两阶段后训练实现短语级图像标签绑定。

前置知识

多模态大语言模型 (MLLM)

把视觉编码器(如 ViT)与语言模型(如 Qwen)拼接,能同时吃图像、视频和文本,输出自然语言的模型。本文用 Qwen3-VL-8B-Instruct 作为基座,它先把视频抽帧编码,再与文本 token 一起喂给语言模型生成描述。

RefCaptioner 本质上是对 MLLM 做后训练,理解基座模型的输入输出格式和视觉 token 机制才能看懂方法。

视频描述 (Video Captioning)

任务是给一段视频生成一段自然语言描述,覆盖主体、外观、动作、背景、镜头、风格等信息。早期用 BLEU/CIDEr 等词汇重叠指标评测,现在转向 VDC、VCapsBench 这类评估事实正确性和覆盖度的 benchmark。

本文在标准视频描述基础上叠加了「参考图锚定」的新要求,理解原任务的评测维度才能看清新任务的增量在哪。

GRPO (Group Relative Policy Optimization)

一种强化学习微调方法:对每个输入采样一组候选输出(本文采样 6 个),用奖励函数打分,在组内做归一化得到 advantage,再用 PPO 风格的 clipped 目标更新策略。相比 PPO 不需要单独的 critic 网络,省显存。本文用的是作者改造的分层覆盖折扣版 HCD-GRPO。

本文方法的核心是设计了一组多层级奖励函数并通过 GRPO 优化,不懂 GRPO 就无法理解第二阶段为什么有效。

SFT + LoRA 微调

SFT 是用带标签的指令数据做监督学习,让模型学会期望的输出格式。LoRA 是只训练注入到注意力层和前馈层的低秩矩阵(本文 rank=64),冻结主干,大幅降低显存。本文第一阶段用 LoRA SFT 教会模型插入 标签。

两阶段框架的第一阶段就是 LoRA SFT,理解它和 GRPO 的衔接(SFT 初始化策略,GRPO 全参微调)是看懂训练流程的关键。

参考条件视频生成/编辑

给一段文本和几张参考图(人物、物体、场景),让视频生成模型产出保持参考身份的视频。代表工作有 Movie Weaver、MultiRef-Compass 等。这类任务严重依赖参考图与视频的精确对齐。

本文的描述任务正是为这类下游生成任务服务的——描述里嵌入的图像标签把生成时该用哪些参考、绑到哪个主体告诉生成器,是上游赋能。

研究动机

现有视频描述模型(如 Qwen3-VL、InternVL3.5、Keye-VL)能流畅地叙述视频内容,但当给定一批候选参考图时,无法把局部视觉元素和对应参考图显式对应起来。这带来三个具体难题:其一,参考选择歧义——给一组图中既有真正相关的正面参考、又有视觉相近的干扰项,模型不知道该用哪些;从 Table 1 看,Qwen3-VL-8B-Instruct 的 Ref-Tag-R 只有 0.711、Eff-Bind 只有 0.599,InternVL3.5-8B 的 Eff-Bind 更低到 0.271。其二,短语级绑定错误——即便选对了图,多主体场景里模型常把不同人的衣服、身份、动作标签串错,Table 2 的两阶段 CaptionRefine 即使加第二轮润色,Ref-Bind 也只有 0.805(InternVL3.5-38B)。其三,跨参考一致性差——同一主体的多视角参考图本应聚到同一短语后,模型却把它们拆开或漏掉,Subj-F1 普遍偏低。此外,约 40% 的 MRVBench 样本含注入干扰项,基线模型 FalseRef-Any 普遍在 0.15–0.67,说明大量误用。

本文的目标是本文要造一个能同时做好四件事的模型:生成事实正确且详尽的视频描述;从候选参考池中选出真正被视频支持的图;把每张选中图的 标签精确插到它描述的那个名词短语之后;当多张参考图画的是同一主体(不同视角/姿态/外观)时把它们聚到同一短语后,同时拒绝所有干扰图。更具体地,作者要求在自建的 MRVBench 上做到 Ref-Tag-P≈1.0 且 Ref-Tag-R 尽可能高、Dist-Rej≈1.0、FalseRef-Any≈0,并且在通用 benchmark VDC/VCapsBench 上不掉点,最好还能超越基座 Qwen3-VL-8B,证明新任务能力不损害通用描述质量。

与已有工作不同的是,近期参考条件视频生成(Movie Weaver、LumosX、MV-S2V)和编辑(Kiwi-Edit、ReBind)很火,但它们都把参考-视频对齐当作生成端的隐式能力,几乎没人显式研究「能不能在描述文本里把这种对齐表达出来」。评测层面,OpenS2V-Nexus、MultiRef-Compass 这些 benchmark 关注的是生成端的主体保持,没有一个评估 MLLM 能否在描述中做短语级多参考锚定。作者抓住了这个被忽视的空白:既提出新任务、又配套造了 MRVBench(462 视频、3,831 参考图、2,172 QA 对、约 40% 含干扰项),还设计了专门的分层奖励把这件事端到端学会,而不是用两阶段后处理硬补。

核心方法

直觉上,作者希望模型写描述时像人在做「图—文对照填空」:写到「一位女士」时,把画她的几张参考图标签贴上;写到「红裙子」时,贴画裙子的那张;写到「石桥」贴桥的,绝不贴不相关的伞。技术路线是两阶段后训练。第一阶段做混合数据 SFT:一半是带 标签的人工核验多参考描述(教选择和绑定格式),一半是标准视频描述(保住事实覆盖和细节)。第二阶段做 HCD-GRPO,对每个输入采样多条候选描述,用「覆盖折扣」式奖励打分——做对的覆盖给正分,可观测的错误(事实错、绑错、用干扰、拆组)按权重折扣掉,再用 GRPO 更新。视觉编码器和视觉-语言融合层全程冻结,只动语言模型。

核心创新是「分层覆盖折扣奖励」(Coverage-Discounted Reward)的设计哲学:正信号只来自有用的覆盖,任何可观测错误都按系数折扣该信号,使得模型没法靠「少贴标签躲绑定」或「多贴标签蹭覆盖」来骗分。具体到参考分支,作者把奖励拆成三个互补子项:正确绑定参考覆盖 $C_{ref}$(只对绑定判定正确的参考计数,防止错绑蹭分)、DAES 干扰感知证据抑制(一旦用了任何不在视频里的参考图就触发 $E_{DAES}=1$ 的惩罚)、CRSC 跨参考语义一致性(用 $A_{CRSC}$ 衡量同一主体的多张参考是否被聚到同一短语,公式 $A_{CRSC} = \frac{1}{|E_{multi}|}\sum_e \max(0, \frac{|b\hat{T}_e(y)\cap T_e^*|}{|b\hat{T}_e(y)\cup T_e^*|})$)。再叠加一个确定性守卫(deterministic guard):输出含乱造/非局部/违禁标签时直接把奖励封顶到 $R=\min(R_{raw},0.2)$。这种「软覆盖折扣 + 硬结构守卫」的组合是和普通 GRPO+单点奖励最本质的区别。

方法步骤详情

完整流程分两阶段。阶段一 SFT:用 Qwen3-VL-8B-Instruct 初始化,冻结视觉编码器和投影层,在语言模型的注意力与 FFN 注入 LoRA(rank=64, alpha=128, dropout=0.05),用 AdamW、lr=$1\times10^{-4}$、cosine、3 epoch、BF16+DeepSpeed ZeRO-2、8×H800 训练;数据是 Dmr 与 Dcap 1:1 混合,视频按 2 fps 抽帧、帧限 602,112 像素、参考图限 401,408 像素,最大序列 18,000 token,目标就是标准 next-token prediction。阶段二 HCD-GRPO:从 SFT checkpoint 出发,解冻整个 LM(不再用 LoRA),用 12,838 训练样本;每次更新对 16 个 prompt 各采 6 条回复(共 96 条,每条 ≤512 token),算双分支奖励——描述分支 $R_{cap}$ 用关键点覆盖奖励并按视频 QA 错误以 $\lambda_{qa}=0.5$ 折扣($R_{cap}=\frac{1}{K}\sum_k s_k\cdot(1-\lambda_{qa}\frac{1}{Q}\sum_q e_q)$),参考分支按式 $R_{ref}=C_{ref}[1-\lambda_b(1-A_{bind})]^+ - m_d\lambda_d E_{DAES} - m_c\lambda_c(1-A_{CRSC})$,权重 $\lambda_b=0.3,\lambda_d=0.4,\lambda_c=0.3$;两分支等权 $R_{raw}=0.5R_{cap}+0.5R_{ref}$;组内归一化得 advantage,actor lr=$1\times10^{-6}$、KL 系数 0.005,rollout 张量并行 2,32×H800 四节点,按验证集选最终策略。

技术新颖性

新颖性体现在四点。第一,任务定义本身是新的——把参考锚定显式塞进描述生成而非留给下游,并给出 Accuracy/Identification/Consistency 三要求。第二,奖励用「覆盖折扣」而非单纯加分,天然防骗分;并区分 $C_{ref}$(绑定对的才算覆盖)和 $A_{bind}$(绑定精度)两个层级,避免单层奖励的盲区。第三,DAES 把干扰项抑制做成可观测的二元证据信号 $E_{DAES}$,CRSC 用集合交并比量化同主体聚合,是专门为多参考一致性设计的奖励,通用 GRPO 方案里没有。第四,端到端一起学描述+锚定,对照实验(Table 2)证明这比先生成再润色的两阶段 CaptionRefine 强——后者 Ref-Bind 只有 0.805 而 RefCaptioner 达 0.967。配套的 MRVBench(含关键点库/QA 库/同实体组/干扰项四类标注)和 11 维评测体系也是首次提出的完整评测方案。

后训练框架总览:能力保持的混合数据 SFT + 分层覆盖折扣 GRPO。
Figure 2: 后训练框架总览:能力保持的混合数据 SFT + 分层覆盖折扣 GRPO。
MRVBench 数据构建流水线:多领域视频收集、关键帧抽取、六维度引导裁剪、带干扰注入的参考池整理、局部图像标签绑定、人工核验。
Figure 3: MRVBench 数据构建流水线:多领域视频收集、关键帧抽取、六维度引导裁剪、带干扰注入的参考池整理、局部图像标签绑定、人工核验。

实验结果

主结果见 Table 1:RefCaptioner 在开源模型里综合最优,MRVScore 0.888,逼近 Gemini-3.1-Pro 的 0.897、超过 GPT-5.4 的 0.870。逐项看,KP-Cov 0.882 在开源里最高(也超过 Gemini 的 0.878),VQA-Cov 0.837 最高,说明事实覆盖没掉链子;参考选择上 Ref-Tag-P 0.994、Ref-Tag-R 0.943,Recall 同时压过 Gemini(0.938) 和 GPT-5.4(0.807);Ref-Bind 0.967、Eff-Bind 0.912 在开源里最高;Dist-Rej 0.985、FalseRef-Any 仅 0.100,干扰抑制极强;Subj-R 0.817、Subj-F1 0.869 甚至超过 Gemini(0.799/0.844) 和 GPT-5.4(0.609/0.718),跨参考一致性最强。唯一短板是 VQA 0.686 略低于 Qwen3-VL-32B-Instruct 的 0.701。通用 benchmark 同样领先:VDC(Table 3)五个维度全开源第一,Cam 59.54/Short 50.87/Back 73.23/Obj 73.50/Detail 70.11,背景/主体/细节相对 Qwen3-VL-8B 基座提升 5.66–6.08 个点;VCapsBench(Table 4)AR 66.13、CR 76.39 双第一,IR 13.42 持平。Figure 4 的鲁棒性按参考数分桶,最难的 13+ 组 RefCaptioner 得 0.769,碾压 GPT-5.4 的 0.703 和 Qwen3.6-35B-A3B 的 0.398。消融(Table 5)显示去掉事实奖励 VQA 从 0.686 掉到 0.642,去掉 DAES 使 Dist-Rej 从 0.985 掉到 0.914(降幅最大),去掉 CRSC 使 Subj-R 从 0.817 掉到 0.778,三奖励互补。人类评估方面,Figure 6 的 GSB 重建对比中 RefCaptioner 对所有基线的 Good 都多于 Bad,对开源模型优势尤其大(如对 Qwen3.6-35B-A3B 为 76% Good/10% Bad);Figure S5 中 RefCaptioner 平均排名 1.75(最好)、人工绑定精度 0.99,逼近 Gemini/GPT-5.4 的 1.00。

MRVBench 主结果:描述与视频内容 + 多参考锚定,开源最优、逼近闭源。
Table 1: MRVBench 主结果:描述与视频内容 + 多参考锚定,开源最优、逼近闭源。
与两阶段描述润色的对比:每个基线先生成纯视频草稿,再用视频+有序参考图改写插入标签。
Table 2: 与两阶段描述润色的对比:每个基线先生成纯视频草稿,再用视频+有序参考图改写插入标签。
VDC 结果:五个评测维度的准确率,越高越好。
Table 3: VDC 结果:五个评测维度的准确率,越高越好。
VCapsBench 结果:AR/CR 越高越好,IR 越低越好。
Table 4: VCapsBench 结果:AR/CR 越高越好,IR 越低越好。
训练阶段与三个 HCD-GRPO 奖励组件的消融。
Table 5: 训练阶段与三个 HCD-GRPO 奖励组件的消融。
参考图数量增加时的锚定鲁棒性,分数=参考召回×绑定精度×干扰拒绝。
Figure 4: 参考图数量增加时的锚定鲁棒性,分数=参考召回×绑定精度×干扰拒绝。
MRVBench 上的定性对比:基线出现干扰侵入、错误/不完整绑定、主体不一致,RefCaptioner 选对并正确绑定。
Figure 5: MRVBench 上的定性对比:基线出现干扰侵入、错误/不完整绑定、主体不一致,RefCaptioner 选对并正确绑定。
caption 条件视频重建的成对 Good/Same/Bad 人工评估,对比 RefCaptioner 与各基线。
Figure 6: caption 条件视频重建的成对 Good/Same/Bad 人工评估,对比 RefCaptioner 与各基线。
查看结构化数据
任务指标本文基线提升
MRVBench 综合分 MRVScore 0.888 Qwen3-VL-32B-Instruct 0.829(开源最优基线) +0.059,开源第一,逼近 Gemini-3.1-Pro 0.897、超 GPT-5.4 0.870
MRVBench 参考选择召回 Ref-Tag-R 0.943 Gemini-3.1-Pro 0.938 / GPT-5.4 0.807 同时超过两大闭源模型
MRVBench 主体一致性 Subj-F1 0.869 Gemini-3.1-Pro 0.844 / GPT-5.4 0.718 +0.025 over Gemini,开源闭源通吃
VDC 背景 Background Acc 73.23 Qwen3-VL-8B 基座 67.57 +5.66,开源全维度第一
VCapsBench 覆盖率 CR 76.39 Qwen3-VL-8B 基座 74.69 +1.70,开源第一
多参考鲁棒性(13+组) Robustness=Recall×Bind×DistRej 0.769 GPT-5.4 0.703 / Qwen3.6-35B-A3B 0.398 +0.066 over GPT-5.4,复杂参考集最强
人工偏好平均排名 Mean Rank (↓) 1.75 次优 Gemini-3.1-Pro 2.02 排名第一,绑定精度 0.99

局限与改进

作者承认的局限包括:训练语料因授权原因不公开,只放 benchmark 测试集;评测强依赖 Gemini-3.1-Pro 当 judge,存在指标与裁判模型耦合的循环风险;VQA 上仍略输给 Qwen3-VL-32B-Instruct,说明纯事实问答不是最强。我额外观察到几点:其一,所有实验只在 Qwen3-VL-8B 一个基座上做,没验证 HCD-GRPO 在更大模型或其它架构(InternVL、Keye)上的迁移性,方法通用性存疑。其二,奖励权重 $\lambda_b=0.3,\lambda_d=0.4,\lambda_c=0.3$ 和分支等权 0.5/0.5 都是手工设定,论文没给敏感性分析,最优配比是否鲁棒未知。其三,MRVBench 只覆盖短视频(最长约 6 秒重建帧),对分钟级长视频、对话音频、多镜头剪辑没涉及。其四,MRVScore 0.888 仍低于 Gemini-3.1-Pro 0.897,且评测样本仅 462 条,统计上与闭源差距是否显著未量化。其五,重建实验用的是 Wan2.1-VACE/Seedance 固定 seed 的可控设置,真实下游任务的增益还需更大规模验证。

独立分析的弱点

第一个弱点是裁判依赖与指标耦合——KP-Cov、VQA、Ref-Bind、Subj 一致性全靠 Gemini-3.1-Pro 给结构化打分,而 Gemini 本身又是一个被比较的参赛者,可能引入系统性偏向。改进方向是引入多裁判集成(再加 GPT、Claude)或训练轻量专用判分模型,并对裁判一致性做标注。第二个弱点是单一基座验证,只在 Qwen3-VL-8B 上跑,不知道 HCD-GRPO 在 32B 或不同视觉骨干上是否同样涨点;应在 InternVL3.5、Keye-VL 上复现关键消融。第三个弱点是奖励权重和分支权重全凭经验,建议做网格搜索或用元学习/贝叶斯优化自动调,并报告带方差的多次重复结果(论文只提到「重复三次显著」但没给具体方差)。第四个弱点是任务粒度偏粗——标签只能贴在名词短语后,无法表达「同一标签覆盖哪些时间区间」这种时序锚定,在动作序列复杂的场景会丢信息;可扩展为带时间区间的结构化标签如 。第五个弱点是只支持英文、只覆盖短视频,跨语言和长视频场景待补。

未来方向

作者隐含提到的方向有:把显式锚定推广到参考条件视频生成/编辑的端到端管线,用 caption 带标签直接驱动生成器;扩展 MRVBench 到更多生成后端和真实下游任务。基于成果可延伸的方向:一是时序锚定,把短语级标签升级为带时间戳/帧区间的时空锚定,服务于精确剪辑;二是与音频描述、OCR、说话人身份联合,做全模态多参考锚定;三是把 HCD-GRPO 的覆盖折扣奖励范式迁移到带 grounding 的图像描述、文档 VQA、3D 场景描述等同样有「多候选需精确绑定」特性的任务;四是探索自博弈或在线难例挖掘,让模型在训练中主动构造对抗性干扰参考,提升 Dist-Rej 上限;五是用更小成本(如 DPO/直接偏好优化替代 GRPO 的多采样开销)把方法下沉到 7B 以下可端侧部署的规模。

复现评估

复现门槛中等偏高。有利因素:代码承诺开源(github.com/pkucs-Ltf/RefCaptioner),MRVBench 测试集及标注(关键点库、QA 库、同实体组、干扰项)会按 license 释放,训练指令和输入序列化格式在 Appendix D 给得很完整,固定 seed 20260710,并明确「重复三次显著」。不利因素:训练语料(20,000 视频、171,354 参考图)因授权不公开,这是最大障碍——SFT 的 Dmr 人工核验多参考描述无法直接拿到,复现者需自建等质数据,工作量巨大。算力方面 SFT 用 8×H800、GRPO 用 32×H800 四节点,对学术组很重。基座锁定 Qwen3-VL-8B-Instruct(需 Transformers 5.8.1 / vLLM 0.11.2 等特定版本)。评测还依赖 Gemini-3.1-Pro API(有费用和限速)。综合判断:方法思路和奖励公式可复用,但完整复现训练需自建数据+租 H800 集群,难度高;若只在 MRVBench 测试集上跑已开源的 checkpoint 做评测或做小规模 LoRA 复现,则可行。