RefCaptioner:多参考图锚定的视频描述生成 RefCaptioner: Multi-Reference Image-Grounded Video Captioning
提出多参考图锚定的视频描述新任务,用两阶段后训练实现短语级图像标签绑定。
前置知识
多模态大语言模型 (MLLM)
把视觉编码器(如 ViT)与语言模型(如 Qwen)拼接,能同时吃图像、视频和文本,输出自然语言的模型。本文用 Qwen3-VL-8B-Instruct 作为基座,它先把视频抽帧编码,再与文本 token 一起喂给语言模型生成描述。
RefCaptioner 本质上是对 MLLM 做后训练,理解基座模型的输入输出格式和视觉 token 机制才能看懂方法。
视频描述 (Video Captioning)
任务是给一段视频生成一段自然语言描述,覆盖主体、外观、动作、背景、镜头、风格等信息。早期用 BLEU/CIDEr 等词汇重叠指标评测,现在转向 VDC、VCapsBench 这类评估事实正确性和覆盖度的 benchmark。
本文在标准视频描述基础上叠加了「参考图锚定」的新要求,理解原任务的评测维度才能看清新任务的增量在哪。
GRPO (Group Relative Policy Optimization)
一种强化学习微调方法:对每个输入采样一组候选输出(本文采样 6 个),用奖励函数打分,在组内做归一化得到 advantage,再用 PPO 风格的 clipped 目标更新策略。相比 PPO 不需要单独的 critic 网络,省显存。本文用的是作者改造的分层覆盖折扣版 HCD-GRPO。
本文方法的核心是设计了一组多层级奖励函数并通过 GRPO 优化,不懂 GRPO 就无法理解第二阶段为什么有效。
SFT + LoRA 微调
SFT 是用带标签的指令数据做监督学习,让模型学会期望的输出格式。LoRA 是只训练注入到注意力层和前馈层的低秩矩阵(本文 rank=64),冻结主干,大幅降低显存。本文第一阶段用 LoRA SFT 教会模型插入 标签。
两阶段框架的第一阶段就是 LoRA SFT,理解它和 GRPO 的衔接(SFT 初始化策略,GRPO 全参微调)是看懂训练流程的关键。
参考条件视频生成/编辑
给一段文本和几张参考图(人物、物体、场景),让视频生成模型产出保持参考身份的视频。代表工作有 Movie Weaver、MultiRef-Compass 等。这类任务严重依赖参考图与视频的精确对齐。
本文的描述任务正是为这类下游生成任务服务的——描述里嵌入的图像标签把生成时该用哪些参考、绑到哪个主体告诉生成器,是上游赋能。
研究动机
现有视频描述模型(如 Qwen3-VL、InternVL3.5、Keye-VL)能流畅地叙述视频内容,但当给定一批候选参考图时,无法把局部视觉元素和对应参考图显式对应起来。这带来三个具体难题:其一,参考选择歧义——给一组图中既有真正相关的正面参考、又有视觉相近的干扰项,模型不知道该用哪些;从 Table 1 看,Qwen3-VL-8B-Instruct 的 Ref-Tag-R 只有 0.711、Eff-Bind 只有 0.599,InternVL3.5-8B 的 Eff-Bind 更低到 0.271。其二,短语级绑定错误——即便选对了图,多主体场景里模型常把不同人的衣服、身份、动作标签串错,Table 2 的两阶段 CaptionRefine 即使加第二轮润色,Ref-Bind 也只有 0.805(InternVL3.5-38B)。其三,跨参考一致性差——同一主体的多视角参考图本应聚到同一短语后,模型却把它们拆开或漏掉,Subj-F1 普遍偏低。此外,约 40% 的 MRVBench 样本含注入干扰项,基线模型 FalseRef-Any 普遍在 0.15–0.67,说明大量误用。
本文的目标是本文要造一个能同时做好四件事的模型:生成事实正确且详尽的视频描述;从候选参考池中选出真正被视频支持的图;把每张选中图的 标签精确插到它描述的那个名词短语之后;当多张参考图画的是同一主体(不同视角/姿态/外观)时把它们聚到同一短语后,同时拒绝所有干扰图。更具体地,作者要求在自建的 MRVBench 上做到 Ref-Tag-P≈1.0 且 Ref-Tag-R 尽可能高、Dist-Rej≈1.0、FalseRef-Any≈0,并且在通用 benchmark VDC/VCapsBench 上不掉点,最好还能超越基座 Qwen3-VL-8B,证明新任务能力不损害通用描述质量。
与已有工作不同的是,近期参考条件视频生成(Movie Weaver、LumosX、MV-S2V)和编辑(Kiwi-Edit、ReBind)很火,但它们都把参考-视频对齐当作生成端的隐式能力,几乎没人显式研究「能不能在描述文本里把这种对齐表达出来」。评测层面,OpenS2V-Nexus、MultiRef-Compass 这些 benchmark 关注的是生成端的主体保持,没有一个评估 MLLM 能否在描述中做短语级多参考锚定。作者抓住了这个被忽视的空白:既提出新任务、又配套造了 MRVBench(462 视频、3,831 参考图、2,172 QA 对、约 40% 含干扰项),还设计了专门的分层奖励把这件事端到端学会,而不是用两阶段后处理硬补。
核心方法
直觉上,作者希望模型写描述时像人在做「图—文对照填空」:写到「一位女士」时,把画她的几张参考图标签贴上;写到「红裙子」时,贴画裙子的那张;写到「石桥」贴桥的,绝不贴不相关的伞。技术路线是两阶段后训练。第一阶段做混合数据 SFT:一半是带 标签的人工核验多参考描述(教选择和绑定格式),一半是标准视频描述(保住事实覆盖和细节)。第二阶段做 HCD-GRPO,对每个输入采样多条候选描述,用「覆盖折扣」式奖励打分——做对的覆盖给正分,可观测的错误(事实错、绑错、用干扰、拆组)按权重折扣掉,再用 GRPO 更新。视觉编码器和视觉-语言融合层全程冻结,只动语言模型。
核心创新是「分层覆盖折扣奖励」(Coverage-Discounted Reward)的设计哲学:正信号只来自有用的覆盖,任何可观测错误都按系数折扣该信号,使得模型没法靠「少贴标签躲绑定」或「多贴标签蹭覆盖」来骗分。具体到参考分支,作者把奖励拆成三个互补子项:正确绑定参考覆盖 $C_{ref}$(只对绑定判定正确的参考计数,防止错绑蹭分)、DAES 干扰感知证据抑制(一旦用了任何不在视频里的参考图就触发 $E_{DAES}=1$ 的惩罚)、CRSC 跨参考语义一致性(用 $A_{CRSC}$ 衡量同一主体的多张参考是否被聚到同一短语,公式 $A_{CRSC} = \frac{1}{|E_{multi}|}\sum_e \max(0, \frac{|b\hat{T}_e(y)\cap T_e^*|}{|b\hat{T}_e(y)\cup T_e^*|})$)。再叠加一个确定性守卫(deterministic guard):输出含乱造/非局部/违禁标签时直接把奖励封顶到 $R=\min(R_{raw},0.2)$。这种「软覆盖折扣 + 硬结构守卫」的组合是和普通 GRPO+单点奖励最本质的区别。
方法步骤详情
完整流程分两阶段。阶段一 SFT:用 Qwen3-VL-8B-Instruct 初始化,冻结视觉编码器和投影层,在语言模型的注意力与 FFN 注入 LoRA(rank=64, alpha=128, dropout=0.05),用 AdamW、lr=$1\times10^{-4}$、cosine、3 epoch、BF16+DeepSpeed ZeRO-2、8×H800 训练;数据是 Dmr 与 Dcap 1:1 混合,视频按 2 fps 抽帧、帧限 602,112 像素、参考图限 401,408 像素,最大序列 18,000 token,目标就是标准 next-token prediction。阶段二 HCD-GRPO:从 SFT checkpoint 出发,解冻整个 LM(不再用 LoRA),用 12,838 训练样本;每次更新对 16 个 prompt 各采 6 条回复(共 96 条,每条 ≤512 token),算双分支奖励——描述分支 $R_{cap}$ 用关键点覆盖奖励并按视频 QA 错误以 $\lambda_{qa}=0.5$ 折扣($R_{cap}=\frac{1}{K}\sum_k s_k\cdot(1-\lambda_{qa}\frac{1}{Q}\sum_q e_q)$),参考分支按式 $R_{ref}=C_{ref}[1-\lambda_b(1-A_{bind})]^+ - m_d\lambda_d E_{DAES} - m_c\lambda_c(1-A_{CRSC})$,权重 $\lambda_b=0.3,\lambda_d=0.4,\lambda_c=0.3$;两分支等权 $R_{raw}=0.5R_{cap}+0.5R_{ref}$;组内归一化得 advantage,actor lr=$1\times10^{-6}$、KL 系数 0.005,rollout 张量并行 2,32×H800 四节点,按验证集选最终策略。
技术新颖性
新颖性体现在四点。第一,任务定义本身是新的——把参考锚定显式塞进描述生成而非留给下游,并给出 Accuracy/Identification/Consistency 三要求。第二,奖励用「覆盖折扣」而非单纯加分,天然防骗分;并区分 $C_{ref}$(绑定对的才算覆盖)和 $A_{bind}$(绑定精度)两个层级,避免单层奖励的盲区。第三,DAES 把干扰项抑制做成可观测的二元证据信号 $E_{DAES}$,CRSC 用集合交并比量化同主体聚合,是专门为多参考一致性设计的奖励,通用 GRPO 方案里没有。第四,端到端一起学描述+锚定,对照实验(Table 2)证明这比先生成再润色的两阶段 CaptionRefine 强——后者 Ref-Bind 只有 0.805 而 RefCaptioner 达 0.967。配套的 MRVBench(含关键点库/QA 库/同实体组/干扰项四类标注)和 11 维评测体系也是首次提出的完整评测方案。
实验结果
主结果见 Table 1:RefCaptioner 在开源模型里综合最优,MRVScore 0.888,逼近 Gemini-3.1-Pro 的 0.897、超过 GPT-5.4 的 0.870。逐项看,KP-Cov 0.882 在开源里最高(也超过 Gemini 的 0.878),VQA-Cov 0.837 最高,说明事实覆盖没掉链子;参考选择上 Ref-Tag-P 0.994、Ref-Tag-R 0.943,Recall 同时压过 Gemini(0.938) 和 GPT-5.4(0.807);Ref-Bind 0.967、Eff-Bind 0.912 在开源里最高;Dist-Rej 0.985、FalseRef-Any 仅 0.100,干扰抑制极强;Subj-R 0.817、Subj-F1 0.869 甚至超过 Gemini(0.799/0.844) 和 GPT-5.4(0.609/0.718),跨参考一致性最强。唯一短板是 VQA 0.686 略低于 Qwen3-VL-32B-Instruct 的 0.701。通用 benchmark 同样领先:VDC(Table 3)五个维度全开源第一,Cam 59.54/Short 50.87/Back 73.23/Obj 73.50/Detail 70.11,背景/主体/细节相对 Qwen3-VL-8B 基座提升 5.66–6.08 个点;VCapsBench(Table 4)AR 66.13、CR 76.39 双第一,IR 13.42 持平。Figure 4 的鲁棒性按参考数分桶,最难的 13+ 组 RefCaptioner 得 0.769,碾压 GPT-5.4 的 0.703 和 Qwen3.6-35B-A3B 的 0.398。消融(Table 5)显示去掉事实奖励 VQA 从 0.686 掉到 0.642,去掉 DAES 使 Dist-Rej 从 0.985 掉到 0.914(降幅最大),去掉 CRSC 使 Subj-R 从 0.817 掉到 0.778,三奖励互补。人类评估方面,Figure 6 的 GSB 重建对比中 RefCaptioner 对所有基线的 Good 都多于 Bad,对开源模型优势尤其大(如对 Qwen3.6-35B-A3B 为 76% Good/10% Bad);Figure S5 中 RefCaptioner 平均排名 1.75(最好)、人工绑定精度 0.99,逼近 Gemini/GPT-5.4 的 1.00。
查看结构化数据
| 任务 | 指标 | 本文 | 基线 | 提升 |
|---|---|---|---|---|
| MRVBench 综合分 | MRVScore | 0.888 | Qwen3-VL-32B-Instruct 0.829(开源最优基线) | +0.059,开源第一,逼近 Gemini-3.1-Pro 0.897、超 GPT-5.4 0.870 |
| MRVBench 参考选择召回 | Ref-Tag-R | 0.943 | Gemini-3.1-Pro 0.938 / GPT-5.4 0.807 | 同时超过两大闭源模型 |
| MRVBench 主体一致性 | Subj-F1 | 0.869 | Gemini-3.1-Pro 0.844 / GPT-5.4 0.718 | +0.025 over Gemini,开源闭源通吃 |
| VDC 背景 | Background Acc | 73.23 | Qwen3-VL-8B 基座 67.57 | +5.66,开源全维度第一 |
| VCapsBench 覆盖率 | CR | 76.39 | Qwen3-VL-8B 基座 74.69 | +1.70,开源第一 |
| 多参考鲁棒性(13+组) | Robustness=Recall×Bind×DistRej | 0.769 | GPT-5.4 0.703 / Qwen3.6-35B-A3B 0.398 | +0.066 over GPT-5.4,复杂参考集最强 |
| 人工偏好平均排名 | Mean Rank (↓) | 1.75 | 次优 Gemini-3.1-Pro 2.02 | 排名第一,绑定精度 0.99 |
局限与改进
作者承认的局限包括:训练语料因授权原因不公开,只放 benchmark 测试集;评测强依赖 Gemini-3.1-Pro 当 judge,存在指标与裁判模型耦合的循环风险;VQA 上仍略输给 Qwen3-VL-32B-Instruct,说明纯事实问答不是最强。我额外观察到几点:其一,所有实验只在 Qwen3-VL-8B 一个基座上做,没验证 HCD-GRPO 在更大模型或其它架构(InternVL、Keye)上的迁移性,方法通用性存疑。其二,奖励权重 $\lambda_b=0.3,\lambda_d=0.4,\lambda_c=0.3$ 和分支等权 0.5/0.5 都是手工设定,论文没给敏感性分析,最优配比是否鲁棒未知。其三,MRVBench 只覆盖短视频(最长约 6 秒重建帧),对分钟级长视频、对话音频、多镜头剪辑没涉及。其四,MRVScore 0.888 仍低于 Gemini-3.1-Pro 0.897,且评测样本仅 462 条,统计上与闭源差距是否显著未量化。其五,重建实验用的是 Wan2.1-VACE/Seedance 固定 seed 的可控设置,真实下游任务的增益还需更大规模验证。
独立分析的弱点
第一个弱点是裁判依赖与指标耦合——KP-Cov、VQA、Ref-Bind、Subj 一致性全靠 Gemini-3.1-Pro 给结构化打分,而 Gemini 本身又是一个被比较的参赛者,可能引入系统性偏向。改进方向是引入多裁判集成(再加 GPT、Claude)或训练轻量专用判分模型,并对裁判一致性做标注。第二个弱点是单一基座验证,只在 Qwen3-VL-8B 上跑,不知道 HCD-GRPO 在 32B 或不同视觉骨干上是否同样涨点;应在 InternVL3.5、Keye-VL 上复现关键消融。第三个弱点是奖励权重和分支权重全凭经验,建议做网格搜索或用元学习/贝叶斯优化自动调,并报告带方差的多次重复结果(论文只提到「重复三次显著」但没给具体方差)。第四个弱点是任务粒度偏粗——标签只能贴在名词短语后,无法表达「同一标签覆盖哪些时间区间」这种时序锚定,在动作序列复杂的场景会丢信息;可扩展为带时间区间的结构化标签如 。第五个弱点是只支持英文、只覆盖短视频,跨语言和长视频场景待补。
未来方向
作者隐含提到的方向有:把显式锚定推广到参考条件视频生成/编辑的端到端管线,用 caption 带标签直接驱动生成器;扩展 MRVBench 到更多生成后端和真实下游任务。基于成果可延伸的方向:一是时序锚定,把短语级标签升级为带时间戳/帧区间的时空锚定,服务于精确剪辑;二是与音频描述、OCR、说话人身份联合,做全模态多参考锚定;三是把 HCD-GRPO 的覆盖折扣奖励范式迁移到带 grounding 的图像描述、文档 VQA、3D 场景描述等同样有「多候选需精确绑定」特性的任务;四是探索自博弈或在线难例挖掘,让模型在训练中主动构造对抗性干扰参考,提升 Dist-Rej 上限;五是用更小成本(如 DPO/直接偏好优化替代 GRPO 的多采样开销)把方法下沉到 7B 以下可端侧部署的规模。
复现评估
复现门槛中等偏高。有利因素:代码承诺开源(github.com/pkucs-Ltf/RefCaptioner),MRVBench 测试集及标注(关键点库、QA 库、同实体组、干扰项)会按 license 释放,训练指令和输入序列化格式在 Appendix D 给得很完整,固定 seed 20260710,并明确「重复三次显著」。不利因素:训练语料(20,000 视频、171,354 参考图)因授权不公开,这是最大障碍——SFT 的 Dmr 人工核验多参考描述无法直接拿到,复现者需自建等质数据,工作量巨大。算力方面 SFT 用 8×H800、GRPO 用 32×H800 四节点,对学术组很重。基座锁定 Qwen3-VL-8B-Instruct(需 Transformers 5.8.1 / vLLM 0.11.2 等特定版本)。评测还依赖 Gemini-3.1-Pro API(有费用和限速)。综合判断:方法思路和奖励公式可复用,但完整复现训练需自建数据+租 H800 集群,难度高;若只在 MRVBench 测试集上跑已开源的 checkpoint 做评测或做小规模 LoRA 复现,则可行。
论文图表
用一个红裙女士遛狗过桥、撑伞的例子对比:标准描述只输出纯文本,RefCaptioner 在「女士」「红裙」「棕狗」「石桥」「瀑布」「黄伞」等短语后分别贴上对应参考图标签,并示意存在干扰图。
一张图直观讲清新任务到底是什么、和普通视频描述差在哪,是理解整篇论文的入口。