DICS:面向视觉指令选择的样本内在一致性探索 DICS: Exploring Data Intrinsic Consistency for Visual Instruction Selection
以图像-指令-回答的损失差分一致性为样本打分,25%数据即可超越全量微调
前置知识
视觉指令微调(Visual Instruction Tuning)
在多模态大模型预训练之后,用(图像,指令,回答)三元组构成的对话数据对模型做监督微调,使其能理解人类指令并基于图像内容作答。LLaVA、InstructBLIP 等模型都依赖这一阶段建立视觉与语言的对接,数据规模从几十万条(LLaVA-1.5-665K)到千万级(InternVL3 用 21.7M)不等。
本文要解决的问题正是这一阶段的数据筛选:只有理解视觉指令微调的数据构成与训练方式,才能明白'选哪 25% 的数据'为何能决定模型最终性能。
交叉熵损失与信息增益
语言模型用交叉熵损失 $\mathcal{L}=-\log p(t_i|c,t_{<i})$ 衡量预测下一个 token 的难度。若加入条件 $c'$ 后损失下降,说明 $c'$ 带来了信息增益。本文用有/无图像两种条件下的加权损失差 $\mathcal{L}^w(y|x)-\mathcal{L}^w(y|x,I)$ 量化图像对回答的信息贡献,并经 $\exp(\cdot)$ 映射为正数得分。
VIC 与 RIC 两个核心指标全部建立在损失差分之上,不熟悉'损失下降=信息增益'这层关系就无法读懂打分公式的含义。
IFD(Instruction Following Difficulty)
纯文本指令数据选择的经典指标:比较'有指令时生成回答的损失'与'无指令时的损失'之差,衡量回答对指令的依赖程度,从而筛出真正跟随指令的样本。本文把这一思想扩展到多模态,但指出它无法评估视觉信息的贡献。
IFD 是本文方法最直接的思想源头(作者自述受其启发),也是重要基线之一(在 665K 上仅 87.58% 相对性能),对比它能看清多模态扩展的必要性。
最远点采样(FPS)
一种贪心多样性采样算法:先选一个起点,之后每轮都选与已选集合距离最远的样本,直到选满 $k$ 个,使子集在嵌入空间中尽量铺开、覆盖原始分布。本文用最后一层 final-token 隐状态(4096 维)作嵌入,时间复杂度 $O(kMd)$。
DICS 的第二阶段就是在高 DIC 候选池内用 FPS 做多样性采样,理解它才能理解'质量排序 + 多样性采样'的完整选择流程。
词性(POS)加权
用 spaCy 为每个 token 标注词性并赋权:名词、动词、形容词、副词、数词等内容词权重 $w_i=1.0$;冠词、介词、连词、代词、助动词、标点等功能词权重 $w_i=0.1$。加权损失 $\mathcal{L}^w$ 让高频但信息稀疏的功能词不会主导打分。
消融实验显示去掉该加权会使相对性能从 101.40% 掉到 100.25%,它是指标保持语义敏感性的关键工程细节。
对象幻觉与评测基准(POPE / HallusionBench)
对象幻觉指模型把图像中不存在的物体描述为存在。POPE 通过'图中是否有 X'的是非轮询探测此类幻觉;HallusionBench 进一步考察视觉错觉与推理一致性。本文认为低 VIC/RIC 的脏数据是幻觉的重要来源。
幻觉缓解是本文核心卖点之一:RIC 单独使用时在 POPE(85.83)上全场最高,理解这些基准才能读懂消融实验中 VIC/RIC 的分工结论。
研究动机
视觉指令数据规模正快速膨胀:LLaVA-1.5-665K 聚合约 66.5 万条样本,InternVL3 的 SFT 语料达 2170 万条,全量微调的算力与时间成本极高,因此必须在固定采样比例下挑出最有价值的子集。现有方法大体分三类:一是基于全局分布多样性的表示类方法(DataTailor、PRISM 用嵌入聚类保证概念覆盖);二是基于训练动态/梯度的方法(LESS 的低秩梯度相似度、COINCIDE/ICON/TIVE 的影响函数);三是启发式过滤(按长度、CLIP-Score、Perplexity、IFD 打分)。它们的共同盲区是只关心样本之间的关系或表层统计量,完全忽略单个样本内部图像、指令、回答三者的自洽性。后果有两类:低视觉依赖样本(不看图也能答)会鼓励模型依赖语言先验、诱发幻觉;回答与指令脱节的样本则破坏视觉-语言对齐。这些缺陷在实验中可直接量化:按长度过滤只有 88.79% 的相对性能,纯文本的 IFD 只有 87.58%,即便最强的基线 PRISM 在 25% 比例下也只有 97.66%,全部低于全量训练。
本文的目标是本文要回答的问题是:能否定义一个样本级、无需外部大模型评审、只需前向推理的自评分指标,直接度量'图像-指令-回答'三元组的内在一致性,并据此在任意数据预算下选出高质量子集?具体目标拆解为三点:(1)提出 DIC 指标,由视觉信息一致性 VIC(图像对生成回答是否提供关键信息)与回答信息一致性 RIC(回答是否紧扣指令且忠实于图像)组成,取二者最小值作为严格门槛;(2)设计预算自适应的选择策略 DICS:低比例时优先高 DIC 样本并保持多样性,高比例时剔除低 DIC 冗余样本;(3)验证可扩展性:在 LLaVA-1.5-665K、Vision-FLAN-186K 上用 25% 数据达到甚至超过全量微调,并构建 600 万样本的 DICS-6M 语料,在 InternVL3-8B 上完成迄今最大规模的视觉指令选择实验,用不到官方 25% 的数据量逼近官方 Instruct 模型。
与已有工作不同的是,本文的独特切入是把'数据质量'从样本间关系(多样性、影响力)拉回到样本内部的信息结构:一条好数据应让图像对回答不可或缺、回答对指令不可或缺。技术上有三个与已有工作本质不同的点。其一,用同一个 VLM 的损失差分做双向信息增益对比:VIC 对比有/无图像时回答的损失,RIC 对比有/无回答时指令的损失,这与只做单向图文对齐的 CLIP-Score(把'语义相关'与'视觉必要'混为一谈)有本质区别。其二,RIC 采用'逆预测'任务——让模型根据图像(和回答)反推原始指令,泛泛而谈的回答(如'这是一张图片')无法在反推指令时提供增益,从而被自动惩罚,这是纯文本 IFD 做不到的。其三,用 $\min(\mathrm{VIC},\mathrm{RIC})$ 而非求和/乘积融合,构成'两项都必须高'的严格门控——消融显示 Sum/Product 只有 98.61%/98.84%,而 min 达到 101.40%。此外,全程只需推理前向、无需梯度反传,成本随数据量线性增长,这与依赖反传的 LESS/COINCIDE 类方法形成鲜明对比。
核心方法
直觉上,一条高质量的视觉指令样本要同时满足两件事:模型必须看着图才能写出这个回答(图像提供不可替代的信息),且回答必须精准回应这个指令(而非答非所问或套用语言模板)。DICS 据此把选择拆成两个阶段。第一阶段是打分与排序:先用 5% 随机子集对基座模型做 LoRA 热身,得到一个仅用于打分的检查点(打完即弃,最终模型一律从原始预训练权重训练,避免泄漏);然后对每个样本 $(I,x,y)$ 计算两个分数——VIC 度量加入图像后回答预测损失下降的幅度,RIC 度量加入回答后指令重建损失下降的幅度,二者都用 POS 加权交叉熵并取 $\exp$ 保证为正,最后取 $\mathrm{DIC}=\min(\mathrm{VIC},\mathrm{RIC})$ 对全库降序排序。第二阶段是自适应采样:按目标比例 $p$ 分三种情况——$p<50\%$ 时取 top-$2p$ 做候选池,再用最远点采样(FPS)从中选出 $p$;$p=50\%$ 直接取 top-50%;$p>50\%$ 时保留 top-$(2p-1)$ 为核心集,再从剩余样本中用 FPS 补选 $(1-p)$。这样低预算时强调样本质量、高预算时剔除低质冗余,质量与多样性随预算自动平衡。
核心创新是用'部分条件 vs 完整条件'的损失对比,把样本内部一致性变成可计算的标量。VIC 定义为 $\mathrm{VIC}(I,x,y)=\exp(\mathcal{L}^w(y|x)-\mathcal{L}^w(y|x,I))$:计算'无图'损失时直接遮蔽输入序列中的图像 token(换成无关图像的替代方案结果相近),损失差越大说明图像对回答越不可或缺;反之,不看图也能答、甚至含幻觉的样本得分趋近 1 或更低。RIC 是镜像设计:$\mathrm{RIC}(I,x,y)=\exp(\mathcal{L}^w(x|I)-\mathcal{L}^w(x|y,I))$,通过精心设计的提示让模型'根据图像(和回答)猜出最可能的问题',只有回答包含指令特有的语义线索时才能大幅降低指令重建损失,从而系统性惩罚通用、低信息的回答。两个方向合成 $\min$ 后,一条样本只有在'图像必要'与'回答紧扣指令'两个维度都达标时才能入选。与已有方法的本质区别在于:它度量的是样本内在一致性,而非全局分布属性(DataTailor/PRISM)或训练动态(LESS/COINCIDE),且完全不需要昂贵的外部 LLM 逐条评审。
方法步骤详情
完整流水线分四步。第一步,热身:在 5% 随机子集上对基座模型(如 LLaVA-1.5-7B-Base)做 LoRA 微调,该检查点只用于打分,打完即弃。第二步,计算 VIC:先用 spaCy 标注词性并赋权(内容词 $w_i=1.0$、功能词 $w_i=0.1$),加权损失为 $\mathcal{L}^w(y|c)=-\sum_{i=1}^{N} w_i\log p(t_i|c,t_{0.5$:核心集 top-$(2p-1)$,FPS 从剩余补 $(1-p)$)。FPS 特征取最后一层 final-token 隐状态(4096 维),GPU 批处理下百万样本选 10 万只需单张 A100 几分钟;打分整体复杂度 $O(NF)$ 线性,嵌入提取与打分共享同一批前向传播。
技术新颖性
技术新颖性可从四个层面评估。(1)指标层面:首次把'双向信息增益一致性'引入视觉指令选择——VIC 沿用并改造了文本 IFD 的差分思想,但把差分对象换成图像条件;RIC 的逆预测任务设计在多模态数据选择中是新的,天然抑制模板化回答。(2)融合层面:$\min$ 算子看似简单,实验证明是关键——Sum(98.61%)与 Product(98.84%)会让单项虚高补偿另一项短板,只有 min 构成'双高'硬门槛,这为质量指标组合提供了可复用的设计经验。(3)流程层面:打分与嵌入提取共享前向、无需梯度反传,复杂度 $O(NF)$ 线性,比 COINCIDE(选择耗时 16.3h)、DataTailor(14.5h)更快(12.0h),且随数据规模优势扩大。(4)性质层面:作者验证了 DIC 的跨架构迁移性——用 LLaVA-1.5-7B 打分选的数据给 Qwen2-VL-7B 训练达 101.25%,给 LLaVA-1.5-13B 训练达 101.79%(弱到强),说明它捕捉的是通用样本特性而非打分模型偏好,这让小模型可以当'数据裁判'为大模型服务,大幅降低大规模数据治理成本。
实验结果
主实验围绕 12 个基准展开(MME、MMBench-en/cn、MMMU、SQA-I、VizWiz、AI2D、DocVQA、InfoVQA、POPE、HallusionBench、MM-Vet,覆盖通用/知识推理/文档理解/幻觉/开放对话五个维度)。(1)LLaVA-1.5-665K 25% 子集(166K,LLaVA-1.5-7B):DICS 相对全量性能 101.40%,明显超过全量(100%);MME 63.39 vs 全量 59.92(+3.47),MMBench-CN 55.03 vs 51.93,MMMU 36.11 vs 35.89,DocVQA 24.64 vs 23.82,InfoVQA 23.11 vs 22.30,POPE 84.91 vs 84.49;基线方面 CLIP-Score 98.66%、PRISM 97.66%、DataTailor 97.17%、Random 96.69%、Length 88.79%、IFD 87.58%;5 次重复实验标准差 ≤0.13,优势显著。(2)采样比例曲线:DICS 在 50% 时达到峰值 103.15%,低比例(<25%)时领先最大;PRISM/DataTailor 峰值出现在约 75%。(3)Vision-FLAN-186K 25%:DICS 99.91% 几乎追平全量,超过 PRISM(98.48%)等所有基线,验证跨数据分布稳健性。(4)跨架构:Qwen2-VL-7B 用自己打分的子集 100.91%,用 LLaVA-7B 打分的子集 101.25%;LLaVA-1.5-13B 用 7B 选择器的数据达 101.79%。Qwen2-VL-7B-Base 平均分 51.05,DICS 微调后达 71.35,距官方 Instruct(72.20)不足 1%。(5)DICS-6M + InternVL3-8B:85% 比例(5.1M)最优,超 6M 全量 3.10%;相对官方 InternVL3-8B-Instruct(21.7M 数据,相对分 109.08)达到 94.52%。(6)消融:FPS 仅多样性 97.02%,VIC-only 101.02%,RIC-only 97.60%(但 POPE 85.83 全场最高),Sum 98.61%,Product 98.84%,去掉 POS 加权降至 100.25%;Top-K/Hierarchical/FPS 三种采样策略下 DICS 均超过全量(100.40%/101.39%/101.40%)。(7)指标有效性验证:把图换成无关图后 VIC 中位数下降 43.0%(AUC 0.816),注入幻觉下降 32.8%(AUC 0.689),通用化回答使 RIC 下降 13.1%(AUC 0.701);750 样本的人评与 VLM 评审(Qwen3.5-397B)显示 DIC 高分组质量分单调更高(人类均分 2.58→2.92→3.17),Spearman 相关 ρ=0.27(人类)/0.20(VLM),p<0.001。(8)效率:665K 打分约 12h(8×A100),25% 子集总耗时 14h vs 全量 15h;6M 选择+训练共 85h(32×A100),比全量省 5h 且性能高 3.10%。
查看结构化数据
| 任务 | 指标 | 本文 | 基线 | 提升 |
|---|---|---|---|---|
| 视觉指令选择(LLaVA-1.5-665K 25% 子集,LLaVA-1.5-7B) | 12 基准平均相对全量性能 (%) | 101.40 | 全量 665K 微调 = 100.00;学习型最强基线 PRISM = 97.66 | +1.40 vs 全量;+3.74 vs PRISM |
| LLaVA-1.5-665K 25% 子集(单项基准) | MME / MMBench-CN / DocVQA | 63.39 / 55.03 / 24.64 | 全量微调:59.92 / 51.93 / 23.82 | +3.47 / +3.10 / +0.82 |
| Vision-FLAN-186K 25% 子集 | 5 维平均相对性能 (%) | 99.91 | 全量 100.00 / PRISM 98.48 / CLIP-Score 97.90 | 基本持平全量(-0.09),超过所有基线 |
| 跨架构迁移(Qwen2-VL-7B 训练,25% 子集) | 12 基准平均相对性能 (%) | 101.25(LLaVA-7B 打分)/ 100.91(Qwen2-VL 自打分) | 全量 100.00 / Random 100.21 | +1.25 / +0.91 |
| 弱到强迁移(LLaVA-1.5-13B 训练,7B 模型打分) | 12 基准平均相对性能 (%) | 101.79 | 全量 100.00 / Random 99.93 | +1.79(所有设置中最大增益) |
| 大规模选择(DICS-6M + InternVL3-8B) | 5 维平均相对 6M 全量 (%) | 103.10(85% 比例,5.1M 样本) | 6M 全量 = 100.00;官方 InternVL3-8B-Instruct(21.7M)= 109.08 | +3.10 vs 全量;以官方 23.5% 的数据量达到官方模型 94.52% 的性能 |
| 指标消融(LLaVA-1.5-665K 25%) | 12 基准平均相对性能 (%) | min(VIC,RIC)=101.40;VIC-only=101.02;RIC-only=97.60 | FPS 仅多样性 = 97.02;Sum = 98.61;Product = 98.84 | +4.38 vs 仅多样性;min 融合比 Sum/Product 高 2.6~2.8 个点 |
局限与改进
作者明确承认的局限:一致性评估目前只覆盖图文模态,未扩展到视频、音频;最优采样比例 $p$ 不固定,随数据集和指标变化,实践中仍需小规模实验确定。我补充几点观察:其一,打分模型来自 5% 随机子集的热身,其视觉感知与知识偏差会系统性传导给 DIC 打分,论文未分析热身规模与质量的敏感性;其二,纯文本样本 VIC 恒为 1.0,在混合语料中这类样本自动通过 VIC 门控、只受 RIC 约束,与图文样本的筛选标准不对称;其三,DIC 与人类质量评分的 Spearman 相关只有 0.27(VLM 评审 0.20),说明它捕捉的是'一致性'而非全部质量维度,排序尾部(低-中分位)的可信度有限;其四,在高比例(>75%)区间所有方法都趋于饱和,DICS 的相对收益缩小,主要价值集中在低中预算场景;其五,665K 打分需约 12 小时多卡推理,虽然复杂度线性,但在亿级语料上仍是不小的固定开销,且 FPS 嵌入质量依赖打分模型的表征能力。
独立分析的弱点
独立分析发现以下弱点,并附改进方向。(1)min 门控的误杀问题:一条'图像信息极强但回答质量一般'的样本(例如标注略有瑕疵的好图)会被 min 卡掉,而这类样本恰恰可能是稀有视觉知识的来源;可改为按 VIC/RIC 分别做分层配额,或给低分维度一次修复后复评的机会。(2)逆预测提示固定为英文模板:对中文指令、OCR 密集型样本,'猜问题'任务的难度不均衡,可能造成语言与任务类型上的系统性偏差;可按任务类型自适应选择提示或对分数做分域校准。(3)热身检查点只训 5% 随机数据:小规模热身对长尾领域(如医学图表、遥感图像)的感知不足,DIC 可能系统性低估此类样本;可用领域分层热身或集成多个热身模型打分。(4)一致性不等于正确性:一个图文一致但事实错误的样本照样得高分,而人评相关系数 ρ=0.27 也说明 DIC 只是质量的代理变量;可叠加事实校验模块,或用强模型对高分层做抽查。(5)超参均为经验设定:候选池系数 2、POS 权重 0.1/1.0、FPS 特征取 final-token 等都缺少敏感性分析;应报告这些选择在不同数据分布下的鲁棒区间,否则跨语料迁移时调参成本未知。此外,评测集中在 7B/8B 规模,方法在更大模型上是否仍保持 1~3 个点的增益尚待验证。
未来方向
作者提出的方向:(1)把一致性评估从图文扩展到视频、音频等多模态,例如用帧间一致性、音画一致性定义类似的 VIC/RIC;(2)开发自适应策略自动决定子集大小与组成,摆脱对人工设定 $p$ 的依赖;(3)从'丢弃低 DIC 样本'转向'主动修复'——用强模型重写回答或更换图像,把脏数据转化为好数据。基于本文成果可延伸的方向:其一,把 DIC 接入训练过程做动态数据选择(curriculum 或在线重加权),随模型能力演化重新排序样本,替代一次性静态筛选;其二,用 DIC 引导数据合成——定向让生成模型生产'高视觉依赖 + 高指令贴合'的新样本,从源头扩大高质量数据池;其三,把 RIC 的逆预测思想推广为幻觉缓解的训练目标,例如在损失中加入'回答对图像条件的信息增益'正则项;其四,利用弱到强迁移性质构建'小模型打分—大模型训练'的常态化数据蒸馏流水线,并从信息论角度解释 min 融合与 FPS 分布覆盖组合有效的原因。
复现评估
复现条件总体友好。开源情况:代码将在 https://github.com/cqu-student/DICS 发布,作者承诺开源训练好的模型与 DICS-6M 语料;所用数据集(LLaVA-1.5-665K、Vision-FLAN-186K 及 DICS-6M 中的公开来源)均可获取,符合许可要求。工具与协议:打分用 spaCy 做 POS 标注,FPS 用最后一层 final-token 隐状态,评测统一走 VLMEvalKit、生成温度 0.0,开放题用 Qwen3-32B 作裁判,统计检验报告 5 次运行均值与标准差,协议清晰。算力需求:LLaVA-1.5 侧为 8×A100-40GB 的 LoRA 训练(1 epoch),665K 打分约 12 小时(仅推理前向);InternVL3-8B 全量微调需 32 卡、选择+训练共 85 小时,这对个人研究者偏高,但复现核心结论(Table 1/5)只需单机 8 卡。方法本身超参少、无需梯度反传,主要工程量在多卡推理调度与 12 个基准的评测搭建,整体复现难度为中等。
论文图表
折线图:横轴为采样比例 p,纵轴为相对全量微调的性能百分比。DICS 曲线在所有比例下都位于其他方法之上,25% 时即超过 100%(全量水平),50% 时达到峰值 103.15%;PRISM、DataTailor 等基线峰值出现在约 75%,且在部分比例下明显低于全量。
这是全文的核心结论图,一图概括了'25% 数据超越全量微调 + 全比例稳定领先'两大卖点,也是读者判断该方法实用价值的第一入口。
主表:LLaVA-1.5-7B 上 12 个基准的完整对比。DICS 相对性能 101.40%,MME 63.39、MMBench-CN 55.03、MMMU 36.11、POPE 84.91;基线中 CLIP-Score 98.66%、PRISM 97.66%、DataTailor 97.17%、Random 96.69%、Length 88.79%、IFD 87.58%,全部低于全量(100%)。
支撑'25% 数据超越全量微调'这一核心声明的主证据,且展示了各基线在个别基准上偏科、整体下滑的模式,反衬 DICS 的均衡性。
Table 2 的 12 基准展开版:DICS 在 AI2D(26.93)、InfoVQA(26.63)、POPE(84.44)等基准上领先,Perplexity 基线崩至 83.50%,Length 仅 91.47%。
提供跨数据集实验的细粒度数据,便于分析 DICS 在不同能力维度上的增益分布而非只看平均分。
Table 3 的完整展开:含 Qwen2-VL-7B-Base(72.45)与官方 Qwen2-VL-7B-Instruct(102.46)参照行。DICS 微调的 Qwen2-VL 达 71.35 平均分(相对 101.25),距官方 Instruct 不足 1%;LLaVA-1.5-13B 用 7B 选择器达 101.79%。
给出弱到强迁移与架构无关性的全部细粒度数据,是判断'用小模型给大模型选数据'策略可行性的核心依据。