← 返回 2026-09-01

DICS:面向视觉指令选择的样本内在一致性探索 DICS: Exploring Data Intrinsic Consistency for Visual Instruction Selection

Yuyang Hong, Jinhui Guo, Jiaqi Gu, Lubin Fan, Ruixiang Wang, Kun Ding, Yue Wu, Shiming Xiang, Jieping Ye 📅 2026-08-31 👍 2 2026-09-01 18:30
多模态大模型 数据质量评估 数据选择 视觉指令微调 高效训练

以图像-指令-回答的损失差分一致性为样本打分,25%数据即可超越全量微调

前置知识

视觉指令微调(Visual Instruction Tuning)

在多模态大模型预训练之后,用(图像,指令,回答)三元组构成的对话数据对模型做监督微调,使其能理解人类指令并基于图像内容作答。LLaVA、InstructBLIP 等模型都依赖这一阶段建立视觉与语言的对接,数据规模从几十万条(LLaVA-1.5-665K)到千万级(InternVL3 用 21.7M)不等。

本文要解决的问题正是这一阶段的数据筛选:只有理解视觉指令微调的数据构成与训练方式,才能明白'选哪 25% 的数据'为何能决定模型最终性能。

交叉熵损失与信息增益

语言模型用交叉熵损失 $\mathcal{L}=-\log p(t_i|c,t_{<i})$ 衡量预测下一个 token 的难度。若加入条件 $c'$ 后损失下降,说明 $c'$ 带来了信息增益。本文用有/无图像两种条件下的加权损失差 $\mathcal{L}^w(y|x)-\mathcal{L}^w(y|x,I)$ 量化图像对回答的信息贡献,并经 $\exp(\cdot)$ 映射为正数得分。

VIC 与 RIC 两个核心指标全部建立在损失差分之上,不熟悉'损失下降=信息增益'这层关系就无法读懂打分公式的含义。

IFD(Instruction Following Difficulty)

纯文本指令数据选择的经典指标:比较'有指令时生成回答的损失'与'无指令时的损失'之差,衡量回答对指令的依赖程度,从而筛出真正跟随指令的样本。本文把这一思想扩展到多模态,但指出它无法评估视觉信息的贡献。

IFD 是本文方法最直接的思想源头(作者自述受其启发),也是重要基线之一(在 665K 上仅 87.58% 相对性能),对比它能看清多模态扩展的必要性。

最远点采样(FPS)

一种贪心多样性采样算法:先选一个起点,之后每轮都选与已选集合距离最远的样本,直到选满 $k$ 个,使子集在嵌入空间中尽量铺开、覆盖原始分布。本文用最后一层 final-token 隐状态(4096 维)作嵌入,时间复杂度 $O(kMd)$。

DICS 的第二阶段就是在高 DIC 候选池内用 FPS 做多样性采样,理解它才能理解'质量排序 + 多样性采样'的完整选择流程。

词性(POS)加权

用 spaCy 为每个 token 标注词性并赋权:名词、动词、形容词、副词、数词等内容词权重 $w_i=1.0$;冠词、介词、连词、代词、助动词、标点等功能词权重 $w_i=0.1$。加权损失 $\mathcal{L}^w$ 让高频但信息稀疏的功能词不会主导打分。

消融实验显示去掉该加权会使相对性能从 101.40% 掉到 100.25%,它是指标保持语义敏感性的关键工程细节。

对象幻觉与评测基准(POPE / HallusionBench)

对象幻觉指模型把图像中不存在的物体描述为存在。POPE 通过'图中是否有 X'的是非轮询探测此类幻觉;HallusionBench 进一步考察视觉错觉与推理一致性。本文认为低 VIC/RIC 的脏数据是幻觉的重要来源。

幻觉缓解是本文核心卖点之一:RIC 单独使用时在 POPE(85.83)上全场最高,理解这些基准才能读懂消融实验中 VIC/RIC 的分工结论。

研究动机

视觉指令数据规模正快速膨胀:LLaVA-1.5-665K 聚合约 66.5 万条样本,InternVL3 的 SFT 语料达 2170 万条,全量微调的算力与时间成本极高,因此必须在固定采样比例下挑出最有价值的子集。现有方法大体分三类:一是基于全局分布多样性的表示类方法(DataTailor、PRISM 用嵌入聚类保证概念覆盖);二是基于训练动态/梯度的方法(LESS 的低秩梯度相似度、COINCIDE/ICON/TIVE 的影响函数);三是启发式过滤(按长度、CLIP-Score、Perplexity、IFD 打分)。它们的共同盲区是只关心样本之间的关系或表层统计量,完全忽略单个样本内部图像、指令、回答三者的自洽性。后果有两类:低视觉依赖样本(不看图也能答)会鼓励模型依赖语言先验、诱发幻觉;回答与指令脱节的样本则破坏视觉-语言对齐。这些缺陷在实验中可直接量化:按长度过滤只有 88.79% 的相对性能,纯文本的 IFD 只有 87.58%,即便最强的基线 PRISM 在 25% 比例下也只有 97.66%,全部低于全量训练。

本文的目标是本文要回答的问题是:能否定义一个样本级、无需外部大模型评审、只需前向推理的自评分指标,直接度量'图像-指令-回答'三元组的内在一致性,并据此在任意数据预算下选出高质量子集?具体目标拆解为三点:(1)提出 DIC 指标,由视觉信息一致性 VIC(图像对生成回答是否提供关键信息)与回答信息一致性 RIC(回答是否紧扣指令且忠实于图像)组成,取二者最小值作为严格门槛;(2)设计预算自适应的选择策略 DICS:低比例时优先高 DIC 样本并保持多样性,高比例时剔除低 DIC 冗余样本;(3)验证可扩展性:在 LLaVA-1.5-665K、Vision-FLAN-186K 上用 25% 数据达到甚至超过全量微调,并构建 600 万样本的 DICS-6M 语料,在 InternVL3-8B 上完成迄今最大规模的视觉指令选择实验,用不到官方 25% 的数据量逼近官方 Instruct 模型。

与已有工作不同的是,本文的独特切入是把'数据质量'从样本间关系(多样性、影响力)拉回到样本内部的信息结构:一条好数据应让图像对回答不可或缺、回答对指令不可或缺。技术上有三个与已有工作本质不同的点。其一,用同一个 VLM 的损失差分做双向信息增益对比:VIC 对比有/无图像时回答的损失,RIC 对比有/无回答时指令的损失,这与只做单向图文对齐的 CLIP-Score(把'语义相关'与'视觉必要'混为一谈)有本质区别。其二,RIC 采用'逆预测'任务——让模型根据图像(和回答)反推原始指令,泛泛而谈的回答(如'这是一张图片')无法在反推指令时提供增益,从而被自动惩罚,这是纯文本 IFD 做不到的。其三,用 $\min(\mathrm{VIC},\mathrm{RIC})$ 而非求和/乘积融合,构成'两项都必须高'的严格门控——消融显示 Sum/Product 只有 98.61%/98.84%,而 min 达到 101.40%。此外,全程只需推理前向、无需梯度反传,成本随数据量线性增长,这与依赖反传的 LESS/COINCIDE 类方法形成鲜明对比。

核心方法

直觉上,一条高质量的视觉指令样本要同时满足两件事:模型必须看着图才能写出这个回答(图像提供不可替代的信息),且回答必须精准回应这个指令(而非答非所问或套用语言模板)。DICS 据此把选择拆成两个阶段。第一阶段是打分与排序:先用 5% 随机子集对基座模型做 LoRA 热身,得到一个仅用于打分的检查点(打完即弃,最终模型一律从原始预训练权重训练,避免泄漏);然后对每个样本 $(I,x,y)$ 计算两个分数——VIC 度量加入图像后回答预测损失下降的幅度,RIC 度量加入回答后指令重建损失下降的幅度,二者都用 POS 加权交叉熵并取 $\exp$ 保证为正,最后取 $\mathrm{DIC}=\min(\mathrm{VIC},\mathrm{RIC})$ 对全库降序排序。第二阶段是自适应采样:按目标比例 $p$ 分三种情况——$p<50\%$ 时取 top-$2p$ 做候选池,再用最远点采样(FPS)从中选出 $p$;$p=50\%$ 直接取 top-50%;$p>50\%$ 时保留 top-$(2p-1)$ 为核心集,再从剩余样本中用 FPS 补选 $(1-p)$。这样低预算时强调样本质量、高预算时剔除低质冗余,质量与多样性随预算自动平衡。

核心创新是用'部分条件 vs 完整条件'的损失对比,把样本内部一致性变成可计算的标量。VIC 定义为 $\mathrm{VIC}(I,x,y)=\exp(\mathcal{L}^w(y|x)-\mathcal{L}^w(y|x,I))$:计算'无图'损失时直接遮蔽输入序列中的图像 token(换成无关图像的替代方案结果相近),损失差越大说明图像对回答越不可或缺;反之,不看图也能答、甚至含幻觉的样本得分趋近 1 或更低。RIC 是镜像设计:$\mathrm{RIC}(I,x,y)=\exp(\mathcal{L}^w(x|I)-\mathcal{L}^w(x|y,I))$,通过精心设计的提示让模型'根据图像(和回答)猜出最可能的问题',只有回答包含指令特有的语义线索时才能大幅降低指令重建损失,从而系统性惩罚通用、低信息的回答。两个方向合成 $\min$ 后,一条样本只有在'图像必要'与'回答紧扣指令'两个维度都达标时才能入选。与已有方法的本质区别在于:它度量的是样本内在一致性,而非全局分布属性(DataTailor/PRISM)或训练动态(LESS/COINCIDE),且完全不需要昂贵的外部 LLM 逐条评审。

方法步骤详情

完整流水线分四步。第一步,热身:在 5% 随机子集上对基座模型(如 LLaVA-1.5-7B-Base)做 LoRA 微调,该检查点只用于打分,打完即弃。第二步,计算 VIC:先用 spaCy 标注词性并赋权(内容词 $w_i=1.0$、功能词 $w_i=0.1$),加权损失为 $\mathcal{L}^w(y|c)=-\sum_{i=1}^{N} w_i\log p(t_i|c,t_{0.5$:核心集 top-$(2p-1)$,FPS 从剩余补 $(1-p)$)。FPS 特征取最后一层 final-token 隐状态(4096 维),GPU 批处理下百万样本选 10 万只需单张 A100 几分钟;打分整体复杂度 $O(NF)$ 线性,嵌入提取与打分共享同一批前向传播。

技术新颖性

技术新颖性可从四个层面评估。(1)指标层面:首次把'双向信息增益一致性'引入视觉指令选择——VIC 沿用并改造了文本 IFD 的差分思想,但把差分对象换成图像条件;RIC 的逆预测任务设计在多模态数据选择中是新的,天然抑制模板化回答。(2)融合层面:$\min$ 算子看似简单,实验证明是关键——Sum(98.61%)与 Product(98.84%)会让单项虚高补偿另一项短板,只有 min 构成'双高'硬门槛,这为质量指标组合提供了可复用的设计经验。(3)流程层面:打分与嵌入提取共享前向、无需梯度反传,复杂度 $O(NF)$ 线性,比 COINCIDE(选择耗时 16.3h)、DataTailor(14.5h)更快(12.0h),且随数据规模优势扩大。(4)性质层面:作者验证了 DIC 的跨架构迁移性——用 LLaVA-1.5-7B 打分选的数据给 Qwen2-VL-7B 训练达 101.25%,给 LLaVA-1.5-13B 训练达 101.79%(弱到强),说明它捕捉的是通用样本特性而非打分模型偏好,这让小模型可以当'数据裁判'为大模型服务,大幅降低大规模数据治理成本。

Examples of Data Intrinsic Consistency in Visual Instruction Data. (a) High-quality samples exhibiting both high VIC and RIC. (b) Low-VIC samples showing low visual dependency between cross-modal inputs and responses. (c) Low-RIC samples showing weak alignment of the response with the image and instruction.
Figure 2: Examples of Data Intrinsic Consistency in Visual Instruction Data. (a) High-quality samples exhibiting both high VIC and RIC. (b) Low-VIC samples showing low visual dependency between cross-modal inputs and responses. (c) Low-RIC samples showing weak alignment of the response with the image and instruction.
Overview of Data Intrinsic Consistency Selection (DICS).
Figure 3: Overview of Data Intrinsic Consistency Selection (DICS).
Task distribution of the DICS-6M instruction dataset.
Figure 6: Task distribution of the DICS-6M instruction dataset.

实验结果

主实验围绕 12 个基准展开(MME、MMBench-en/cn、MMMU、SQA-I、VizWiz、AI2D、DocVQA、InfoVQA、POPE、HallusionBench、MM-Vet,覆盖通用/知识推理/文档理解/幻觉/开放对话五个维度)。(1)LLaVA-1.5-665K 25% 子集(166K,LLaVA-1.5-7B):DICS 相对全量性能 101.40%,明显超过全量(100%);MME 63.39 vs 全量 59.92(+3.47),MMBench-CN 55.03 vs 51.93,MMMU 36.11 vs 35.89,DocVQA 24.64 vs 23.82,InfoVQA 23.11 vs 22.30,POPE 84.91 vs 84.49;基线方面 CLIP-Score 98.66%、PRISM 97.66%、DataTailor 97.17%、Random 96.69%、Length 88.79%、IFD 87.58%;5 次重复实验标准差 ≤0.13,优势显著。(2)采样比例曲线:DICS 在 50% 时达到峰值 103.15%,低比例(<25%)时领先最大;PRISM/DataTailor 峰值出现在约 75%。(3)Vision-FLAN-186K 25%:DICS 99.91% 几乎追平全量,超过 PRISM(98.48%)等所有基线,验证跨数据分布稳健性。(4)跨架构:Qwen2-VL-7B 用自己打分的子集 100.91%,用 LLaVA-7B 打分的子集 101.25%;LLaVA-1.5-13B 用 7B 选择器的数据达 101.79%。Qwen2-VL-7B-Base 平均分 51.05,DICS 微调后达 71.35,距官方 Instruct(72.20)不足 1%。(5)DICS-6M + InternVL3-8B:85% 比例(5.1M)最优,超 6M 全量 3.10%;相对官方 InternVL3-8B-Instruct(21.7M 数据,相对分 109.08)达到 94.52%。(6)消融:FPS 仅多样性 97.02%,VIC-only 101.02%,RIC-only 97.60%(但 POPE 85.83 全场最高),Sum 98.61%,Product 98.84%,去掉 POS 加权降至 100.25%;Top-K/Hierarchical/FPS 三种采样策略下 DICS 均超过全量(100.40%/101.39%/101.40%)。(7)指标有效性验证:把图换成无关图后 VIC 中位数下降 43.0%(AUC 0.816),注入幻觉下降 32.8%(AUC 0.689),通用化回答使 RIC 下降 13.1%(AUC 0.701);750 样本的人评与 VLM 评审(Qwen3.5-397B)显示 DIC 高分组质量分单调更高(人类均分 2.58→2.92→3.17),Spearman 相关 ρ=0.27(人类)/0.20(VLM),p<0.001。(8)效率:665K 打分约 12h(8×A100),25% 子集总耗时 14h vs 全量 15h;6M 选择+训练共 85h(32×A100),比全量省 5h 且性能高 3.10%。

Performance comparison of data selection methods using 25% of Vision-FLAN dataset. (Sampling Ratio: 25%)
Table 2: Performance comparison of data selection methods using 25% of Vision-FLAN dataset. (Sampling Ratio: 25%)
Generalization across architectures on LLaVA-1.5-665K. Average performances are reported.
Table 3: Generalization across architectures on LLaVA-1.5-665K. Average performances are reported.
Performance comparison on the 6M large-scale dataset using InternVL3-8B.
Table 4: Performance comparison on the 6M large-scale dataset using InternVL3-8B.
Ablation study on DICS. (Sampling Ratio: 25%)
Table 5: Ablation study on DICS. (Sampling Ratio: 25%)
Robustness across selection strategies and combinations. We evaluate different scoring metrics combined with various sampling methods at a 25% ratio.
Table 6: Robustness across selection strategies and combinations. We evaluate different scoring metrics combined with various sampling methods at a 25% ratio.
Composition of the DICS-6M instruction dataset.
Table 7: Composition of the DICS-6M instruction dataset.
Detailed hyperparameter settings and implementation specifics of DICS.
Table 8: Detailed hyperparameter settings and implementation specifics of DICS.
Mean scores and standard deviations over 5 independent runs. The results correspond to the overall performance in Table 1 and Table 2.
Table 10: Mean scores and standard deviations over 5 independent runs. The results correspond to the overall performance in Table 1 and Table 2.
Ablation study on Data Intrinsic Consistency (DIC).
Table 12: Ablation study on Data Intrinsic Consistency (DIC).
Ablation study on selection strategies.
Table 13: Ablation study on selection strategies.
Evaluation metrics under controlled corruption analysis.
Table 14: Evaluation metrics under controlled corruption analysis.
Quality scores across different DIC quantiles evaluated by VLM-as-Judge and human annotators.
Table 15: Quality scores across different DIC quantiles evaluated by VLM-as-Judge and human annotators.
Computational cost analysis on LLaVA-665K (N=665K) using 8×A100 GPUs.
Table 16: Computational cost analysis on LLaVA-665K (N=665K) using 8×A100 GPUs.
Computational cost comparison (in hours) among different methods.
Table 17: Computational cost comparison (in hours) among different methods.
Visualization of DIC. We contrast samples with high and low VIC/RIC scores.
Figure 4: Visualization of DIC. We contrast samples with high and low VIC/RIC scores.
Qualitative comparison on text-to-image attention maps for the query: "What color is the horse in the image?" (Answer: "Brown."). DICS exhibits more precise visual grounding.
Figure 5: Qualitative comparison on text-to-image attention maps for the query: "What color is the horse in the image?" (Answer: "Brown."). DICS exhibits more precise visual grounding.
The distribution of DIC scores of 25% selected data of LLaVA-1.5-665K dataset.
Figure 7: The distribution of DIC scores of 25% selected data of LLaVA-1.5-665K dataset.
More visualization of DIC scores.
Figure 8: More visualization of DIC scores.
Analysis of attention. Compared to the random selection baseline, DICS encourages the model to pay more attention to the core visual details, rather than irrelevant background information.
Figure 9: Analysis of attention. Compared to the random selection baseline, DICS encourages the model to pay more attention to the core visual details, rather than irrelevant background information.
查看结构化数据
任务指标本文基线提升
视觉指令选择(LLaVA-1.5-665K 25% 子集,LLaVA-1.5-7B) 12 基准平均相对全量性能 (%) 101.40 全量 665K 微调 = 100.00;学习型最强基线 PRISM = 97.66 +1.40 vs 全量;+3.74 vs PRISM
LLaVA-1.5-665K 25% 子集(单项基准) MME / MMBench-CN / DocVQA 63.39 / 55.03 / 24.64 全量微调:59.92 / 51.93 / 23.82 +3.47 / +3.10 / +0.82
Vision-FLAN-186K 25% 子集 5 维平均相对性能 (%) 99.91 全量 100.00 / PRISM 98.48 / CLIP-Score 97.90 基本持平全量(-0.09),超过所有基线
跨架构迁移(Qwen2-VL-7B 训练,25% 子集) 12 基准平均相对性能 (%) 101.25(LLaVA-7B 打分)/ 100.91(Qwen2-VL 自打分) 全量 100.00 / Random 100.21 +1.25 / +0.91
弱到强迁移(LLaVA-1.5-13B 训练,7B 模型打分) 12 基准平均相对性能 (%) 101.79 全量 100.00 / Random 99.93 +1.79(所有设置中最大增益)
大规模选择(DICS-6M + InternVL3-8B) 5 维平均相对 6M 全量 (%) 103.10(85% 比例,5.1M 样本) 6M 全量 = 100.00;官方 InternVL3-8B-Instruct(21.7M)= 109.08 +3.10 vs 全量;以官方 23.5% 的数据量达到官方模型 94.52% 的性能
指标消融(LLaVA-1.5-665K 25%) 12 基准平均相对性能 (%) min(VIC,RIC)=101.40;VIC-only=101.02;RIC-only=97.60 FPS 仅多样性 = 97.02;Sum = 98.61;Product = 98.84 +4.38 vs 仅多样性;min 融合比 Sum/Product 高 2.6~2.8 个点

局限与改进

作者明确承认的局限:一致性评估目前只覆盖图文模态,未扩展到视频、音频;最优采样比例 $p$ 不固定,随数据集和指标变化,实践中仍需小规模实验确定。我补充几点观察:其一,打分模型来自 5% 随机子集的热身,其视觉感知与知识偏差会系统性传导给 DIC 打分,论文未分析热身规模与质量的敏感性;其二,纯文本样本 VIC 恒为 1.0,在混合语料中这类样本自动通过 VIC 门控、只受 RIC 约束,与图文样本的筛选标准不对称;其三,DIC 与人类质量评分的 Spearman 相关只有 0.27(VLM 评审 0.20),说明它捕捉的是'一致性'而非全部质量维度,排序尾部(低-中分位)的可信度有限;其四,在高比例(>75%)区间所有方法都趋于饱和,DICS 的相对收益缩小,主要价值集中在低中预算场景;其五,665K 打分需约 12 小时多卡推理,虽然复杂度线性,但在亿级语料上仍是不小的固定开销,且 FPS 嵌入质量依赖打分模型的表征能力。

独立分析的弱点

独立分析发现以下弱点,并附改进方向。(1)min 门控的误杀问题:一条'图像信息极强但回答质量一般'的样本(例如标注略有瑕疵的好图)会被 min 卡掉,而这类样本恰恰可能是稀有视觉知识的来源;可改为按 VIC/RIC 分别做分层配额,或给低分维度一次修复后复评的机会。(2)逆预测提示固定为英文模板:对中文指令、OCR 密集型样本,'猜问题'任务的难度不均衡,可能造成语言与任务类型上的系统性偏差;可按任务类型自适应选择提示或对分数做分域校准。(3)热身检查点只训 5% 随机数据:小规模热身对长尾领域(如医学图表、遥感图像)的感知不足,DIC 可能系统性低估此类样本;可用领域分层热身或集成多个热身模型打分。(4)一致性不等于正确性:一个图文一致但事实错误的样本照样得高分,而人评相关系数 ρ=0.27 也说明 DIC 只是质量的代理变量;可叠加事实校验模块,或用强模型对高分层做抽查。(5)超参均为经验设定:候选池系数 2、POS 权重 0.1/1.0、FPS 特征取 final-token 等都缺少敏感性分析;应报告这些选择在不同数据分布下的鲁棒区间,否则跨语料迁移时调参成本未知。此外,评测集中在 7B/8B 规模,方法在更大模型上是否仍保持 1~3 个点的增益尚待验证。

未来方向

作者提出的方向:(1)把一致性评估从图文扩展到视频、音频等多模态,例如用帧间一致性、音画一致性定义类似的 VIC/RIC;(2)开发自适应策略自动决定子集大小与组成,摆脱对人工设定 $p$ 的依赖;(3)从'丢弃低 DIC 样本'转向'主动修复'——用强模型重写回答或更换图像,把脏数据转化为好数据。基于本文成果可延伸的方向:其一,把 DIC 接入训练过程做动态数据选择(curriculum 或在线重加权),随模型能力演化重新排序样本,替代一次性静态筛选;其二,用 DIC 引导数据合成——定向让生成模型生产'高视觉依赖 + 高指令贴合'的新样本,从源头扩大高质量数据池;其三,把 RIC 的逆预测思想推广为幻觉缓解的训练目标,例如在损失中加入'回答对图像条件的信息增益'正则项;其四,利用弱到强迁移性质构建'小模型打分—大模型训练'的常态化数据蒸馏流水线,并从信息论角度解释 min 融合与 FPS 分布覆盖组合有效的原因。

复现评估

复现条件总体友好。开源情况:代码将在 https://github.com/cqu-student/DICS 发布,作者承诺开源训练好的模型与 DICS-6M 语料;所用数据集(LLaVA-1.5-665K、Vision-FLAN-186K 及 DICS-6M 中的公开来源)均可获取,符合许可要求。工具与协议:打分用 spaCy 做 POS 标注,FPS 用最后一层 final-token 隐状态,评测统一走 VLMEvalKit、生成温度 0.0,开放题用 Qwen3-32B 作裁判,统计检验报告 5 次运行均值与标准差,协议清晰。算力需求:LLaVA-1.5 侧为 8×A100-40GB 的 LoRA 训练(1 epoch),665K 打分约 12 小时(仅推理前向);InternVL3-8B 全量微调需 32 卡、选择+训练共 85 小时,这对个人研究者偏高,但复现核心结论(Table 1/5)只需单机 8 卡。方法本身超参少、无需梯度反传,主要工程量在多卡推理调度与 12 个基准的评测搭建,整体复现难度为中等。