← 返回 2026-07-28

DecoupleMix:面向可扩展 VLM 数据配方的解耦比例搜索与凸分配 DecoupleMix: Decoupled Ratio Search and Convex Allocation for Scalable VLM Data Recipes

Jiahao Xie, Zhongbin Guo, Qianle Wang, Ruiqi Lu, Dongling Xiao, Wanxuan Sun, Cheng Yang 📅 2026-07-27 👍 7 2026-08-02 18:30
LLM-as-a-Judge VLM 凸优化 多模态预训练 数据配比优化

将 VLM 数据配方解耦为类间比例搜索与类内凸优化,实现可归因、可迁移的配比。

前置知识

Vision Language Model (VLM)

视觉语言模型将视觉感知、语言理解与跨模态推理统一在一个框架内,是构建通用多模态系统的主流范式,代表如 Qwen3-VL、LLaVA 系列。其能力高度依赖预训练阶段所用的图文混合数据。

本文讨论的全部内容都围绕如何为 VLM 的多模态继续预训练构造数据配方,不理解 VLM 训练流程就无法理解配方优化的意义。

Data Mixture Recipe(数据混合配方)

指训练数据的选择、组合与配额分配方案,包括不同能力类别之间的 token 预算划分(类间比例)以及同一类别内多个数据源之间的取舍(类内比例)。配方质量直接决定模型能力与数据效率。

本文的核心贡献就是把'数据配方'从经验堆叠变成可优化、可归因的工程问题,理解配方是理解全文的钥匙。

凸优化(Convex Optimization)

凸优化是指在凸可行域上最优化凹(或凸)目标函数的问题,其局部最优即全局最优,可高效求解。本文用熵正则项 $H(w)=-\sum_i w_i\log w_i$(凹函数)加上线性得分项,构成可由 ECOS 求解器处理的凸规划。

类内数据选择被形式化为一个带上下界约束的凸优化问题,这是本文方法可扩展、可复现的关键技术基础。

坐标下降 / 单变量搜索

一种迭代优化策略:每轮只变动一个变量(固定其余变量并重新归一化),保留使验证性能最优的取值,反复迭代直至稳定。它把指数级的多变量搜索降到线性时间复杂度。

本文用这种坐标式单变量过程搜索类间比例,避免了高维联合搜索的不可行性,是'解耦'思想的具体实现。

LLM-as-a-Judge

用一个大语言模型(本文用 Seed-1.6)作为自动评估器,对采样的样本进行打分或分类,替代昂贵的人工标注。本文对每个数据集采样 150 条,用判官模型给出质量分和难度分。

自动化数据集级评估是整个闭环的输入基础,其与人的一致性(Spearman r=0.82)决定了下游优化的可靠性。

研究动机

尽管 VLM 的数据治理日益活跃,但公开实践中构建预训练混合数据的方式仍然高度依赖经验:从业者把通过质量过滤的数据集简单堆叠起来,跨领域比例靠直觉设定,且缺乏一个有原则、可归因的'是否引入新数据'判据,而前沿模型的配方又对外保密。这导致两个突出问题。其一,过度依赖质量过滤:现有方法聚焦于清洗'噪声'数据,却缺乏对数据难度(Difficulty)和多样性(Diversity)的系统评估。其二,混合策略不系统:类间比例(如 Grounding 与 Caption 之间)通常凭直觉设置;类内(如有多个 OCR 数据集)则直接暴力堆叠所有过滤后的数据,忽略冗余。结果是把所有数据'重新堆叠并重训'的消融实验会让全局预算、类间比例同时变动,性能变化被多重因素混淆,难以判断某个数据源的真实贡献。

本文的目标是本文的目标是把'构造继续预训练数据'这件事变成一项可复现的工程学科。具体而言,作者将数据构造形式化为一个系统的混合物优化问题,并把它拆解为两个正交的子问题——跨能力的类间比例分配(inter-class)与类别内部的类内成分组合(intra-class),分别用单变量迭代搜索和带多样性目标的约束凸优化来求解。在此之上,作者希望提供一个标准化的数据准入判据:在固定类间比例、总预算和类内优化器的前提下,把引入一个候选数据集变成一次可控、可归因的干预实验,从而清晰回答'这个数据源该不该收'这一策略级问题。最终目标是用小规模代理模型(2.5B tokens)上搜到的配方,无缝迁移到更大规模而无需重新调参,并以仅 80B 多模态继续预训练 token 的预算做出有竞争力的开源级模型。

与已有工作不同的是,本文的独特切入角度在于:它把单个数据集(而非单条样本)作为最小评估和分配单元,这恰好契合工业界数据按'数据集'组织、内聚性强的现实,也避开了样本级标注噪声和高维不可行搜索。更关键的是,作者敏锐地抓住了'数据准入会被全局混淆'这一被以往工作忽视的方法论问题,通过对性能函数 $P=f(r,x,T)$ 做一阶泰勒展开 $dP=\nabla_r f\cdot dr + \sum_c \nabla_{x_c} f\cdot dx_c + \frac{\partial f}{\partial T}dT$,指出只有同时固定 $r$、$T$ 和优化器 $g$,才能让引入数据集的效应 $\Delta P_{d^\star}=f(r,g(D\cup\{d^\star\}),T)-f(r,g(D),T)$ 完全归因于该候选本身。这种'把数据验收做成受控实验'的视角是以往堆叠式工作所没有的。

核心方法

DecoupleMix 是一个由三个核心模块构成的闭环系统。直觉上,作者认为'到底该混什么'这个庞大问题可以拆成两件相对独立的事:一是不同能力类别之间各分多少 token(宏观结构),二是同一类别里多个候选数据源如何分摊它们的那份预算(微观组合)。第一个模块是自动化数据集级评估:作者把 VLM 能力组织成一个可扩展的层级分类法,从业者用自然语言定义类别标准,由判官模型自动分类,并对每个数据集(而非样本)评估质量分 $q_i$(4 个维度加权,惩罚幻觉)和难度分 $d_i$(6 个维度聚合,强调跨模态综合与先验知识),每个数据集采样 150 条由 Seed-1.6 打分,多样性则不在数据集级评分,而是在优化阶段用熵项结构性地强制保证。第二模块是解耦的混合优化:类间用坐标式单变量搜索(从参考配方均值作为热启动 $r^{(0)}$,每轮扫描一个类别并归一化其余),类内用约束凸规划(每类在分配预算 $T_c=r_c T$ 下独立求解)。第三模块是标准化准入判据,用 MCQ 在代理模型上做闭式验证。

最核心的创新是'解耦'与'可归因'两件事。与以往样本级过滤(相似度过滤、模型质量筛选、质量-多样性联合选择)或 DoReMi/RegMix 等用小规模训练预测未见配方的方法不同,DecoupleMix 把数据治理放在'数据集'这一更高、更符合工业实践的粒度上,并把'混什么'显式拆成两个轴:类间比例当超参做单变量搜索,类内成分当凸规划带熵正则项求解。其类内目标是 $\max_{w\in\Delta^{N-1}}\sum_{i=1}^{N}w_i(\alpha q_i+\beta d_i)+\gamma H(w)$,s.t. $\ell_i\le w_i\le u_i$,其中熵项 $H(w)=-\sum_i w_i\log w_i$ 抑制过度集中于少数高分数据集。更具方法论新颖性的是准入协议:固定 $r$、$T$、$g$,让候选只进入一个类,由凸规划做预算守恒的再平衡,于是性能变化可被完全归因,且凸规划还能零成本筛掉分到零配额的数据源。

方法步骤详情

完整流程分五步。第一步,数据集级评估:每个候选数据集采样 150 条,由判官 Seed-1.6 按可扩展分类法归类,产出质量分 $q_i$(4 维,惩罚幻觉)与难度分 $d_i$(6 维,强调跨模态综合),与人一致性 Spearman r=0.82/0.75。第二步,类间搜索:以参考配方均值为热启动 $r^{(0)}$,每轮只扫一个类别、固定并归一化其余,保留使 MCQ 验证最优的取值,迭代至稳定,复杂度线性。第三步,类内凸优化:在每类预算 $T_c=r_c T$ 下用 ECOS 解 $\max_{w\in\Delta^{N-1}}\sum_i w_i(\alpha q_i+\beta d_i)+\gamma H(w)$,s.t. $\ell_i\le w_i\le u_i$,输出配额 $t_i=T_c w_i$。第四步,数据准入:把候选 $d^\star$ 放入唯一一类,固定凸规划重解该类,测 $\Delta P_{d^\star}$。第五步,迁移:2.5B 代理配方直接用到 5B/10B token 与 32B 模型。评估用 16 基准、5 域,视频采 8 帧。

技术新颖性

技术新颖性体现在四个层面。第一,粒度创新:以数据集为原子单元而非样本,匹配工业流水线、降低标注噪声,让数百个源的优化保持可行。第二,解耦创新:首次在 VLM 场景把类间预算分配(单变量搜索)与类内数据集分配(凸优化)显式分离并联合求解,区别于 MM1 等只证明比例重要、或 LLaVA-OneVision/Bee 只给出固定参考配方的工作。第三,目标创新:用熵正则项 $H(w)$ 在凸框架内结构性地强制多样性,避免贪心质量选择把预算堆在少数易分高分集上(实验显示纯质量选择会让 Math&Logic 掉到 27.0)。第四,方法论创新:用一阶泰勒展开论证准入协议的可归因性,把'是否引入数据源'从昂贵且混淆的'重堆重训'升级为受控干预,并用凸规划的零配额结果作为低成本预筛。这套组合让数据治理第一次具备了可复现、可迁移、可归因的工程属性。

Overview of DecoupleMix.
Figure 1: Overview of DecoupleMix.

实验结果

实验从四维度展开。端到端(Table 1):用 80B 多模态继续预训练 token、指令微调前评测,4B 与参数匹配的 Qwen3-VL-4B 总均分打平(62.5 vs 62.5),1B 逼近更大的 2B(52.3 vs 53.7),增益集中在 PuzzleVQA(49.0 vs 43.0)、CharXiv(63.7 vs 59.9)。可归因准入(Table 2):引入一个 OCR 数据集时本文协议目标域 +0.3、非目标域偏移≤0.6、均分 +0.2,而 Stack 最大非目标偏移 1.1、Displace 让 General 退化 −2.3。缩放(Table 3):2.5B/5B/10B 三规模稳定领先基线 +1.6/+2.0/+1.4。跨模型迁移(Table 4):代理配方直用 32B,均分 62.7 vs 堆叠 61.5(+1.2),16 项领先 13 项。消融(Table 5/6):Inter+Intra 58.2 高于仅类间 57.1、堆叠 56.6;类内凸分配 48.7 优于纯质量 47.1、数量比例 46.0,OCR 域改善最大(52.7 vs 44.8)。

Comprehensive Performance Comparison.
Table 1: Comprehensive Performance Comparison.
Attributable validation of single-dataset admission.
Table 2: Attributable validation of single-dataset admission.
Comprehensive Scaling Analysis.
Table 3: Comprehensive Scaling Analysis.
Cross-model-scale transfer to 32B.
Table 4: Cross-model-scale transfer to 32B.
Ablation on Decoupled Strategies.
Table 5: Ablation on Decoupled Strategies.
Intra-class allocation under a fixed inter-class budget.
Table 6: Intra-class allocation under a fixed inter-class budget.
查看结构化数据
任务指标本文基线提升
16 项多模态基准总均分(4B 参数匹配) Avg(16 基准均值) 62.5(80B token,指令微调前) Qwen3-VL-4B-Instruct 62.5 打平,并在 PuzzleVQA +6.0、CharXiv +3.8
16 项多模态基准总均分(1B vs 更大 2B) Avg 52.3 Qwen3-VL-2B-Instruct 53.7 以更小参数逼近更大模型,PuzzleVQA +16.8、MVBench +3.4
缩放数据规模对比堆叠基线 Avg 差距 2.5B/5B/10B 全领先 启发式堆叠 +1.6 / +2.0 / +1.4,配方跨规模无需重调
跨模型规模迁移(32B) Avg 62.7(2.5B 配方直用) 堆叠 61.5 +1.2,16 项领先 13 项(如 OCR +2.1)
类内分配策略对比(1B token 预算) Avg 凸分配 48.7 纯质量 47.1 / 数量比例 46.0 OCR 域 52.7 vs 44.8,熵正则保长尾覆盖

局限与改进

作者明确列出若干局限。其一,缩放范围:研究仅覆盖 2.5B–10B token,模型级迁移只在 32B 参数上验证,未触及前沿工业预训练的更大 token 预算下的趋势。其二,优化算法:单变量类间搜索与凸类内规划刻意保持可解但很可能次优,更丰富的联合搜索或更有表达力的目标或能改善配方。其三,模态覆盖:仅在视觉-语言模型上验证,扩展到全模态(音频、视频原生等)未测试。其四,判官评估受限于冻结判官 Seed-1.6 的能力,且把每个数据集当作原子的质量-难度单元,排除了更细的样本级增益。我额外观察到的局限包括:端到端对比(Table 1)只能算描述性而非因果,因为基线在数据、规模、训练上均有差异;准入效应只在代理尺度测得,迁移到大尺度后该效应本身未被重测;16 项基准里多项指标本工作仍略低(如 OCRBench、MME、AI2D),说明并非全维度占优。

独立分析的弱点

独立分析下我认为存在几处可改进的弱点。第一,类间搜索是逐维单变量坐标下降,容易陷入局部最优、忽略类别间的交互效应——改进方向是引入贝叶斯优化或基于小规模外推的代理模型做联合搜索,类似 RegMix 的回归预测。第二,类内目标是质量分、难度分的线性加权加熵正则,假设收益与得分线性相关,无法刻画数据集间的非线性互补/替代——可考虑用学习型代理函数替代手工得分项。第三,每个数据集仅采样 150 条做评估,对高度异质的内部数据集可能代表性不足,且强烈依赖 Seed-1.6 这个冻结判官;可引入多判官集成或样本级置信度加权。第四,可归因协议的关键假设是 $r$、$T$、$g$ 可被真正固定,但在持续进化的数据池里,类间比例本身可能需要周期性重搜,文中对'多久重搜一次'缺乏讨论。第五,模态只覆盖图文,视频部分仅统一采 8 帧,对长视频、音频等原生多模态未触及。

未来方向

作者指出的未来方向包括:把缩放规律推广到前沿级 token 预算并发布相应趋势;设计更丰富的联合搜索与更具表达力的目标函数;把框架扩展到全模态模型(音频、视频等);以及突破冻结判官的能力上限。基于本文成果,我认为还可延伸出几个方向:一是把数据集级评估与样本级去重/去噪结合,形成层级化的混合粒度治理;二是把可归因准入协议与在线主动学习结合,让数据池在训练过程中持续自适应更新;三是研究不同判官模型对配方搜索结果的敏感度,建立判官鲁棒性基准;四是把迁移性量化成显式的缩放律,给出'代理尺度要多大才足够稳定迁移'的理论界;五是把该方法迁移到后训练/对齐阶段的数据配比,而不仅是继续预训练。

复现评估

复现难度较高但核心算法可复现。论文未提及代码或具体数据集的开源,配方涉及 ByteDance 内部基础设施与内部数据源,且判官用的是 Seed-1.6(半内部),这些都显著抬高了端到端复现门槛。不过方法本身的数学部分清晰可落地:类内凸规划用 ECOS 求解、目标与约束(含 $\ell_i$、$u_i$ 的归一化)都有明确定义,类间单变量搜索与热启动方式描述清楚,评估协议(16 benchmark、5 域、视频 8 帧、MCQ 闭式验证)也给出细节,并在 Appendix B/C 提供判官 prompt 与超参。算力方面,完整规模需 80B 多模态继续预训练 token(1B 与 4B 两个模型),加上多轮代理搜索(2.5B 起)与 32B 迁移验证,属于工业级算力投入,学术小组难以独立复现完整结果,但可在小代理尺度上验证算法逻辑与相对趋势。