← 返回 2026-07-27

DataPrep-Bench:把大模型当作训练数据准备者的统一基准 DataPrep-Bench: Benchmarking LLMs as Training Data Preparators

Hao Liang, Qifeng Cai, Yibo Lin, Jianzhuo Du, Qifeng Xia, Sizhe Qiu, Linzhuang Sun, Meiyi Qiang, Zhaoyang Han, Xiaochen Ma, Bohan Zeng, Ruichuan An, Conghui He, Wentao Zhang 📅 2026-05-19 👍 53 2026-08-01 18:30
SFT数据 下游评测 域适应 基准测试 数据构造 数据质量评估 数据驱动AI 最大均值差异

首个统一下游驱动基准,同时评测LLM构造数据与评估数据质量两大能力

前置知识

监督微调(SFT)

Supervised Fine-Tuning 指在基座模型 $f_0$ 上用指令-回答配对数据 $X$ 继续训练,得到适配模型 $f(X)=\text{SFT}(f_0,X)$。本文所有下游评测都基于此范式,构造的QA数据与Dolly-15k联合训练。

DataPrep-Bench 把『数据有用』操作化为『SFT后下游分数』,理解SFT才能看懂整个benchmark评分逻辑。

最大均值差异(MMD)与RKHS

MMD在再生核希尔伯特空间 $\mathcal{H}_\kappa$ 比较两分布均值嵌入 $\text{MMD}^2=\|\mathbb{E}[\psi(x)]-\mathbb{E}[\psi(y)]\|^2$。用特征核(如高斯RBF $\kappa(x,y)=\exp(-\|x-y\|^2/2\sigma^2)$)时MMD=0当且仅当两分布相同。

DAS的核心算子就是MMD,理解它和核函数才能明白为何『分布对齐』能预测下游训练收益。

域适应理论

研究训练分布 $S_X$ 与目标分布 $T_X$ 不一致时源/目标风险关系。Redko Theorem 36给出界 $R_T(h)\le R_S(h)+d_{\text{MMD}}+\text{复杂度项}+\lambda/2$,分布距离越小目标风险上界越紧。

DAS理论依据正是此bound,把『训练数据与目标分布接近度』作为下游性能的训练前预测信号。

Dolly-15k

Databricks开源的约1.5万条人工撰写指令跟随数据,涵盖头脑风暴、分类、问答、生成等7类任务。本文把候选领域数据与它联合训练以隔离基础指令跟随能力,Dolly-only作对照基线。

它是所有构造方法的『公共底盘』,理解它才能看懂T1发现『添加合成数据反而拖累Dolly-only』。

ReAct智能体与技能(Skill)层

ReAct让LLM交替输出推理与工具调用,本文agent以Claude Code为执行环境在长文档上规划、切块、迭代验证。Skill是把任务语义、输出schema、过滤规则、覆盖约束封装成可复用控制接口的中间层。

Data-Construction-Skill关键创新是用skill层替代硬编码prompt,需理解二者区别才能看懂其优势。

皮尔逊相关系数

衡量两向量 $\mathbf{q},\mathbf{s}$ 线性相关 $\rho=\frac{\sum(q_i-\bar q)(s_i-\bar s)}{\sqrt{\sum(q_i-\bar q)^2\sum(s_i-\bar s)^2}}\in[-1,1]$。本文用它度量质量分数与下游性能的线性趋势,要求双侧 $p<0.05$ 才显著。

质量评估Track完全以Pearson相关为评测准则;作者特意选Pearson而非Spearman,因下游分数有真实数值尺度,需捕捉相对间距。

研究动机

训练数据质量决定LLM能力,但社区对『LLM能否当好数据准备者』缺可比标尺。问题分两层:第一,数据构造方法(Self-Instruct、Evol-Instruct、UltraChat、UltraMedical、MegaScience)各用不同源文档、基座、训练配方和下游benchmark,跨方法比较基本靠传闻;第二,质量评估方法(QuRating、Deita、Superfiltering、FineWeb-Edu、PairQual、Vendi Score等)只在单一backbone单一领域验证,没回答『训练前打分到底多可靠』。更隐蔽的是,作者实测发现Llama-3.1-8B上混入合成领域数据,多数生成器反而拖累Math(Dolly-only Avg 11.7)和Science(13.2)基线,而所有表面质量代理察觉不到这种回归,『数据越多越好』从未被端到端检验。

本文的目标是建一个统一、端到端、下游驱动的benchmark,同时覆盖LLM数据准备两条互补能力。第一条数据构造:给定相同原始源文档,让不同方法输出SFT数据,与Dolly-15k联合训练后用统一下游benchmark打分,把构造质量操作化为真实训练收益。第二条数据质量评估:给定候选数据集池,让打分函数 $Q$ 输出标量,用它与下游性能的Pearson相关度量预测可靠性。目标是让六领域(General/Math/Science/Medical/Finance/Law)、多基座共享同一原始源、训练协议、下游评测,使跨方法跨度量比较真正公平,并发布两个强基线作为参照点。

与已有工作不同的是,已有数据基准没填补空白:DataComp/DataComp-LM评测传统curation(启发式过滤、去重),DataPerf面向数据选择/清洗多模态榜单,DCBENCH只覆盖表格特征工程;都不把LLM当自主数据准备者评测。Data-Juicer和DataFlow只提供工具不做跨方法比较。本文独特切入有三:把构造与质量评估作为同等重要的双轨道在同一protocol下联合评测;所有评测grounding在真实下游训练性能而非表层属性,明确把质量定义为下游训练效用;候选池混入in-domain和out-of-domain数据制造性能梯度,强迫度量不仅排序正确还要间距合理。

核心方法

直觉是『数据决策只有让模型变好才算数』,两轨道都以真实下游性能为最终裁判。先把每领域原始PDF用MinerU统一转Markdown,所有构造方法吃同一份输入。构造轨形式化 $X_k^{(M)}=M(B_k)=\{(q_i,a_i)\}$,得分 $\text{Score}_{\text{con}}(M,D_k)=\text{Perf}(f(X_k^{(M)}),T_k)$;质量轨对每候选 $X_{k,i}$ 得配对 $(q_{k,i}=Q(X_{k,i}),\,s_{k,i}=\text{Perf}(f(X_{k,i}),T_k))$,用Pearson相关 $\rho(Q,D_k)$(要求 $p<0.05$)作可预测性指标。两轨道共享6领域、相同下游benchmark(Math用AIME/AMC/GSM8K/MATH等7个、Science用MMLU-STEM等7个)和统一协议(AIME温度0.6、MMLU-Redux 5-shot、LLM-as-judge校正语义等价答案)。

两核心创新与已有方法本质不同。Data-Construction-Skill把『什么算合法监督』从硬编码prompt抽到可复用skill层——打包任务指令、输出schema、质量约束、过滤规则、覆盖要求、验证工具,agent只负责规划执行。这区别于仍藏控制逻辑在prompt里的agent流水线和固定专家DataFlow流水线,既保规划灵活又稳定行为。DAS则从『逐样本评分再聚合』转向『数据集整体分布对齐』:$\text{DAS}(X_{k,i})=-d_{\text{MMD}}(\Phi(X_{k,i}),\Phi(X_k^{\text{proxy}});\kappa)$,把候选与领域代理在嵌入空间的分布距离作质量代理。理论依据是域适应bound:分布距离越小目标风险上界越紧。代理是目标分布 $P_k^\star$ 的可观测锚点,由MMD三角不等式证明只引入有界误差,同时避免测试集泄露。

方法步骤详情

Data-Construction-Skill流程:(1)结构感知切块 $C_k=\text{Chunk}(B_k)$,保留局部语义;(2)对每chunk判断是否含可复用知识,丢弃导航/噪声/重复chunk;(3)识别命题与关系(定义、规则、机制、条件、比较、因果);(4)自适应生成最多三类不相交QA:$G_{\text{concept}}$(概念)、$G_{\text{reason}}$(推理)、$G_{\text{case}}$(案例);(5)取并集 $X_k^{(\text{MDCS})}=\bigcup_{c\in C_k}G(c)$;(6)后处理剔除文档相对表述(如『根据上文』)和畸形/重复/弱支撑样本,维护chunk级记录支持断点续跑。DAS三步:(1)用Qwen3-Embedding-8B(4096维)编码 $X_{k,i}$ 与代理,每数据集采5000条;(2)用有偏经验估计算MMD,高斯RBF核带宽 $\sigma=1.0$ 固定;(3)返回 $\text{DAS}=-d_{\text{MMD}}$,越高越对齐。完全training-free。

技术新颖性

新颖性三方面。第一,DataPrep-Bench是首个把数据构造与质量评估作为同等目标、在共享领域/基座/训练协议/下游benchmark下联合评测的基准,明确把质量定义为下游训练效用而非表层属性。第二,Data-Construction-Skill首次把『技能』概念引入数据构造——位于高层目标与底层agent执行间的可复用控制接口,相对一次性prompt或刚性DataFlow能稳定agent行为、保证schema一致、支持断点续跑;三类QA模板是对监督类型的形式化分解。第三,DAS是首个基于MMD与领域代理的『数据集整体分布对齐』度量,相对逐样本打分再平均的QuRating/Deita更具理论根基,计算上比同等精度的BERTVendi(459s)和Deita-Quality(435s)快1.4-1.5倍(306s/数据集)。

Data construction prompt used to guide the LLM.
Figure 2: Data construction prompt used to guide the LLM.
Data construction prompt used to guide the agent.
Figure 3: Data construction prompt used to guide the agent.

实验结果

三大发现。T1——合成数据常拖累下游:Llama-3.1-8B上Dolly-only在Math(11.7)和Science(13.2)已不错,混入合成数据后多数生成器(含DataFlow/LLM/agent)反而拉低,而表层质量代理给这些数据打高分却察觉不到回归,证明端到端下游评测不可或缺。T2——无单一最优方法族:DataFlow-Skill在结构化领域领先(Qwen Finance 64.8、Law 74.7);agent类在推理重领域占多数顶尖;本文Skill在知识抽取密集领域最强,Llama-3.1-8B Finance把Dolly-only的15.1绝对提升近20点到34.2(+19.1),全表最大涨幅;Science和部分Law仍开放。T3——DAS最可靠:6领域里4个领先或并列第一,Math上Qwen/Llama $r>0.93$、$p<10^{-4}$,是唯一Math(0.86)/Science(0.72)/Medical(0.77)三领域Avg同破0.70的度量;现有度量要么窄域专家要么符号翻转;Finance(0.18)/Law(0.36)对所有度量都难。

Proxy datasets and candidate dataset pools across six domains.
Table 1: Proxy datasets and candidate dataset pools across six domains.
Performance of Qwen2.5-7B on Math, General, and Finance benchmarks after fine-tuning on datasets synthesized by different generators.
Table 2: Performance of Qwen2.5-7B on Math, General, and Finance benchmarks after fine-tuning on datasets synthesized by different generators.
Performance of Llama-3.1-8B on Math, General, and Finance benchmarks.
Table 3: Performance of Llama-3.1-8B on Math, General, and Finance benchmarks.
Performance of Qwen2.5-7B on Science, Law, and Medical benchmarks.
Table 4: Performance of Qwen2.5-7B on Science, Law, and Medical benchmarks.
Performance of Llama-3.1-8B on Science, Law, and Medical benchmarks.
Table 5: Performance of Llama-3.1-8B on Science, Law, and Medical benchmarks.
Pearson correlation between data quality metric and downstream performance on General, Math, and Science, with compute overhead.
Table 6: Pearson correlation between data quality metric and downstream performance on General, Math, and Science, with compute overhead.
Pearson correlation on Medical, Finance, and Law, with compute overhead.
Table 7: Pearson correlation on Medical, Finance, and Law, with compute overhead.
Number of training samples synthesized by each data construction method across six domains.
Table 8: Number of training samples synthesized by each data construction method across six domains.
查看结构化数据
任务指标本文基线提升
Finance 数据构造(Llama-3.1-8B,CPA-KQA/FinEval-KR/XFinBench均值) 下游Avg分 Skill (Claude Opus 4.6) = 34.2 Dolly-15k only = 15.1 +19.1绝对分(≈近20点),全表单领域最大涨幅
Math 数据构造(Qwen2.5-7B,7个数学benchmark均值) 下游Avg分 GPT-5.2 agent = 25.5;Skill = 24.1 Dolly-15k only = 23.6 agent族整体领先直接LLM和DataFlow;约+1.9
Finance 数据构造(Qwen2.5-7B) 下游Avg分 DataFlow-Skill = 64.8 Dolly-15k only = 57.8 +7.0,结构化领域专家工作流优势
数据质量预测(Math领域,3基座Avg Pearson相关) Pearson r DAS = 0.86(Qwen 0.93、Llama 0.94、Mistral 0.72,p<10⁻⁴) RewardModel = 0.79;Qurating-Expertise = 0.69 唯一同时Math/Science/Medical破0.70的度量
数据质量预测(Medical领域Avg Pearson相关) Pearson r DAS = 0.77(Qwen 0.73、Llama 0.87、Mistral 0.72) Qurating-Expertise = 0.65;Deita-Quality = 0.63 +0.12,分布对齐在医学知识密集领域优势明显
数据质量预测(Science领域Avg Pearson相关) Pearson r DAS = 0.72(与Qurating-Expertise并列最高) Task2Vec = 0.41;Perplexity = 0.45 DAS在Mistral上跌至0.53未显著,但Avg仍最高
度量计算开销(每候选数据集平均秒数) Wall-clock 秒 DAS = 306.02s BERTVendi = 459.37s;Deita-Quality = 434.99s 比同等精度基线快1.4-1.5×

局限与改进

作者承认:Finance和Law对包括DAS在内的所有度量都开放——DAS在Finance Avg仅0.18、Law仅0.36,因候选池结构性失衡(1个in-domain对7个out-of-domain,几乎无方差可排),且这两个领域专业惯例通用嵌入表达不好。Science上Skill在两基座都低于Dolly-only(13.2),作者归因Claude Opus 4.6 backbone在开放式科学推理上偏保守、产出稀疏,且某些agent的长案例答案更契合benchmark格式。候选池规模不对称(General 14个、其他8-10个)削弱小池子统计功效。LESS等基于梯度的influence方法因逐梯度计算代价过高且预设已知目标任务(task-agnostic协议冲突)被排除。我的额外观察:DAS对代理选择极敏感,若代理与 $P_k^\star$ 不对齐,三角不等式只保证有界误差但不保序;固定 $\sigma=1.0$ 和单一Qwen3-Embedding-8B对Finance/Law可能不合适;构造轨未做多seed重复,T1结论稳健性需谨慎。

独立分析的弱点

弱点一:DAS完全依赖代理数据集,代理选择本身是开放问题;建议把DAS与无参考质量评分、领域感知嵌入模型组合(作者future work也提及)形成多信号集成。弱点二:训练单点估计——Tables 2-5每格只跑一次微调无随机种子方差,3 epochs + LR $5\times10^{-6}$ 是否最优未做敏感性分析;建议多seed平均并报置信区间,尤其T1『合成数据有害』需稳健性验证。弱点三:构造轨数据量不可比——作者刻意不设统一上限,DataFlow 849K与直接LLM 12K混在一起训练,下游分数混淆『质量』与『产量』;建议增设等量子实验隔离二者贡献。弱点四:候选池in-domain稀缺,Finance/Law/Medical仅1个in-domain候选,Pearson统计功效极弱;建议扩池或改用bootstrap置信区间。弱点五:MMD带宽与编码器未做领域自适应,固定 $\sigma=1.0$ 可能就是Finance/Law失灵部分原因;建议median-heuristic带宽或多编码器集成。

未来方向

作者明确计划三方向:(i)随更多高质量in-domain SFT语料公开扩充Finance/Law/Medical候选池;(ii)针对开放式科学推理设计专用skill-guided方法弥补Skill在Science的不足;(iii)把DAS与互补信号(无参考质量评分、领域感知嵌入模型)配对提升Finance/Law可靠性。基于成果可延伸方向:第一,把DAS从被动预测器升级为主动构造反馈信号——在Data-Construction-Skill生成中实时监控与代理的MMD,引导agent向目标分布收敛,形成『构造-评估』闭环;第二,探索task-agnostic的影响力估计近似解决LESS被排除的根本矛盾;第三,把候选池与代理纳入持续学习框架,让benchmark随社区新数据发布自动扩展而不失效;第四,研究跨基座度量稳定性指标(符号一致性、ranking重叠度),目前只看Avg会掩盖cell级翻转风险。

复现评估

复现性优秀。代码已开源(github.com/haolpku/Data-Preparation-Bench),数据集与demo在HuggingFace(lhpku20010120/Data-Prep-Bench),benchmark网站可访问,skill通过Clawhub下载,邮箱wentao.zhang@pku.edu.cn。训练超参完整:3 epochs、cosine LR、初始LR $5\times10^{-6}$、warmup 0.1、batch 1×grad-accum 4、全局batch 32、8×H20集群;DAS细节给出(Qwen3-Embedding-8B、5000样本、RBF $\sigma=1.0$);下游benchmark、代理、候选池(Tables 1/8)齐全。主要门槛是算力:复现6领域×2基座×13生成器+18度量×3基座需大量H20机时;skill完整内容需去仓库获取;部分数据集规模大需额外工程。整体属『资源到位即可复现』级别。