DataPrep-Bench:把大模型当作训练数据准备者的统一基准 DataPrep-Bench: Benchmarking LLMs as Training Data Preparators
首个统一下游驱动基准,同时评测LLM构造数据与评估数据质量两大能力
前置知识
监督微调(SFT)
Supervised Fine-Tuning 指在基座模型 $f_0$ 上用指令-回答配对数据 $X$ 继续训练,得到适配模型 $f(X)=\text{SFT}(f_0,X)$。本文所有下游评测都基于此范式,构造的QA数据与Dolly-15k联合训练。
DataPrep-Bench 把『数据有用』操作化为『SFT后下游分数』,理解SFT才能看懂整个benchmark评分逻辑。
最大均值差异(MMD)与RKHS
MMD在再生核希尔伯特空间 $\mathcal{H}_\kappa$ 比较两分布均值嵌入 $\text{MMD}^2=\|\mathbb{E}[\psi(x)]-\mathbb{E}[\psi(y)]\|^2$。用特征核(如高斯RBF $\kappa(x,y)=\exp(-\|x-y\|^2/2\sigma^2)$)时MMD=0当且仅当两分布相同。
DAS的核心算子就是MMD,理解它和核函数才能明白为何『分布对齐』能预测下游训练收益。
域适应理论
研究训练分布 $S_X$ 与目标分布 $T_X$ 不一致时源/目标风险关系。Redko Theorem 36给出界 $R_T(h)\le R_S(h)+d_{\text{MMD}}+\text{复杂度项}+\lambda/2$,分布距离越小目标风险上界越紧。
DAS理论依据正是此bound,把『训练数据与目标分布接近度』作为下游性能的训练前预测信号。
Dolly-15k
Databricks开源的约1.5万条人工撰写指令跟随数据,涵盖头脑风暴、分类、问答、生成等7类任务。本文把候选领域数据与它联合训练以隔离基础指令跟随能力,Dolly-only作对照基线。
它是所有构造方法的『公共底盘』,理解它才能看懂T1发现『添加合成数据反而拖累Dolly-only』。
ReAct智能体与技能(Skill)层
ReAct让LLM交替输出推理与工具调用,本文agent以Claude Code为执行环境在长文档上规划、切块、迭代验证。Skill是把任务语义、输出schema、过滤规则、覆盖约束封装成可复用控制接口的中间层。
Data-Construction-Skill关键创新是用skill层替代硬编码prompt,需理解二者区别才能看懂其优势。
皮尔逊相关系数
衡量两向量 $\mathbf{q},\mathbf{s}$ 线性相关 $\rho=\frac{\sum(q_i-\bar q)(s_i-\bar s)}{\sqrt{\sum(q_i-\bar q)^2\sum(s_i-\bar s)^2}}\in[-1,1]$。本文用它度量质量分数与下游性能的线性趋势,要求双侧 $p<0.05$ 才显著。
质量评估Track完全以Pearson相关为评测准则;作者特意选Pearson而非Spearman,因下游分数有真实数值尺度,需捕捉相对间距。
研究动机
训练数据质量决定LLM能力,但社区对『LLM能否当好数据准备者』缺可比标尺。问题分两层:第一,数据构造方法(Self-Instruct、Evol-Instruct、UltraChat、UltraMedical、MegaScience)各用不同源文档、基座、训练配方和下游benchmark,跨方法比较基本靠传闻;第二,质量评估方法(QuRating、Deita、Superfiltering、FineWeb-Edu、PairQual、Vendi Score等)只在单一backbone单一领域验证,没回答『训练前打分到底多可靠』。更隐蔽的是,作者实测发现Llama-3.1-8B上混入合成领域数据,多数生成器反而拖累Math(Dolly-only Avg 11.7)和Science(13.2)基线,而所有表面质量代理察觉不到这种回归,『数据越多越好』从未被端到端检验。
本文的目标是建一个统一、端到端、下游驱动的benchmark,同时覆盖LLM数据准备两条互补能力。第一条数据构造:给定相同原始源文档,让不同方法输出SFT数据,与Dolly-15k联合训练后用统一下游benchmark打分,把构造质量操作化为真实训练收益。第二条数据质量评估:给定候选数据集池,让打分函数 $Q$ 输出标量,用它与下游性能的Pearson相关度量预测可靠性。目标是让六领域(General/Math/Science/Medical/Finance/Law)、多基座共享同一原始源、训练协议、下游评测,使跨方法跨度量比较真正公平,并发布两个强基线作为参照点。
与已有工作不同的是,已有数据基准没填补空白:DataComp/DataComp-LM评测传统curation(启发式过滤、去重),DataPerf面向数据选择/清洗多模态榜单,DCBENCH只覆盖表格特征工程;都不把LLM当自主数据准备者评测。Data-Juicer和DataFlow只提供工具不做跨方法比较。本文独特切入有三:把构造与质量评估作为同等重要的双轨道在同一protocol下联合评测;所有评测grounding在真实下游训练性能而非表层属性,明确把质量定义为下游训练效用;候选池混入in-domain和out-of-domain数据制造性能梯度,强迫度量不仅排序正确还要间距合理。
核心方法
直觉是『数据决策只有让模型变好才算数』,两轨道都以真实下游性能为最终裁判。先把每领域原始PDF用MinerU统一转Markdown,所有构造方法吃同一份输入。构造轨形式化 $X_k^{(M)}=M(B_k)=\{(q_i,a_i)\}$,得分 $\text{Score}_{\text{con}}(M,D_k)=\text{Perf}(f(X_k^{(M)}),T_k)$;质量轨对每候选 $X_{k,i}$ 得配对 $(q_{k,i}=Q(X_{k,i}),\,s_{k,i}=\text{Perf}(f(X_{k,i}),T_k))$,用Pearson相关 $\rho(Q,D_k)$(要求 $p<0.05$)作可预测性指标。两轨道共享6领域、相同下游benchmark(Math用AIME/AMC/GSM8K/MATH等7个、Science用MMLU-STEM等7个)和统一协议(AIME温度0.6、MMLU-Redux 5-shot、LLM-as-judge校正语义等价答案)。
两核心创新与已有方法本质不同。Data-Construction-Skill把『什么算合法监督』从硬编码prompt抽到可复用skill层——打包任务指令、输出schema、质量约束、过滤规则、覆盖要求、验证工具,agent只负责规划执行。这区别于仍藏控制逻辑在prompt里的agent流水线和固定专家DataFlow流水线,既保规划灵活又稳定行为。DAS则从『逐样本评分再聚合』转向『数据集整体分布对齐』:$\text{DAS}(X_{k,i})=-d_{\text{MMD}}(\Phi(X_{k,i}),\Phi(X_k^{\text{proxy}});\kappa)$,把候选与领域代理在嵌入空间的分布距离作质量代理。理论依据是域适应bound:分布距离越小目标风险上界越紧。代理是目标分布 $P_k^\star$ 的可观测锚点,由MMD三角不等式证明只引入有界误差,同时避免测试集泄露。
方法步骤详情
Data-Construction-Skill流程:(1)结构感知切块 $C_k=\text{Chunk}(B_k)$,保留局部语义;(2)对每chunk判断是否含可复用知识,丢弃导航/噪声/重复chunk;(3)识别命题与关系(定义、规则、机制、条件、比较、因果);(4)自适应生成最多三类不相交QA:$G_{\text{concept}}$(概念)、$G_{\text{reason}}$(推理)、$G_{\text{case}}$(案例);(5)取并集 $X_k^{(\text{MDCS})}=\bigcup_{c\in C_k}G(c)$;(6)后处理剔除文档相对表述(如『根据上文』)和畸形/重复/弱支撑样本,维护chunk级记录支持断点续跑。DAS三步:(1)用Qwen3-Embedding-8B(4096维)编码 $X_{k,i}$ 与代理,每数据集采5000条;(2)用有偏经验估计算MMD,高斯RBF核带宽 $\sigma=1.0$ 固定;(3)返回 $\text{DAS}=-d_{\text{MMD}}$,越高越对齐。完全training-free。
技术新颖性
新颖性三方面。第一,DataPrep-Bench是首个把数据构造与质量评估作为同等目标、在共享领域/基座/训练协议/下游benchmark下联合评测的基准,明确把质量定义为下游训练效用而非表层属性。第二,Data-Construction-Skill首次把『技能』概念引入数据构造——位于高层目标与底层agent执行间的可复用控制接口,相对一次性prompt或刚性DataFlow能稳定agent行为、保证schema一致、支持断点续跑;三类QA模板是对监督类型的形式化分解。第三,DAS是首个基于MMD与领域代理的『数据集整体分布对齐』度量,相对逐样本打分再平均的QuRating/Deita更具理论根基,计算上比同等精度的BERTVendi(459s)和Deita-Quality(435s)快1.4-1.5倍(306s/数据集)。
实验结果
三大发现。T1——合成数据常拖累下游:Llama-3.1-8B上Dolly-only在Math(11.7)和Science(13.2)已不错,混入合成数据后多数生成器(含DataFlow/LLM/agent)反而拉低,而表层质量代理给这些数据打高分却察觉不到回归,证明端到端下游评测不可或缺。T2——无单一最优方法族:DataFlow-Skill在结构化领域领先(Qwen Finance 64.8、Law 74.7);agent类在推理重领域占多数顶尖;本文Skill在知识抽取密集领域最强,Llama-3.1-8B Finance把Dolly-only的15.1绝对提升近20点到34.2(+19.1),全表最大涨幅;Science和部分Law仍开放。T3——DAS最可靠:6领域里4个领先或并列第一,Math上Qwen/Llama $r>0.93$、$p<10^{-4}$,是唯一Math(0.86)/Science(0.72)/Medical(0.77)三领域Avg同破0.70的度量;现有度量要么窄域专家要么符号翻转;Finance(0.18)/Law(0.36)对所有度量都难。
查看结构化数据
| 任务 | 指标 | 本文 | 基线 | 提升 |
|---|---|---|---|---|
| Finance 数据构造(Llama-3.1-8B,CPA-KQA/FinEval-KR/XFinBench均值) | 下游Avg分 | Skill (Claude Opus 4.6) = 34.2 | Dolly-15k only = 15.1 | +19.1绝对分(≈近20点),全表单领域最大涨幅 |
| Math 数据构造(Qwen2.5-7B,7个数学benchmark均值) | 下游Avg分 | GPT-5.2 agent = 25.5;Skill = 24.1 | Dolly-15k only = 23.6 | agent族整体领先直接LLM和DataFlow;约+1.9 |
| Finance 数据构造(Qwen2.5-7B) | 下游Avg分 | DataFlow-Skill = 64.8 | Dolly-15k only = 57.8 | +7.0,结构化领域专家工作流优势 |
| 数据质量预测(Math领域,3基座Avg Pearson相关) | Pearson r | DAS = 0.86(Qwen 0.93、Llama 0.94、Mistral 0.72,p<10⁻⁴) | RewardModel = 0.79;Qurating-Expertise = 0.69 | 唯一同时Math/Science/Medical破0.70的度量 |
| 数据质量预测(Medical领域Avg Pearson相关) | Pearson r | DAS = 0.77(Qwen 0.73、Llama 0.87、Mistral 0.72) | Qurating-Expertise = 0.65;Deita-Quality = 0.63 | +0.12,分布对齐在医学知识密集领域优势明显 |
| 数据质量预测(Science领域Avg Pearson相关) | Pearson r | DAS = 0.72(与Qurating-Expertise并列最高) | Task2Vec = 0.41;Perplexity = 0.45 | DAS在Mistral上跌至0.53未显著,但Avg仍最高 |
| 度量计算开销(每候选数据集平均秒数) | Wall-clock 秒 | DAS = 306.02s | BERTVendi = 459.37s;Deita-Quality = 434.99s | 比同等精度基线快1.4-1.5× |
局限与改进
作者承认:Finance和Law对包括DAS在内的所有度量都开放——DAS在Finance Avg仅0.18、Law仅0.36,因候选池结构性失衡(1个in-domain对7个out-of-domain,几乎无方差可排),且这两个领域专业惯例通用嵌入表达不好。Science上Skill在两基座都低于Dolly-only(13.2),作者归因Claude Opus 4.6 backbone在开放式科学推理上偏保守、产出稀疏,且某些agent的长案例答案更契合benchmark格式。候选池规模不对称(General 14个、其他8-10个)削弱小池子统计功效。LESS等基于梯度的influence方法因逐梯度计算代价过高且预设已知目标任务(task-agnostic协议冲突)被排除。我的额外观察:DAS对代理选择极敏感,若代理与 $P_k^\star$ 不对齐,三角不等式只保证有界误差但不保序;固定 $\sigma=1.0$ 和单一Qwen3-Embedding-8B对Finance/Law可能不合适;构造轨未做多seed重复,T1结论稳健性需谨慎。
独立分析的弱点
弱点一:DAS完全依赖代理数据集,代理选择本身是开放问题;建议把DAS与无参考质量评分、领域感知嵌入模型组合(作者future work也提及)形成多信号集成。弱点二:训练单点估计——Tables 2-5每格只跑一次微调无随机种子方差,3 epochs + LR $5\times10^{-6}$ 是否最优未做敏感性分析;建议多seed平均并报置信区间,尤其T1『合成数据有害』需稳健性验证。弱点三:构造轨数据量不可比——作者刻意不设统一上限,DataFlow 849K与直接LLM 12K混在一起训练,下游分数混淆『质量』与『产量』;建议增设等量子实验隔离二者贡献。弱点四:候选池in-domain稀缺,Finance/Law/Medical仅1个in-domain候选,Pearson统计功效极弱;建议扩池或改用bootstrap置信区间。弱点五:MMD带宽与编码器未做领域自适应,固定 $\sigma=1.0$ 可能就是Finance/Law失灵部分原因;建议median-heuristic带宽或多编码器集成。
未来方向
作者明确计划三方向:(i)随更多高质量in-domain SFT语料公开扩充Finance/Law/Medical候选池;(ii)针对开放式科学推理设计专用skill-guided方法弥补Skill在Science的不足;(iii)把DAS与互补信号(无参考质量评分、领域感知嵌入模型)配对提升Finance/Law可靠性。基于成果可延伸方向:第一,把DAS从被动预测器升级为主动构造反馈信号——在Data-Construction-Skill生成中实时监控与代理的MMD,引导agent向目标分布收敛,形成『构造-评估』闭环;第二,探索task-agnostic的影响力估计近似解决LESS被排除的根本矛盾;第三,把候选池与代理纳入持续学习框架,让benchmark随社区新数据发布自动扩展而不失效;第四,研究跨基座度量稳定性指标(符号一致性、ranking重叠度),目前只看Avg会掩盖cell级翻转风险。
复现评估
复现性优秀。代码已开源(github.com/haolpku/Data-Preparation-Bench),数据集与demo在HuggingFace(lhpku20010120/Data-Prep-Bench),benchmark网站可访问,skill通过Clawhub下载,邮箱wentao.zhang@pku.edu.cn。训练超参完整:3 epochs、cosine LR、初始LR $5\times10^{-6}$、warmup 0.1、batch 1×grad-accum 4、全局batch 32、8×H20集群;DAS细节给出(Qwen3-Embedding-8B、5000样本、RBF $\sigma=1.0$);下游benchmark、代理、候选池(Tables 1/8)齐全。主要门槛是算力:复现6领域×2基座×13生成器+18度量×3基座需大量H20机时;skill完整内容需去仓库获取;部分数据集规模大需额外工程。整体属『资源到位即可复现』级别。
论文图表
框架图分两条轨道:Track 1数据构造——六大领域Source Corpus经LLM/WorkFlow/DataFlow/Agent/Skill等不同方法处理得到Constructed Dataset,分别在Llama/Qwen/Mistral上监督微调再Benchmark Evaluation打分;Track 2数据质量评估——Source Dataset经MMD等Data Evaluation Methods打分得Evaluation Score,对Candidate Dataset与Target Dataset做Correlation Calculation。底部用高/低分色块示意质量好坏。
这是理解整篇论文架构的地图,一眼看清两轨道如何共享领域、基座、下游benchmark,以及为何用『相关/打分』作评测准则。看不懂这图就读不懂benchmark设计。