← 返回 2026-08-17

LLM预训练中领域数据重复的规模缩放研究 Scaling Domain Data Repetition in LLM Pretraining

Jingwei Li, Xinran Gu, Rui Dai, Xintong Hao, Chengyin Xu, Yan Wu, Shuran Zheng, Jingzhao Zhang 📅 2026-08-14 👍 14 2026-08-22 18:30
大模型预训练 数据混合 数据重复 缩放律 过拟合

固定TPP缩放下最优重复次数随模型变大反而增加,且由领域验证损失主导

前置知识

tokens-per-parameter(TPP,每参数训练词元数)

TPP 定义为 $\mathrm{TPP} := D/N$,即总训练词元数 $D$ 除以模型参数量 $N$。Chinchilla 缩放律指出计算最优训练约为每个参数 20 个词元,模型越大,$D$ 应按比例增长。它是衡量“训练充分程度”的核心比值。

本文的全部结论都建立在固定 TPP 的缩放制度上:训练词元预算随模型规模成比例增长。这与先前固定 $D$ 的重复研究形成根本对比,不理解 TPP 就无法理解结论为何反转。

数据重复与多轮训练(data repetition)

指在训练中对有限数据集重复采样多轮(multi-epoch)。重复能在数据稀缺时提供更多梯度更新、对抗高质量数据被稀释,但重复过多会使模型记忆样本、在验证集上过拟合。最优重复次数 $e^*$ 是损失关于重复次数 $e$ 曲线的最低点。

$e^*$ 正是本文要刻画的对象:它如何随领域、模型规模 $N$、唯一数据比例 $\alpha$ 变化,以及如何从小代理模型迁移到大模型,构成全文的主线。

缩放律与缩放制度

缩放律描述验证损失随模型规模、数据量、算力的经验变化规律。同一问题在不同“缩放制度”下可能得出相反结论:固定数据量 $D$ 与固定比值 $D/N$ 是两种不同制度,前者的结论不能直接搬到后者。

本文的核心洞察是制度切换:先前工作固定 $D$ 得出“大模型应少重复”,而固定 TPP 时最优重复次数随规模温和上升,理解制度差异是读懂 Figure 1 和全文论证的前提。

验证损失与过拟合

验证损失是模型在留出数据上按 token 平均的负对数似然 $\mathcal{L}(\theta;V) = -\frac{1}{M_V}\sum_{x}\sum_t \log p_\theta(x_t|x_{<t})$。重复数据过多时模型开始记忆训练样本,验证损失不降反升,即过拟合。

本文用二次拟合曲线最低点估计 $\hat{e}^*=-\hat{b}/(2\hat{a})$,并发现 $\hat{e}^*$ 与领域最小验证损失的皮尔逊相关高达 -0.944,验证损失是连接所有经验规律的核心变量。

幂律数据分布与源条件

理论模型中知识单元 $e_k$ 的出现频率服从幂律 $p_k = c_\alpha k^{-\alpha}$;源条件假设目标参数满足 $\mathbb{E}[(\theta^*_k)^2 p_k] = k^{-\beta}$,即知识能量按坐标幂律衰减。这是学习理论中刻画“易学知识与难学知识长尾分布”的标准假设。

第 4.2 节的三个定理(噪声衰减、模型规模交叉点 $N_0$、固定 TPP 下 $r^*=\Theta(D^{\alpha/\beta})$)全部在该模型下证明,读懂理论部分必须掌握这套记号。

研究动机

大语言模型预训练通常混合通用网页文本、代码、数学、科学语料等多领域数据。根据 Chinchilla 等缩放律,模型规模增大时训练词元预算必须同步增长以维持合适的 tokens-per-parameter 比例(TPP)。这造成一个不对称的数据扩张困境:通用网页数据可以相对容易地等比例扩张,而数学、代码、维基、医学等高质量领域数据的增长速度远跟不上,于是随着总词元预算 $D$ 增大,高质量数据在训练混合物中的占比被持续稀释。近期研究表明,知识密集型领域只有当混合比例超过某个临界阈值才会被学到,低于阈值时继续训练也无法习得目标知识。重复使用有限的高质量数据是对抗稀释的直接手段,但过度重复会导致过拟合。更麻烦的是,已有跨规模研究(如 data-constrained scaling 一系工作)在比较不同模型规模时通常固定训练数据量而非 TPP,得出的结论是“模型越大越容易被重复数据过拟合,最优重复次数应趋近 1”——即大模型几乎不应重复,这与实践中大规模训练实际上反复利用高质量数据的做法存在张力。

本文的目标是本文要在贴近工业界实际的缩放制度下——即训练词元预算随模型规模按固定 TPP(实验中大于 100)成比例增长——系统地回答三个问题:第一,对代码、数学、维基、医学四个高质量领域,最优重复次数 $e^*$ 如何随领域本身变化;第二,$e^*$ 随模型规模 $N$ 是增加还是减少;第三,$e^*$ 是否依赖于唯一(不重复)高质量数据的数量 $\alpha$。在此基础上,作者希望给出一个可操作的工程方案:能否在较小的代理模型上扫重复次数,再把结果安全地迁移到大规模目标模型,从而避免在每个规模上都做昂贵的数据配方搜索;并进一步用理论模型解释这些经验规律背后的机制。

与已有工作不同的是,本文的独特切入有三点。其一是缩放制度的切换:与 Muennighoff 等固定数据量 $D$ 的研究不同,本文首次在固定 $\mathrm{TPP}=D/N$ 的制度下研究重复,实验发现结论完全反转——最优重复次数随模型规模温和上升而非下降,这直接修正了“大模型不应重复”的直觉。其二是变量选择:以往工作把领域当作分类变量,本文改用领域最终验证损失作为连续代理变量来预测最优重复次数,发现二者的皮尔逊相关高达 -0.944,而与唯一数据量 $\alpha$ 的相关仅 0.018,从而把“重复多少”问题归结为“领域学得多好”问题。其三是理论与实证的闭环:作者把期望风险精确分解为知识获取误差与噪声拟合误差两项,用三个定理分别解释了验证损失、模型规模、噪声水平如何决定最优重复(停止)步数,使经验观察获得了统一的机制性解释。

核心方法

直觉上,重复高质量数据是在“多学几遍知识”与“背下样本噪声”之间权衡:重复不足则知识学不透,重复过度则过拟合。实证上作者构建完整实验网格:4 个高质量领域(代码、数学、维基、医学)× 多个模型规模 × 3 个唯一数据比例 $\alpha\in\{1/40,1/20,1/10\}$ × 7 个重复次数 $e\in\{1,\dots,7\}$。每个 run 的总词元预算固定为 $D_N=\mathrm{TPP}\cdot N$,$U_{N,\alpha}=\alpha D_N$ 个唯一高质量词元重复 $e$ 次,剩余 $(1-e\alpha)D_N$ 用不重复网页数据填满(保证 $e\alpha\le 1$),故同规模所有 run 总词元数相同、仅组成不同。训练后在领域内(IID)与领域外(OOD)验证集上测 token 平均负对数似然,并对“损失—重复次数”曲线拟合二次函数 $\hat{\mathcal{L}}=\hat{a}e^2+\hat{b}e+\hat{c}$,取最低点 $\hat{e}^*=-\hat{b}/(2\hat{a})$ 作为连续最优估计,消除离散网格影响。理论上在无穷维 one-hot 线性回归中建模:知识单元频率服从幂律 $p_k=c_\alpha k^{-\alpha}$,容量 $N$ 限制模型只能看到前 $N$ 个坐标,全批量梯度下降下期望风险可精确分解为未表示知识、知识获取误差与噪声拟合误差三项,据此证明三个定理。

核心创新是缩放制度的切换带来的结论反转。当固定数据量 $D$ 时,更大的模型面对的是同一份重复数据,没有额外新观测,过拟合更早发生,最优重复次数随规模下降趋近 1(Figure 1 左);而当固定 $\mathrm{TPP}=D/N$ 时,词元预算随模型同步增长,更稀疏、更微弱的知识单元也获得了更多观测,知识获取收益的边际主导期被拉长,最优重复次数反而随规模温和上升(Figure 1 右,皮尔逊相关 +0.400)。第二个关键发现是变量归因:最优重复次数几乎完全由领域的最终验证损失决定(相关 -0.944)——损失越低的领域越能容忍重复,而与唯一高质量数据的数量 $\alpha$ 几乎无关(相关 0.018),增大 $\alpha$ 只降低绝对损失、几乎不移动损失曲线最低点的位置。这两点合起来给出一个实用的迁移原则:在与目标模型相同 TPP 的小代理模型上、用任意合理的 $\alpha$ 扫一遍重复次数,小模型上不引起过拟合的重复次数对大模型也是保守安全的。

方法步骤详情

第一步,设定预算:对每个模型规模 $N$,令总训练词元数 $D_N=\mathrm{TPP}\cdot N$(TPP 为大于 100 的常数),同规模所有 run 预算一致。第二步,采样唯一数据:从领域 $d\in\{\mathrm{Code},\mathrm{Math},\mathrm{Wiki},\mathrm{Medical}\}$ 抽取 $U_{N,\alpha}=\alpha D_N$ 个唯一高质量词元,$\alpha\in\{1/40,1/20,1/10\}$。第三步,构造混合流:将唯一子集重复 $e$ 次($e\in\{1,\dots,7\}$),高质量词元总数 $H=e\alpha D_N$,剩余 $W=(1-e\alpha)D_N$ 用不重复网页数据填充;每个 run 只重复单一领域。第四步,训练:Muon 优化器(AdamW 变体),学习率与全局批量按模型规模幂律设置,前 200 步线性 warmup 后恒定,注意力 dropout 0.1。第五步,评估:计算 token 平均负对数似然,IID 用领域留出集,OOD 用 ArXiv、News 等预训练验证集。第六步,估计最优重复次数:对每个 $(d,N,\alpha)$ 配置把最终验证损失拟合为 $e$ 的二次函数 $\hat{\mathcal{L}}(e)=\hat{a}e^2+\hat{b}e+\hat{c}$ 并取 $\hat{e}^*=-\hat{b}/(2\hat{a})$。第七步,相关分析:计算 $\hat{e}^*$ 与最小验证损失、模型规模、α 的皮尔逊相关,得到 -0.944、+0.400、+0.018。第八步,理论建模:在幂律分布与源条件 $\mathbb{E}[(\theta^*_k)^2p_k]=k^{-\beta}$ 下推导最优停止步数 $r^*$ 的三个定理,分别刻画噪声、固定 $D$ 与固定 TPP 下的规模效应。

技术新颖性

技术新颖性体现在四个层面。第一,制度级修正:Muennighoff 等人的重复缩放律与 Xue 等人的混合重复研究都隐含固定 $D$ 的跨规模比较,本文指出这一设定掩盖了实际训练中 $D$ 随 $N$ 增长的事实,并证明固定 TPP 下最优重复次数与规模正相关,属于对已有缩放律适用条件的实质性修正而非增量改进。第二,领域粒度的新经验规律:以往重复研究多在单一数据集或“目标领域+通用数据”的二混合上进行,本文按四个具体领域分别刻画,发现固定总高质量占比 $\rho=\alpha e$ 时,数学领域的重复数据可近似替代唯一数据(重复 1 到 4 次损失仅小幅上升),而维基超过 2 次就显著劣化,否定了“约 4 次重复可替代新鲜数据”这类普适阈值的存在。第三,连续代理变量方法:用二次拟合的 $\hat{e}^*$ 与领域最小验证损失做相关分析(-0.944),把分类性的“领域差异”提炼成可预测的连续规律。第四,机制性理论:风险分解明确分离知识获取与噪声拟合两种相互竞争的边际效应——知识获取项随重复下降、噪声拟合项随重复上升——三个定理与三组实验一一对应,形成罕见的实证—理论闭环。

Overview of our experimental framework
Figure 2: Overview of our experimental framework
Factors affecting the optimal repetition count
Figure 3: Factors affecting the optimal repetition count

实验结果

第一,领域差异显著(Figure 8–11):固定 TPP 下,数学最能容忍重复,验证损失在约 5–6 次重复时最低;代码 4–5 次;维基与医学最低,约 3–4 次;各领域最优重复次数都随规模温和增加、几乎不随 α 变化。第二,跨因素归因(Figure 4):二次拟合估计的 $\hat{e}^*$ 与最小验证损失的皮尔逊相关为 -0.944,与模型规模 +0.400,与唯一数据比例 α 仅 +0.018,即由领域损失主导、弱依赖规模、与数据量基本无关。第三,固定总占比替代实验(Figure 5、12):固定 $\rho=\alpha e$ 时,数学重复 1→4 次损失仅小幅上升,重复数据可大体替代唯一数据;维基超过 2 次损失急剧变差;代码与医学行为类似维基。第四,OOD 稳健性(Figure 6):在 ArXiv 和 News 上,固定数据占比、把唯一高质量词元替换为重复词元,OOD 损失基本稳定,1、2、4 次重复差异很小且无单调关系。第五,学习率调度(Figure 7):WSD 衰减开始越早(0%)劣化越早,延迟到 75% 或恒定学习率可容忍最多重复,原因是低学习率阶段更易记住样本特异模式。第六,理论与实证对应:$\sigma^2\to 0$ 时 $r^*=\log(1/\sigma^2)/(-\log(1-\eta/D))+O(1)$ 解释损失—重复负相关;固定 $D$ 下超过交叉规模 $N_0=\Theta((D/\sigma^2)^{1/(\beta-\alpha)})$ 后 $r^*$ 随 $N$ 递减;固定 TPP 下 $r^*=\Theta(D^{\alpha/\beta})$ 随规模递增,分别解释 Figure 1 两侧。

Factors associated with the estimated optimal repetition count
Figure 4: Factors associated with the estimated optimal repetition count
Final validation loss at fixed total high-quality data fractions
Figure 5: Final validation loss at fixed total high-quality data fractions
OOD validation loss at fixed total high-quality data fractions
Figure 6: OOD validation loss at fixed total high-quality data fractions
Effect of the learning-rate schedule on the optimal repetition count
Figure 7: Effect of the learning-rate schedule on the optimal repetition count
Final validation loss across repetition counts for Math
Figure 8: Final validation loss across repetition counts for Math
Final validation loss across repetition counts for Wikipedia
Figure 9: Final validation loss across repetition counts for Wikipedia
Final validation loss across repetition counts for Code
Figure 10: Final validation loss across repetition counts for Code
Additional results at fixed total high-quality data fractions
Figure 12: Additional results at fixed total high-quality data fractions
查看结构化数据
任务指标本文基线提升
数学领域固定 TPP 预训练的重复次数扫描 最终 IID 验证损失的最低点(最优重复次数) 约 5–6 次重复,且随模型规模温和增加 先前固定数据量研究的跨规模结论:最优重复次数随模型规模减小并趋近 1 修正了缩放制度带来的方向性错误结论,支持用小代理模型安全估计大模型重复次数
最优重复次数与三类因素的归因分析 皮尔逊相关系数($\hat{e}^*$ 与各因素) 最小验证损失 −0.944;模型规模 +0.400;唯一数据比例 $\alpha$ +0.018 无先前定量归因(此前仅将领域视为分类变量) 首次确立领域验证损失是预测最优重复次数的首要连续变量,数据量几乎不重要
固定总高质量占比下重复替代唯一数据(Math) 最终验证损失增幅(重复次数 1→4) 仅小幅上升,重复数据可近似替代等量唯一数据 等量唯一(不重复)数学数据 验证了“约 4 次”结论在 Math 成立;但 Wiki 超过 2 次即急剧劣化,证明该阈值并非普适
领域外(OOD)预训练性能影响评估 ArXiv / News 上 OOD 验证损失变化 1、2、4 次重复配置间差异很小,无一致单调关系 使用等量唯一高质量词元的配置 证明在固定数据占比时重复的影响被局限在被重复领域内部,不损害整体预训练性能

局限与改进

作者明确承认的局限:每次训练只重复单一高质量领域,未覆盖多领域同时重复时的相互作用;建议的迁移方法只提供保守安全保证(小模型不过拟合则大模型安全),并非精确定量预测。我的补充观察:其一,α 只有 3 个取值(2.5%、5%、10%),重复网格为 1–7 的整数,数学在大模型端最优约 5–6 已逼近边界,二次拟合外推有偏差风险;其二,未报告多种子方差或置信区间,-0.944 这样高的相关系数稳健性难以评估;其三,理论模型是无穷维 one-hot 线性回归加全批量梯度下降,与 Transformer 加随机优化差距很大,定理只提供定性机制而非可定量套用的公式;其四,实验 TPP 大于 100,明显高于 Chinchilla 计算最优的约 20,低 TPP 制度下结论是否成立未知;其五,四个领域数据集仅一段文字描述,无具体来源、规模与清洗流程,网页语料也未指明,实证难以严格复现;其六,评估全部基于验证损失,无下游任务基准,重复引起的记忆化对泛化的影响未被直接测量。

独立分析的弱点

弱点一:单领域重复设定过于理想化,真实预训练会同时重复多个领域且领域间存在竞争协同。改进方向:构建多领域重复的因子化网格,理论中引入多领域源条件与共享容量约束。弱点二:只看验证损失,无法区分“学会知识”与“背下样本”,记忆可能损害生成质量与多样性。改进方向:补充下游基准(GSM8K、HumanEval 类)与 n-gram/嵌入级记忆度量,检查损失最优点的下游对应性。弱点三:网格较粗且有边界截断,$e$ 只到 7 而 Math 大模型端最优约 5–6 已近上界,α 仅 3 档,二次拟合在边界处偏差未量化。改进方向:自适应加密网格或用贝叶斯优化估计 $e^*$ 并给出置信区间。弱点四:缺少误差棒与显著性,-0.944、+0.400 等相关系数基于单次训练点估计。改进方向:对代表性配置做 3–5 个种子重复,报告相关系数抽样分布。弱点五:迁移规则只有安全性没有精度,“小模型安全则大模型安全”会系统性低估大模型可用的重复次数。改进方向:利用定理 4.4 的标度 $r^*=\Theta(D^{\alpha/\beta})$ 先用小模型标定 α/β 再外推大模型最优次数,并实验验证外推误差。弱点六:TPP>100 偏离常见的约 20 的计算最优训练,工业界低 TPP 场景下结论需专门验证。

未来方向

作者在结论中提出两个方向:一是研究多个高质量领域同时被重复的混合训练及其相互作用,包括领域间的竞争、干扰与协同;二是发展定量的缩放规则,能够从小模型实验结果直接预测大模型的最优重复次数,实现更精确高效的数据配方选择。基于本文成果还可以自然延伸:第一,把重复感知的缩放律与数据混合优化方法(如基于代理训练或缩放律估计领域权重的工作)统一到一个框架中,联合优化混合比例与重复次数;第二,将学习率调度的发现(衰减越晚越容忍重复)与重复次数做联合设计,例如把“延迟衰减+更高重复”作为数据受限训练的默认配方,并给出二者的定量联合缩放关系;第三,在低 TPP(约 20 的 Chinchilla 制度)与更大模型规模上复核结论,检验固定 TPP 增长趋势在大规模端是否持续;第四,把重复与课程学习、数据质量过滤结合,研究“重复哪些样本”而非只研究“重复多少”;第五,理论上把 one-hot 线性模型推广到更现实的分布假设与 Adam 类自适应优化器,并推导 $\hat{e}^*$ 随 $N$、$D$ 的有限样本修正项;第六,评估重复训练对记忆化与隐私(如训练数据抽取攻击)的影响,为重复次数的上限提供安全维度约束。

复现评估

复现难度中等偏高,主要障碍在数据与算力,而非方法本身。论文未提及开源代码或数据发布;四个高质量领域数据集只有定性描述(多语言编程语料、含题目与逐步解答的双语数学语料、百科类文本、医学健康内容),无具体来源、规模、清洗与去重流程,通用网页语料也未指明,而领域差异恰是本文核心变量,数据选择会直接影响结论可比性。训练配置披露了关键项:Muon 优化器(AdamW 变体)、学习率与全局批量按模型规模幂律缩放、前 200 步线性 warmup、注意力 dropout 0.1、固定 TPP 且大于 100,但未给出各规模的具体参数量与总算力估计。多规模 × 4 领域 × 3 个 α × 7 个 e 的网格意味着数百次预训练 run,粗估需数千到数万 GPU 小时。有利的一面是方法逻辑清晰(固定预算、扫网格、二次拟合取最低点),即便无法完整复现网格,在单一领域、两三个规模上抽样验证“TPP 制度下最优重复次数随规模增加、随 α 不变”的定性结论,算力对中小实验室是可承受的。