← 返回 2026-08-17

LittleLearner:教学论控制知识暴露下的语言模型 LittleLearner: Language Models Under Pedagogically Controlled Knowledge Exposure

Fanfei Li, Jana Zeller, Manuel Prada-Corral, Thaddäus Wiedemer, Prasanna Mayilvahanan, Ryan Cotterell, Wieland Brendel 📅 2026-08-13 👍 7 2026-08-22 18:30
受控预训练 小模型 强化学习后训练 数据过滤 知识边界 课程学习

用K-5小学语料从零训练5B模型构建可控知识沙盒,检验规模、后训练与ICL能否突破预训练边界

前置知识

习得年龄(Age-of-Acquisition, AoA)

心理语言学指标,指母语者典型习得某个词汇的年龄。词频高、概念具体的词 AoA 小(如'猫'),专业术语 AoA 大(如'偏微分')。本文用它做廉价的第一级难度代理:Kuperman 等人给出了大规模 AoA 词表,且 AoA 与词频的对数呈近似线性关系,因此缺失值可用词频回归插补。

本文过滤流水线第一步就是 AoA 预过滤,用来以极低成本先筛掉大量超龄文档,理解 AoA 才能理解流水线的分级设计。

共同核心州立标准(CCSS)与 K-5

CCSS 是美国绝大多数州采用的 K-12 课程标准,逐年规定学生应掌握的知识与技能;K-5 指幼儿园至五年级(约 5–11 岁),意味着代数记号、负数、三角函数等内容都明确排除在外。LLM-as-a-judge 的标注提示词与 MathCAMPS 评测题都以 CCSS 条目为锚。

K-5 边界是整篇论文的定义域:语料过滤、评测题分级(Jeopardy 按 NGSS、MathCAMPS 按 CCSS)全部依赖这套课程标准体系。

LLM-as-a-judge(LLMJ)

用强 LLM 代替人工为海量数据打标签的范式:设计评分提示词,让 LLM 对每个文档判断其年级适用性。成本极高——本文估算用 Gemini Flash 标注全量 FineWeb-Edu 约需 4600 万美元——因此工程上只标注子集,再蒸馏训练传统分类器(FastText/ModernBERT)去处理全量数据。

本文流水线的核心分类器正是 LLMJ 蒸馏出来的,理解这一'贵标注训练便宜分类器'的级联思路是读懂方法部分的前提。

bits-per-byte(BPB)

语言建模困惑度的字节归一化版本,$\text{BPB} = -\frac{1}{\text{字节数}}\sum_i \log_2 p(x_i \mid x_{<i})$。按字节而非 token 归一后,不同分词器、不同词表大小的模型可以在同一尺度上比较,是纯语言模型(无聊天模板)评测的标准指标。

论文用 BPB 在 CLEAR 和 CoMTA 上量化模型对不同难度文本的'熟悉度',是验证 LittleLearner 知识边界存在的主要证据之一。

SFT + GRPO 后训练

两阶段对齐流程:先监督微调(SFT)用标准答案训练模型输出格式与基础解题行为,再用组相对策略优化(GRPO,DeepSeek 提出的 RL 算法)做强化学习——对每个问题采样一组回答,以组内相对奖励作基线更新策略,目标函数形如 $\mathcal{L} = -\mathbb{E}\left[\frac{1}{G}\sum_{i=1}^{G}\min\left(r_i A_i,\ \text{clip}(r_i) A_i\right)\right]$,其中 $r_i$ 为重要性比率、$A_i$ 为组内相对优势。

第 4.2 节的核心干预实验就是 SFT+GRPO,论文用它检验'RL 能否把模型能力推出预训练分布'这一关键问题。

上下文学习(In-Context Learning, ICL)

不更新参数、仅在提示词中加入少量示例(few-shot)或说明,让模型模仿示例格式与推理路径完成新任务的能力。其威力通常随模型规模增大而显著增强,是小模型上常见的能力短板。

第 4.3 节测试手工 CoT 示例的 few-shot 能否解锁 Beyond-K-5 推理,理解 ICL 的规模依赖性才能正确解读其阴性结果。

研究动机

现代大语言模型在数万亿 token 的异构网络语料上预训练,模型'见过什么、没见过什么'几乎无法刻画。这带来一个根本性困扰:当我们用后训练或上下文学习让模型表现出新行为时,很难判断这是真正的新能力增长,还是仅仅唤起了预训练时已隐式编码的知识。已有证据表明预训练暴露强烈塑造下游行为:数据污染会虚高基准成绩,reversal curse 等现象说明从事实学到的泛化十分脆弱,缺技能的模型往往还需要定向的数据补丁。主流解决方案是从评测端入手,构建更难或刻意避开网络语料的新基准(如 Humanity's Last Exam、GPQA、MMLU-Pro、MATH-B),但这只能提供间接控制:每换一个评测都要重新验证其新颖性,且训练分布始终是不透明的黑箱,知识边界既难概念化也难验证。

本文的目标是本文的目标是把'控制先验暴露'从评测端搬到训练端:构造一个知识边界可解释、可验证的预训练沙盒。具体交付三个成果:(1) LittleCurriculum——一个 88B token 的预训练语料,从 FineWeb-Edu 过滤而来,只保留美国幼儿园至五年级(K-5)课程范围内的概念、事实与词汇,明确排除五年级以上教学内容;(2) LittleLearner——在该语料上从零预训练的 5B 参数语言模型,遵循 Qwen3 架构,在 8 张 NVIDIA B200 上训练 100 小时;(3) 一组首发探针实验,用沙盒回答三个此前无法干净回答的问题:加大模型规模、GRPO 后训练、上下文学习能否把模型能力推到 K-5 边界之外。数据与模型均已开源,供社区研究受限暴露下的知识获取、表示与使用。

与已有工作不同的是,已有约束预训练分布的工作只有两条路线,各有缺口。BabyLM 限制的是数据量而非概念范围,模型仍可自由接触高深材料;同期工作(Levine et al.)用 1931 年前的英语文本构造时间截断,边界干净但无法约束该时期内部的概念复杂度。本文的独特切入点是'发展性截断':以教育学课程标准(CCSS)定义边界,使边界既可解释('模型没见过负数与代数记号'是可核查的陈述)又可在 LLM 规模上实施。方法论上,作者坚持'精度优先':宁可丢掉约 65% 的真 K-5 文档,也要把 Beyond-K-5 内容的保留率压到 0%,从而得到一条足够锐利、可供机制解读的知识边界。这与以往追求召回率的数据策划形成鲜明对照,也是沙盒能对能力增长做干净归因的前提。

核心方法

整体思路是先造语料、再训模型、最后做探针实验。造语料采用五级过滤流水线处理 FineWeb-Edu:先用轻量规则做习得年龄(AoA)预过滤,再用 LLM-as-a-judge 标注的小样本训练 FastText 与 ModernBERT 两级课程分类器,接着用正则做符号过滤,最后按词频分布做保守采样。直觉是:像'薛定谔的猫'或 $\ln(0)$ 这类五年级以上的概念和记号在网络语料中零散分布,单靠一个强分类器既昂贵又易漏,多级级联让便宜过滤器先挡掉绝大多数越界内容,昂贵组件只处理剩下的小头。语料验证通过后,作者遵循 Qwen3 架构从零预训练 5B 的 LittleLearner(100 小时、8×B200),并同步训练 0.6B/1.3B 缩放组和一个在未过滤 FineWeb-Edu 上以相同配方训练的 UNFILTERED 对照模型。所有验证围绕一个原则:模型能力应与受控暴露紧密对应——域内强、域外塌、边界处渐变。

核心创新是'把知识边界写进训练分布,而不是在评测时猜测'。与已有工作的本质区别有三点。第一,边界定义来自教育学:以美国 K-5 课程标准为锚,天然可解释——时间截断只能限制信息可得性,却无法限制概念复杂度,而课程边界直接约束了模型能接触的词汇、概念与推理需求。第二,精度优先的过滤哲学:作者明确牺牲召回(在 CommonCoreText 真值集上仅保留 35–42% 的真 K-5 文档)换取 Beyond-K-5 保留率降为 0%,因为该语料的用途是受控实验而非小学教材全集;手工对比显示被丢弃的 K-5 文档系统性地更长、词汇更复杂。第三,便宜优先的级联设计:AoA 规则与 FastText 先廉价初筛,50 倍成本的 ModernBERT 只处理约 2.66 亿条与 AoA 判断年级档一致的样本;LLMJ 全量标注估计要 4600 万美元,因此只用于制造分类器训练数据。三者结合使边界在统计上可验证、在语义上可解释。

方法步骤详情

流水线五步如下。第一步 AoA 预过滤:FineWeb-Edu 中约 10% 的词无 AoA 标注,利用 AoA 与词频的已知关系,用线性模型 $\widehat{\text{AoA}}(w)=\alpha\log_2 f(w)+\beta$ 插补(词频取自 Zipf/WordFreq),只丢弃超过 5% 的词龄超过 12 岁的文档。第二步 LLMJ 标注:基于 CCSS 设计提示词,用 DSPy 与 OpenEvolve 自动优化,Gemini Flash 只标注子集作为分类器训练数据。第三步课程分类:先用轻量 FastText 分类器,对约 2.66 亿条年级档与 AoA 一致的样本再上 50 倍推理成本的 ModernBERT。第四步符号过滤:用固定正则扫描二次表达式与 $\sum$、$\partial$、$\int$ 等记号族,任一命中即整篇丢弃,额外移除约 0.1% 文档。第五步频率采样:找出与 Beyond-K-5 强关联的词,删除含这些词的文档——Ruis 等人证明模型能从稀疏出现中习得事实,故须收紧到底。验证:自建 CommonCoreText 真值集上 Beyond-K-5 保留 0%、K-5 保留 35–42%;外部 WeeBit 上 6000 条 Beyond-K-5 仅保留 2.48%,人工核查真正越界仅 3 条(0.05%);126 个越界 n-gram 全库扫描命中率仅 0.09%。训练:5B LittleLearner(Qwen3 架构,8×B200,100 小时),另有 0.6B/1.3B 缩放组与 UNFILTERED 对照。

技术新颖性

技术新颖性体现在三处。其一,'发展性截断'本身是新的边界类型,与 BabyLM 的数量截断、时间截断正交互补,且是首个在 LLM 规模上以课程标准实施的工作——把'哪个年级教的'这一人类可读的语义直接注入数据策划。其二,验证闭环设计:不只报告过滤器在留出集上的指标,还自建 CommonCoreText 真值集(公开推荐读物配年级标签)、在外部 WeeBit 语料上盲测并人工复核,再用 126 个越界 n-gram 做语料级扫描,把'边界确实存在'变成多层异源证据。其三,把完全相同的训练配方复制到 UNFILTERED 对照组和 0.6B/1.3B 缩放组,使后续实验能把性能差异干净归因于预训练语料本身而非架构、算力或超参差异——这在对网络语料训练的模型上几乎不可能做到。附带方法学贡献是用 AoA-词频关系做缺失值插补,解决了 AoA 词表覆盖率仅 90% 的现实问题。

生成 LittleCurriculum 的过滤流程保守地执行 K-5 边界:CommonCoreText 与 WeeBit 上的分阶段保留率
Figure 2: 生成 LittleCurriculum 的过滤流程保守地执行 K-5 边界:CommonCoreText 与 WeeBit 上的分阶段保留率

实验结果

验证实验显示能力边界与暴露高度对应。(1) 语言难度:CLEAR 数据集上按 Bradley-Terry 易度分桶,LittleLearner 的 bits-per-byte($\text{BPB}=-\frac{1}{\text{字节数}}\sum_i \log_2 p(x_i|x_{<i})$)随文本变难单调上升,UNFILTERED 与 Gemma 2B 基本持平。(2) 数学熟悉度:CoMTA 辅导对话上三者 K-5 内 BPB 相当,Beyond-K-5 上 LittleLearner 的 BPB 在代数、三角、微分类上持续走高。(3) 事实知识:Jeopardy 科学题按 NGSS 划分,LittleLearner K-5 内与对照相当、Beyond-K-5 骤降,UNFILTERED 两区间几乎无差。(4) 数学推理:MathCAMPS 上差距随年级渐进拉大而非阈值突变;8 年级题即使 pass@1024,LittleLearner 解题数也不到 UNFILTERED 一半;且能力不遵循课程顺序——多位数除数的除法好于个位数除数。三项干预结论一致:0.6B→5B 扩容在 K-5 内显著提分、6-7 年级边界处部分获益、8 年级全部贴地,且 0.6B 的 LittleLearner 在 K-5 内反超 UNFILTERED(专注容量红利);SFT+GRPO 抬高两个模型的 K-5 成绩,但 LittleLearner 在 Beyond-K-5 仅小幅提升、即使用越界数据做 GRPO 也与 K-5 数据无差别,差距反而扩大;few-shot ICL 在 K-5 小幅提分、Beyond-K-5 完全无效,解释性提示则连输出分布都不改变。

与 UNFILTERED 基线相比,LittleLearner 对小学问题的回答得体:K-5 与 Beyond-K-5 问题的定性示例
Table 1: 与 UNFILTERED 基线相比,LittleLearner 对小学问题的回答得体:K-5 与 Beyond-K-5 问题的定性示例
LittleLearner 对更难的文本越来越不熟悉(CLEAR 上按 Bradley-Terry 易度分桶的 BPB)
Figure 3: LittleLearner 对更难的文本越来越不熟悉(CLEAR 上按 Bradley-Terry 易度分桶的 BPB)
LittleLearner 对高年级数学内容不熟悉(CoMTA 学生回答的 BPB)
Figure 4: LittleLearner 对高年级数学内容不熟悉(CoMTA 学生回答的 BPB)
LittleLearner 能回答 K-5 科学问题,但在 Beyond-K-5 上崩溃(Jeopardy 科学题 Pass@1,按 NGSS 划分)
Figure 5: LittleLearner 能回答 K-5 科学问题,但在 Beyond-K-5 上崩溃(Jeopardy 科学题 Pass@1,按 NGSS 划分)
LittleLearner 的数学答题在 K-5 内与基线持平,但在高难度上不对称地崩溃(MathCAMPS,1024 rollouts)
Figure 6: LittleLearner 的数学答题在 K-5 内与基线持平,但在高难度上不对称地崩溃(MathCAMPS,1024 rollouts)
扩大模型参数在 K-5 内和边界处有帮助,但不能很好地恢复 Beyond-K-5 性能(0.6B/1.3B/5B 对比)
Figure 7: 扩大模型参数在 K-5 内和边界处有帮助,但不能很好地恢复 Beyond-K-5 性能(0.6B/1.3B/5B 对比)
在未过滤内容上做后训练提升 K-5 能力,但无法跨越 Beyond-K-5 差距(SFT+GRPO 前后对比)
Figure 8: 在未过滤内容上做后训练提升 K-5 能力,但无法跨越 Beyond-K-5 差距(SFT+GRPO 前后对比)
上下文学习无法恢复 Beyond-K-5 能力(Direct/Few-shot/解释提示对比)
Figure 9: 上下文学习无法恢复 Beyond-K-5 能力(Direct/Few-shot/解释提示对比)
查看结构化数据
任务指标本文基线提升
语料边界验证(自建 CommonCoreText 真值集) Beyond-K-5 文档保留率 0%(K-5 保留 35–42%) 未过滤 FineWeb-Edu(越界内容全部保留) 完全阻断越界内容,以精度优先设计换来锐利边界
外部盲测(WeeBit 年级标注语料) 真正越界内容比例(人工核查) 0.05%(6000 条 Beyond-K-5 仅 3 条,另余 2.48% 为爬虫噪声) 126 个越界 n-gram 全库扫描命中率仅 0.09%,交叉印证
语言难度泛化(CLEAR,教师易度标注) BPB 随 Bradley-Terry 难度分桶的走势 LittleLearner 随难度单调上升 UNFILTERED 与 Gemma 2B 基本平坦且互相接近 边界存在的语言学证据,归因于预训练数据
事实知识(Jeopardy 科学题,NGSS 分级) Pass@1 K-5 内与基线相当,Beyond-K-5 断崖式下降 UNFILTERED 在两个区间成绩几乎不变 同配方对照证明下降由语料过滤导致
数学推理(MathCAMPS,按 CCSS 年级,1024 rollouts) Pass@1 / pass@1024 8 年级 pass@1024 仍不足基线一半,5B 在 Grade 8 贴地 UNFILTERED 随规模与采样预算持续提升 证明规模化与采样预算无法恢复越界能力
GRPO 后训练(MathCAMPS) Pass@1 LittleLearner:K-5 提升,Beyond-K-5 仅小幅提升;越界数据后训练与 K-5 数据无差别 UNFILTERED 后训练在 Beyond-K-5 大幅提升 后训练反而扩大两者差距,GRPO 无法桥接边界

局限与改进

作者承认的局限:5B 规模下某些涌现能力(尤其是 ICL)可能明显弱于前沿模型,因此'ICL 无法解锁越界推理'的结论未必能外推;后训练实验明确限定在'测试预算内'未见差异,更大的预算或更强算法可能不同。我自己的观察:第一,精度优先策略丢弃了约 65% 的真 K-5 文档,LittleLearner 的域内能力可能被系统性低估——'K-5 内与全量训练的基线相当'其实是很强的结果,反之域内弱项不能归咎于方法;第二,年级标签是人类课程的难度代理,论文自己展示模型能力不按课程顺序排列(多位数除数优于个位数除数),说明用年级刻画模型边界存在内在张力;第三,语料以英语、美国课程为锚,对其他语言与教育体系的迁移未知;第四,过滤依赖 AoA 词表与 LLMJ 标注,AoA 覆盖率仅 90%,词频插补可能引入隐蔽泄漏;第五,沙盒刻意不模拟儿童发展,用它直接下教育学结论需谨慎。

独立分析的弱点

弱点一:召回率过低。35–42% 的 K-5 保留率意味着语料远非小学材料的代表样本,域内结论可能受选择偏差影响(保留的都是短而简单的文档)。改进:在保持零泄漏约束下用校准的软阈值替代硬丢弃,或对被拒文档做分层人工抽检后回收低风险部分。弱点二:AoA 插补的鲁棒性。10% 词汇无 AoA,线性插补假设 AoA-频率关系对所有词成立,低频专名可能被误判为'简单'而漏网。改进:对插补词施加保守惩罚,或用上下文嵌入难度预测做二次校验。弱点三:小规模外推风险。5B 模型的 ICL 本就很弱,'few-shot 无效'可能与前沿模型上 ICL 的真实作用混淆。改进:利用 0.6B/1.3B/5B 三点报告 ICL 增益随规模的斜率并外推。弱点四:后训练干预单一且预算受限。只测了一种 SFT+GRPO 配置的有限预算,未覆盖更多 epoch、更大 rollout 量或拒绝采样微调等替代。改进:绘制'越界能力-训练预算'曲线,量化桥接边界所需的最小干预强度。弱点五:评测题与语料的表面重叠未完全审计,n-gram 扫描只针对课程术语。改进:对每道评测题做与语料的重叠扫描,排除'见过原题'干扰。

未来方向

作者提出的方向:(1) RL 与发现——LittleLearner 是'受限先验 + RL 能否产生真发现'的干净试验台,可研究奖励信号、验证器、自博弈与搜索能否把 K-5 智能体推向更高年级或竞赛数学,也可测试 RL 从小操作数算术向大数字、长序列的外推是否意味着习得了程序而非插值;(2) 持续学习与可解释性——在 K-5 之后再引入负数、代数记号等新材料,测量样本效率、保持与新旧知识干扰,并做前后对照的表示分析(如追踪从整数到分数、从算式到方程的内部变化);(3) 认知校准——构造域内/边界/域外任务,控制性评估模型何时答对、表达不确定、弃权或幻觉;(4) 教育科学与交互学习——比较模型与儿童学习分数所需的曝光量与错误结构,测试检索与外部记忆能否可靠整合域外内容、自反思能否重组潜在能力、多智能体协作中新信息的来源追踪。我的延伸:该沙盒天然适合做知识注入审计与 RAG 污染检测,把 K-5 边界推广到中学、多语言课程体系,或在同一框架下训练更大规模版本,将使'能力=预训练分布'这一假说的检验更具说服力。

复现评估

复现难度中等偏低,对学术实验室友好。有利条件:LittleCurriculum(88B token)与 LittleLearner 权重公开在项目主页;过滤流水线各阶段在附录有完整描述,核心组件——FineWeb-Edu、FastText、ModernBERT、WordFreq 词频表、DSPy、MathCAMPS/CLEAR/CoMTA/Jeopardy 评测集——均为开源或廉价 API;训练成本为 8×B200×100 小时(800 GPU 时),且提供 0.6B/1.3B 缩放组进一步降低门槛。风险点:LLMJ 标注依赖 Gemini Flash,提示词经 DSPy 与 OpenEvolve 自动优化,严格复现过滤结果需要相同的标注模型版本与优化轨迹;CommonCoreText 真值集与 126 个越界 n-gram 列表是否随模型一并发布,正文未明确说明;若项目页只放权重不放流水线代码,重建语料的成本会显著上升。评估部分最容易复跑:四个评测基准全部公开,且 BPB、pass@1、pass@1024 都是标准指标。总体判断:复现模型推理与评测约数天工作量,完整重建语料约数周。