DFM Mimir v1:仅用合规后训练数据、以10亿参数达到前沿性能的开放HRM模型 DFM Mimir v1: An Open HRM Delivering Frontier Performance at 1B Parameters Using Only Permissible Post-Training Data
仅用合规数据从头训练的10亿参数HRM模型,丹麦语新SOTA、英语媲美4B模型
前置知识
HRM(Hierarchical Reasoning Model,分层推理模型)
一种非主流 Transformer 变体,用双层循环结构组织推理:高层模块(H-cycle)负责抽象规划,低层模块(L-cycle)负责细化计算,配合截断反向传播(本文设 5 步)控制训练成本。HRM-Text 是其文本版,特点是无需海量预训练语料,训练阶段即可直接聚焦后训练数据。
Mimir v1 整个技术报告都建立在 HRM-Text 架构之上,不了解 H-cycle/L-cycle 循环机制就无法理解为何它能用 70B token 从头训出有竞争力的 1B 模型。
后训练(post-training)与指令微调(SFT)
在基座模型之上用指令-回答对数据进行监督微调,使模型学会遵循指令、对话和推理。本文语料全部按 8 个功能类别(如丹麦语指令与知识、数学推理、智能体工具调用)组织,属于大规模多任务 SFT 配方。
本文标题中的 permissible post-training data 即指这一阶段的数据合规性,理解 SFT 的数据配比思想才能看懂 161 个数据集的分类与混合策略。
数据合规性(permissible data)
指训练数据的法律与伦理可用性:包括开放许可证、协议授权(agreement)、公有领域,以及欧盟文本与数据挖掘(TDM)研究例外覆盖的数据;排除含个人信息或侵犯版权的内容。不合规数据需要被替换或剔除。
这是全文的立论核心:论文要证明合规约束不会毁掉模型性能,合成移植数据集正是为解决合规缺口而生。
FSDP(全分片数据并行)
Fully Sharded Data Parallelism,把模型参数、梯度和优化器状态切片分布到多张加速卡上,按需聚合,从而在显存有限的设备上训练超出单卡容量的模型。本文采用 bf16 计算、fp32 聚合的常规配置。
理解第 4 节训练设置(8 张 B200、全局 batch 262,144 token)时需要知道 FSDP 是支撑该规模训练的基础设施。
RoPE(旋转位置编码)
Rotary Position Embedding,把位置信息编码为对注意力查询/键向量的旋转操作,使注意力得分只依赖相对位置。本文取基频 $\theta = 10{,}000$,配合 pre-norm 层归一化($\epsilon = 10^{-6}$)。
RoPE 是 Table 5 模型超参数中的关键项,也是 Mimir 评测时必须用 FlashAttention 捕获 PrefixLM 结构的原因之一。
研究动机
当前大语言模型开发依赖 Wang et al. (2026) 所说的单一配方:海量数据 + 多阶段流水线,这既需要巨大的预训练算力,也让坚持开源与伦理取数的研究者望而却步。对丹麦基金会模型(DFM)这类国家级项目,问题更尖锐:他们坚持只用许可合规、尽量开放授权的数据,而丹麦语的高质量语料池天然狭小,从头训练一个有竞争力的 LLM 常常不可行,导致主流平台上长期缺少合规的丹麦语基座模型。此外,HRM-Text 原始训练数据(Sapient 混合语料,捆绑 Flan、Platypus、tasksource 共 107 个子集)中有部分数据集不满足 DFM 的许可哲学,且这些语料以 A/B/C/D 多选题判别任务为主,与 GSM8K、MATH、DROP 等精确匹配评测的目标错位。如何在保住数据权利的同时补齐能力缺口,是本文要解决的具体问题。
本文的目标是本文的目标是证明:只用许可合规的数据——开放授权、协议供给或欧盟 TDM 研究例外覆盖的内容——也能从头训练出性能处于前沿水平的 1B 参数语言模型。具体路径是基于 HRM-Text 架构训练 Mimir v1,针对英语和丹麦语优化,混合 161 个数据集、每 epoch 约 70.5B token(70,479,308,606);对不合规数据,用 Gemma 4 31B 合成生成并审计的移植数据集加以替换。评测上要在英语、数学与代码、丹麦语三类共 20 个基准上,与 HRM-Text 1B、Qwen 3.5(0.8B/2B/4B)、Gemma 3 1B、Gemma 4 E2B、OLMo 2 1B、SmolLM3 3B 以及 8-9B 的三个 Munin 丹麦语模型全面对比,目标是超越原 HRM-Text 1B、与更大的前沿模型竞争,并为丹麦语树立新的 SOTA。
与已有工作不同的是,本文的独特切入角度是不走更大模型 + 更多数据的军备竞赛路线,而是把全部工程重心压在后训练数据的合规性上。关键洞察有二:其一,HRM-Text 架构允许在初始训练阶段就聚焦后训练数据,绕开了对海量预训练语料的依赖,这对丹麦语这类低资源语言尤其重要;其二,不合规数据不必简单丢弃——用合成再创作的方式生成移植数据集,可以在保留任务能力的同时彻底替换数据来源,且合成替代品的性能可持平甚至超过原数据。此外,作者刻意把语料重心从多选题判别转向自由形式生成:83% 的 token 来自 Sapient 之外,三大生成式类别合计 39.54B token(56.1%),使训练目标与精确匹配评测天然对齐,这是对社区通用的多选题为主配方的直接反思。
核心方法
整体直觉是:小模型的能力上限主要由数据配方决定,与其堆预训练语料,不如把预算花在精心策展的合规后训练数据上。技术路线分四步。第一步是数据策展:混合 161 个数据集,按 8 个功能类别组织——丹麦语指令与知识(15.56B token,占 22.07%)、英语指令(13.58B,19.26%)、Sapient 混合(12.00B,17.02%)、数学与推理(10.40B,14.76%)、Mimir 合成(7.05B)、智能体与工具调用(6.66B)、机器翻译(3.50B)、科学与摘要(1.74B)。第二步是合规移植:用 Gemma 4 31B 合成并审计 70 个 Sapient-synth 移植数据集(75M token),替换不合规的 Flan/Platypus/Tasksource 原始数据。第三步是从头训练 HRM-Text 1B(1.65M 步、8 张 B200、不足 3 周)。第四步是在 20 个基准上做温度 0 的贪心解码评测,并对四类有记忆化风险的数据做独立的版权审计。
核心创新是合规优先的配方工程加上合成移植数据集方法论。与主流先海量预训练、再后训练的单一路线不同,HRM-Text 让训练从第一阶段就围绕后训练数据展开,使 1B 模型在 70.5B token 的 SFT 语料上从零训出指令跟随和推理能力。点睛之笔是移植数据集:原文指出不合规的 Sapient 数据主要是 Flan NIV2、Flan Dialog、Platypus、Tasksource 的英文指令任务,作者用 Gemma 4 31B 将这些任务重新生成为生成并审计形式的合规版本,同时把大量原本的多选题分类任务(如 task590-amazonfood-summary-correction-classification)改写成开放生成或答案生成任务。这证明数据权利与模型性能并非零和博弈。另一个与已有工作的本质区别是评测哲学:刻意把训练分布从选项判别转向自由生成,使模型在精确匹配指标(GSM8K、MATH、DROP)上的表现系统性受益。
方法步骤详情
第一步,数据策展与分类:161 个数据集按 8 个功能类别组织,语言分布为英语 68.62%、丹麦语 24.74%、丹英双语 6.54%;数据以 7 种形式进入流水线——重格式化 46.49B(65.96%)、策展加重格式化 11.92B(16.91%)、合成加审计 7.81B(11.08%,Gemma 4 31B 生成)、工具调用格式化 1.87B、翻译加审计 1.59B、协议供给 0.67B(许可不公开,仅用于派生合成指令数据)、派生任务 0.13B。重复采样:lærebogen 重复 4 倍(2.08B 膨胀至 8.32B),8 个小型丹麦语数据集重复 10 倍。第二步,构建模型:隐藏层 1536、32 层、12 注意力头、FFN 扩展 4、2 个 H-cycle、3 个 L-cycle、截断反向传播 5 步、RoPE $\theta=10{,}000$、pre-norm $\epsilon=10^{-6}$,非嵌入参数 1.3B 加嵌入 0.4B,用 Gemma-4 分词器。第三步,训练:FSDP、bf16 计算加 fp32 聚合,AdamW,峰值学习率 $3\times10^{-4}$、2000 步线性 warmup 后恒定,EMA 0.9999,全局 batch 262,144 token(8 卡、梯度累积 2、每卡 4 个 4096 上下文),1.65M 步、不足 3 周、平均每步约 1.1 秒。
技术新颖性
技术新颖性体现在四个层面。第一,这是首个以完全合规数据为硬约束、从头训练并达到前沿性能的小型 HRM 语言模型,把法律与伦理约束从附加考量提升为设计前提。第二,移植数据集方法论是全新的:不是过滤或弃用不合规数据,而是用 Gemma 4 31B 合成再创作并系统性审计,实证表明 75M token 的移植数据足以替代原 Sapient 语料的功能,且顺带把多选题判别改写为生成任务。第三,对 HRM-Text 的工程化扩展有借鉴意义:从自定义分词器换成 Gemma-4 分词器并通过聊天模板从头学习现代对话结构,使模型能直接复用 Gemma 生态的模板与推理设施。第四,评测设计上明确对齐精确匹配类基准而非多选题准确率,并公开指出原 Sapient 语料以分类选择为主的结构性偏差——这种对训练-评测对齐问题的坦诚分析在小模型技术报告里相当少见。
实验结果
三大基准套件全面领先同类。英语 7 项基准平均 69.0 分,超过 HRM-Text 1B(66.1)、SmolLM3 3B(63.1)、Gemma 4 E2B(56.6)及其 think 模式(66.6),仅比 Qwen 3.5 4B(69.3)低 0.3 分;BoolQ 87.8、Winogrande 73.5、DROP 83.1 为全部受测模型最佳,ARC-C 81.6 仅次于 HRM-Text 的 82.2。数学与代码平均 64.1,比 HRM-Text 的 46.9 相对提升 36.7%:GSM8K 89.9 在其量级内第一、总榜第二(仅次 Gemma 4 E2B think 的 90.3),HumanEval 56.7 优于 Qwen 3.5 2B 的 47.6(HRM-Text 为 0.0),总体只落后 SmolLM3 3B(67.9)约 3.8 个百分点。丹麦语平均 56.8 为全场最高,超过所有 8-9B 的 Munin 模型(最佳 45.6),DaLA 96.1、GEC 85.6、WikiQA 66.8、Angry Tweets 67.4 领先,短板是 Daisy 仅 9.6。记忆化审计:50 token 以上逐字匹配仅占训练文档的 0.00022%–0.015%,模型输入侧仅 0.000045% 呈连贯散文、0.00000073% 呈表达性文本,无高优先级版权发现。
查看结构化数据
| 任务 | 指标 | 本文 | 基线 | 提升 |
|---|---|---|---|---|
| 英语综合(BoolQ/Winogrande/Hellaswag/MMLU/ARC-C/DROP/GovRep) | 平均分 | 69.0 | HRM-Text 1B 66.1;最强竞品 Qwen 3.5 4B 69.3 | 较 HRM-Text +2.9,距 4B 的 Qwen 3.5 仅差 0.3 |
| 数学与代码(GSM8K/MATH/HumanEval) | 平均分 | 64.1 | HRM-Text 1B 46.9 | +17.2,相对提升 36.7% |
| 丹麦语综合(DaLA/GEC/WikiQA/AngryTweets/PIQA/Daisy/WMT/N.News/IFEval/HellaSwag-DA) | 平均分 | 56.8 | HRM-Text 1B 21.7;非 HRM 最强竞品 Gemma 4 E2B (think) 49.9 | 较 HRM-Text +35.1,创丹麦语新 SOTA,并超过 8-9B 的 Munin 系列最佳(45.6) |
| GSM8K | Acc | 89.9 | HRM-Text 1B 84.8;Qwen 3.5 0.8B 49.1 | +5.1,其量级内第一、全榜第二 |
| HumanEval | Acc | 56.7 | HRM-Text 1B 0.0;Qwen 3.5 2B 47.6 | 从 0 修复到 56.7,并反超大其两倍的 Qwen 3.5 2B |
局限与改进
作者承认的局限:数学与代码仍落后 Gemma 4(总参 5B、有效 2.3B)——MATH 45.8 对 64.2、HumanEval 56.7 对 73.8,说明小模型在该领域还有明显空间;作为助手的对话能力与 SOTA 相比仍有限;该架构尚未探索强化学习。我自己的观察:其一,语料高度集中,前 10 个数据集占 66.5%、前 3 个占 38.1%,lærebogen 重复 4 倍、8 个小型丹麦语数据集重复 10 倍,重复采样有放大偏差与过拟合的风险;其二,英语平均 69.0 仍低于 Qwen 3.5 4B 的 69.3,且 GovRep 仅 32.0、Daisy 仅 9.6,说明长文档抽取式问答和信息检索类任务薄弱;其三,基线体系中缺少同数据配方加标准 Transformer 架构的消融,读者无法区分性能增益究竟来自 HRM 架构还是数据配方本身;其四,这是英丹双语特化模型,向其他语言迁移的能力完全未知。
独立分析的弱点
弱点一:合成移植数据的质量控制依赖 Gemma 4 31B 的生成能力和人工审计流程,而论文披露各类别的接受率从个位数百分比到 90% 以上波动巨大,说明部分类别的合成质量并不稳定;改进方向是建立自动评测指标加人工抽检的闭环,并对接受率低的类别引入多模型交叉生成。弱点二:数据集中度过高——Sapient 大仓库占 16.9%、lærebogen 占 11.8% 且重复 4 倍,小型数据集重复 10 倍,容易过拟合到少数来源;改进方向是用语料配比优化方法(如 DoReMi 类的分布搜索)替代手工设定重复倍数。弱点三:Daisy 9.6 与 GovRep 32.0 暴露长文档理解和开放域抽取问答的短板,可能是 4096 上下文窗口与 HRM 循环深度的共同限制。弱点四:纯 SFT 训练缺乏 RLHF/RLVR 阶段,助手式对话能力受限;同时论文未报告 HRM 层级循环带来的推理时额外延迟,与标准 Transformer 的部署成本对比缺失。弱点五:没有架构消融实验,HRM 架构与数据配方各自的贡献无法解耦,这削弱了 HRM 路线本身的说服力。
未来方向
作者明确提出的方向有三个:探索 HRM 模型的 scaling 行为(更大参数量下该架构是否持续有效);提升助手能力,包括尚未在该架构上尝试的强化学习;继续完善数据集的许可开放性并改进性能。基于本文成果可以自然延伸的方向包括:把可验证奖励强化学习(RLVR)应用到 GSM8K、HumanEval 这类已有精确匹配信号的领域,恰好补上纯 SFT 的短板;将移植数据集方法论推广到其他低资源语言,形成低资源语言合规建模的通用范式;设计同数据配方下 HRM 与标准 Transformer 的对照实验以解耦架构贡献;研究 HRM 的 H/L 双循环与测试时计算扩展的结合,看能否用推理时多轮循环弥补参数量差距;以及向北欧其他语言(挪威语、瑞典语)做零样本迁移评测,检验双语配方的泛化性。
复现评估
复现条件总体较好。模型权重在 Hugging Face Hub 公开(danish-foundation-models/DFM-Mimir);训练框架开源(github.com/schneiderkamplab/HRM-Text,构建于 Sapient 的 HRM-Text 代码之上);161 个数据集中绝大多数来自 HF Hub,附录 A 给出完整数据清单,附录 B 给出评测配置:温度 0 贪心解码、shuffle seed 4242、全量数据集评测,基线用 vLLM 加 FlashInfer,Mimir 因需 FlashAttention 捕获 PrefixLM 结构而单独处理(与 HF Transformers 结果一致);多选题任务 max tokens 为 1,其余 2048,丹麦语任务全部 0-shot,统一用 Inspect AI 框架评测。主要门槛是算力:8 张 B200(180GB HBM)训练近 3 周,完整复现需要 B200 级集群;少数协议供给数据不公开,但仅用于派生合成数据,不影响主流程。若只做评测验证,用 HF Transformers 加单卡即可,难度中等。
论文图表
附录 C 中的记忆化审计图:对四类有记忆化风险的数据类别(协议来源派生的合成指令数据、 opt-out 状态不确定的 HF 指令数据、高置信无 opt-out 的 HF 指令数据、其他低风险合成与推理数据)分别展示前缀攻击得到的逐字匹配分布,50 token 以上逐字片段仅占 0.00022%–0.015%。
为合规声明提供了实证支撑:仅 0.000045% 的模型输入对应连贯散文、0.00000073% 对应表达性文本且无高优先级版权发现,这是论文合法性的关键证据链。