注入、对齐、恢复:面向免检索文档知识内化的分阶段后训练 Inject, Align, Recover: Staged Post-Training for Retrieval-Free Document Knowledge Internalization
三阶段后训练把文档语料内化为参数知识,免检索答题同时保住通用能力。
前置知识
检索增强生成(RAG)
RAG 在回答问题时先由检索器从外部文档库中召回相关段落,再把段落拼进提示词让模型基于证据作答。模型本身不记忆文档内容,记忆外置在检索索引里,因此知识可以随文档库更新而即时更新,也便于溯源。
本文研究的恰是 RAG 的反面场景:推理时不给任何检索段落,模型必须凭参数里的知识回答固定语料上的问题。理解 RAG 的记忆外置逻辑,才能理解'内化'这一设定为什么更难、什么时候有价值(延迟、隐私、验证后训练是否真的改变了参数知识)。
持续预训练(CPT)与监督微调(SFT)
CPT 直接在领域原始文本上继续做语言建模,损失为 $\mathcal{L}_{\text{CPT}} = -\frac{1}{T}\sum_t \log p_\theta(x_t|x_{<t})$,对整个 token 流计损;SFT 则在指令-回答对上训练,通常只对回答 span 计损(answer-only loss masking),让模型学会按问答接口输出。
论文的核心对照就是这两条路:QA-only SFT 学习信号稀疏,只覆盖 QA 生成器选中的事实;CPT 暴露密集但不教问答行为。IAR 的 Inject 阶段正是要在这两者之间取中——用指令条件化的文档重构任务获得密集监督,同时保留问答接口的格式。
灾难性遗忘
神经网络在新任务上微调时,权重被新梯度覆盖,旧任务(如通用指令跟随、常识问答)性能大幅下滑的现象。Kirkpatrick 等 2017 年正式提出。在 LLM 领域适配中表现为:领域问答准确率上升的同时 IFEval、MMLU 等通用基准暴跌。
本文所有实验表格都呈现这种此消彼长:Vanilla SFT 把 Llama 的 MMLU 从 50.8 打到 11.2,CPT+SFT 更是打到 3.7。Recover 阶段的目标就是缓解遗忘,读懂这个概念才能理解为什么需要第三阶段以及合并系数如何权衡领域与通用。
模型合并与任务向量
模型合并在权重空间组合多个检查点。任务向量定义为微调模型与基模型之差 $\Delta = \theta_{\text{IA}} - \theta_0$,可用 $\theta_R = \theta_0 + \lambda\Delta$ 插值,或用 TIES(裁剪-选举-合并解决符号冲突)、DARE(随机丢弃任务向量元素)、SLERP(球面插值)、Task Arithmetic 等算子融合。
Recover 阶段不发明新算法,而是在 SLERP、Task Arithmetic、TIES、DARE 四族共 12 个候选的固定网格上做后验选择。理解任务向量的直觉(领域知识是相对基模型的一个可加减的位移)是读懂第三阶段机制的前提。
LLM-as-a-Judge
用一个强 LLM 给被评模型的开放式回答打分,替代人工标注。本文用双评审取中位、分歧时唤起第三评审的自适应面板(gpt-oss-120b、MiniMax-M2.5、DeepSeek-V3 变体),分数取 0/0.5/1 三档,并做一致性审计(binary Cohen's κ = .691)。
论文的领域 QA 主指标完全由该面板产生,242,255 条评审记录的审计协议是结果可信度的关键支撑。理解它的偏差来源与审计方法,才能正确解读表中那些不是答案比对、而是评审意见的百分数。
条件比特每字节(BPB)
跨分词器比较语言模型困惑度的标准化指标:$\text{BPB} = \frac{-\log_2 p(x_t|x_{<t})}{B}$,即每 UTF-8 字节的条件比特数。token 级困惑度因词表不同不可比,BPB 把分母统一到字节,可用于对比不同分词器的模型对同一段文本的拟合程度。
附录 F 用 BPB 诊断 Qwen3-4B 在 CCI 上未经训练就达 70.6% 准确率的边界情况:其源文本 BPB 仅 0.744,显著低于 Llama 的 1.021。这个工具揭示了'高基线先验'现象,是解读 Qwen 行、判断结果是否被数据污染类因素混淆的关键证据。
研究动机
文档问答的工程默认答案是 RAG:先检索再作答。但在很多真实部署中检索不可得或不可取——低延迟场景扛不住检索链路、隐私敏感场景不允许文档出域、以及评测场景刻意移除检索以验证后训练是否真正改变了模型参数。论文把这一设定称为文档知识内化(document knowledge internalization):给定一个有界文档集合,模型要在推理时完全看不到源文档的条件下回答从中生成的held-out问题。现有两条路线都有硬伤。其一是 QA-only SFT:在文档衍生的问答对上做监督微调,输入输出格式与测试一致,但学习信号极稀疏——以 CC 语料为例,4,001 份输入文档经文件级过滤后只剩一半(48.6% 被拒),问题生成有效率 48.4%,QA 保留率 44.6%,最终只沉淀出 15,008 条实验 QA,模型只能学到 QA 生成器恰好问到的那部分事实。其二是持续预训练(CPT):对文档 token 流做密集语言建模,但没有任何提示/回答边界,不直接教模型答题。更麻烦的是两条路都伴随通用能力坍塌:主表中 Vanilla SFT 让 Llama-3.2-3B 的 IFEval 从 77.1 跌到 54.2、MMLU 从 50.8 崩到 11.2;Base 初始化的 CPT+SFT 甚至把 MMLU 打到 3.7。一个答得准但听不懂普通指令的内化模型是不可部署的。
本文的目标是论文的目标是把免检索文档问答从单指标比拼重新定义为一个'领域-通用操作点'问题:同时在免检索领域 QA 准确率和通用能力(IFEval 指令跟随、MMLU 多任务推理、MSBench 对话质量)两个维度上度量,寻找更好的帕累托前沿而非单点冠军。操作层面要回答四个研究问题:RQ1——IAR 是否在领域-通用操作点上优于直接 SFT 与常规 CPT+SFT;RQ2——收益是否只是训练 token 更多(用 BudgetMatch 控制预算);RQ3——在 Recover 之前,Inject+Align 两阶段是否已贡献可测的领域内化信号;RQ4——恢复模式能否在 Qwen3-8B/14B/32B 的规模化中复现。最终交付一个可复现的三阶段框架 IAR(Inject, Align, Recover),跨 CC/CCI 两个语料与 Llama、Phi、Qwen、SmolLM 四个模型族验证。
与已有工作不同的是,最接近的已有工作都在改变模型获取文档知识的接口:AdaptLLM 把语料改写成阅读理解文本、PIT 反转'先文档后问答'的顺序、Self-Tuning 加自监督记忆/理解/反思任务、KiDG 把多文档变成模拟对话。但它们的语料、模型、训练顺序和评测契约互不对齐,发表分数无法协议对齐地比较。本文的独特切入是拒绝发明新的重构损失家族,而把 IAR 定位为一次受控实证分解:把'文档暴露密度'、'问答可及性'、'能力恢复'三个通常被折叠在一次微调对比里的变量拆开,各自配可证伪的假设——QA-only 暴露可能太少、文档级训练可能无法通过问答接口取回、领域适配可能损害通用指令跟随。三阶段各自可独立归因,某阶段负结果不推翻其他阶段;Recover 被显式当作第三个实验变量而非隐式超参搜索;评测侧则用固定 12 候选合并网格、验证集选择规则、held-out 测试前置锁定,把'选择'本身变成可审计的协议。这种'分解而非配方'的立场是它区别于同类工作的核心。
核心方法
先说直觉:把文档塞进参数并让它能被问出来,等价于同时解决'读得够密'和'答得出来'两个问题,而直接 SFT 只做了后者、CPT 只做了前者,两者还都会顺带砸掉通用能力。IAR 因此把流程拆成三段。第一阶段 Inject:不做原始流上的 CPT,而是把每份文档改造成指令条件化的监督重构任务——Continuation 给文档前缀预测后缀,Rewrite 从生成的摘要/大纲/知识骨架重建全文,Instruction-formatted reconstruction 给一句通用阅读指令就预测清理后的全文——三者按整数比例混合(如 1:1:1、1:1:2、1:0:0),损失只打在助手目标上:$\mathcal{L}_{\text{Inject}} = \sum_{m\in\mathcal{M}} \pi_m\, \mathbb{E}_{(u,y)\sim D_m}[\ell_\theta(u,y)]$,其中 $\ell_\theta(u,y) = -\frac{1}{|y|}\sum_t \log p_\theta(y_t|u, y_{<t})$,$\pi_m$ 是经验采样份额而非自由损失系数。第二阶段 Align:在注入后的检查点 $\theta_I$ 上做 answer-only QA SFT,$\mathcal{L}_{\text{align}} = -\frac{1}{|a|}\sum_t \log p_\theta(a_t|q, a_{<t})$,得到 $\theta_{IA} = \text{Align}(\theta_I)$。第三阶段 Recover:从原指令模型出发做后验权重合并 $\Delta = \theta_{IA} - \theta_0$、$\theta_R = \theta_0 + \lambda\Delta$,在 SLERP/Task Arithmetic/TIES/DARE 共 12 个候选的固定网格里,按'领域为主、通用护栏'的验证集规则选出部署操作点。数据侧先由 anchor-aware 流水线从文档块生成自包含 QA:抽取可引用锚点、判定六种问题类型适用性、生成禁止指代(不许出现'这个方法''根据上文')的自包含问题、验证、再从同一块生成有据答案。
核心创新不在单个损失函数,而在三个操作上的本质区别。第一,Inject 与 CPT 的区别:CPT 的 $\mathcal{L}_{\text{CPT}} = -\frac{1}{T}\sum_t \log p_\theta(x_t|x_{<t})$ 直接对原始文档流建模,没有提示/目标边界、没有问答接口;Inject 则把每份文档包装成带指令的监督目标(前缀→后缀、骨架→全文、阅读指令→全文),系统与用户提示 token 全部被 mask,损失只落在助手目标上,既保住 CPT 级的密集文档暴露(每份文档的全文或长后缀都是监督信号,而 QA 对只覆盖被问到的事实),又维持与测试时一致的指令条件化接口。第二,Align 用 answer-only 监督把'见过'变成'问得出来':$\theta_{SFT} = \text{Align}(\theta_0)$ 与 $\theta_{IA} = \text{Align}(\theta_I)$ 使用完全相同的 QA 损失,唯一差异是初始化,这个对照让注入的贡献可被隔离。第三,Recover 把抗遗忘从事后补救变成显式的选择问题:任务向量合并 $\theta_R = \text{Merge}(\theta_0, \theta_{IA})$ 的候选在验证集上按形式化规则筛选——域准确率为主键、IFEval/MMLU/MSBench 为护栏、容忍度 $\tau = 1.0$ 个百分点、held-out 测试只在候选固定后才触碰。论文反复强调 IAR 是'适配预算的实验分解'而非统治一切的配方,这种自我定位本身就是方法论上的差异点。
方法步骤详情
完整流程分数据构建与三阶段训练。第一步 QA 构建:对每份文档切块,锚点抽取步骤要求每块至多 $K$ 个可独立引用的核心对象,禁止'这个机制'之类指代;类型适用性判定在事实提取、机制解释、设计动机、条件约束、局限权衡、比较关系六类中筛选该块支持的问题类型;问题生成要求问题脱离源文档也能理解且以问号结尾;验证步骤检查自包含性与语义清晰度;答案生成严格限定从同一块作答并输出自然段落。该流水线的过滤很狠:CC 从 4,001 份文档开始,48.6% 被文件级过滤,77,224 个候选问题只留下 48.4%,最终 15,008 条实验 QA(14,258 训练 + 750 测试);CCI 从 7,000 份文档得到 11,501 条(10,926 训练 + 575 测试)。第二步 Inject:按选定配比(主设置多为 Mixed 1:1:2 或 1:1:1,约 19,000 行)混合三种重构目标训练 3 个 epoch,所有目标使用指令模型的聊天模板。第三步 Align:从 Inject 最终 epoch 初始化,QA answer-only 训练 3 个 epoch,得到 $\theta_{IA}$。第四步 Recover:对每个可恢复的 IA 检查点评估固定的 12 候选网格(SLERP $t\in\{0.2,0.3,0.4\}$、Task Arithmetic $w\in\{0.3,0.5,0.7\}$、TIES $d\in\{0.3,0.5,0.7\}$、DARE $dr\in\{0.1,0.3,0.5\}$),用验证集执行四步选择规则:保留 $D(c) \geq D(v) - \tau$ 的领域可行候选;要求 $G(c)\geq G(v)$ 且三项通用指标至少两项不低于 Vanilla SFT 超过 $\tau$;在 $(D,G)$ 平面非支配候选中以领域准确率为主键排序;同域层级内取 $G(c)$ 最大者,再以最小通用指标改善和更小合并超参破平。训练配置为 AdamW、$\text{lr} = 5\times10^{-5}$、cosine 调度、warmup 5%、BF16、4096 序列长、有效全局 batch 64(1×8 累积×8 卡)、DeepSpeed ZeRO-2,8×A100-40GB。
技术新颖性
技术新颖性可以从四个层面评估。损失设计层面,Inject 的三个目标(续写、骨架重写、指令格式化重构)本身在 AdaptLLM、Self-Tuning 等前作中都有近亲,论文也诚实声明'不声称新的重构损失家族';真正的新东西是把这些目标放进一个统一目标视角:每个 Inject 目标 $m$ 构造配方数据集 $D_m$,混合损失中的 $\pi_m$ 是实现后的采样份额而非自由系数,从而让'配方'成为可枚举、可复现的实验变量(论文给出 1:1:1、1:1:2、1:0:0 等完整敏感性网格)。结构层面,最大的新颖性是把能力恢复提为第三实验变量:以往工作要么用 Replay/LoRA 这类训练时干预,要么用 FAPM 这类剪枝恢复,本文则证明一个两行公式的事后任务向量合并($\Delta = \theta_{IA} - \theta_0$,$\theta_R = \theta_0 + \lambda\Delta$)配合严格的验证集选择协议就能在 Qwen3-8B/14B/32B 上稳定换来 14.9-24.1 个点的平均通用分,代价仅 0.7-1.1 个点领域分。方法学层面,BudgetMatch 控制(用 14/17/21/11 个 QA-only epoch 精确匹配 Inject+Align 的 token 量,Table 11 显示实现比 99.9%-102.8%)、judge 面板的 242,255 条审计(exact agreement .707、binary κ=.691)、以及 BPB 诊断(排除 Qwen 高先验的数据污染嫌疑)都超出了同类论文的严谨度标准。
实验结果
RQ1 主对比(Table 1):IAR 在 8 个数据集-模型设置中的 7 个上全面超过 Vanilla SFT 的全部四项指标,平均提升 3.6 个百分点领域准确率、12.1 个百分点平均通用分。最干净的案例是 Qwen3-4B on CC:领域准确率 50.5% 对 Vanilla SFT 的 42.4%,同时 IFEval 59.8 对 51.1、MMLU 19.5 对 8.8、MSBench 63.0 对 51.0。对照 CPT+SFT 能看出 Inject 的价值:CPT+SFT 领域分不差(Qwen CC 49.6)但 MMLU 只有 18.8、IFEval 31.8,几乎不可部署。两个边界情况被如实保留:Phi on CCI 上 IAR 提升通用但领域分 39.7 略低于 Vanilla SFT 的 40.2;Qwen3-4B on CCI 因基线已有 70.6% 高先验而头空间有限。扩展基线压力测试(Tables 21/22)显示 SDFT 是强数据配方基线(CC Llama 领域 39.9 为全场最高,IAR 36.5 居次),LoRA 和 FAPM 常赢得单项通用指标但领域内化很差——LoRA 领域分低至 15.5-31.3,FAPM 在 sparsity 0.9 下 CC Llama 领域分从 35.5 掉到 22.3。IAR 是 Phi、Qwen3-4B、SmolLM3-3B 的领域最优,定位是强领域为主操作点而非全指标统治。RQ2(Table 2):BudgetMatch 用 14/17/21/11 个 QA-only epoch 匹配 IA 预算后,在 CC 上确实抬升领域分(+4.9/+4.4),但 CCI Llama 不动、CCI Qwen3-4B 反降 2.9;相对 BudgetMatch,IAR 在 16 项指标对比中赢 14 项,证明收益不能归因于 token 更多。RQ3(Figure 3):Recover 之前最好的 Inject+Align 检查点在全部 8 个设置上领域分超过 Vanilla SFT,CC 提升 +2.8/+7.7/+5.3/+4.7(Llama/Phi/Qwen/SmolLM),CCI 提升 +5.6/+6.1/+0.4/+2.3,说明结构化文档暴露在任何权重合并之前就有可测信号。RQ4(Table 3):Qwen3-8B/14B/32B 上,选定的 TIES d=0.3 检查点与 Best IA 领域差距仅 0.7/0.9/1.1 个点,平均通用分提升 14.9/24.1/17.9 个点,且三项通用基准全面同向提升(如 14B:IFEval +14.0、MMLU +26.9、MSBench +31.5),但恢复不完全——最终模型仍比原指令模型多保留 15.6-19.2 个点领域分、通用分未完全回归。
查看结构化数据
| 任务 | 指标 | 本文 | 基线 | 提升 |
|---|---|---|---|---|
| 免检索领域 QA(Qwen3-4B on Common Corpus) | 领域准确率(LLM 评审面板正确率) | IAR 50.5% | Vanilla SFT 42.4%;CPT+SFT 49.6%;Base Instruct 34.3% | 较 Vanilla SFT +8.1 个百分点,且 IFEval/MMLU/MSBench 全部同时提升 |
| 免检索领域 QA(Qwen3-4B on CCI) | 领域准确率 | IAR 76.3%(IFEval 76.1 / MMLU 64.5 / MSBench 70.0) | Vanilla SFT 75.1%(通用三项 45.6/26.3/49.5);BudgetMatch 72.2% | 较 Vanilla SFT +1.2 个百分点,通用分大幅回升;较 BudgetMatch 领域 +4.1 个百分点 |
| 通用能力保持(跨 8 设置平均) | IFEval、MMLU、MSBench 均值 | IAR 较 Vanilla SFT 平均 +12.1 个百分点 | Vanilla SFT(如 Llama CC:IFEval 54.2 / MMLU 11.2 / MSBench 21.5) | +12.1 个百分点平均通用分,同时领域分 +3.6 个百分点 |
| Qwen3 规模化(8B/14B/32B on CC) | 平均通用分恢复量 | IAR (TIES d=0.3) 相对 Best IA 平均通用分 +14.9 / +24.1 / +17.9 个百分点 | Best IA(Recover 前的 Inject+Align 最优检查点) | 领域分仅付出 0.7 / 0.9 / 1.1 个百分点 |
| Pre-Recovery 领域内化(Inject+Align vs Vanilla SFT) | 领域准确率提升 | CC 上 +2.8 / +7.7 / +5.3 / +4.7;CCI 上 +5.6 / +6.1 / +0.4 / +2.3 个百分点 | Vanilla SFT(3 epoch answer-only QA,从原 Instruct 初始化) | 8/8 设置全胜(CCI Qwen3-4B +0.4 为高基线先验边界情况) |
| Token 预算控制(BudgetMatch 消融) | 16 项指标对比胜场 | IAR 胜 14/16(例外:CC Llama 领域、CC Qwen3-4B MMLU) | BudgetMatch(14/17/21/11 QA-only epochs,token 量匹配 IA 的 99.9%-102.8%) | 证明 IAR 收益来自分阶段暴露与恢复,而非训练 token 更多 |
局限与改进
作者明确承认的局限:其一,IAR 不是全指标统治——Phi on CCI 和 Llama on CC 是真实的领域-通用权衡点(CC Llama 上 IAR 比 BudgetMatch 少 3.9 个领域分换 11.0 个平均通用分),部署偏好仍需人工决策;其二,最佳 Inject 配方强依赖模型与语料(Llama/Phi 偏好 1:1:2、Qwen CC 偏好 1:1:1、Qwen CCI 偏好 1:0:0),无法给出普适推荐;其三,恢复是部分的而非完全的——选定检查点比原指令模型保留 15.6-19.2 个点领域增益,但通用分并未完全回归基座水平;其四,RQ4 仅覆盖 CC 一个语料、同一 TIES d=0.3 密度,是同族内重复模式而非 scaling law;其五,所有检查点均为单次训练,无多种子平均,且 Qwen3-8B/14B/32B 扩展运行的训练参数与日志未完整归档(provenance 缺失);其六,LLM-as-judge 本身不完美(exact agreement 仅 .707)。我自己的观察:测试集仅 750/575 题,bootstrap 区间虽给出但单设置差异小于 2 个点的结论需谨慎;训练 QA 与测试 QA 由同一生成流水线产出,'内化'可能部分是对生成式问答分布的拟合而非对文档知识的全面掌握,BPB 诊断只针对 Qwen 边界情况做了部分回应;Base 与 Instruct 初始化的混淆虽用 Table 23 的诊断部分澄清,但覆盖不完整(仅 Llama/Phi);附录 F 承认 BPB 比较未控制模型容量与预训练构成,不能确立因果。
独立分析的弱点
弱点一:QA 生成的信息瓶颈。Inject 阶段虽提供密集文档暴露,但 Align 与最终评测都锚定在 LLM 生成的 QA 上——CC 的 QA 生成历经文件过滤 48.6%、问题有效率 48.4%、QA 保留率 44.6% 的多重漏斗,最终 750 道测试题的覆盖面天然受限于锚点抽取能找到的'可引用事实',文档中的长程逻辑、跨段落论证很难变成自包含问题。改进方向:在评测集之外补充文档级 BPB/记忆探针作为次要指标,或生成跨文档多跳问题测试真正的结构化内化。弱点二:三阶段串行的算力开销与超参组合爆炸。每个设置要跑 Inject(约 19k 行)+ Align + 12 个合并候选的完整评测,8 个主设置加上扩展基线,中小团队难以复制;配比、epoch、合并系数之间的交互也没有系统研究。改进方向:探索用轻量代理指标(如验证集 BPB 下降量)提前剪枝合并候选。弱点三:Recover 的合并对象必须同源(共享基座 $\theta_0$),无法处理多轮迭代注入或持续学习的场景,tied-embedding 模型还需临时物化 LM head 的工程补丁。改进方向:结合参数空间方法(如 Fisher 加权)或多检查点 soup。弱点四:领域主指标完全依赖 LLM 评审面板,0/0.5/1 三档打分对需要精确数值、单位或否定的答案可能有系统性偏差,且面板模型(gpt-oss-120b 等)自身知识可能与被测语料重叠。改进方向:对测试集分层抽样做人标校准,报告人机一致率。
未来方向
作者方向上:把 IAR 的分解方法论推广到其他适配场景(代码库、私有知识库、多语言语料),验证 Inject 配方是否存在随模型规模或语料性质可预测的最优配比;将 RQ4 的同族重复模式扩展为跨语料、跨密度的系统性 scaling 研究;改进选择协议,让部署方可以按自身偏好在领域-通用前沿上任意取点(Figure 4 的候选前沿可视化已为此铺路)。基于成果可延伸的:其一,把 Inject 的指令条件化重构与知识编辑/定位技术结合,检查内化知识在参数中的位置,区分'分布式吸收'与'表层记忆',这能直接回应 QA 分布拟合的疑虑;其二,探索 Recover 的在线版本——在持续学习多批文档时维护一个滚动任务向量,避免每批文档都重跑三阶段;其三,用 BPB 类似然诊断前置于数据配比选择,自动检测'高基线先验'语料(如 CCI Qwen 情形)从而跳过冗余 Inject;其四,与 RAG 做混合部署研究:内化文档主干、检索长尾细节,量化两者在不同问答类型上的互补;其五,评测侧引入跨文档推理题与时间性/可更新性问题,测试内化知识的组织质量而非仅事实命中率。
复现评估
复现条件总体透明度较高但门槛不低。有利因素:所有模型全开源(Llama-3.2-3B、Phi-4-mini、Qwen3-4B/8B/14B/32B、SmolLM3-3B);语料公开(Common Corpus、CCI4.0-M2、MSBench Apache-2.0 的 200 题固定子集);训练配置完整到可执行——AdamW、$\text{lr}=5\times10^{-5}$、cosine/warmup 5%、BF16、4096 长度、有效 batch 64、DeepSpeed ZeRO-2、每阶段 3 epoch,且 Table 11 给出每设置实测 token 量(45.7M-67.0M)供预算核对;judge 面板使用公开模型(gpt-oss-120b、MiniMax-M2.5、DeepSeek-V3)并给出温度/top-p 配置、逐票存档、242,255 条记录的一致性审计与 2,000 次自助法区间;论文提到代码包内含 artifacts/qa_generation_quality/reports 与 artifacts/domain_eval_reliability 等审计产物,暗示代码会随论文发布。不利因素:算力需求为 8×A100-40GB 的多节点级全参微调,单设置三阶段加 12 候选合并评测的完整复现估计需要数十 GPU 日;judge API 调用量大(24.2 万次评审)且有成本;随机性未被完全控制(vLLM 推理与 judge API 均无固定种子,作者明确承认单次运行不构成重复运行稳健性证据);Qwen3 扩展运行的训练参数未归档,该部分只能复现结论方向而无法逐字复现。综合评估:有充足算力与 API 预算的团队复现主表(Table 1/2)难度中等,完整复现含附录全部网格则相当昂贵。
论文图表