Open-MOPD:诊断并修复多教师在线策略蒸馏中的能力失衡 Open-MOPD: Diagnosing and Fixing Capability Imbalance in Multi-Teacher On-Policy Distillation
定位多教师蒸馏的预算错配根因,三个机制把能力恢复率从35.6%提到83.4%
前置知识
在线策略蒸馏(On-Policy Distillation, OPD)
学生模型 $\pi_\theta$ 先按自己的策略采样回复 $y \sim \pi_\theta(\cdot|x)$,教师模型只需一次 prefill 在学生实际访问的轨迹上给出逐 token 的概率分布,两者的 log 概率差 $\delta_t(v) = \mathrm{sg}[\log \pi_\phi(v) - \log \pi_\theta(v)]$ 构成稠密奖励,直接填入 PPO 的 advantage 槽位做更新。与之相对的离线蒸馏在教师预生成的固定语料上做 SFT,存在训练分布与推理分布不一致的 exposure bias。
本文的整套目标函数、三个机制的修改点、以及所有诊断实验都建立在 OPD 的逐 token 奖励结构上,不理解这个目标函数就无法理解"预算"和"奖励过期"到底指什么。
多教师路由(Multi-teacher routing)
把多个领域专家教师(数学、代码、指令遵循各一个 RL 专家)组成教师库,每个训练样本携带域标签 $d(x)$,硬路由到对应教师提供监督。理想情况下单个学生同时向多个教师学习,最终一个模型顶多个专用模型。RouteRL/RouteOPD 指部署时按域标签在多个专用模型间切换的"伪整合"上限参照。
论文用 oracle routing(真值域标签)刻意把"能力整合问题"与"路由错误问题"解耦,这是全文实验设计的基石;理解 RouteOPD 参照才能理解"整合差距"的定义。
PPO 与 advantage
PPO 是策略梯度强化学习算法,用优势函数 $A_t$ 估计某动作相对期望的好坏,并通过 clip 机制限制单次策略更新幅度。GRPO 是其免 critic 变体,靠组内相对奖励估计优势。本文中 OPD 的稠密奖励 $r_t$ 不经过 critic,直接放进 advantage 槽位,PPO 的 clip 和多次小批量内更新($K$ 个 inner updates)机制则直接催生了"奖励过期"问题。
论文的诊断和修复都围绕 PPO 训练管线:一个 rollout 批被切成 $K$ 个 minibatch 顺序更新,学生策略在更新中漂移,导致第 3 节的 staleness 测量和第 4 节的 reward refresh。
token-mean 损失聚合与梯度预算
训练损失通常对所有有效响应 token 取平均,即 $\mathcal{L} = \frac{1}{\sum_j n_j L_j} \sum_d n_d L_d \bar{\ell}_d$,因此每个域对梯度的实际贡献正比于它的"梯度 token 体积" $\mathrm{stok}_d = n_d L_d / \sum_j n_j L_j$(prompt 数 $\times$ 平均响应长度),而非 prompt 采样频率。本文把每个域分到的这份 token 体积称作它的"优化预算"。
"预算错配"是全文的核心论点:等 prompt 采样完全不等价于等训练份额,理解 token 份额与 prompt 份额的解耦是看懂诊断部分的前提。
教师-学生差距的可观测代理 $\bar{m}_d$
逐 token 奖励幅度 $\bar{m}_d = \mathbb{E}_{t \in d}[|r_t|]$ 度量学生与教师策略的平均偏离程度:学生离教师越远,log 概率差越大,$|r_t|$ 越大;学生逼近教师时它自然衰减。因此它可以作为"该域还剩多少蒸馏空间"的在线、免验证集的信号(例如用指数移动平均维护)。
Open-MOPD 的第二个机制 gap-following allocation 完全建立在这个量上:把预算分给 $\bar{m}_d$ 大(差距大)的域,而不是像朴素归一化那样分给已收敛的域。
研究动机
工业界已广泛使用多教师在线策略蒸馏(M-OPD)把多个领域 RL 专家压进一个通用学生:DeepSeek-V4 蒸馏十余个教师,Kimi K3 用九个教师,Nemotron-Cascade 2 和 Agents-A1 也采用类似配方,但优化动力学从未被系统研究,开源社区也没有可复现的完整配方。更麻烦的是,朴素做法存在真实且高度不对称的"能力整合差距":在 SmolLM3-3B 的受控实验里,朴素 M-OPD 总分只有 28.05,比按域切换单教师学生组成的 RouteOPD 参照(31.55)低 3.50 分;其中简洁的指令跟随(IF)任务掉 6.16 分,是数学掉分(1.89)的 3.3 倍,且是唯一在训练中段不升反降的域(第 100–200 步窗口内下降 11%),300 步内三个域没有一个达到各自的 RouteOPD 参照线——IF 最早停滞,恢复的理论提升空间仅 26%,而数学恢复了 64%。
本文的目标是本文要回答一个非常具体的问题:当路由已经完全正确(使用真值域标签的 oracle 硬路由)时,究竟是什么阻止三个领域专家的能力被同时写进同一组学生参数?为此作者从零搭建完全开源、可在 8×A100-80GB 单节点复现的端到端流水线——混合域 SFT、三个域 RL 教师、多教师 OPD 全链路——先建立并量化整合差距,再逐个检验候选根因(教师冲突、token 数量、奖励幅度、奖励过期),最后针对每个被证实的根因提出对应修复机制,把恢复率推向实用水平,并公开全部训练轨迹、检查点与评测套件。
与已有工作不同的是,本文最独特的切入是把归因问题变成测量问题,并给出了一个反直觉的答案。此前最自然的假设是"教师冲突":不同教师在共享的格式词、连接词上给出矛盾偏好,梯度互相干扰。作者让三个教师同时给同一个上下文打分,测得教师间分歧 $c_t$ 均值仅 0.126 nat、超过 1 nat 阈值的 token 只占 0.62%,且遮蔽或替换高冲突 token 的四种干预全部掉分 0.52–0.83 分——冲突不是瓶颈。真正的切角是把多任务训练看成"token 级优化预算的分配问题":由于损失按 token-mean 聚合,各域收到的训练量由梯度 token 体积而非 prompt 频率决定,IF 占 20.3% 的 prompt 却只贡献 0.99% 的梯度 token。这与此前在 prompt 采样比例上做数据混合优化的路线(DoReMi、MoDoMoDo)有本质区别。
核心方法
直觉上,一个域在共享学生里获得的"优化预算"由三个可分离的量决定:批内它分到的梯度 token 数量、每个 token 的奖励幅度(即师生差距)、以及奖励信号是否还对应当前学生。朴素 M-OPD 对这三者都不加管理,于是短回复的 IF 域几乎拿不到梯度、已收敛的域继续吸走预算、重复小批量更新又让奖励过期。Open-MOPD 保持教师路由和 OPD 目标函数不变,只改"预算如何分配、奖励如何计算",用三个机制一一对应三个病灶:token-share balancing 在批内把各域加权 token 份额钉在目标值(等份额 $g^\star=(1/3,1/3,1/3)$),gap-following allocation 在训练全程按剩余师生差距动态移动各域预算,reward refresh 在每次内更新前用当前学生重算学生相关的奖励项。三者作用于不同时间尺度(单批、全程、单 rollout 内),可独立验证也可叠加。
核心创新是先诊断后设计:用 oracle 路由测试台把"整合失败"分解为三个可测量、可分别干预的成因,而不是端到端调参。第一,序列长度结构差:math/code 平均响应约 10,500 token 而 IF 仅 409,差距 25 倍以上,若靠过采样补足 IF 需要 33.6 倍的 prompt 放大,会把批内长链监督挤垮。第二,收敛速率不同导致预算漂移:起始 $\bar{m}_d$ 相差 4.9 倍(math 0.019、code 0.063、IF 0.091),且收缩速率不同(IF 2.4×、math 2.1×、code 1.9×),即便把 token 份额摊平到 1/3,25 步内 IF 的预算份额仍从 48.7% 跌到约 9% 而 code 涨到 63.8%。第三,共享 rollout 的 $K$ 次内更新使学生漂移:rollout 策略与当前策略的 KL 从 $K{=}1$ 的 0 涨到 $K{=}4$ 的 0.059、$K{=}32$ 的 0.216,被 PPO clip 的 token 比例最高达 0.86,而稠密奖励仍用 rollout 时的学生概率计算。与已有方法的本质区别在于:预算分配发生在 token 层和奖励层,而非数据采样层。
方法步骤详情
流水线分三阶段。阶段 I 混合域 SFT:从 SmolLM3-3B-Base 出发,在 OpenR1-Math-93k(93,733 条)、OCR-50k(自 OpenCodeReasoning 采样)、Instruction-Nemotron(820,039 条)上按响应 token 数平衡(约 37/28/35)训练 4 个 epoch,长度上限 32,768,得到 $\pi_{\text{mix}}^{\text{sft}}$(总分 25.67)。阶段 II 领域教师:从 $\pi_{\text{mix}}^{\text{sft}}$ 分别 fork,各自在自己域的可验证奖励上跑 GRPO(math 用 DAPO-Math-17k,code 用去污染的 DeepScaler-24k,IF 用 Nemotron-IF-RL-46k),得 $\pi_{\phi_{\text{math}}}, \pi_{\phi_{\text{code}}}, \pi_{\phi_{\text{IF}}}$,合成的 RouteRL 达 32.35。阶段 III 多教师 OPD:学生同样从 $\pi_{\text{mix}}^{\text{sft}}$ 出发,每个 prompt 按域标签硬路由;学生采样回复,教师一次 prefill 在学生 top-$k$($k{=}16$)集合 $S_t$ 上缓存 $\log \pi_{\phi_d}$;token 级优势 $\delta_t(v) = \mathrm{sg}[\log \pi_{\phi_d}(v) - \log \pi_\theta(v)]$ 与学生 softmax 权重 $\tilde{\pi}_\theta$ 相乘得 $r_t(v)$,求和为位置奖励 $r_t$ 直接进 PPO。机制一 token-share balancing:令 $w_d^{\text{shared}} = g_d^\star / \mathrm{stok}_d$,使加权份额精确等于 $g_d^\star$,等份额下 IF 权重 32.7、约放大 48 倍。机制二 gap-following:$\tilde{w}_d = w_d^{\text{shared}} \cdot \mathrm{Clamp}[(m_d/m_{\text{ref}})^\alpha,\ 0.05,\ 20]$($\alpha{=}1$,$m_{\text{ref}}$ 为批内均值),归一化后批内总损失尺度不变,预算流向差距大的域。机制三 reward refresh:第 $k$ 次内更新前用当前学生重算 $\delta_t^{(k)}(v)$ 与 $r_t^{(k)}(v)$,教师项复用缓存,不增加任何前向。评测在六基准上做:AIME24/25 mean@64、LiveCodeBench v5/v6 mean@10、IFEval/IFBench mean@1,先域内平均再三域宏平均。
技术新颖性
技术新颖性体现在四处。其一,诊断方法论:作者没有接受"多教师必然冲突"的直觉,而是构造了 $c_t = \max_{d} \log \pi_{\phi_d} - \min_d \log \pi_{\phi_d}$ 这样的直接测量,再用因果干预(冲突掩蔽、共识目标)验证归因,排除了主流假设。其二,预算视角:把多任务 RL/蒸馏的失衡从"数据混合"层面下沉到"梯度 token 体积 × 奖励幅度 × 奖励新鲜度"三层,每层给出可测量的量与专门机制,且三个机制正交、可独立消融。其三,gap-following 的方向选择:朴素的逆归一化 $m_d^{-\alpha}$ 会形成"越收敛越加权"的正反馈——实验中 IF 的 $m_d$ 前 75 步降 35.3 倍、权重从 26.7 飙到 90.7,$\alpha{=}-0.5$ 时训练在 74 步崩溃——本文反其道把预算给差距更大的域,形成负反馈稳定系统。其四,工程上 reward refresh 借鉴 AsyncOPD 的洞察但用于同步流水线的批内 staleness,复用 PPO 本就要做的 actor 前向,几乎零开销。相比之下,权重合并(Task Arithmetic/TIES/DARE)和专家拼接(BTM/BTX/BTS)是在训练后整合,本文则研究训练中如何均衡。
实验结果
主结果(Table 2)确立了整合差距与修复效果:朴素 M-OPD 总分 28.05,仅恢复 SFT(25.67)到 RouteRL(32.35)提升的 35.6%,比 RouteOPD 低 3.50 分;Open-MOPD 达到 31.24,恢复率 83.4%,与 RouteOPD 的差距缩到 0.31 分。分域看:数学 22.42(朴素 21.26,RouteOPD 23.15)、代码 21.73(朴素 19.26,RouteOPD 21.71,已追平 oracle)、IF 49.58(朴素 43.64,RouteOPD 49.80,其中 IFEval 74.49 与 oracle 持平)。对比基线全面领先:RFT 26.51(恢复率 12.6%)、混合域 RL 的 $\pi_{\text{mix}}^{\text{rl}}$ 28.96(49.3%)、参数平均合并 27.87(32.9%)、TIES 式 Task Arithmetic 30.46(71.7%)。逐机制消融(Table 4,$K{=}1$ 阶梯):+token-share 提 1.17 分且几乎全部来自 IF(43.64→47.53),验证预算确实被 math/code 挤占;+gap-following 累计提 1.89(IF 到 49.50)。切到 $K{=}4$ 吞吐设置后:同设置朴素对照 29.28,+share+gap 30.43,三者齐开后 Open-MOPD 31.24(相对提升 3.19)。reward refresh 几乎免费:dense reward 计算 27.3s vs 27.8s,占单步 2.10% vs 2.12%,整步 1298s vs 1313s,差异落在步间方差内。诊断侧(Figure 1)显示 200–300 步窗口内 math 关闭 64% 差距、code 40%、IF 仅 26%。
查看结构化数据
| 任务 | 指标 | 本文 | 基线 | 提升 |
|---|---|---|---|---|
| 六基准总分(AIME24/25 + LiveCodeBench v5/v6 + IFEval/IFBench) | 三域宏平均总分(越高越好) | 31.24(恢复率 83.4%) | Naive M-OPD 28.05(35.6%);单模型基线中最好的 ParamMerge-TA 30.46(71.7%) | 较 Naive M-OPD +3.19 分、恢复率 +47.8 个百分点;较最强单模型基线 +0.78 分;与 RouteOPD 差距从 3.50 缩至 0.31 |
| 数学推理(AIME24 / AIME25,mean@64,温度 0.6) | 域平均准确率 | 22.42(AIME24 21.98 / AIME25 22.86) | Naive M-OPD 21.26;RouteOPD oracle 23.15 | +1.16 分,约恢复该域 oracle 差距的一半 |
| 代码生成(LiveCodeBench v5 / v6,mean@10,温度 1.0) | 域平均 pass@1 | 21.73(v5 20.84 / v6 22.63) | Naive M-OPD 19.26;RouteOPD oracle 21.71 | +2.47 分,完全追平 oracle 参照 |
| 指令跟随(IFEval / IFBench-test,mean@1) | 域平均准确率 | 49.58(IFEval 74.49 / IFBtest 24.67) | Naive M-OPD 43.64;RouteOPD oracle 49.80 | +5.94 分(占全部提升的最大头),几乎追平 oracle;IFEval 与 oracle 完全持平 |
| 单模型能力整合基线对比 | 六基准总分 / 相对 RouteRL 恢复率 | 31.24 / 83.4% | RFT 26.51 / 12.6%;π_mix_rl 28.96 / 49.3%;ParamMerge-Avg 27.87 / 32.9%;ParamMerge-TA 30.46 / 71.7% | 分别领先 +4.73 / +2.28 / +3.37 / +0.78 分,是唯一超过 80% 恢复率的单模型方法 |
局限与改进
作者承认的边界:其一,实验建立在 oracle 硬路由上,刻意隔离了路由误差,真实部署中域标签需要学习得到,路由错误与预算失衡如何耦合完全未研究;其二,整合只恢复了 83.4%,Open-MOPD(31.24)仍低于 RouteRL(32.35),残差来源未解释;其三,规模限于单一 3B 模型、三个域、约 300–600 步的训练窗口,跨规模与域数量的外推性未知。我自己的观察:gap-following 的超参相当手工——$\alpha{=}1$、clip 区间 $[0.05,20]$、等份额目标 $g^\star$ 都没有给出选择准则,$\alpha$ 的符号还被证明是结构性的($-0.5$ 即 74 步崩溃),换域集合后是否稳健存疑;$\bar{m}_d$ 作为差距代理有混淆——奖励小既可能意味着"已收敛"也可能意味着"教师偏弱或任务偏易",在不可验证奖励的开放域(如写作、对话)上这一信号是否可用未验证;IF 的 IFBench-test 绝对分只有 24.67,说明"恢复 oracle 差距"不等于任务被解决;此外评测里 IFEval 用 mean@1,单次采样方差较大,部分小差距结论的置信度有限。
独立分析的弱点
第一,路由假设过强:oracle 标签在真实产品里通常不存在,若换成学习型路由器,错误路由的样本会拿错教师信号,token-share 平衡反而可能放大错信号的权重;改进方向是把路由器与预算机制联合训练,例如对低置信路由样本用教师共识或降低其预算权重。第二,等份额目标缺乏最优性依据:$g^\star=(1/3,1/3,1/3)$ 免调参但未必对齐下游需求,若应用以代码为主,三等分可能过度投资 IF;改进是引入基于验证集或目标分布的自适应 $g^\star$。第三,$\bar{m}_d$ 代理的歧义:它混合了"剩余差距"与"任务固有难度/教师强度",两个域的教师能力不同时横向比较无意义;改进是改用域内归一化(相对自身初值的衰减率)或直接测量 held-out 验证集上的师生 KL。第四,机制超参的敏感性集中在 gap-following:$\alpha$ 的符号错误立即崩溃说明该机制依赖正确的差距读数,任何使 $\bar{m}_d$ 失真的因素(如奖励分布突变)都可能触发误分配;改进是加保守的速率限制或用自适应方式估计差距。第五,只在 3B/3 域/"响应长度极端分层"的设置下验证,而 25 倍长度差恰是 IF 惨败的结构性原因;若域间长度接近,token-share balancing 的收益可能大幅缩水,方法的价值边界需要划清。
未来方向
作者明确提出开源配方是为支持可复现的后续研究,可延伸的方向包括:把 oracle 路由换成学习型路由并研究路由误差与预算失衡的交互;将三机制推广到更多教师(DeepSeek-V4 十余个、Kimi K3 九个的规模)与非验证奖励域;把 token-share balancing 从蒸馏推广到混合域 RLVR 本身——"等任务采样不等于等训练"的论断对 RL 同样成立;研究 gap-following 与课程学习的关系(本文证明预算应流向差距大的域,本质上是一种隐式课程);与异步系统(AsyncOPD)结合处理跨节点的策略滞后;从理论上刻画预算漂移的动力学并给出 $\alpha$、clip 区间的稳定性条件;以及在数据侧与 DoReMi/MoDoMoDo 式混合优化结合,形成 prompt 层 + token 层的双层预算控制。另一个自然方向是把恢复率从 83.4% 推向 100%:残差约 0.9 分可能来自多任务干扰的残余,也可能来自单学生容量上限,值得用容量对照实验(3B vs 7B 学生、固定教师)分离这两种解释。
复现评估
复现条件在同类工作中属于最优档:作者完整开源端到端后训练流水线、模型检查点、训练轨迹与评测套件,项目页为 bytedtsinghua-sia.github.io/Open-MOPD/,明确以"单节点 8×A100-80GB 可反复消融"为设计约束。数据全部公开:SFT 用 OpenR1-Math-93k、OCR-50k、Instruction-Nemotron,教师 RL 用 DAPO-Math-17k、DeepScaler-24k(LCB 去污染版)、Nemotron-IF-RL-46k;附录给出全部真实运行超参(SFT lr 4e-5 共 4 epoch;GRPO 教师 lr 1e-6,math/code 各 1000 步、IF 3000 步;OPD lr 1.5e-6 共 600 步,$K{=}4$,top-$k{=}16$,nucleus $p{=}0.99$)。难点主要在工程而非算力:需要维护学生 rollout、教师 prefill 缓存、逐域验证的基础设施(基于 verl),完整复现含三个教师训练加蒸馏,单节点估计需要数天量级;逐 token 奖励与 top-$k$ 集合缓存的实现细节需要仔细对照论文公式。综合评价:对有 RLHF 训练经验的团队是中等偏易,对没有此类基础设施的团队门槛主要在训练框架搭建。
论文图表
三联图。(a) 各域 macro 平均分上朴素 M-OPD 与 RouteOPD 参照的柱状对比,标注各域差距:math -1.89、code -2.45、IF -6.16;(b) 朴素 M-OPD 300 步训练中各域验证曲线,虚线为对应域的 RouteOPD 参照,没有任何域达到参照;(c) 相对 RouteRL 的已恢复理论空间 $(\text{current}-\pi_{\text{mix}}^{\text{sft}})/(\text{RouteRL}-\pi_{\text{mix}}^{\text{sft}})$,IF 恢复最少且最早停滞。
这是全文的问题陈述图:它同时给出整合差距的存在性、跨域不对称性(IF 掉分是 math 的 3.3 倍)和 IF 中段倒退(100–200 步降 11%)三个关键事实,是后续所有诊断的出发点。
(a) 300 步训练中教师分歧 $c_t$(对数轴)的均值轨迹,全程低于 0.27 nat,远小于 1 nat 冲突判据;(b) $c_t>1$ 的 token 比例按域分解:平均 0.62%,IF 最高 3.9%,math 最低 0.31%;(c) 四种冲突干预相对基线的总分变化:top-1%/5%/20% 冲突掩蔽分别 -0.52/-0.73/-0.75 分,共识目标 -0.83 分,全部为负。
这张图完成了对最流行假设"教师冲突导致整合失败"的否定,是论文诊断链条的第一环,直接把注意力引向预算分配这一真正的根因。
(a) 全程平均的 prompt 份额(39.8%/39.8%/20.3%)对比 token 份额(49.7%/49.3%/0.99%),IF 占五分之一 prompt 却只贡献约 1% 梯度 token;(b) 平均响应长度(对数轴)解释了这一差异:math/code 约 10,500 token,IF 仅 409;(c) 若只靠过采样把 IF 的 token 份额拉到 1/3,需要 33.6× 的 prompt 放大,会严重压缩 math/code 的批内多样性。
它给出了"预算错配"最直观的证据:token-mean 聚合下 prompt 份额与训练份额完全脱钩,并证明调采样比例这条最简单的修复路线不可行,从而引出 token-share balancing。
(a) 各域逐 token 奖励幅度 $\bar{m}_d$(对数轴),起始相差 4.9 倍(math 0.019、code 0.063、IF 0.091);(b) 归一化到各自初值后三个域以不同速率收缩(IF 2.4×、math 2.1×、code 1.9×),说明 $\bar{m}_d$ 追踪剩余师生差距;(c) 在 token 份额被钉死为 1/3 的轨迹上,预算份额仍随差距漂移:25 步内 IF 从 48.7% 跌至约 9%、终值 11.4%,code 从 39.6% 涨到 63.8%。
它证明"摊平 token 数"不足以锁定预算——奖励幅度差异是第二个独立的失衡源,直接催生了 gap-following allocation 机制。
横轴为每个 rollout 批的内更新次数 $K$(1/2/4/8/16/32)。(a) 同一批内 rollout 策略与当前学生策略的 KL 随 $K$ 单调上升:$K{=}2$ 时 0.026、$K{=}4$ 时 0.059、$K{=}8$ 时 0.102、$K{=}16$ 时 0.143、$K{=}32$ 时 0.216;(b) 被 PPO clip 的 token 比例同步上升至约 0.86。$K{=}1$ 时两者均为 0。
它量化了第三个失衡源——奖励过期:高吞吐训练中大多数 token 在学生已漂移后才被更新,而稠密奖励仍用 rollout 时的学生概率,为 reward refresh 提供了动机和量化依据。
累积消融阶梯:$K{=}1$ 下 Naive 28.05 → +share 29.22(+1.17,IF 43.64→47.53)→ +gap 29.94(+1.89,IF 49.50);切到 $K{=}4$ 吞吐设置后,同设置 Naive 对照 29.28(+1.23),+share+gap 30.43(+2.38),全开(Open-MOPD)31.24(+3.19),math 22.42、code 21.73、IF 49.58。
它逐一验证三机制的独立贡献并给出最终配方的完整来源,且显式区分了 $K{=}1$ 与 $K{=}4$ 两种吞吐设置,避免不公平比较。
三个候选基座的取舍:Qwen3-1.7B-Base 在 OpenR1-Math-93k SFT 后 AIME24 最高仅 7.08、截断率 69.17–80.42%,容量不足以闭合长推理轨迹;Qwen2.5-7B-Base 达 31.25、截断 12.92%,能力足够但全配方反复消融太贵;SmolLM3-3B-Base 三域混合 SFT 后 AIME24 15.63、截断 15.2%,被选为折中。
它解释了"为什么是 3B":模型规模卡在两个失败边界之间——太小则机制归因被截断污染,太大则超出社区基线的资源约束,这一论证对任何想做同类研究的团队都有参考价值。