Kimi K3:开放的前沿智能 Kimi K3: Open Frontier Intelligence
首个开源3T级原生多模态MoE,配1M上下文与多档强化学习
前置知识
混合专家模型(Mixture-of-Experts, MoE)
MoE 是一种通过条件计算扩展模型容量的稀疏架构:每个 token 只激活少量专家子网络,而非全部参数。以 Kimi K3 为例,2.8 万亿总参数中每个 token 仅激活约 104B,路由器用 Top-k 选出最相关的专家。其代价是路由负载容易不均衡、跨设备 all-to-all 通信开销大,专家池越大越难训练稳定。
Kimi K3 把专家数从 K2 的 384 翻到 896、激活专家数从 8 翻到 16,理解 MoE 的负载均衡与通信瓶颈才能看懂 Stable LatentMoE 三件套(RMSNorm、SiTU-GLU、Quantile Balancing)的设计动机。
Delta 规则与线性注意力(KDA 的递推基础)
Delta 规则是一种带门控的线性注意力递推形式,用固定大小的递推状态 $S_t$ 替代 softmax 注意力中随序列增长的 KV cache。KDA 的更新为 $S_t = (I - \beta_t k_t k_t^\top)\,\mathrm{Diag}(\alpha_t)\,S_{t-1} + \beta_t k_t v_t^\top$,其中 $\alpha_t$ 是通道遗忘门、$\beta_t$ 是写入强度。它把注意力压缩成常数空间,代价是序列内计算需要分块并行。
KDA 是 Kimi K3 处理百万 token 的算子基础,理解它的递推形式与分块并行才能看懂本文算法-系统协同设计(FlashKDA、KDA Context Parallelism)。
Attention Residuals(沿深度的注意力残差)
标准残差连接把所有历史信息压缩进单一隐状态 $h_l$,沿深度方向是累加式瓶颈。Attention Residuals 把'注意力'思想搬到深度维度:每层用学到的伪查询 $q_l$ 对前面所有层输出做软选择,权重 $\alpha_{i\to l} \propto \exp(q_l^\top \mathrm{RMSNorm}(k_i))$,让信息流可以跨层跳连。
Kimi K3 用 AttnRes 解决深层网络信息退化,并用 8 块的分块设计把开销压到可承受范围,这是它从 61 层扩到 93 层的关键。
智能体强化学习(Agentic RL / RLVR)
智能体强化学习指在可验证环境中用 RL 训练模型完成多步工具调用任务,奖励来自环境客观信号(代码能否通过测试、答案是否匹配、交付物是否满足评分表),而非人类偏好。Kimi K3 的训练轨迹往往要数千次工具调用、累积上下文达数百万 token,需要部分 rollout、可恢复沙箱等基础设施支撑。
后训练是 Kimi K3 编程与智能体能力的来源,理解 agentic RL 才能看懂它为何要造 AgentENV microVM 沙箱、分级预算控制和 reasoning-effort RL。
投机解码(Speculative Decoding / EAGLE-3)
投机解码用一个小的草稿模型先并行预测若干 token,再由目标模型批量验证,能显著降低大模型的自回归延迟。EAGLE-3 用单层解码器作草稿,Kimi K3 复用预训练的多 token 预测(MTP)层微调成 EAGLE-3 草稿,并直接优化接受率损失 $L_{\mathrm{LK}} = -\log \sum_{x} \min(p(x), q(x))$。
Kimi K3 部署的关键是推理速度与成本,投机解码+MXFP4 量化是把它压到可服务成本的核心手段,看不懂这部分就难以评估其性价比结论。
研究动机
开源大模型生态在'测试时算力'(test-time scaling)这条轴上进步飞快——OpenAI o 系列、DeepSeek-R1、Kimi K1.5 等让大规模 RL 和长链推理成为范式,但'训练时算力'这条轴却被严重忽视:近期开源模型大多停留在或略超 1T 参数量级(如 GLM、DeepSeek、K2 自身仅 1.04T)。当越来越激进的 RL 方法被反复堆叠在规模相近的预训练底座上,开源社区的能力提升开始趋同收敛,而与最强闭源系统(Claude Fable 5、GPT-5.6 Sol)的差距反而在拉大。与此同时,传统 softmax 注意力把 KV cache 随序列线性增长,要把上下文推到 1M token 在训练和推理两端都极其昂贵;深层网络的标准残差连接退化严重;当专家数逼近千级时,原有的辅助无损路由偏置更新不再稳定,负载失衡会让专家并行训练吞吐崩塌。这些都是把开源模型推向真正前沿必须同时解决的具体瓶颈。
本文的目标是本文要把两条 scaling 轴同时推到前沿:一方面把预训练底座首次扩到开源社区前所未有的 3T 级(2.8T 总参、104B 激活),另一方面在 1M 上下文上系统性地做 RL、推理努力分级和长程交互。可量化的目标包括:相对 Kimi K2 取得约 2.5× 的整体 scaling 效率提升;把上下文窗口从 K2 的 128K 扩到 1M 且无需任何位置编码重调;原生多模态(视觉从训练第一步就联合优化)而非事后拼接;在编程、智能体、知识、推理、视觉这五条能力轴上达到前沿水平,并在保持开源权重的前提下,把每个任务的推理成本压到 Claude Fable 5 的几分之一。
与已有工作不同的是,本文的独特切入角度是'同时、协同地扩展序列、深度、宽度三个维度的信息流',并配套全栈基础设施。已有开源工作多只押注一条轴:要么堆 RL 但底座不动,要么换架构但不解决工程落地。Kimi K3 既不满足于把 K2 的 MLA 换成线性注意力就直接发版,也不把视觉当成事后对齐阶段,而是认定:要让 3T+1M+agentic RL 三件事同时成立,必须在算子(KDA 上下界衰减、FlashKDA)、算法(Stable LatentMoE、Block AttnRes、Per-Head Muon)、系统(MoonEP 完美均衡、KCP、AgentENV、KDA 感知前缀缓存)三层一起协同设计。另一个被忽视的点是视觉编码器——主流做法用 SigLIP 对比预训练初始化,但本文发现从零用 next-token prediction 训练 MoonViT-V2 更稳定且效果相当。
核心方法
直觉上,Kimi K3 像是在同时给一栋大楼升级三套管线:把走廊(序列方向)从 softmax 全局注意力换成更省空间的 KDA 递推通道、并在每四层插一条全局 MLA 走廊保持全局交互;把楼层间(深度方向)的单线楼梯改成可跨层直达的电梯(AttnRes);把每层的房间(宽度方向)从少数大专家改成 896 个精专小专家中按需点亮 16 个。技术路线由此展开:每个 block 含 3 层 KDA + 1 层 Gated MLA(3:1 比例),每个注意力层后接一个 Stable LatentMoE;AttnRes 把 93 层切成 8 个块做块间注意力;MoonViT-V2 作原生视觉入口;Per-Head Muon 优化矩阵参数。配合 4 阶段上下文扩展(8K→64K→256K→1M)、cosine 学习率、原生多模态联合训练、QAT 量化训练贯穿全流程,最终在 scaling law 曲线上拿到对 K2 的约 2.5× 效率。
核心创新是用'有界化'与'量化均衡'两招把极端稀疏和极深网络压进可训练区间,与已有方法(小专家池、浅网络、或事后打补丁)本质不同。其一,KDA 把衰减对数 $g_t$ 用缩放 sigmoid 界定在 $(g_{\min},0)$($g_{\min}=-5$),使 16-token tile 累积衰减落在 $(-80,0)$,倒数重缩放因子 $<e^{80}$ 仍在 BF16 范围,对角 tile 也能走 Tensor Core,彻底干掉 Kimi Linear 的逐位置对角瓶颈。其二,Stable LatentMoE 三管齐下:RMSNorm 隔离路由分支尺度漂移;SiTU-GLU 把门控与上投影都压在 $|f|\le\beta_1\beta_2=100$($\beta_1=4,\beta_2=25$);Quantile Balancing 从一次前向的 Top-(k+1) 切口算出每专家恰好拿目标负载 $q=mk/n$ 的偏置,直方图一次 all-reduce 估全局分位数。这让 896 专家、16 激活、sparsity 56 的极端稀疏首次稳定可训。
方法步骤详情
流程分预训练与后训练。预训练在 Web/Code/Math/Knowledge 四域文本加视觉语料上原生多模态联合训练,Per-Head Muon + QB 负载均衡,cosine 学习率,上下文经 8K→64K→256K→1M 四阶段扩展并合成跨 1M 任务。后训练三段:(1) SFT 冷启动,用 XTML 序列化 agentic 轨迹,全程 MXFP4/MXFP8 QAT;(2) RL 在通用/智能体/编程三域 × {low,high,max} 共 9 专家分别训练,配 partial rollout、预算控制(超 $\tau b_0(x)$ 判 $-1$)和强制 rubric 协议的 Generative Reward Model;(3) Multi-Teacher On-Policy Distillation 用 OPD 奖励 $r_{\mathrm{dopd}}=\mathrm{clip}(\mathrm{sg}\log\frac{\pi^{(d,e)}_{\mathrm{teacher}}}{\pi_\theta},\pm R_{\max})$ 把 9 专家融成单模型。
技术新颖性
相对已有技术的具体区别:(1) 与 DeepSeek-V2/K2 的纯 MLA 不同,Kimi K3 用 3:1 的 KDA-Gated MLA 混合并对 MLA 全部用 NoPE,扩展上下文无需调 RoPE 或 YaRN;(2) 与 DeepSeekMoE 的辅助无损偏置固定步长更新不同,QB 改成'一次前向、直方图估全局分位数、恰好达目标负载'的解析更新,把 896 专家的失衡从'调参难题'变成'闭式解';(3) 与 SwiGLU 的无界乘性不同,SiTU-GLU 在原点附近保留 Swish 线性区、在大值处用 softcap 有界,同时压住门控与上投影两支;(4) 与 SigLIP 初始化的视觉塔不同,MoonViT-V2 从零 NTP 训练更稳且不损精度,挑战了'对比预训练初始化必不可少'的共识;(5) 系统层 MoonEP 证明了至多 $E/R$ 个冗余专家即可完美均衡并本质紧确,EAGLE-3 草稿直接吃 AttnRes 的低/中/高三层特征融合,都是同类工作里少见的工程创新。
实验结果
Kimi K3 略落后 Fable 5、GPT-5.6 Sol,但稳定领先 Opus 4.8、GPT-5.5 与开源 GLM-5.2。编程是强项:ProgramBench 77.8%、SWE-Marathon 42.0%(比 Fable 5 高 7pt)均全场第一,Terminal-Bench 88.3% 几乎追平 GPT-5.6 Sol 88.8%。智能体:BrowseComp 91.2%(2.03 美元/任务,约 GPT-5.6 Sol 一半成本)全场最高,MCPMark 94.5%、AutomationBench 30.8% 近 SOTA,但 Elo 类知识工作落后(GDPval-AA v2 1686 vs 1747)。推理 GPQA 93.5% 持平前沿,HLE-Full 43.5/56.0、CritPt 23.4% 研究级是短板。视觉 OmniDocBench 91.1% 最高、Math-Vision 加 Python 达 97.8%。第三方 WebDev Arena 1678 Elo(#1/99,首个登顶的开源模型)、AA Intelligence Index 57.1。
查看结构化数据
| 任务 | 指标 | 本文 | 基线 | 提升 |
|---|---|---|---|---|
| BrowseComp(网页深度检索) | 准确率 | 91.2% (2.03 美元/任务) | GPT-5.6 Sol 90.4% / Fable 5 88.0% | 全场 SOTA,成本约为 GPT-5.6 Sol 的 1/2、Claude 系的 1/10 |
| SWE-Marathon(GPU 内核长程软件工程) | 完成率 | 42.0% | Opus 4.8 40.0% / Fable 5 35.0% / GPT-5.6 Sol 39.0% | 全场 SOTA,领先 Fable 5 +7pt |
| ProgramBench(编程) | 准确率 | 77.8% | GPT-5.6 Sol 77.6% / Fable 5 76.8% | 全场最高 |
| Artificial Analysis Intelligence Index v4.1(第三方综合) | 综合智能指数 | 57.1 (#4/580) | Fable 5 59.9 / GPT-5.6 Sol 58.9 | 开源第一,仅次于两个闭源模型 |
| WebDev Arena(第三方众包前端) | Elo | 1678 (#1/99) | Fable 5 1634 / GPT-5.6 Sol 1630 | 首个登顶该榜的开源模型 |
| 端到端漏洞利用套件(自评) | 解决率 | 14/36 (38.9%) | GLM-5.2 8/36 (22.2%) | +16.7pt;用户态 10/14,内核态仍弱 |
局限与改进
作者明确承认:(1) 研究级推理仍是短板,HLE-Full 落后 Fable 5 约 7 个点、CritPt 23.4% 在四个对手之后;(2) 知识工作 Elo 类基准(GDPval-AA v2、AA-Briefcase)整体被 Claude Fable 5 压制;(3) Agent Behavior Bench 仅 65.0(Fable 5 75.5)、MIRA Bench 64.1(72.9)、24/7 ClawBench 2.0、Agentic Vision Bench、KWV Bench 均落后;(4) 端到端漏洞利用的瓶颈在'从已得原语完成最后一步利用链',41 项任意代码执行 0 成功,作者把这视作能力下界。我额外观察到:部分编程基准(如 SWE-Marathon)用 H20 重校准分支、Fable 5 在 35% 任务触发 fallback、对比口径不完全对齐;BBench/JobBench 等内部基准与公开基准方法学未公开,结果可比性受限于自评;评测集中在 max 推理档,性价比优势部分建立在'别人用 max、自己用 high'的对比上。
独立分析的弱点
第一个弱点是潜在的工具套件过拟合:尽管引入统一白盒 RL 环境随机组合 harness 模块,但评测仍主要落在 Kimi Code/Claude Code/Codex 三家,换上完全未见过的 harness(如新兴开源 agent 框架)时泛化能力未验证——改进方向是 harness 无关的元 RL 或在线 harness 生成。第二个弱点是视觉塔仅 0.4B 参数且训练数据偏通用,面对医学影像、遥感、工业质检等长尾细粒度场景可能力不从心——可加领域自适应预训练或可插拔视觉专家。第三个弱点是研究级推理(HLE、CritPt)短板暴露预训练语料对深度学术知识的覆盖不足——可针对性上采样 arxiv/专著/教科书并做难题合成。第四个弱点是相对小 dense 模型,短任务的路由与稀疏开销仍偏高,性价比曲线在短上下文场景不够陡——可做动态专家剪枝、提升草稿模型接受率。第五个弱点是反 reward-hacking 是被动追加('观察到新策略就加防护'),可能漏掉新型攻击——可引入形式化验证或对抗性红队自动化。
未来方向
作者明确点出的方向:补齐研究级推理(HLE-Full、CritPt)、完成端到端漏洞利用链与硬核计算机操作(OSWorld 2.0、SaaS-Bench),并表示会在每次大版本更新时重新评估网络能力下界。基于本成果可延伸的方向:(1) 把 Stable LatentMoE 的 QB 推到更大专家池(如 2k+),并用 scaling law 外推到 5T+;(2) 探索 KDA 之外的线性注意力变体或纯状态空间模型以进一步降本;(3) MiniTriton 与 nano-kpu 案例表明模型已能自主写编译器与芯片,可构建'模型-编译器-硬件'全自动协同设计的闭环;(4) 在 >1M 上下文上继续做 agentic RL,结合 swarm 多智能体扩展 test-time scaling;(5) 把 MOPD 从 9 个专家扩展到更多域与努力档,研究统一的 effort-conditioned 单模型。
复现评估
权重完全开源在 HuggingFace(moonshotai/Kimi-K3),并提供 MXFP4 量化版可直接推理,这一点对社区极友好。基础设施部分开源:MoonEP(专家并行)、AgentENV(microVM 沙箱)、FlashKDA/KCP(经 flash-linear-attention PR #691)、MiniTriton、nano-kpu RTL 均有公开仓库。但训练数据、RL 任务合成知识图谱、白盒 harness 配置、内部 benchmark(KCB 2.0、ClawBench 等)均未开源,复现完整训练几乎不可能。算力门槛极高:2.8T 预训练 + 1M 上下文 RL 需数千张 GPU 和 AgentENV 上 5120 万次沙箱创建,个人与中小团队无法复现训练;但基于开源权重做微调、推理、benchmark 复跑是可行的,难度中等。总体评估:训练复现难度'极高',权重使用复现难度'低-中'。
论文图表
在 held-out OOD 验证集上,Kimi K2 与 Kimi K3 的 loss-FLOPs 曲线(横轴 10 美元^{20}$ 到 10 美元^{21}$ FLOPs),Kimi K3 曲线明显下移,达到相同 loss 所需 FLOPs 约为 K2 的 1/2.5,标注'2.5× Validation'。
这张图直接量化了论文的核心主张'相对 K2 提升 2.5× scaling 效率',是判断架构+数据+训练改动是否值得的关键证据,也是 motivation 的落脚点。