← 返回 2026-07-28

Kimi K3:开放的前沿智能 Kimi K3: Open Frontier Intelligence

Kimi Team, Tongtong Bai, Yifan Bai, Yiping Bao, M. C., Jianfeng Cai, Xinyuan Cai, Peizhou Cao, Yuxuan Cao, Ziwei Chai, Y. Charles, H. S. Che, Guanduo Chen, Guangyu Chen, Guanzheng Chen, Huarong Chen, Jia Chen, Jianlong Chen, Jun Chen, Kexin Chen, Peng Chen, Ruijue Chen, Wentao Chen, Xin Chen, Yang Chen, Yanru Chen, Yifei Chen, Yingjiang Chen, Yuankun Chen, Yujie Chen, Yutian Chen, Zhirong Chen, Dazhi Cheng, Yean Cheng, Jialei Cui, Jingbing Cui, Anqi Dai, Jiaqi Deng, Hao Ding, Rui Ding, Shaofeng Ding, Mengfan Dong, Mengnan Dong, Yuhao Dong, Yuxin Dong, Angang Du, Chenzhuang Du, Dikang Du, Jusen Du, Yulun Du, Yu Fan, Jing Feng, Qiulin Feng, Yichen Feng, Kelin Fu, Qiang Fu, Fuxuan Gao, Hongcheng Gao, Jingyue Gao, Tong Gao, Weijia Gao, Shangyi Geng, Jie Gong, Linhu Gong, Shengao Gong, Xiaochen Gong, Qizheng Gu, Yicheng Gu, Shuhao Guan, Haiqing Guo, Shiqi Guo, Xiang Guo, Zhengyan Guo, Beixi Hao, Wenxin Hao, Xiaoru Hao, Dailan He, Haotian He, Lehan He, Qi He, Weiran He, Xinran He, Xinyi He, Yibo He, Yunjia He, Chao Hong, Tiange Hong, Hao Hu, Jiaxi Hu, Ruikun Hu, Weiming Hu, Yangyang Hu, Zhenxing Hu, Liang Hua, Jinbin Huang, Ke Huang, Ruiyuan Huang, Siying Huang, Weixiao Huang, Yan Huang, Zhengjie Huang, Zhiqi Huang, Yulong Hui, Chaobo Jia, Yutong Jiang, Zhejun Jiang, Zuoyou Jiang, Wenyi Jin, Xinyi Jin, Yu Jing, Huanjun Kong, Guokun Lai, Aidi Li, Cheng Li, Chengyuan Li, Cong Li, Fang Li, Guanyu Li, Haoyang Li, Jia Li, Junxiong Li, Lei Li, Letian Li, Lincan Li, Weihong Li, Wentao Li, Xintong Li, Yang Li, Yishen Li, Yiwei Li, Yuxiao Li, Zhaowei Li, Zhaoxi Li, Zheming Li, Zhengxiao Li, Zhiyuan Li, Jiawei Lin, Xiaohan Lin, Yibo Lin, Zichao Lin, Ziyan Lin, Bill Liu, Boxiao Liu, Chuan Liu, Liang Liu, Shaowei Liu, Shudong Liu, Shuran Liu, Tianwei Liu, Weizhou Liu, Yangyang Liu, Yanming Liu, Yibo Liu, Yipeng Liu, Zhengying Liu, Zhiheng Liu, Enzhe Lu, Haoyu Lu, Linqiang Lu, Tingzhan Lu, Zhiyuan Lu, Aotian Luo, G. Luo, Junyu Luo, Yifan Luo, B. Lyu, Wenzhou Lyu, Shaoguang Mao, Yuan Mei, Xin Men, Minqing Ni, Yixuan Niu, Siyuan Pan, Shujun Peng, Zhangyang Qi, Ruoyu Qin, ZeChao Qin, Zeyu Qin, Haiquan Qiu, Jianxin Qiu, Jiezhong Qiu, Bowen Qu, Yuhao Qu, Zeyu Shang, Youbo Shao, Han Shen, Jincheng Shi, Juanfeng Shi, Lidong Shi, Shengyuan Shi, Wingchun Siu, Pengwei Song, Xiaoxi Song, Jianlin Su, Yunfeng Su, Zhaochen Su, Lin Sui, Jingsong Sun, Junyao Sun, Shaoning Sun, Shuzhe Sun, Tongyu Sun, Yujun Sun, Yunpeng Tai, Chuning Tang, Heyi Tang, Sirui Tang, Zecheng Tang, Chaoran Tian, Rongpeng Tian, Yu Tian, Wei Tu, Chensi Wang, Chuang Wang, Chunjie Wang, Dinglu Wang, Feng Wang, Hailong Wang, Haiming Wang, Hao Wang, Huaqing Wang, Hui Wang, Jiayi Wang, Jinglong Wang, Jinhong Wang, Jiuzheng Wang, Linian Wang, Shaobo Wang, Shenzhi Wang, Shuyi Wang, Si Wang, Siyuan Wang, Tianfu Wang, Wenjue Wang, Xingran Wang, Xinmei Wang, Xinyuan Wang, Xusheng Wang, Yalin Wang, Yangkun Wang, Yao Wang, Yaoyu Wang, Yejie Wang, Yiqin Wang, Yucheng Wang, Yuzhi Wang, Zhaoji Wang, Zhaowei Wang, Zhengtao Wang, Zhenhao Wang, Zhongsheng Wang, Zifan Wang, Chu Wei, Ming Wei, Shouxin Wei, Zichen Wen, Fan Wu, Haoning Wu, Rucong Wu, Wenhao Wu, Xiaoxue Wu, Yingcong Wu, Yongqi Wu, Yuxin Wu, Zijian Wu, Xinglang Xian, Chenxuan Xiang, Yuye Xiang, Bocheng Xiao, Chenjun Xiao, Xin Xiao, Jin Xie, Xiaotong Xie, Yifeng Xie, Zhe Xie, Bowei Xing, Yiming Xiong, Baosheng Xu, Boyu Xu, Jiale Xu, Jianfan Xu, Jing Xu, Jinjing Xu, L. H. Xu, Qingtao Xu, Shuyao Xu, Suting Xu, Tiantian Xu, Tianxiang Xu, Weixin Xu, Xinran Xu, Yangchuan Xu, Ye Xu, Yueni Xu, Ziyao Xu, Haonan Xue, Junjie Yan, Yaoyao Yan, Fan Yang, Guangyao Yang, Hao Yang, Junwei Yang, Ruoyu Yang, Wenjie Yang, Xiaofei Yang, Xinyu Yang, Yi Yang, Yiling Yang, Ying Yang, Yuchen Yang, Zhen Yang, Zhilin Yang, Zian Yang, Zuhao Yang, Haotian Yao, Dan Ye, Haoran Ye, Wenjie Ye, Zhanbo Ye, Bohong Yin, Haoxiang Yin, Xietong Yin, Chengzhen Yu, Haozhen Yu, Longhui Yu, Shengnan Yu, Shuying Yu, Tianxiang Yu, Enming Yuan, Mengjie Yuan, Tongtian Yue, Wei Yue, Yang Yue, Dunyuan Zha, Haobing Zhan, B. H. Zhang, Dehao Zhang, Fei Zhang, Hao Zhang, Haoyuan Zhang, Huanyu Zhang, Jiapei Zhang, Jiaxuan Zhang, Jin Zhang, Kaiyi Zhang, Miaozhen Zhang, Puqi Zhang, Qinglei Zhang, Rong Zhang, Rui Zhang, Shaoshuai Zhang, Shiyi Zhang, Xiaobin Zhang, Xiaoyun Zhang, Y. Zhang, Yangkun Zhang, Ye Zhang, Yichi Zhang, Yikun Zhang, Yizhi Zhang, Yongting Zhang, Yu Zhang, Yutao Zhang, Yutong Zhang, Zheng Zhang, Zijing Zhang, Bin Zhao, Chenguang Zhao, Feifan Zhao, Jinglun Zhao, Jinxiang Zhao, Shuai Zhao, Wenshuo Zhao, Xiangyu Zhao, Xuanle Zhao, Yikai Zhao, Zijia Zhao, Haozhi Zheng, Huabin Zheng, Ruihan Zheng, Shaojie Zheng, Tengyang Zheng, Haofeng Zhong, Lei Zhong, Longguang Zhong, M. Zhou, Qiankang Zhou, Runjie Zhou, Ruozhang Zhou, Xinyu Zhou, Yiqiao Zhou, Zaida Zhou, Jinguo Zhu, Liya Zhu, Xinhao Zhu, Yangjunfeng Zhu, Yuxuan Zhu, Zhen Zhu, Chen Zhuang, Weiyu Zhuang, Xinxing Zu 📅 2026-07-27 👍 431 2026-08-02 18:30
Mixture-of-Experts 原生多模态 大语言模型 智能体强化学习 长上下文

首个开源3T级原生多模态MoE,配1M上下文与多档强化学习

前置知识

混合专家模型(Mixture-of-Experts, MoE)

MoE 是一种通过条件计算扩展模型容量的稀疏架构:每个 token 只激活少量专家子网络,而非全部参数。以 Kimi K3 为例,2.8 万亿总参数中每个 token 仅激活约 104B,路由器用 Top-k 选出最相关的专家。其代价是路由负载容易不均衡、跨设备 all-to-all 通信开销大,专家池越大越难训练稳定。

Kimi K3 把专家数从 K2 的 384 翻到 896、激活专家数从 8 翻到 16,理解 MoE 的负载均衡与通信瓶颈才能看懂 Stable LatentMoE 三件套(RMSNorm、SiTU-GLU、Quantile Balancing)的设计动机。

Delta 规则与线性注意力(KDA 的递推基础)

Delta 规则是一种带门控的线性注意力递推形式,用固定大小的递推状态 $S_t$ 替代 softmax 注意力中随序列增长的 KV cache。KDA 的更新为 $S_t = (I - \beta_t k_t k_t^\top)\,\mathrm{Diag}(\alpha_t)\,S_{t-1} + \beta_t k_t v_t^\top$,其中 $\alpha_t$ 是通道遗忘门、$\beta_t$ 是写入强度。它把注意力压缩成常数空间,代价是序列内计算需要分块并行。

KDA 是 Kimi K3 处理百万 token 的算子基础,理解它的递推形式与分块并行才能看懂本文算法-系统协同设计(FlashKDA、KDA Context Parallelism)。

Attention Residuals(沿深度的注意力残差)

标准残差连接把所有历史信息压缩进单一隐状态 $h_l$,沿深度方向是累加式瓶颈。Attention Residuals 把'注意力'思想搬到深度维度:每层用学到的伪查询 $q_l$ 对前面所有层输出做软选择,权重 $\alpha_{i\to l} \propto \exp(q_l^\top \mathrm{RMSNorm}(k_i))$,让信息流可以跨层跳连。

Kimi K3 用 AttnRes 解决深层网络信息退化,并用 8 块的分块设计把开销压到可承受范围,这是它从 61 层扩到 93 层的关键。

智能体强化学习(Agentic RL / RLVR)

智能体强化学习指在可验证环境中用 RL 训练模型完成多步工具调用任务,奖励来自环境客观信号(代码能否通过测试、答案是否匹配、交付物是否满足评分表),而非人类偏好。Kimi K3 的训练轨迹往往要数千次工具调用、累积上下文达数百万 token,需要部分 rollout、可恢复沙箱等基础设施支撑。

后训练是 Kimi K3 编程与智能体能力的来源,理解 agentic RL 才能看懂它为何要造 AgentENV microVM 沙箱、分级预算控制和 reasoning-effort RL。

投机解码(Speculative Decoding / EAGLE-3)

投机解码用一个小的草稿模型先并行预测若干 token,再由目标模型批量验证,能显著降低大模型的自回归延迟。EAGLE-3 用单层解码器作草稿,Kimi K3 复用预训练的多 token 预测(MTP)层微调成 EAGLE-3 草稿,并直接优化接受率损失 $L_{\mathrm{LK}} = -\log \sum_{x} \min(p(x), q(x))$。

Kimi K3 部署的关键是推理速度与成本,投机解码+MXFP4 量化是把它压到可服务成本的核心手段,看不懂这部分就难以评估其性价比结论。

研究动机

开源大模型生态在'测试时算力'(test-time scaling)这条轴上进步飞快——OpenAI o 系列、DeepSeek-R1、Kimi K1.5 等让大规模 RL 和长链推理成为范式,但'训练时算力'这条轴却被严重忽视:近期开源模型大多停留在或略超 1T 参数量级(如 GLM、DeepSeek、K2 自身仅 1.04T)。当越来越激进的 RL 方法被反复堆叠在规模相近的预训练底座上,开源社区的能力提升开始趋同收敛,而与最强闭源系统(Claude Fable 5、GPT-5.6 Sol)的差距反而在拉大。与此同时,传统 softmax 注意力把 KV cache 随序列线性增长,要把上下文推到 1M token 在训练和推理两端都极其昂贵;深层网络的标准残差连接退化严重;当专家数逼近千级时,原有的辅助无损路由偏置更新不再稳定,负载失衡会让专家并行训练吞吐崩塌。这些都是把开源模型推向真正前沿必须同时解决的具体瓶颈。

本文的目标是本文要把两条 scaling 轴同时推到前沿:一方面把预训练底座首次扩到开源社区前所未有的 3T 级(2.8T 总参、104B 激活),另一方面在 1M 上下文上系统性地做 RL、推理努力分级和长程交互。可量化的目标包括:相对 Kimi K2 取得约 2.5× 的整体 scaling 效率提升;把上下文窗口从 K2 的 128K 扩到 1M 且无需任何位置编码重调;原生多模态(视觉从训练第一步就联合优化)而非事后拼接;在编程、智能体、知识、推理、视觉这五条能力轴上达到前沿水平,并在保持开源权重的前提下,把每个任务的推理成本压到 Claude Fable 5 的几分之一。

与已有工作不同的是,本文的独特切入角度是'同时、协同地扩展序列、深度、宽度三个维度的信息流',并配套全栈基础设施。已有开源工作多只押注一条轴:要么堆 RL 但底座不动,要么换架构但不解决工程落地。Kimi K3 既不满足于把 K2 的 MLA 换成线性注意力就直接发版,也不把视觉当成事后对齐阶段,而是认定:要让 3T+1M+agentic RL 三件事同时成立,必须在算子(KDA 上下界衰减、FlashKDA)、算法(Stable LatentMoE、Block AttnRes、Per-Head Muon)、系统(MoonEP 完美均衡、KCP、AgentENV、KDA 感知前缀缓存)三层一起协同设计。另一个被忽视的点是视觉编码器——主流做法用 SigLIP 对比预训练初始化,但本文发现从零用 next-token prediction 训练 MoonViT-V2 更稳定且效果相当。

核心方法

直觉上,Kimi K3 像是在同时给一栋大楼升级三套管线:把走廊(序列方向)从 softmax 全局注意力换成更省空间的 KDA 递推通道、并在每四层插一条全局 MLA 走廊保持全局交互;把楼层间(深度方向)的单线楼梯改成可跨层直达的电梯(AttnRes);把每层的房间(宽度方向)从少数大专家改成 896 个精专小专家中按需点亮 16 个。技术路线由此展开:每个 block 含 3 层 KDA + 1 层 Gated MLA(3:1 比例),每个注意力层后接一个 Stable LatentMoE;AttnRes 把 93 层切成 8 个块做块间注意力;MoonViT-V2 作原生视觉入口;Per-Head Muon 优化矩阵参数。配合 4 阶段上下文扩展(8K→64K→256K→1M)、cosine 学习率、原生多模态联合训练、QAT 量化训练贯穿全流程,最终在 scaling law 曲线上拿到对 K2 的约 2.5× 效率。

核心创新是用'有界化'与'量化均衡'两招把极端稀疏和极深网络压进可训练区间,与已有方法(小专家池、浅网络、或事后打补丁)本质不同。其一,KDA 把衰减对数 $g_t$ 用缩放 sigmoid 界定在 $(g_{\min},0)$($g_{\min}=-5$),使 16-token tile 累积衰减落在 $(-80,0)$,倒数重缩放因子 $<e^{80}$ 仍在 BF16 范围,对角 tile 也能走 Tensor Core,彻底干掉 Kimi Linear 的逐位置对角瓶颈。其二,Stable LatentMoE 三管齐下:RMSNorm 隔离路由分支尺度漂移;SiTU-GLU 把门控与上投影都压在 $|f|\le\beta_1\beta_2=100$($\beta_1=4,\beta_2=25$);Quantile Balancing 从一次前向的 Top-(k+1) 切口算出每专家恰好拿目标负载 $q=mk/n$ 的偏置,直方图一次 all-reduce 估全局分位数。这让 896 专家、16 激活、sparsity 56 的极端稀疏首次稳定可训。

方法步骤详情

流程分预训练与后训练。预训练在 Web/Code/Math/Knowledge 四域文本加视觉语料上原生多模态联合训练,Per-Head Muon + QB 负载均衡,cosine 学习率,上下文经 8K→64K→256K→1M 四阶段扩展并合成跨 1M 任务。后训练三段:(1) SFT 冷启动,用 XTML 序列化 agentic 轨迹,全程 MXFP4/MXFP8 QAT;(2) RL 在通用/智能体/编程三域 × {low,high,max} 共 9 专家分别训练,配 partial rollout、预算控制(超 $\tau b_0(x)$ 判 $-1$)和强制 rubric 协议的 Generative Reward Model;(3) Multi-Teacher On-Policy Distillation 用 OPD 奖励 $r_{\mathrm{dopd}}=\mathrm{clip}(\mathrm{sg}\log\frac{\pi^{(d,e)}_{\mathrm{teacher}}}{\pi_\theta},\pm R_{\max})$ 把 9 专家融成单模型。

技术新颖性

相对已有技术的具体区别:(1) 与 DeepSeek-V2/K2 的纯 MLA 不同,Kimi K3 用 3:1 的 KDA-Gated MLA 混合并对 MLA 全部用 NoPE,扩展上下文无需调 RoPE 或 YaRN;(2) 与 DeepSeekMoE 的辅助无损偏置固定步长更新不同,QB 改成'一次前向、直方图估全局分位数、恰好达目标负载'的解析更新,把 896 专家的失衡从'调参难题'变成'闭式解';(3) 与 SwiGLU 的无界乘性不同,SiTU-GLU 在原点附近保留 Swish 线性区、在大值处用 softcap 有界,同时压住门控与上投影两支;(4) 与 SigLIP 初始化的视觉塔不同,MoonViT-V2 从零 NTP 训练更稳且不损精度,挑战了'对比预训练初始化必不可少'的共识;(5) 系统层 MoonEP 证明了至多 $E/R$ 个冗余专家即可完美均衡并本质紧确,EAGLE-3 草稿直接吃 AttnRes 的低/中/高三层特征融合,都是同类工作里少见的工程创新。

Kimi K3 architecture(架构总览:token/通道/层三路混合 + 原生视觉通路)
Figure 2: Kimi K3 architecture(架构总览:token/通道/层三路混合 + 原生视觉通路)
Scores and average assistant steps across evaluations during RL(RL FLOPs 扩展曲线)
Figure 8: Scores and average assistant steps across evaluations during RL(RL FLOPs 扩展曲线)
Fine-grained prefix caching within a physical cache block(KDA-MLA 混合细粒度前缀缓存)
Figure 12: Fine-grained prefix caching within a physical cache block(KDA-MLA 混合细粒度前缀缓存)

实验结果

Kimi K3 略落后 Fable 5、GPT-5.6 Sol,但稳定领先 Opus 4.8、GPT-5.5 与开源 GLM-5.2。编程是强项:ProgramBench 77.8%、SWE-Marathon 42.0%(比 Fable 5 高 7pt)均全场第一,Terminal-Bench 88.3% 几乎追平 GPT-5.6 Sol 88.8%。智能体:BrowseComp 91.2%(2.03 美元/任务,约 GPT-5.6 Sol 一半成本)全场最高,MCPMark 94.5%、AutomationBench 30.8% 近 SOTA,但 Elo 类知识工作落后(GDPval-AA v2 1686 vs 1747)。推理 GPQA 93.5% 持平前沿,HLE-Full 43.5/56.0、CritPt 23.4% 研究级是短板。视觉 OmniDocBench 91.1% 最高、Math-Vision 加 Python 达 97.8%。第三方 WebDev Arena 1678 Elo(#1/99,首个登顶的开源模型)、AA Intelligence Index 57.1。

Architectural comparison between Kimi K2 and Kimi K3(K2→K3 架构对比)
Table 1: Architectural comparison between Kimi K2 and Kimi K3(K2→K3 架构对比)
Performance comparison of Kimi K3 against proprietary and open-source models(全基准性能对比)
Table 2: Performance comparison of Kimi K3 against proprietary and open-source models(全基准性能对比)
Kimi K3 main results(编程与通用/视觉智能体主要结果)
Figure 1: Kimi K3 main results(编程与通用/视觉智能体主要结果)
Score vs. per-task inference cost(四套基准的性价比前沿)
Figure 13: Score vs. per-task inference cost(四套基准的性价比前沿)
查看结构化数据
任务指标本文基线提升
BrowseComp(网页深度检索) 准确率 91.2% (2.03 美元/任务) GPT-5.6 Sol 90.4% / Fable 5 88.0% 全场 SOTA,成本约为 GPT-5.6 Sol 的 1/2、Claude 系的 1/10
SWE-Marathon(GPU 内核长程软件工程) 完成率 42.0% Opus 4.8 40.0% / Fable 5 35.0% / GPT-5.6 Sol 39.0% 全场 SOTA,领先 Fable 5 +7pt
ProgramBench(编程) 准确率 77.8% GPT-5.6 Sol 77.6% / Fable 5 76.8% 全场最高
Artificial Analysis Intelligence Index v4.1(第三方综合) 综合智能指数 57.1 (#4/580) Fable 5 59.9 / GPT-5.6 Sol 58.9 开源第一,仅次于两个闭源模型
WebDev Arena(第三方众包前端) Elo 1678 (#1/99) Fable 5 1634 / GPT-5.6 Sol 1630 首个登顶该榜的开源模型
端到端漏洞利用套件(自评) 解决率 14/36 (38.9%) GLM-5.2 8/36 (22.2%) +16.7pt;用户态 10/14,内核态仍弱

局限与改进

作者明确承认:(1) 研究级推理仍是短板,HLE-Full 落后 Fable 5 约 7 个点、CritPt 23.4% 在四个对手之后;(2) 知识工作 Elo 类基准(GDPval-AA v2、AA-Briefcase)整体被 Claude Fable 5 压制;(3) Agent Behavior Bench 仅 65.0(Fable 5 75.5)、MIRA Bench 64.1(72.9)、24/7 ClawBench 2.0、Agentic Vision Bench、KWV Bench 均落后;(4) 端到端漏洞利用的瓶颈在'从已得原语完成最后一步利用链',41 项任意代码执行 0 成功,作者把这视作能力下界。我额外观察到:部分编程基准(如 SWE-Marathon)用 H20 重校准分支、Fable 5 在 35% 任务触发 fallback、对比口径不完全对齐;BBench/JobBench 等内部基准与公开基准方法学未公开,结果可比性受限于自评;评测集中在 max 推理档,性价比优势部分建立在'别人用 max、自己用 high'的对比上。

独立分析的弱点

第一个弱点是潜在的工具套件过拟合:尽管引入统一白盒 RL 环境随机组合 harness 模块,但评测仍主要落在 Kimi Code/Claude Code/Codex 三家,换上完全未见过的 harness(如新兴开源 agent 框架)时泛化能力未验证——改进方向是 harness 无关的元 RL 或在线 harness 生成。第二个弱点是视觉塔仅 0.4B 参数且训练数据偏通用,面对医学影像、遥感、工业质检等长尾细粒度场景可能力不从心——可加领域自适应预训练或可插拔视觉专家。第三个弱点是研究级推理(HLE、CritPt)短板暴露预训练语料对深度学术知识的覆盖不足——可针对性上采样 arxiv/专著/教科书并做难题合成。第四个弱点是相对小 dense 模型,短任务的路由与稀疏开销仍偏高,性价比曲线在短上下文场景不够陡——可做动态专家剪枝、提升草稿模型接受率。第五个弱点是反 reward-hacking 是被动追加('观察到新策略就加防护'),可能漏掉新型攻击——可引入形式化验证或对抗性红队自动化。

未来方向

作者明确点出的方向:补齐研究级推理(HLE-Full、CritPt)、完成端到端漏洞利用链与硬核计算机操作(OSWorld 2.0、SaaS-Bench),并表示会在每次大版本更新时重新评估网络能力下界。基于本成果可延伸的方向:(1) 把 Stable LatentMoE 的 QB 推到更大专家池(如 2k+),并用 scaling law 外推到 5T+;(2) 探索 KDA 之外的线性注意力变体或纯状态空间模型以进一步降本;(3) MiniTriton 与 nano-kpu 案例表明模型已能自主写编译器与芯片,可构建'模型-编译器-硬件'全自动协同设计的闭环;(4) 在 >1M 上下文上继续做 agentic RL,结合 swarm 多智能体扩展 test-time scaling;(5) 把 MOPD 从 9 个专家扩展到更多域与努力档,研究统一的 effort-conditioned 单模型。

复现评估

权重完全开源在 HuggingFace(moonshotai/Kimi-K3),并提供 MXFP4 量化版可直接推理,这一点对社区极友好。基础设施部分开源:MoonEP(专家并行)、AgentENV(microVM 沙箱)、FlashKDA/KCP(经 flash-linear-attention PR #691)、MiniTriton、nano-kpu RTL 均有公开仓库。但训练数据、RL 任务合成知识图谱、白盒 harness 配置、内部 benchmark(KCB 2.0、ClawBench 等)均未开源,复现完整训练几乎不可能。算力门槛极高:2.8T 预训练 + 1M 上下文 RL 需数千张 GPU 和 AgentENV 上 5120 万次沙箱创建,个人与中小团队无法复现训练;但基于开源权重做微调、推理、benchmark 复跑是可行的,难度中等。总体评估:训练复现难度'极高',权重使用复现难度'低-中'。