K-EXAONE 2.0 技术报告:迈向全球前沿规模的基础模型 K-EXAONE 2.0 Technical Report
LG 升级再造 K-EXAONE,构建 750B 总参/37B 激活的 MoE 多语言基础模型。
前置知识
Mixture-of-Experts (MoE) 混合专家
一种稀疏激活的神经网络结构:每个 token 只激活全部专家中的一小部分(如本文从 256 个专家里选 top-8 路由专家 + 1 个共享专家),从而在保持总参数量巨大的同时把单 token 的计算量(激活参数)压得很低。路由通常用 sigmoid 或 softmax 打分,并配合负载均衡损失防止少数专家被塞爆。
K-EXAONE 2.0 的核心架构就是 fine-grained sparse MoE,不理解 MoE 就无法理解它为何能做到 750B 总参数却只有 37B 激活,也无法理解升级再造(upcycling)时为何要按专家维度扩容。
Speculative Decoding 推测解码
一种推理加速技术:用一个轻量级的「草稿模型/drafter」一次性预测多个候选 token,再用大模型(target)并行验证,被接受的草稿 token 直接采纳,被拒的则回退重算。self-speculative 指草稿头与 target 共享同一套权重。本文的 MTP 头和 DSpark 都属于 self-speculative drafting。
理解推测解码才能看懂本文两条加速路径(MTP 与 DSpark)的 acceptance length 和 end-to-end speedup 指标,以及 DSpark 为何用 block-diffusion 一次生成整块草稿。
Model Upcycling 模型升级再造(深度/宽度上扩)
不从头训练,而是把已训练好的模型沿「深度」(增加层数)或「宽度」(增加专家/通道)扩容后继续预训练,以节省算力。本文把 K-EXAONE 从 48 层/128 专家扩到 78 层/256 专家,深度上按 LLLG 块(3 层滑窗 + 1 层全局注意力)复制中间块,宽度上复制专家并加随机旋转噪声打破对称性。
升级再造是本文区别于「从头训练」的根本方法论,也是论文宣称保留前代投入、用 3.2× 参数量继续前进的核心论据。
Sliding Window Attention & Hybrid Attention 滑窗与混合注意力
滑窗注意力(SWA)让每层只关注局部窗口(本文窗口 128,第二层用 4096)内的 token,把注意力复杂度从 O(n²) 降到 O(n·w);混合注意力把 SWA 层与少量全局注意力(GA)层交错(本文 LLLG 模式),兼顾局部建模效率与长程信息传递,配合 RoPE、QK Norm 稳定训练。
K-EXAONE 2.0 支持 256K 上下文,靠的就是 78 层里 58 层 SWA + 20 层 GA 的混合结构;不理解这一点就看不懂它如何在超长上下文下保持效率。
Multi-Token Prediction (MTP) 多 token 预测
在主干模型之上接一个额外的小模块,训练时要求它基于当前隐藏状态同时预测未来多个 token,从而学到更好的未来 token 表示;推理时该模块可作为 self-speculative decoding 的草稿头。本文 MTP 头在 RL 阶段前用端到端 total-variation loss 精调,直接优化多步接受率而非交叉熵代理。
MTP 是本文两条推理加速路径之一,与 DSpark 对比时接受长度和加速比是关键实验数据。
SwiGLU 与 Clamped SwiGLU
SwiGLU 是 GLU 类前馈模块:output = silu(gate(x)) ⊙ up(x) 的形式,其中 silu 为 SiLU 激活。当 gate 与 up 投影对齐时,输出幅值会爆炸性增长,破坏低精度训练/推理。Clamped SwiGLU 在两支路合并前对 gate 支路上界、对 linear 支路双侧同时夹紧到阈值 τ(本文 τ=7.0),把激活上限压到 $\mathrm{silu}(\tau)\cdot\tau=48.96$,但不触碰路由决策。
这是本文解决升级再造后深层专家激活爆炸、保证 FP8 训练与推理稳定性的关键技术,图 3 显示未夹紧时峰值达 6862,夹紧后约 140× 压缩。
研究动机
当前大模型进入全球白热化竞争,专有模型定义了前沿,开源权重模型则通过规模、数据与方法不断缩小差距,部分 MoE 模型已进入数百亿乃至万亿参数级别。然而对希望建立可持续 AI 能力的国家而言,仅能「访问」前沿模型远远不够,真正关键的是在本国语言、文化与制度语境下自主构建、运营、评估并持续改进模型的能力。K-EXAONE 作为韩国政府战略计划下 LG AI Research 推出的第一代 MoE 基座(236B 总参/23B 激活、256K 上下文、6 语言),虽证明国内可造出有全球竞争力的模型,但在实际部署场景中仍有明显短板——尤其在 agentic coding、长上下文理解等方向「留下了相当大的提升空间」,且与 DeepSeek V4 Pro(1.6T)、GLM-5.1(754B)等更大的前沿模型存在能力差距。
本文的目标是K-EXAONE 2.0 围绕一个单一目标展开:把模型推向前沿规模,并让增加的容量真实转化为「实际部署条件下可靠的能力」,同时继承前代积累的参数与训练经验。具体而言,作者希望在不丢弃 K-EXAONE 已学到的知识与算力投入的前提下,把总参数提升到 750B、激活参数到约 37B(3.2× 于前代),把上下文长度维持在 256K,把多语言覆盖从 6 种扩展到 10 种(新增法语、意大利语、波兰语、葡萄牙语),并通过持续预训练、聚焦难度的 mid-training 与后训练,强化推理、agentic coding、多语言与植根韩国社会文化的安全性,使规模本身成为「可被高效运行、广泛使用、可靠部署」的能力基础,而非自吹自擂的数字。
与已有工作不同的是,本文的独特切入角度有三点。第一,方法论上不走「从头训练」的常规路线,而是 upcycling(升级再造):沿深度(48→78 层,按 LLLG 块复制中间块)和宽度(128→256 专家,复制专家+路由行并加范数保持的随机旋转噪声)扩容已有模型,再恢复大规模持续预训练,从而把前代投入视为可继承资产而非沉没成本。第二,工程上同时引入 Clamped SwiGLU(深层 τ=7.0 夹紧)解决扩容后激活爆炸,以及 MTP + DSpark 双 self-speculative 推测解码路径,让 750B 规模在推理时可用。第三,安全思路上提出「主权模型必须自己定义风险」——通过 K-AUT-V2 分类法(风险领域从 226 扩到 296,新增 70 项)和由 46 位 UNESCO GCED 认证教师组成的 Safety Teacher Advisory Council,把风险发现的视角从技术专家扩展到价值与领域专家,植根韩国历史地缘语境。
核心方法
整体思路是「先扩容、再愈合、再续训、再对齐」。直觉上,与其把一个训练好的千亿模型当作废纸重练,不如把它像乐高一样在深度和宽度上拆开加层、再加专家,然后用一部分后段训练数据「愈合」扩容带来的扰动,最后喂入 8T token 的新预训练混合。技术路线上:先对 K-EXAONE 做 depth up-scaling(按 LLLG 块从 12 块扩到 19 块,前面 2 层 dense)和 width up-scaling(专家 128→256,top-8 路由 + 1 共享专家保持不变),引入 Clamped SwiGLU 稳定深层;随后 mid-training 分两阶段把上下文从 8K 逐步拉到 64K 再到 256K,每阶段各喂 400B token,强调长上下文、高级推理与 agentic 工作流;最后 post-training 用 SFT(350B token,冻结路由器)+ 两阶段偏好学习(multi-task 与 safety-aware,均用 GROUPER 目标)完成对齐,并贯穿扩展多语言与 K-AUT-V2 安全训练。
核心创新点与已有方法的本质区别体现在三处。一是「升级再造 + Clamped SwiGLU」的组合:不同于简单 repeated stacking 或 identity init,作者按 LLLG 块复制中间段块(实验证明比复制首尾更好),并在最后 16 层(62–77 层)对专家施加 τ=7.0 的双向夹紧,把 SwiGLU 峰值激活从 6862 压到 48.96(约 140×),既保住了低精度训练又保住了低精度推理。二是「双 self-speculative 路径共享同一 target 权重」:MTP 头从预训练起与主干联合训练、RL 前用 total-variation loss 端到端精调;DSpark 草稿器(5 层、block size γ=7)在最终权重锁定后训练,用 block-diffusion 主干一次前向生成整块草稿、再用轻量 sequential 模块从左到右修正块内依赖——同一份 target 权重可二选一挂载。三是把安全性做成「主权定义」:K-AUT-V2 与教师顾问理事会把风险发现从技术红队扩展到价值/领域专家。
方法步骤详情
完整步骤如下。(1)架构扩容:depth up-scaling 把 48 层扩成 78 层(2 dense + 76 MoE,其中后 16 层用 Clamped SwiGLU),按 LLLG 模式(3 SWA + 1 GA,SWA 窗口除第二层 4096 外均为 128)从 12 块扩到 19 块;width up-scaling 把每层专家从 128 复制到 256(每专家连同其 router 行一起复制),对复制出的专家加范数保持的随机旋转噪声打破对称性。(2)愈合 + 持续预训练:先用一部分 K-EXAONE 后段训练数据做 healing 稳定扩容扰动,再喂入 8T token 的 K-EXAONE 2.0 预训练混合,其中用 Active Reading(AR)合成知识数据(伪 AR 复用有效 prompt 降本)、thinking-augmented + latent-thought 合成数据降低 loss。(3)mid-training 两阶段:Mid-Stage 1 在 64K 上下文训 400B token,Mid-Stage 2 在 >64K 上下文再训 400B token,逐步引入长上下文语料、研究生级 STEM 知识与 agent 工作流轨迹(GitHub PR 含 diff/review/相关文件/commit 历史),统一 XML 风格工具调用。(4)SFT:350B token 覆盖推理/世界知识/指令遵循/agentic,冻结路由器,联合训练 thinking 与 non-thinking 模式,agent 场景保留跨轮 reasoning block(preserved thinking)。(5)偏好学习:先 multi-task(数学/代码/知识/agent/chat,用可验证信号与 LLM-as-judge 选 chosen/rejected),再 safety-aware(按 K-AUT-V2,每 prompt 采样 4 候选用领域 reward 打分构造 GROUPER 组)。(6)推理部署:挂载 MTP 或 DSpark 实现推测解码。
技术新颖性
技术新颖性体现在工程与安全两条线。工程上,Clamped SwiGLU 的具体构造(gate 支路上界、linear 支路双侧夹紧,阈值 7.0,不触碰路由)与 gpt-oss、DeepSeek-V4 同源但被明确用于「升级再造后深层专家」的稳定化,图 3 给出 140× 峰值压缩的干净证据;DSpark 草稿器把 block-diffusion 主干 + 轻量 sequential 修正 + 从 target 多层注入 KV 的思路做成一个比 MTP 更强的生产级 drafter(acceptance length 提升 32–66%,端到端加速从 1.27–1.77× 提到 1.81–2.57×)。升级再造里「按 LLLG 块复制中间段」与「复制专家加随机旋转噪声」也是相对具体的可复现配方。安全线上,K-AUT-V2(226→296 风险项)与 46 人教师理事会(按性别/年龄/学段/学科/地区六维平衡,76% 教龄>10 年)构成「把风险发现权交给价值专家」的治理创新,并把分歧当信号而非噪声,属于技术报告中少见的、可被借鉴的安全工程范式。
实验结果
核心发现可分五块,均来自 24 个 benchmark、9 大类评估(REASONING 模式)。世界知识:MMLU-PRO 83.5、GPQA-DIAMOND 82.2(较 K-EXAONE +3.1)、HLE(纯文本子集)18.3(+4.7),但与 DeepSeek V4 Pro(HLE 37.7)、GLM-5.1(31.0)差距明显。数学:AIME 2026 92.3、HMMT FEB 2026 78.4(实际略低于前代 80.7)、IMO-ANSWERBENCH 78.6(+2.3),整体与 Qwen3.5(91.3/84.6/80.9)和更大模型有差距。编码/Agentic 是最大亮点:SCICODE 40.1、SWE-BENCH VERIFIED 68.2(+18.8)、TERMINAL-BENCH 2.1 43.8(+13.5),三类合计约 30% 相对提升。指令遵循:IFEVAL 92.4(+2.7)、IFBENCH 72.6(+5.3)。长上下文是另一大跃迁:OPENAI-MRCR 从 52.3 飙到 94.4(+42.1,碾压 GLM-5.1 的 71.5),AA-LCR 56.2、KO-LONGBENCH 89.6;NIAH 在 256K 全范围满分。韩语:KMMLU-PRO 69.1、CLICK 84.2、HRM8K-KSM 91.1。多语言:POLYMATH 71.3(+13.9),MMMLU/GLOBALMMLU-LITE 均 86.6。安全是最强项:KGC-SAFETY 99.8(前代 96.1,且 GLM-5.1 仅 69.3)、ROK-FORTRESS 89.5(前代 60.9,DeepSeek V4 Pro 仅 47.6)。消融方面:AR 合成数据在 ARC-C 上 +1.54(优于 textbook-style 的 -0.42);mid-training 中 Mid-Stage 2 在 HLE 上比 Mid-Stage 1 多 +4.71,叠加 SFT 后达 +5.66;DSpark vs MTP 接受长度提升 32–66%。结论:相对前代平均提升超 10%,最大跃升在 agentic coding 与长上下文,相对同类开源权重模型最清晰的优势在长上下文检索与安全。
查看结构化数据
| 任务 | 指标 | 本文 | 基线 | 提升 |
|---|---|---|---|---|
| SWE-BENCH VERIFIED(仓库级软件工程) | 解决率(%) | 68.2 | K-EXAONE 49.4 | +18.9 分(相对约 +38%) |
| TERMINAL-BENCH 2.1(终端长程 agent) | 解决率(%) | 43.8 | K-EXAONE 30.3 | +13.5 分(相对约 +45%) |
| OPENAI-MRCR(长上下文多针检索,≤128K) | difflib 相似度宏平均 | 94.4 | K-EXAONE 52.3 | +42.1 分;同时高于 Qwen3.5 93.0、GLM-5.1 71.5 |
| ROK-FORTRESS(安全/抗越狱) | Final Score = 100 − 均值TRS | 89.5 | K-EXAONE 60.9 | +28.6 分;DeepSeek V4 Pro 仅 47.6、GLM-5.1 73.2 |
| KGC-SAFETY(韩语社会文化安全) | Safe Rate(%) | 99.8 | K-EXAONE 96.1 | +3.7 分;GLM-5.1 仅 69.3 |
| POLYMATH(多语言数学) | 准确率(%) | 71.3 | K-EXAONE 57.4 | +13.9 分 |
| GPQA-DIAMOND(研究生级科学问答) | 准确率(%) | 82.2 | K-EXAONE 79.1 | +3.1 分 |
| HUMANITY'S LAST EXAM(纯文本子集) | 准确率(%) | 18.3 | K-EXAONE 13.6 | +4.7 分(但仍落后 DeepSeek V4 Pro 37.7) |
| 推测解码端到端加速(DSpark vs MTP,γ=7) | E2E speedup × | DSpark 1.81–2.57× | MTP 1.27–1.77× | 接受长度提升 32–66% |
局限与改进
作者承认的局限偏笼统:模型仍可能产出含个人、有害或偏见信息的不当回答;输出依赖训练数据统计,可能出现语义/语法错误;模型不反映最新信息,回答可能失真或自相矛盾;并明确声明生成内容不代表 LG AI Research 立场。从评估数据可观察到更具体的局限:在纯知识深度(HLE 18.3 vs DeepSeek V4 Pro 37.7)、数学竞赛(HMMT FEB 2026 78.4 略低于前代 80.7,IMO-ANSWERBENCH 78.6 落后 DeepSeek 89.8)、韩语专业知识(KMMLU-PRO 69.1 vs DeepSeek 80.5)等方向与更大或更前沿的开源权重模型仍有明显差距;τ3-BANKING 仅 14.2,与前代持平且未明显领先 Qwen3.5;多语言里波兰语(PL)在 GLOBALMMLU-LITE 上反而从 86.3 降到 84.5,越南语(VI)从 84.8 降到 83.0,说明新增语言训练存在此消彼长。此外,长上下文标杆 AA-LCR 56.2 仍落后 Qwen3.5 的 65.7,长上下文「检索」强但「推理」未必全面领先。作者也指出红队主要覆盖「已知风险」,对「无人设想过的风险」能力有限。
独立分析的弱点
独立分析的弱点与改进方向如下。其一,绝对前沿能力不足:HLE、数学竞赛、KMMLU-PRO 等纯硬指标落后 DeepSeek V4 Pro / GLM-5.1 一大截,根本原因是总参数 750B/激活 37B 仍小于 1.6T/49B 的对手,且 mid-training 的高级知识数据规模有限——改进方向是向万亿参数迈进(作者已点明下一阶段目标)并规模化研究生级 STEM 数据生成与筛选。其二,agent 工具使用的「窄基准」表现弱:τ3-BANKING 仅 14.2、CLAW-EVAL 80.0 略低于 Qwen3.5/DeepSeek,说明复杂真实 API 工作流仍有短板——可引入更多真实多步工具调用轨迹与失败回放强化。其三,多语言此消彼长:波兰语、越南语在部分 benchmark 退化,新增 4 语训练稀释了原语种——改进方向是按语种做 curriculum 与回放,避免灾难性遗忘。其四,长上下文「检索满分但推理不强」(AA-LCR 56.2)——可加强 multi-hop 长程推理合成数据。其五,升级再造的天花板:被复制块的初始化偏置可能限制上限——可探索更精细的块插入与继续预训练配比。
未来方向
作者明确给出的方向包括:规模化高级知识与推理数据的生成与筛选,找到能把 mid-training 提升更大程度保留到 SFT 之后的数据配方(当前 Mid-Stage 2 叠 SFT 仅在 HLE 上额外 +0.95);持续演进安全评估框架以应对日益复杂的安全风险与攻击模式;以及把模型规模推进到万亿参数及以上,作为「全面挑战全球前沿」的下一阶段。基于成果可延伸的方向有:把 DSpark 的 block-diffusion drafter 思路推广到其他 MoE 主干、研究 acceptance length 在更长草稿块(γ>7)下的衰减规律;把 K-AUT-V2 的「价值专家参与风险发现」治理范式国际化,与多国本地分类法对齐;把 preserved thinking 与长上下文结合,研究跨轮 reasoning 在 256K 上下文下的成本/收益权衡;以及在升级再造框架内研究「按需扩容」(按能力短板定向加专家/加层)而非全局等比扩张。
复现评估
复现评估整体偏友好但仍需重资源。开源情况:模型以 Apache 2.0 许可发布,提供 GitHub(github.com/LG-AI-EXAONE/K-EXAONE-2.0)与 HuggingFace(LGAI-EXAONE/K-EXAONE-2.0-750B-A37B)仓库,权重、MTP 与 DSpark 模块、配置(Table 1 给出层数 78、专家 256/1/8、专家维度 2048、SWA 窗口等)均披露。数据层面,预训练/mid/SFT 的 token 量(8T 持续预训练、mid 两阶段各 400B、SFT 350B)与数据来源(FineWeb2、K-DATA、NIA、韩国语科院、东北亚历史财团、Nemotron-Personas、GitHub PR 等)有交代,但具体数据集与合成 prompt 未全量开源,AR/latent-thought 合成仅给方法。算力层面:推测解码对比在 8×H200(TP8)上完成,SWE/Terminal-Bench 每实例 4–8 核、8–16GB 内存、4 小时超时,但完整预训练所需 GPU 规模、训练时长未明确给出(涉及韩国政府 GPU 计划)。方法细节(升级再造、Clamped SwiGLU、GROUPER、AGAPO、preserved thinking)描述较清楚,可中等难度复现局部(如 Clamped SwiGLU 稳定化、DSpark drafter、K-AUT 风格安全评估流程);但要端到端复现 750B 训练对绝大多数团队不现实,主要价值在于「可用、可部署、可在其上二次开发」。
论文图表
展示 46 位 UNESCO GCED 认证教师顾问的构成:按性别、年龄、学段(小/初/高均匀)、学科(以韩语/英语/历史/社会为主,兼有数学/计算机/艺术/特教)、地区等六维平衡,其中 35 人(76%)教龄 >10 年。
体现「风险发现权交给价值/领域专家」的治理设计,是 K-AUT-V2 安全工作可信度的程序性保障,也是本文区别于一般技术报告的安全工程亮点。
给出一个真实案例:在「多元文化语境下反向歧视叙事再现」这一 Korean Sensitivity 子类,教师建议把证据基础从韩国国内法扩展到国际人权标准(ICCPR、ICERD),并新增「将特定国籍/族裔移民与犯罪或社会冲突关联的偏见叙事」这一判定准则;图展示了 advisory input 与最终 adopted change。
用一个可操作的真实例子说明 K-AUT-V2 的修订并非抽象口号,而是落到「证据基础 + 新判定准则」的具体条文,便于读者理解分类法如何被持续打磨。