← 返回 2026-08-06

K-EXAONE 2.0 技术报告:迈向全球前沿规模的基础模型 K-EXAONE 2.0 Technical Report

Eunbi Choi, Kibong Choi, Sehyun Chun, Seokhee Hong, Junwon Hwang, Hyojin Jeon, Ahra Jo, Hyunjik Jo, Yeonsik Jo, Minhyeok Jung, Doyoung Kim, Heegyu Kim, Joonkee Kim, Seonghwan Kim, Soyeon Kim, Sunkyoung Kim, Yireun Kim, Yongil Kim, Byungoh Ko, Changhun Lee, Dohaeng Lee, Haeju Lee, Jinsik Lee, Kyungmin Lee, Minwoo Lee, Wonkee Lee, Sangha Park, Sungjune Park, Kwangrok Ryoo, Kijung Seo, Minju Seo, Yongwoo Song, Sejong Yang, Heuiyeen Yeen, Stanley Jungkyu Choi, Yemuk Choi, Yongchan Chun, Jiwon Ham, Dasol Hong, Sujeong Im, Kijeong Jeon, Gerrard Jeongwon Jo, Hyeongjun Jo, Yujin Jo, Jiyeon Jung, Naeun Kang, Daeseong Kim, Euisoon Kim, Hayeon Kim, Hyosang Kim, Myoungshin Kim, Unsol Kim, Youchul Kim, Chaeeun Lee, ChaeYoon Lee, Edward Hwayoung Lee, Honglak Lee, Hwansoo Lee, Minkyung Lee, Sangeun Lee, Solji Lim, Woohyung Lim, Chanwoo Moon, Jueun Mun, Jimin Park, Seojeong Park, Yongmin Park, Hyerin Seo, Donghyeon Shin, Donghyun Son, Eunyong Son, Kaehyun Um, Sihoon Yang, Chang En Yea, Sihyuk Yi, Kyungjae Yoo, Chansik Yoon 📅 2026-08-05 👍 22 2026-08-11 18:30
MoE混合专家 大语言模型 技术报告 推测解码 模型升级再造 长上下文 韩语AI

LG 升级再造 K-EXAONE,构建 750B 总参/37B 激活的 MoE 多语言基础模型。

前置知识

Mixture-of-Experts (MoE) 混合专家

一种稀疏激活的神经网络结构:每个 token 只激活全部专家中的一小部分(如本文从 256 个专家里选 top-8 路由专家 + 1 个共享专家),从而在保持总参数量巨大的同时把单 token 的计算量(激活参数)压得很低。路由通常用 sigmoid 或 softmax 打分,并配合负载均衡损失防止少数专家被塞爆。

K-EXAONE 2.0 的核心架构就是 fine-grained sparse MoE,不理解 MoE 就无法理解它为何能做到 750B 总参数却只有 37B 激活,也无法理解升级再造(upcycling)时为何要按专家维度扩容。

Speculative Decoding 推测解码

一种推理加速技术:用一个轻量级的「草稿模型/drafter」一次性预测多个候选 token,再用大模型(target)并行验证,被接受的草稿 token 直接采纳,被拒的则回退重算。self-speculative 指草稿头与 target 共享同一套权重。本文的 MTP 头和 DSpark 都属于 self-speculative drafting。

理解推测解码才能看懂本文两条加速路径(MTP 与 DSpark)的 acceptance length 和 end-to-end speedup 指标,以及 DSpark 为何用 block-diffusion 一次生成整块草稿。

Model Upcycling 模型升级再造(深度/宽度上扩)

不从头训练,而是把已训练好的模型沿「深度」(增加层数)或「宽度」(增加专家/通道)扩容后继续预训练,以节省算力。本文把 K-EXAONE 从 48 层/128 专家扩到 78 层/256 专家,深度上按 LLLG 块(3 层滑窗 + 1 层全局注意力)复制中间块,宽度上复制专家并加随机旋转噪声打破对称性。

升级再造是本文区别于「从头训练」的根本方法论,也是论文宣称保留前代投入、用 3.2× 参数量继续前进的核心论据。

Sliding Window Attention & Hybrid Attention 滑窗与混合注意力

滑窗注意力(SWA)让每层只关注局部窗口(本文窗口 128,第二层用 4096)内的 token,把注意力复杂度从 O(n²) 降到 O(n·w);混合注意力把 SWA 层与少量全局注意力(GA)层交错(本文 LLLG 模式),兼顾局部建模效率与长程信息传递,配合 RoPE、QK Norm 稳定训练。

K-EXAONE 2.0 支持 256K 上下文,靠的就是 78 层里 58 层 SWA + 20 层 GA 的混合结构;不理解这一点就看不懂它如何在超长上下文下保持效率。

Multi-Token Prediction (MTP) 多 token 预测

在主干模型之上接一个额外的小模块,训练时要求它基于当前隐藏状态同时预测未来多个 token,从而学到更好的未来 token 表示;推理时该模块可作为 self-speculative decoding 的草稿头。本文 MTP 头在 RL 阶段前用端到端 total-variation loss 精调,直接优化多步接受率而非交叉熵代理。

MTP 是本文两条推理加速路径之一,与 DSpark 对比时接受长度和加速比是关键实验数据。

SwiGLU 与 Clamped SwiGLU

SwiGLU 是 GLU 类前馈模块:output = silu(gate(x)) ⊙ up(x) 的形式,其中 silu 为 SiLU 激活。当 gate 与 up 投影对齐时,输出幅值会爆炸性增长,破坏低精度训练/推理。Clamped SwiGLU 在两支路合并前对 gate 支路上界、对 linear 支路双侧同时夹紧到阈值 τ(本文 τ=7.0),把激活上限压到 $\mathrm{silu}(\tau)\cdot\tau=48.96$,但不触碰路由决策。

这是本文解决升级再造后深层专家激活爆炸、保证 FP8 训练与推理稳定性的关键技术,图 3 显示未夹紧时峰值达 6862,夹紧后约 140× 压缩。

研究动机

当前大模型进入全球白热化竞争,专有模型定义了前沿,开源权重模型则通过规模、数据与方法不断缩小差距,部分 MoE 模型已进入数百亿乃至万亿参数级别。然而对希望建立可持续 AI 能力的国家而言,仅能「访问」前沿模型远远不够,真正关键的是在本国语言、文化与制度语境下自主构建、运营、评估并持续改进模型的能力。K-EXAONE 作为韩国政府战略计划下 LG AI Research 推出的第一代 MoE 基座(236B 总参/23B 激活、256K 上下文、6 语言),虽证明国内可造出有全球竞争力的模型,但在实际部署场景中仍有明显短板——尤其在 agentic coding、长上下文理解等方向「留下了相当大的提升空间」,且与 DeepSeek V4 Pro(1.6T)、GLM-5.1(754B)等更大的前沿模型存在能力差距。

本文的目标是K-EXAONE 2.0 围绕一个单一目标展开:把模型推向前沿规模,并让增加的容量真实转化为「实际部署条件下可靠的能力」,同时继承前代积累的参数与训练经验。具体而言,作者希望在不丢弃 K-EXAONE 已学到的知识与算力投入的前提下,把总参数提升到 750B、激活参数到约 37B(3.2× 于前代),把上下文长度维持在 256K,把多语言覆盖从 6 种扩展到 10 种(新增法语、意大利语、波兰语、葡萄牙语),并通过持续预训练、聚焦难度的 mid-training 与后训练,强化推理、agentic coding、多语言与植根韩国社会文化的安全性,使规模本身成为「可被高效运行、广泛使用、可靠部署」的能力基础,而非自吹自擂的数字。

与已有工作不同的是,本文的独特切入角度有三点。第一,方法论上不走「从头训练」的常规路线,而是 upcycling(升级再造):沿深度(48→78 层,按 LLLG 块复制中间块)和宽度(128→256 专家,复制专家+路由行并加范数保持的随机旋转噪声)扩容已有模型,再恢复大规模持续预训练,从而把前代投入视为可继承资产而非沉没成本。第二,工程上同时引入 Clamped SwiGLU(深层 τ=7.0 夹紧)解决扩容后激活爆炸,以及 MTP + DSpark 双 self-speculative 推测解码路径,让 750B 规模在推理时可用。第三,安全思路上提出「主权模型必须自己定义风险」——通过 K-AUT-V2 分类法(风险领域从 226 扩到 296,新增 70 项)和由 46 位 UNESCO GCED 认证教师组成的 Safety Teacher Advisory Council,把风险发现的视角从技术专家扩展到价值与领域专家,植根韩国历史地缘语境。

核心方法

整体思路是「先扩容、再愈合、再续训、再对齐」。直觉上,与其把一个训练好的千亿模型当作废纸重练,不如把它像乐高一样在深度和宽度上拆开加层、再加专家,然后用一部分后段训练数据「愈合」扩容带来的扰动,最后喂入 8T token 的新预训练混合。技术路线上:先对 K-EXAONE 做 depth up-scaling(按 LLLG 块从 12 块扩到 19 块,前面 2 层 dense)和 width up-scaling(专家 128→256,top-8 路由 + 1 共享专家保持不变),引入 Clamped SwiGLU 稳定深层;随后 mid-training 分两阶段把上下文从 8K 逐步拉到 64K 再到 256K,每阶段各喂 400B token,强调长上下文、高级推理与 agentic 工作流;最后 post-training 用 SFT(350B token,冻结路由器)+ 两阶段偏好学习(multi-task 与 safety-aware,均用 GROUPER 目标)完成对齐,并贯穿扩展多语言与 K-AUT-V2 安全训练。

核心创新点与已有方法的本质区别体现在三处。一是「升级再造 + Clamped SwiGLU」的组合:不同于简单 repeated stacking 或 identity init,作者按 LLLG 块复制中间段块(实验证明比复制首尾更好),并在最后 16 层(62–77 层)对专家施加 τ=7.0 的双向夹紧,把 SwiGLU 峰值激活从 6862 压到 48.96(约 140×),既保住了低精度训练又保住了低精度推理。二是「双 self-speculative 路径共享同一 target 权重」:MTP 头从预训练起与主干联合训练、RL 前用 total-variation loss 端到端精调;DSpark 草稿器(5 层、block size γ=7)在最终权重锁定后训练,用 block-diffusion 主干一次前向生成整块草稿、再用轻量 sequential 模块从左到右修正块内依赖——同一份 target 权重可二选一挂载。三是把安全性做成「主权定义」:K-AUT-V2 与教师顾问理事会把风险发现从技术红队扩展到价值/领域专家。

方法步骤详情

完整步骤如下。(1)架构扩容:depth up-scaling 把 48 层扩成 78 层(2 dense + 76 MoE,其中后 16 层用 Clamped SwiGLU),按 LLLG 模式(3 SWA + 1 GA,SWA 窗口除第二层 4096 外均为 128)从 12 块扩到 19 块;width up-scaling 把每层专家从 128 复制到 256(每专家连同其 router 行一起复制),对复制出的专家加范数保持的随机旋转噪声打破对称性。(2)愈合 + 持续预训练:先用一部分 K-EXAONE 后段训练数据做 healing 稳定扩容扰动,再喂入 8T token 的 K-EXAONE 2.0 预训练混合,其中用 Active Reading(AR)合成知识数据(伪 AR 复用有效 prompt 降本)、thinking-augmented + latent-thought 合成数据降低 loss。(3)mid-training 两阶段:Mid-Stage 1 在 64K 上下文训 400B token,Mid-Stage 2 在 >64K 上下文再训 400B token,逐步引入长上下文语料、研究生级 STEM 知识与 agent 工作流轨迹(GitHub PR 含 diff/review/相关文件/commit 历史),统一 XML 风格工具调用。(4)SFT:350B token 覆盖推理/世界知识/指令遵循/agentic,冻结路由器,联合训练 thinking 与 non-thinking 模式,agent 场景保留跨轮 reasoning block(preserved thinking)。(5)偏好学习:先 multi-task(数学/代码/知识/agent/chat,用可验证信号与 LLM-as-judge 选 chosen/rejected),再 safety-aware(按 K-AUT-V2,每 prompt 采样 4 候选用领域 reward 打分构造 GROUPER 组)。(6)推理部署:挂载 MTP 或 DSpark 实现推测解码。

技术新颖性

技术新颖性体现在工程与安全两条线。工程上,Clamped SwiGLU 的具体构造(gate 支路上界、linear 支路双侧夹紧,阈值 7.0,不触碰路由)与 gpt-oss、DeepSeek-V4 同源但被明确用于「升级再造后深层专家」的稳定化,图 3 给出 140× 峰值压缩的干净证据;DSpark 草稿器把 block-diffusion 主干 + 轻量 sequential 修正 + 从 target 多层注入 KV 的思路做成一个比 MTP 更强的生产级 drafter(acceptance length 提升 32–66%,端到端加速从 1.27–1.77× 提到 1.81–2.57×)。升级再造里「按 LLLG 块复制中间段」与「复制专家加随机旋转噪声」也是相对具体的可复现配方。安全线上,K-AUT-V2(226→296 风险项)与 46 人教师理事会(按性别/年龄/学段/学科/地区六维平衡,76% 教龄>10 年)构成「把风险发现权交给价值专家」的治理创新,并把分歧当信号而非噪声,属于技术报告中少见的、可被借鉴的安全工程范式。

An illustration of K-EXAONE 2.0 model architecture.
Figure 2: An illustration of K-EXAONE 2.0 model architecture.
Peak SwiGLU activation over all routed experts, with and without the clamp (τ = 7.0, shaded layers 62–77).
Figure 3: Peak SwiGLU activation over all routed experts, with and without the clamp (τ = 7.0, shaded layers 62–77).
Illustration of preserved thinking.
Figure 6: Illustration of preserved thinking.

实验结果

核心发现可分五块,均来自 24 个 benchmark、9 大类评估(REASONING 模式)。世界知识:MMLU-PRO 83.5、GPQA-DIAMOND 82.2(较 K-EXAONE +3.1)、HLE(纯文本子集)18.3(+4.7),但与 DeepSeek V4 Pro(HLE 37.7)、GLM-5.1(31.0)差距明显。数学:AIME 2026 92.3、HMMT FEB 2026 78.4(实际略低于前代 80.7)、IMO-ANSWERBENCH 78.6(+2.3),整体与 Qwen3.5(91.3/84.6/80.9)和更大模型有差距。编码/Agentic 是最大亮点:SCICODE 40.1、SWE-BENCH VERIFIED 68.2(+18.8)、TERMINAL-BENCH 2.1 43.8(+13.5),三类合计约 30% 相对提升。指令遵循:IFEVAL 92.4(+2.7)、IFBENCH 72.6(+5.3)。长上下文是另一大跃迁:OPENAI-MRCR 从 52.3 飙到 94.4(+42.1,碾压 GLM-5.1 的 71.5),AA-LCR 56.2、KO-LONGBENCH 89.6;NIAH 在 256K 全范围满分。韩语:KMMLU-PRO 69.1、CLICK 84.2、HRM8K-KSM 91.1。多语言:POLYMATH 71.3(+13.9),MMMLU/GLOBALMMLU-LITE 均 86.6。安全是最强项:KGC-SAFETY 99.8(前代 96.1,且 GLM-5.1 仅 69.3)、ROK-FORTRESS 89.5(前代 60.9,DeepSeek V4 Pro 仅 47.6)。消融方面:AR 合成数据在 ARC-C 上 +1.54(优于 textbook-style 的 -0.42);mid-training 中 Mid-Stage 2 在 HLE 上比 Mid-Stage 1 多 +4.71,叠加 SFT 后达 +5.66;DSpark vs MTP 接受长度提升 32–66%。结论:相对前代平均提升超 10%,最大跃升在 agentic coding 与长上下文,相对同类开源权重模型最清晰的优势在长上下文检索与安全。

Model configurations of K-EXAONE 2.0 and K-EXAONE.
Table 1: Model configurations of K-EXAONE 2.0 and K-EXAONE.
Acceptance length and end-to-end speedup over non-speculative decoding (γ=7, TP8, 8×H200).
Table 2: Acceptance length and end-to-end speedup over non-speculative decoding (γ=7, TP8, 8×H200).
Absolute score changes vs initial checkpoint: Baseline / Active Reading / Textbook-style.
Table 3: Absolute score changes vs initial checkpoint: Baseline / Active Reading / Textbook-style.
Performance on Korean benchmarks across data sources.
Table 4: Performance on Korean benchmarks across data sources.
Absolute HLE score improvements from different training paths (small-scale model).
Table 5: Absolute HLE score improvements from different training paths (small-scale model).
The main evaluation results of K-EXAONE 2.0 REASONING mode.
Table 6: The main evaluation results of K-EXAONE 2.0 REASONING mode.
Revision of K-AUT through newly discovered risks.
Table 10: Revision of K-AUT through newly discovered risks.
Safety performance comparison on KGC-SAFETY.
Table 11: Safety performance comparison on KGC-SAFETY.
The main evaluation results of K-EXAONE 2.0.
Figure 1: The main evaluation results of K-EXAONE 2.0.
Pre-training loss on the Korean subset versus training compute (6·N_active·D, FLOPs, log scale).
Figure 4: Pre-training loss on the Korean subset versus training compute (6·N_active·D, FLOPs, log scale).
Needle-in-a-Haystack (NIAH) retrieval accuracy across context lengths up to 256K tokens.
Figure 5: Needle-in-a-Haystack (NIAH) retrieval accuracy across context lengths up to 256K tokens.
查看结构化数据
任务指标本文基线提升
SWE-BENCH VERIFIED(仓库级软件工程) 解决率(%) 68.2 K-EXAONE 49.4 +18.9 分(相对约 +38%)
TERMINAL-BENCH 2.1(终端长程 agent) 解决率(%) 43.8 K-EXAONE 30.3 +13.5 分(相对约 +45%)
OPENAI-MRCR(长上下文多针检索,≤128K) difflib 相似度宏平均 94.4 K-EXAONE 52.3 +42.1 分;同时高于 Qwen3.5 93.0、GLM-5.1 71.5
ROK-FORTRESS(安全/抗越狱) Final Score = 100 − 均值TRS 89.5 K-EXAONE 60.9 +28.6 分;DeepSeek V4 Pro 仅 47.6、GLM-5.1 73.2
KGC-SAFETY(韩语社会文化安全) Safe Rate(%) 99.8 K-EXAONE 96.1 +3.7 分;GLM-5.1 仅 69.3
POLYMATH(多语言数学) 准确率(%) 71.3 K-EXAONE 57.4 +13.9 分
GPQA-DIAMOND(研究生级科学问答) 准确率(%) 82.2 K-EXAONE 79.1 +3.1 分
HUMANITY'S LAST EXAM(纯文本子集) 准确率(%) 18.3 K-EXAONE 13.6 +4.7 分(但仍落后 DeepSeek V4 Pro 37.7)
推测解码端到端加速(DSpark vs MTP,γ=7) E2E speedup × DSpark 1.81–2.57× MTP 1.27–1.77× 接受长度提升 32–66%

局限与改进

作者承认的局限偏笼统:模型仍可能产出含个人、有害或偏见信息的不当回答;输出依赖训练数据统计,可能出现语义/语法错误;模型不反映最新信息,回答可能失真或自相矛盾;并明确声明生成内容不代表 LG AI Research 立场。从评估数据可观察到更具体的局限:在纯知识深度(HLE 18.3 vs DeepSeek V4 Pro 37.7)、数学竞赛(HMMT FEB 2026 78.4 略低于前代 80.7,IMO-ANSWERBENCH 78.6 落后 DeepSeek 89.8)、韩语专业知识(KMMLU-PRO 69.1 vs DeepSeek 80.5)等方向与更大或更前沿的开源权重模型仍有明显差距;τ3-BANKING 仅 14.2,与前代持平且未明显领先 Qwen3.5;多语言里波兰语(PL)在 GLOBALMMLU-LITE 上反而从 86.3 降到 84.5,越南语(VI)从 84.8 降到 83.0,说明新增语言训练存在此消彼长。此外,长上下文标杆 AA-LCR 56.2 仍落后 Qwen3.5 的 65.7,长上下文「检索」强但「推理」未必全面领先。作者也指出红队主要覆盖「已知风险」,对「无人设想过的风险」能力有限。

独立分析的弱点

独立分析的弱点与改进方向如下。其一,绝对前沿能力不足:HLE、数学竞赛、KMMLU-PRO 等纯硬指标落后 DeepSeek V4 Pro / GLM-5.1 一大截,根本原因是总参数 750B/激活 37B 仍小于 1.6T/49B 的对手,且 mid-training 的高级知识数据规模有限——改进方向是向万亿参数迈进(作者已点明下一阶段目标)并规模化研究生级 STEM 数据生成与筛选。其二,agent 工具使用的「窄基准」表现弱:τ3-BANKING 仅 14.2、CLAW-EVAL 80.0 略低于 Qwen3.5/DeepSeek,说明复杂真实 API 工作流仍有短板——可引入更多真实多步工具调用轨迹与失败回放强化。其三,多语言此消彼长:波兰语、越南语在部分 benchmark 退化,新增 4 语训练稀释了原语种——改进方向是按语种做 curriculum 与回放,避免灾难性遗忘。其四,长上下文「检索满分但推理不强」(AA-LCR 56.2)——可加强 multi-hop 长程推理合成数据。其五,升级再造的天花板:被复制块的初始化偏置可能限制上限——可探索更精细的块插入与继续预训练配比。

未来方向

作者明确给出的方向包括:规模化高级知识与推理数据的生成与筛选,找到能把 mid-training 提升更大程度保留到 SFT 之后的数据配方(当前 Mid-Stage 2 叠 SFT 仅在 HLE 上额外 +0.95);持续演进安全评估框架以应对日益复杂的安全风险与攻击模式;以及把模型规模推进到万亿参数及以上,作为「全面挑战全球前沿」的下一阶段。基于成果可延伸的方向有:把 DSpark 的 block-diffusion drafter 思路推广到其他 MoE 主干、研究 acceptance length 在更长草稿块(γ>7)下的衰减规律;把 K-AUT-V2 的「价值专家参与风险发现」治理范式国际化,与多国本地分类法对齐;把 preserved thinking 与长上下文结合,研究跨轮 reasoning 在 256K 上下文下的成本/收益权衡;以及在升级再造框架内研究「按需扩容」(按能力短板定向加专家/加层)而非全局等比扩张。

复现评估

复现评估整体偏友好但仍需重资源。开源情况:模型以 Apache 2.0 许可发布,提供 GitHub(github.com/LG-AI-EXAONE/K-EXAONE-2.0)与 HuggingFace(LGAI-EXAONE/K-EXAONE-2.0-750B-A37B)仓库,权重、MTP 与 DSpark 模块、配置(Table 1 给出层数 78、专家 256/1/8、专家维度 2048、SWA 窗口等)均披露。数据层面,预训练/mid/SFT 的 token 量(8T 持续预训练、mid 两阶段各 400B、SFT 350B)与数据来源(FineWeb2、K-DATA、NIA、韩国语科院、东北亚历史财团、Nemotron-Personas、GitHub PR 等)有交代,但具体数据集与合成 prompt 未全量开源,AR/latent-thought 合成仅给方法。算力层面:推测解码对比在 8×H200(TP8)上完成,SWE/Terminal-Bench 每实例 4–8 核、8–16GB 内存、4 小时超时,但完整预训练所需 GPU 规模、训练时长未明确给出(涉及韩国政府 GPU 计划)。方法细节(升级再造、Clamped SwiGLU、GROUPER、AGAPO、preserved thinking)描述较清楚,可中等难度复现局部(如 Clamped SwiGLU 稳定化、DSpark drafter、K-AUT 风格安全评估流程);但要端到端复现 750B 训练对绝大多数团队不现实,主要价值在于「可用、可部署、可在其上二次开发」。