NOLLI:面向英韩性能差距诊断的难度校准谜题基准 NOLLI: A Difficulty-Calibrated Puzzle Benchmark for Diagnosing the English-Korean Performance Gap
用过程生成、难度校准的英韩谜题基准,定位韩国语写作系统与文化瓶颈。
前置知识
韩文字母(jamo,初声/中声/终声)
韩文是音节文字,每个音节块按顺序分解为初声(声母)、中声(元音)和可选的终声(韵尾)三类次音节字母。每个音节在 Unicode 中是一个整块,模型要操作单字必须先理解其内部 jamo 结构。本文把 Cipher、Cryptarithmetic 的韩文变体建立在 jamo 索引上。
要读懂'写作系统瓶颈'的诊断,必须分清'把 jamo 当不透明符号'(Cryptarithmetic)与'必须显式拆解、索引运算、重组 jamo'(Cipher)两种不同需求,否则无法理解为什么同一批 jamo 上两类任务出现截然相反的英韩差距。
过程生成基准(procedurally generated benchmark)
与 GSM8K、MATH 这类固定题库不同,过程生成基准用确定性生成器按种子现场产出题目,每题附验证器确保唯一解、用精确匹配打分。优点是可对抗污染、可无限重采样、难度可调参数。本文每题种子可重生、被验证唯一解并附求解器参考轨迹。
本文的难度校准、held-out 重生检验、抗污染主张都建立在'生成器+验证器'范式上;不理解它就无法理解为何难度能脱离固定题目集而存在。
TOST 双单侧等效检验(Two One-Sided Tests)
TOST 是等效性检验:预设容差 $\Delta$,用两个单侧检验证明真实差值绝对值小于 $\Delta$。本文设 $\Delta=\pm 10$pp,对所有非地板模型 Holm 校正后 TOST 全部支持英韩等效(最大 $p=3.1\times 10^{-4}$)。
本文头条结论'展示语言几乎无成本'完全依赖 TOST 而非差异显著性检验;把它与 McNemar 检验配合使用是论文统计设计的精妙之处。
行为难度校准(behavioral difficulty calibration)
传统基准把'更难'等同于'更大'(更大网格、更多变量)。行为校准相反:固定参考模型 Gemini 3 Flash,把档位定义为它必须落到 $75/50/25\pm 10\%$ 的准确率区间,再反调生成器参数直到命中且相邻档隔 $\geq 10$pp,从而把异构任务放到同一行为尺度上。
这是本文区别于既往过程生成基准的核心创新,也是'难度档位可跨模型迁移'(255/300 对)这一结论的源头;没有它就无法理解 Table 3 为何发现'结构大小'不是难度的可靠代理。
研究动机
LLM 在韩国语上的表现通常差于英语,但既有评测把问题压成了一个笼统的'性能差距',无法回答'模型究竟在哪一类能力上失败'。Shi et al., 2023 等多语言评测把语言相关失败合并成单一数字;而 GSM8K、MATH 这类静态题库又面临数据污染与饱和风险(Jacovi et al., 2023)。当某模型在韩文上更差时,研究者无从判断差距是来自'换语言展示同一道题'、还是'韩文书写系统的处理需求'、抑或'韩国文化/正字法独有知识'。更糟的是,多数过程生成基准(DyVal、SATBench)用结构参数定义难度,但'更大=更难'的假设本身未经检验,导致难度刻度与模型真实表现脱节。
本文的目标是本文要构建一个能精确切片、可解释英韩差距的谜题基准:题目必须种子可重生、被验证为唯一解、用确定性精确匹配打分(全程不用 LLM 裁判),从而规避污染与主观评分;必须把'语言展示''书写系统''韩语独有知识'三种性质不同的差距来源分层隔离,使每层比较只暴露一类原因;且难度必须按模型真实行为刻度而非凭结构大小拍脑袋。最终目标是给出一份'诊断而非因果'的差距地图,让社区能定位韩文瓶颈到底卡在次音节执行还是文化词汇。
与已有工作不同的是,既有工作的盲区恰好是本文的切入角度:(1) 同时把难度校准(行为刻度)与三层跨语言设计(直译/书写系统改编/韩语独有)结合在一个基准里——Multilingual Reasoning Gym(Dobler et al., 2026)虽能跨 14 语言生成可验证任务并调难度,但不针对书写系统改编或语言独有任务;(2) IRT(Vania et al., 2021)只能事后估计难度,本文则把校准前置进生成器;(3) 韩文相关基准(KMMLU、CLICK、Son et al., 2025a)多是静态、知识导向或固定难度,缺多步推理与书写系统层面的可控诊断。NOLLI 用'匹配分布的直译'干净估计展示语言效应,再用'故意不翻译等价的书写系统任务'和'韩语独有任务'做诊断性而非因果性对比,这是独特的诊断切片设计。
核心方法
整体直觉是:先把'差距'这个模糊概念拆成三个性质不同的层次,再用一个可调难度的过程生成器把不同任务放到同一把尺子上衡量。NOLLI 共 15 个谜题类型,按语言拆为 25 个任务,三层跨语言谱系(Figure 1)依次为:第一层直译(8 类,如 Sudoku、SAT Puzzle),英韩用同一生成器同一参数、仅作者手写模板不同,故在模板语义等价下准确率差就估计'展示语言'效应;第二层书写系统改编(Cipher、Cryptarithmetic),英文在罗马字母上操作、韩文改编到 jamo 索引上,故意不做翻译等价,用于诊断书写系统需求;第三层韩语独有(Kinship、Saju、Time、Korean Units、Jamo Composition),无英文对应,用'模型自身韩文直译准确率'作基线做组内韩语对比。覆盖约束满足、算法执行、因果/时间推理、组合优化、演绎推断五大推理范式。技术路线是:每个实例由任务生成器产出 → 确定性求解器验证唯一解 → 参考模型行为校准难度档位 → 精确匹配打分。
最核心的创新有两点,都是对'难度=结构大小'和'差距=单一数字'这两个默认假设的颠覆。第一是行为难度校准:作者拒绝把'更难'等同于'更大',而是固定参考模型 Gemini 3 Flash,把 Easy/Medium/Hard 定义为它必须落到 $75/50/25\pm 10\%$ 的准确率区间,再反调生成器参数(如 SAT Puzzle 变量数 $9\to 14$、Cryptarithmetic 操作数长度、Array Formula 行数与干扰列)直到命中区间且相邻档隔 $\geq 10$pp。这把 15 个异构谜题强行放到同一行为尺度,使'难度档位跨模型迁移'成为可检验命题。第二是诊断而非因果的三层切片:只有直译层用匹配分布干净估计展示语言效应;书写系统层和韩语独有层因任务内容或过程需求不同,只做'定位候选瓶颈'的诊断对比,绝不当作可加的因果效应,从设计上避免把'换任务'误读成'换语言'。
方法步骤详情
第一步,为 15 个谜题类型各写过程生成器(回溯法、约束传播、穷举过滤、最优指派/仿真、精确脚本或历法计算等),逐题产出候选。第二步,用确定性求解器验证每题有且仅有唯一解,丢弃多解/无解候选并附求解器参考轨迹;答案格式收窄为整数、固定格式串、坐标列表或变量赋值。第三步,写确定性评测器:抽取声明的最终答案、归一化空白与无序集合与数字格式、规范化结构化输出后做精确匹配,全程无 LLM 裁判。第四步,对每个任务选若干生成器参数当难度旋钮,扫描参数、用参考模型测 $n=100$/档的准确率,调整直到各档命中 $75/50/25\pm 10\%$ 目标区间且相邻档隔 $\geq 10$pp;直译任务只在英文侧校准再把配置镜像到韩文以保参数等价,书写系统改编则英韩独立校准。第五步,在 7,500 道题(25 任务$\times$3 档$\times$100)上评测 15 个模型。
技术新颖性
新颖性体现在四个相互支撑的设计上。(1) 行为校准前置进生成器:相比事后用 IRT 估计难度,本文在生成阶段就用参考模型把异构任务校到同一行为尺度,并用 Table 3 系统性证明'结构大小'在 15 个类型中有 7 个不能随 Easy$\to$Hard 单调增长,反驳行业默认假设。(2) 三层跨语言切片把'展示语言''书写系统''韩语独有'在生成器层面解耦,而非靠事后统计控制。(3) Cipher 与 Cryptarithmetic 的对照设计:两者操作同一批 jamo,但 Cryptarithmetic 把 jamo 当不透明符号、Cipher 要求显式拆解-索引运算-重组,从而把'次音节表征'与'多步次音节执行'分离——这是定位瓶颈的关键对照。(4) 精确匹配+确定性验证+全程无 LLM 裁判,保证了 $\pm 10$pp 等效检验这类精细统计推断的可信度。相比 Multilingual Reasoning Gym,本文明确针对书写系统改编和语言独有任务;相比静态多语言评测,本文可重生、抗污染且难度可控。
实验结果
三大发现。其一,展示语言几乎无成本:直译 8 类上 12 个非地板模型英韩差 $\Delta$ 落在 $-2.7\sim +5.0$pp,Holm 校正 TOST 在 $\pm 10$pp 下全部等效(最大 $p=3.1\times 10^{-4}$),配对 TOST 同样等效。其二,书写系统密集任务差距剧烈:韩文 Cipher 上非前沿模型至少损失 21pp,DeepSeek-V4-Flash 从 74.3% 跌到 5.7%($\Delta=+68.7$pp),仅 GPT-5.5 闭合(+1.7pp),而同 jamo 的 Cryptarithmetic 无系统性惩罚。Jamo Composition 预测韩文 Cipher 的 $R^2=0.91$,指向多步次音节执行瓶颈。其三,韩语独有任务分裂:规则应用类缺陷方向可变(GPT-5.5 反成盈余 $-11.6$pp),而 Kinship 文化词典缺陷在 12 个模型恒为正、与整体能力不相关($r=0.16$、$p=.62$)。难度档位 300 对中 255 对(85%)保持 Easy>Medium>Hard 迁移。
查看结构化数据
| 任务 | 指标 | 本文 | 基线 | 提升 |
|---|---|---|---|---|
| 展示语言(直译任务)英韩差距 | 准确率差 $\Delta=\mathrm{EN}-\mathrm{KO}$(pp)与 Holm 校正 TOST $p$ 值 | 12 个非地板模型 $\Delta$ 在 $-2.7\sim +5.0$pp;TOST 在 $\pm 10$pp 下全部等效,最大 $p=3.1\times 10^{-4}$;配对 TOST 最大 $p=2.5\times 10^{-3}$ | $\pm 10$pp 的难度校准容差边界 | 展示语言效应小于基准分辨率,可视为可忽略——这是诊断韩文差距的前提 |
| 韩文书写系统 Cipher(多步次音节执行) | 准确率差 $\Delta$(pp) | DeepSeek-V4-Flash 74.3% EN vs 5.7% KO,$\Delta=+68.7$pp;非前沿模型至少损失 21pp,仅 GPT-5.5 闭合(+1.7pp) | 同 jamo 的 Cryptarithmetic 无系统性惩罚(6/12 模型 KO 更高) | 把写作系统瓶颈精确定位到'多步次音节执行'而非 tokenization 本身 |
| Jamo Composition 预测韩文 Cipher 准确率 | 线性回归 $R^2$ 与偏相关 $r$ | $R^2=0.91$,$n=12$;控制 Direct-KO 后偏相关 $r=0.87$、$p<.01$;误差分析相似度 $r=0.75$、$p<.01$ | 无(诊断性相关,非因果) | 次音节能力决定 Cipher 成败与失败模式,机制一致但非因果 |
| 整体 25 任务宏观准确率 | Exact-match % | GPT-5.5 84.9% > Opus 4.8 78.3% > Gemini 3.1 73.6%;Qwen3.5-397B 62.5%(最强开源) | 韩系最强 EXAONE-4.0 25.1%、Solar-100B 14.1%,弱于同规模 Qwen3.5-27B 44.4% | 建立前沿/开源/韩系三档清晰梯队,并暴露韩系模型差距 |
| Kinship 文化词典缺陷 | Direct-KO 减 Kinship 准确率(pp) | 12 个非地板模型恒为正,从 Gemini 3.1 $+4.7$pp 到 GPT-5.5 $+36.7$pp;与整体能力不相关 $r=0.16$、$p=.62$ | 随机基线 3.8%(26 候选词);规则应用类缺陷方向可变作对照 | 证明文化词典缺陷不随能力提升而闭合,前沿组内甚至反向 |
| 难度档位跨模型迁移性 | Easy$\to$Medium$\to$Hard 递减的模型-任务对占比 | 12 个非地板模型 300 对中 255 对递减(85%),含并列 94% | 校准锚定单一参考模型(Gemini 3 Flash) | 单模型校准出的难度结构对其他模型仍成立 |
局限与改进
作者承认四点限制。其一,校准与重生只锚定单一参考模型 Gemini 3 Flash 一种配置,绝对档位对别的模型未必成立;held-out 重生检验只覆盖 6 类/8 任务/24 格,4 格脱靶最多 7pp,全套稳定性未验证。其二,次音节机制只是相关而非因果:Jamo Composition–Cipher 关系只覆盖 12 个模型且两者都操作 jamo,没设英文字符级对照,无法把'韩语独有瓶颈'和'通用次词弱点'分开。其三,韩语独有任务是任务混淆的——与 Direct-KO 基线在任务族、答案空间、上下文长度、过程需求上都不同,缺陷仅诊断性;Kinship 是唯一文化词典任务,难推广。其四,结论仅限一种语言对、精确匹配、无部分分,等效只是相对 $\pm 10$pp。我的观察:15 个模型中 3 个处于 3% 地板以下(Llama-3.1-8B、EXAONE-3.5、Mi:dm-2.0)几乎无诊断信号;对长数值答案精确匹配会放大差距。
独立分析的弱点
第一,单参考模型校准带来的脆弱性:若换 GPT-5.5 或弱很多的模型当锚点,$75/50/25$ 档位会落在完全不同的参数上,Table 3 的'结构大小不是难度代理'结论也可能随之改变。改进方向是用多参考模型的 IRT 或聚合校准,并报告档位稳定性对锚点的敏感度。第二,次音节诊断无法排除通用次词弱点:Cipher/Cryptarithmetic/Jamo Composition 都在 jamo 上,没有英文字母级 Cipher 对照(如要求对单字符做索引运算),无法把'韩语独有'与'通用次词执行'分离。改进方向是增设英文等价的多步字符操作任务做控制组。第三,韩语独有任务的任务混淆:Kinship 文化词典结论仅凭一个任务,规则应用类也只有三个任务。改进方向是扩充文化词典任务(饮食、礼节、地名等)和规则应用任务家族,并匹配 Direct-KO 的答案空间与上下文长度。第四,仅精确匹配且无部分分可能高估差距,尤其对长数值答案;可加入部分分或步骤级评分。第五,未报告计算成本/通过率曲线,社区难以判断各模型在 32k token 预算下是否因截断而失败。
未来方向
作者明确提出的延伸包括:扩大 held-out 重生检验到全套 25 任务以验证稳定性、为次音节机制补充每个模型的 jamo 合并行为测量与英文字符级对照、扩充文化词典任务家族以超越单一 Kinship 的局限。基于成果可进一步延伸:(1) 把行为校准协议推广到更多语言对(如英-日、英-中),检验'展示语言无成本'是否普适;(2) 引入过程级诊断——记录模型 Chain-of-Thought 中 jamo 拆解/重组步骤的中间状态,直接验证'多步执行'机制;(3) 用 Jamo Composition 作为轻量探针,反向诊断与改进韩文 Cipher(如训练阶段注入 jamo 级数据增强);(4) 把难度四机制(规模/约束/干扰/算法深度)建成可预测模型失败的可解释特征;(5) 探索难度档位迁移为何对部分任务失效(如 Qwen3.5-397B 的 Cryptarithmetic 韩文 Hard 反而比 Medium 高),把失效案例变成新发现。
复现评估
复现性是本文强项。基准以生成器、实例、评测器三件套开源(GitHub+HuggingFace),所有 7,500 题种子可重生、验证为唯一解、附求解器参考轨迹;打分全程确定性精确匹配、无 LLM 裁判。校准细节(Table 4 每档参数、Table 5 的 75 格参考准确率)与重生检验(Table 6,每格 $n=50$ 新种子)均公开。15 个模型推理配置逐个列出(Table 8:后端、温度、最大 token、推理开关),专有模型走原生 API、开源用 vLLM/OpenRouter,预算 32,768 token(两个 32k 上下文模型降到 14,336)。主要难点是算力与 API 成本:评测含 397B/400B MoE 的 15 个模型在 7,500 题、最大 32k 输出上开销可观;OpenRouter 接入的模型推理强度不可控,复现绝对数值需严格匹配表中设置。校准只需重跑 Gemini 3 Flash,成本低,是好的入门复现路径。
论文图表
用 Sudoku、Cipher、Kinship 三个代表性类型展示三层跨语言谱系:第一层直译(英韩同生成器同参数,Sudoku 规则一致)、第二层书写系统改编(Cipher 英文在罗马字母上、韩文在 jamo 上,刻意不翻译等价)、第三层韩语独有(Kinship 把四步关系链合成一个无英文等价词的韩语称谓如 외종조모)。每层右侧标注它增加的诊断维度:展示语言 $\to$ +书写系统 $\to$ +韩语独有知识。
这张图是理解整篇论文诊断框架的钥匙:三层切片对应后面所有差距分析的三个结论,没有它就无法理解为何直译层可估因果、后两层只做诊断。