← 返回 2026-07-24

K12-KGraph:用于评测与训练教育大模型的课程对齐知识图谱 K12-KGraph: A Curriculum-Aligned Knowledge Graph for Benchmarking and Training Educational LLMs

Hao Liang, Qihan Lin, Zhaoyang Han, Xiaochen Ma, Zhen Hao Wong, Meiyi Qiang, Linzhuang Sun, Wentao Zhang 📅 2026-07-23 👍 60 2026-07-29 18:30
K12教育 基准测试 多模态 指令微调数据 教育大模型 监督微调 知识图谱 课程认知

从人教版教材抽取课程知识图谱,统一支撑教育大模型的评测与微调。

前置知识

知识图谱 (Knowledge Graph, KG)

知识图谱是一种以图结构组织信息的表示方式,节点代表实体(如概念、技能、实验),有向边代表实体间的关系(如「是…的子类」「是…的前置」「验证」「出现于」)。本文构建的是异构属性图(heterogeneous property graph),即节点和边都有多种类型,且每个节点携带若干属性字段(如概念节点的 definition、formula、examples)。

本文所有产出——K12-KGraph、K12-Bench、K12-Train——都建立在知识图谱之上,理解图的节点/边类型、拓扑遍历(如 2-hop 邻域、前置闭包)是读懂方法论与基准构建的基础。

课程认知 (Curriculum Cognition)

作者提出的核心概念,指对「知识如何被组织与呈现」的结构化理解,而非孤立事实记忆。包括:哪些主题必须先学(前置链)、概念的层级分类(taxonomy)、实验与概念的验证关系、知识点在教材中的物理位置、以及教材插图如何图解概念。一个合格的 7 年级数学老师不仅知道「一元一次方程」是一个主题,还知道它以算术运算为前置、与「不等式」同属「代数式」章节、首次出现于人教版某册第 3 章。

这是全文的问题定义与评测目标。论文的核心论点是:现有基准只测「能不能答题」(事实回忆),而真正的教育 AI 还需要课程认知,这正是当前 LLM 的瓶颈。

多选题基准与 EM/F1 指标

K12-Bench 采用多选(multi-select)格式:每题给出 4 个选项,正确答案个数为 1-3 个。精确匹配(Exact Match, EM)要求预测的标签集合与黄金集合完全一致(每实例 0/1);实例级 macro-F1 则对每个样本单独计算标签集合的 precision/recall/F1 再取平均(对应多标签分类中 average='samples' 约定),使每个问题贡献均等。随机基线 EM 为 6.7%、F1 为 36.4%。

理解 EM 与 F1 的定义是解读 Table 3 关键发现(如 Gemini-3-Flash 仅 57.1% EM、LLaMA-3-8B 与随机猜测无差异)的前提,也解释了为何 Prereq/Neighbor 任务尤其困难。

监督微调 (SFT) 与 LoRA

监督微调指在「指令-回答」对上训练基座模型以注入能力。文本实验用全参数 SFT(更新所有权重),学习率 $\eta = 5 \times 10^{-6}$,余弦衰减、10% warmup、3 个 epoch、bf16 精度、DeepSpeed ZeRO-3。多模态实验用 LoRA(Low-Rank Adaptation),仅在注意力等模块注入低秩矩阵(rank 8、alpha 16、dropout 0.05),学习率 $1 \times 10^{-4}$,大幅降低显存与计算开销。

论文通过严格匹配 2,300 样本的 SFT 预算对比 K12-Train 与 8 个通用指令数据集,并对比 7,335 样本与 10,000–142,759 样本的基线;理解 SFT 协议才能判断「样本高效性」这一核心结论的可信度。

有向无环图 (DAG) 与拓扑验证

is_a(分类)与 prerequisites_for(前置)关系天然构成偏序,应为有向无环图,否则会出现「A 是 B 的前置,B 又是 A 的前置」这类课程逻辑矛盾。作者在合并后对这两个子图做深度优先环检测(DFS cycle detection),对发现的环由学科标注员人工裁定(删除/修改/保留),从而保证分类与前置关系的课程学正确性。

DAG 验证是 K12-KGraph 质量保证的关键一步,也是 Prereq 任务能从图中确定性地导出「前置闭包」「直接后继」答案的前提,直接影响 K12-Bench 的正确性。

视觉语言模型 (Vision-Language Model, VLM)

VLM 能同时处理文本与图像输入,用于回答需要看图的教育问题(如几何题、实验装置题)。本文多模态实验在 Qwen3.5-2B-Base 上用 LoRA 微调,评测 Gaokao-MM、MDK12-Bench、K12Vista 三个含图基准。K12-Train-MM 提供的 illustrates、refers_to、requires_figure、supports_edge 四类关系把教材插图与概念/练习显式关联,是 VLM 训练监督的来源。

论文的一大贡献是证明文本监督与多模态监督互补(K12-Train-Full 在三个多模态基准上全面优于单模态版本),理解 VLM 微调与多模态关系才能读懂这部分实验设计。

研究动机

现有 K-12 教育基准(C-Eval、CMMLU、GaokaoBench、EduEval、E-Eval、K-12 EduBench)及多模态基准(Gaokao-MM、MDK12-Bench、K12Vista)几乎只考察「能不能答对一道考题」,即事实回忆与单点解题。前沿模型已接近甚至超越顶尖学生,给人「教育 AI 已被解决」的错觉。但作者指出,答题只占优秀教师工作的一小部分,老师还要掌握课程结构:为何某主题须先学、某实验如何验证某概念、某知识点在教材哪章首次出现、某插图如何图解一条关系。这种「课程认知」既不被任何现有基准探测,也不被任何指令微调数据显式教授。论文用数据印证缺口:在 K12-Bench 上 Gemini-3-Flash 也只达 57.1% EM,开源强模型 Gemma-4-31B-IT 仅 46.4%,Meta-LLaMA-3-8B-Instruct 的 7.2% EM 与 6.7% 随机猜测几乎无差别,说明小模型对课程结构毫无参数化知识。Prereq 与 Neighbor 两类任务尤其困难,EM 普遍低于 35%。

本文的目标是本文要从单一资源出发,同时填补「评测」与「训练」两端的空白。具体目标有三:第一,构建一个大规模、多学科、与官方课程对齐的课程知识图谱 K12-KGraph,覆盖人教版数学、物理、化学、生物四个学科的小学/初中/高中全学段,既包含课程结构(文本组件)又包含教材插图接地(多模态组件)。第二,基于该图派生一个评测集 K12-Bench,用以系统性测量模型的课程认知——包括知识接地、前置推理、邻接推荐、实验证据链、跨章节索引五个维度。第三,基于同一张图派生一份 KG 引导的监督微调语料 K12-Train,把节点属性与边语义渲染成结构化问答对,显式教授课程认知,从而证明「结构化接地数据」对教育大模型的高效性。

与已有工作不同的是,本文的独特切入角度在于「一图两用」与「确定性派生」。不同于以往教育知识图谱只覆盖单一学科、或面向英语课程、或仅用文本实体而无视觉接地,K12-KGraph 首次从中文 K-12 官方教材大规模、多学科地构建课程对齐 KG,并在分类与前置关系上做 DAG 验证。不同于以往基准靠 LLM 生成题目,K12-Bench 的题目(含正确答案与干扰项)是从已验证的图子结构中确定性遍历得到的,因此题目的正确性可归约为图本身的正确性——改进图即改进基准,错误可定位到具体边。不同于以往指令数据靠 Self-Instruct 等合成,K12-Train 把每条边/节点的语义直接渲染成问答,使每条样本都可回溯到具体子图,难度、覆盖、事实正确性皆可系统控制。这种「单一 KG 同时产出可追溯质量的评测与训练数据」是本文与已有工作的本质区别。

核心方法

整体思路是「从教材到图,再从图到评测与训练」。直觉上:一本优秀教材本身就是一个精心编排的知识网络——章节有顺序、概念有前置、实验有验证对象、插图有解释目标。若把这个网络忠实抽取成机器可读的图,遍历邻域即可得评测题,渲染边语义即可得训练问答。技术路线分两大阶段。第一阶段用五步流水线把人教版 PDF 转成 K12-KGraph:(i) MinerU OCR 解析为保留标题层级、公式、图像的 Markdown;(ii) 目录解析生成 sections_index.json 并切分为 per-section 文件;(iii) 对每个 section 用 schema 感知提示调用 GPT-5.2 抽取节点与边,每条边附证据引文或置信度;(iv) 自底向上分层合并(先 book 级去重分配全局 ID,再 subject 级跨册协调);(v) 在 is_a 与 prerequisites_for 子图做 DFS 环检测并由专家人工消解,得合法 DAG。第二阶段从同一张图派生两类资源:K12-Bench 经邻域遍历生成多选题,K12-Train 经节点/边语义渲染生成问答对。

核心创新点在于「用一张经过 DAG 验证、人工全量核验的异构属性图,统一支撑评测与训练,并使两者的质量都可追溯到图本身」。这与已有方法的本质区别有三。其一,评测题不是 LLM 生成的,而是从已验证子图确定性遍历的:正确答案就是真实的图邻居,干扰项从分层结构近邻池(2-hop 邻域、共享父类的兄弟节点)采样后再经 3-gram 余弦去重与 GPT-5.2 教学法过滤,因此 K12-Bench 的正确性等价于 KG 的正确性,分层抽样核查达 98.4% 完全正确。其二,训练数据不是 Self-Instruct 式无锚合成的,而是 KG 引导的:每条 QA 显式编码一种关系(前置、分类、关联、验证),答案模板被严格约束(如 prerequisites_for 要求解释「学习目标需要某知识,而源节点提供该知识,故应先学源节点」)。其三,文本与多模态在同一张图内共生:Figure/VisualElement 节点通过 illustrates、refers_to、requires_figure、supports_edge 与文本组件接地,使监督信号天然覆盖图文互补。

方法步骤详情

图谱构建五步:PDF 经 MinerU 得结构化 Markdown;目录解析得 sections_index.json 与 per-section 文件;每节用 schema 提示调 GPT-5.2 输出含证据与置信度的节点边 JSON;逐级合并去重并重映射边;最后对分类与前置子图做环检测并由专家人工消解,得合法 DAG。K12-Bench 构建:对 Ground/Prereq/Neighbor/Evidence/Locate 五任务定义查询模板,正确答案取真实图邻居,干扰项从分层候选池(如 2-hop 邻域、同节/章/册/学段/学科)按 bge-small-zh 语义相似度排序填充,再字符 3-gram 余弦去重 + GPT-5.2 教学法过滤(剔除与正确答案同义或可宽松解读为正确的候选),最后在答案基数 $k\in\{1,2,3\}$ 与标签组合上平衡,共 23,640 题。K12-Train 分三路合成:(i) 节点接地 QA,对概念/技能/实验/练习用 Qwen3-235B 基于节点属性生成;(ii) 边接地 QA,对每种语义关系套专门模板(如「为何 A 属于 B」)由 LLM 生成;(iii) 确定性模板 QA,对事实无歧义的考查关系直接填模板绕过 LLM。生成后做结构与语言一致性校验,终得 7,335 条(2,267 文本 + 5,068 多模态)。

技术新颖性

技术新颖性体现在五层。第一,本体设计新颖:九种节点类型与十四种有向边类型,首次把课程结构(分类/前置/顺序/位置/考查)与视觉接地(组合/视觉语义/练习依赖/视觉证据)统一在一个异构属性图中。第二,流水线新颖:结合 MinerU 解析、schema 感知的 LLM 抽取(带证据与置信度)、自底向上分层合并、以及针对分类与前置关系的环检测与人工消解,保证二者构成合法 DAG。第三,评测派生新颖:基准题确定性来自图遍历而非 LLM 生成,干扰项来自多层结构近邻并经教学法过滤,使质量与图质量强绑定。第四,数据合成新颖:知识图谱引导的节点/边/模板三路合成,每条样本可回溯子图,并用置信度阈值控质。第五,验证体系新颖:十二名学科专家对全图做三人独立标注,整体一致性 Fleiss' $\kappa=0.84$,分层抽样核查 K12-Bench 98.4%、K12-Train 96.9% 完全正确,质量保证链条完整。

Overview of the K12-KGraph construction pipeline.
Figure 1: Overview of the K12-KGraph construction pipeline.
A concrete example of K12-Bench and K12-Train generation from K12-KGraph.
Figure 2: A concrete example of K12-Bench and K12-Train generation from K12-KGraph.

实验结果

核心发现有三。其一,当前大模型普遍缺乏稳健的课程认知。在 K12-Bench 上,最强专有模型 Gemini-3-Flash 的整体精确匹配也仅 57.1%(F1 为 73.0%),开源最强 Gemma-4-31B-IT 仅 46.4%;而 Meta-LLaMA-3-8B-Instruct 的 7.2% 与 6.7% 的随机猜测几乎无差异,说明小模型对课程结构毫无参数化知识。其中前置推理(Prereq)与邻接推荐(Neighbor)最难,即便最强模型精确匹配也仅约三成;知识接地(Ground)与实验证据(Evidence)相对容易,F1 分别达 83.3% 与 72.4%。其二,K12-Train 在严格匹配预算下表现出显著的高效性。在 2,300 样本预算下,Qwen3-4B 上 GaokaoBench 总分 1009.96 居首(比最强基线 DataFlow 高 24.1,主观题得分率 89.5% 最佳);Llama3.1-8B 上总分 625.49(比 WizardLM 高 32.4,比官方指令版高 221.0);EduEval 上两骨干均取得最佳均分。其三,文本与多模态监督互补。K12-Train-Full 仅 7,335 样本,却在 Gaokao-MM(39.9%)、MDK12(52.94)、K12Vista(79.95,唯一超过强基座)三个多模态基准上全面领先,并优于单独的文本或图文版本。此外,K12-Train 仅由数理化生合成却提升了语文与人文学科分数,证明学到的是可迁移的结构化答题能力。

Statistics of the textual component of K12-KGraph by subject.
Table 1: Statistics of the textual component of K12-KGraph by subject.
Statistics of the multimodal component of K12-KGraph by subject.
Table 2: Statistics of the multimodal component of K12-KGraph by subject.
K12-Bench results (zero-shot, answer-only), reported in %.
Table 3: K12-Bench results (zero-shot, answer-only), reported in %.
GaokaoBench scores after SFT with 2,300 samples from each dataset.
Table 4: GaokaoBench scores after SFT with 2,300 samples from each dataset.
EduEval scores after SFT, organized by capability dimension (18 sub-tasks).
Table 5: EduEval scores after SFT, organized by capability dimension (18 sub-tasks).
Gaokao-MM accuracy (%) after SFT on Qwen3.5-2B-Base.
Table 6: Gaokao-MM accuracy (%) after SFT on Qwen3.5-2B-Base.
MDK12-medium scores after SFT on Qwen3.5-2B-Base.
Table 7: MDK12-medium scores after SFT on Qwen3.5-2B-Base.
K12Vista scores after SFT on Qwen3.5-2B-Base.
Table 8: K12Vista scores after SFT on Qwen3.5-2B-Base.
K12-Bench statistics. All tasks use multi-select format with four options.
Table 11: K12-Bench statistics. All tasks use multi-select format with four options.
Benchmark composition statistics for K12-Bench.
Figure 6: Benchmark composition statistics for K12-Bench.
查看结构化数据
任务指标本文基线提升
K12-Bench 课程认知(零样本多选) Overall EM / F1 (%) Gemini-3-Flash 57.1 / 73.0(最强被测模型) Random guess 6.7 / 36.4;Meta-LLaMA-3-8B-Instruct 7.2 / 52.6 最强模型也仅过半,揭示课程认知缺口;本文同时提供 K12-Train 作为补救手段
GaokaoBench(Qwen3-4B-Base, 2300 样本 SFT) 十科总分 / 客观题率 / 主观题率 K12-Train-Text 1009.96 / 81.8% / 89.5% 最强基线 DataFlow 985.91 / 81.3% / 87.1%;Qwen3-4B-Instruct 895.37 总分 +24.1,主观题率 +2.4 个百分点;相比官方 instruct +114.6
GaokaoBench(Llama3.1-8B-Base, 2300 样本 SFT) 十科总分 / 客观题率 K12-Train-Text 625.49 / 41.0% 最强基线 WizardLM 593.08 / 39.2% 总分 +32.4;相比官方 instruct +221.0
EduEval(18 子任务均分) Avg.(Qwen3-4B / Llama3.1-8B) K12-Train-Text 66.76 / 40.90 WizardLM 66.70 / OpenHermes 40.05 两骨干均最佳,Ethics 维度领先明显
Gaokao-MM(八科多模态) Overall Accuracy (%) K12-Train-Full 39.9%(LoRA, 7335 样本) Qwen3.5-2B-Base 32.4%;WizardLM(Full 142759) 39.1%;DataFlow(Full 10000) 33.3% 比 base +7.5%、比 instruct +3.8%,且优于单独 Text/MM
MDK12-medium(六理科学科) Overall Score K12-Train-Full 52.94 DataFlow(Full) 51.28;base 50.77 比最强非 K12 基线 +1.66;物理、生物单项最佳
K12Vista(五学科三种题型) Overall Average K12-Train-Full 79.95 Qwen3.5-2B-Base 79.72;DataFlow(Full) 72.87;K12-Train-MM 73.97 唯一超过强基座的微调配置;选择/填空/问答三种题型均最佳

局限与改进

作者承认与可观察到的局限包括:第一,学科覆盖仅限数学、物理、化学、生物四个 STEM 学科,语文、英语、历史、地理、政治等人文社科无直接监督,跨学科迁移只在 GaokaoBench 上间接体现且增益较小。第二,K12-Bench 评测采用 answer-only、零样本、温度 0 的设置,不要求思维链,无法区分「真懂课程结构」与「蒙对答案」,也未考察生成式教学场景(如主动讲解、出题)。第三,K12-Train-MM 的 5,068 条多模态样本与文本比例不均,多模态关系依赖 LLM 推断的置信度阈值(如 requires_figure 取 0.8)过滤,阈值选择缺乏系统消融。第四,图谱抽取与 QA 合成重度依赖 GPT-5.2 与 Qwen3-235B,质量受这两个模型上限约束,复现需付费 API 与大模型算力。第五,仅覆盖中国人教版课程,未验证对其他国家课程体系的迁移性。第六,K12-Bench 与 K12-Train 派生自同一张图,作者虽做了泄漏分析但仍存在「同源」结构性偏置隐忧。第七,训练规模较小(文本 2,300、多模态 7,335),未展示更大预算下的扩展曲线。

独立分析的弱点

独立分析的弱点与改进方向如下。其一,学科覆盖偏 STEM:人文与语言学科被排除在 KG 外,语文/英语/史地政无课程认知监督;改进方向是把 schema 扩展到叙事性、文本细读型知识(如修辞、历史因果链)。其二,评测缺思维链:answer-only 设置可能高估或低估真实理解;改进方向是增加 CoT 评测分支,让模型解释为何某节点是前置,再用裁判模型评分推理质量。其三,训练规模未充分扩展:仅 2,300/7,335 样本,未给样本量-性能曲线;改进方向是做 scaling law 式消融,验证大预算下是否仍优于通用语料。其四,抽取依赖闭源大模型:GPT-5.2 抽取既增成本又影响完全复现;改进方向是用开源抽取器并做误差传播分析。其五,干扰项靠 LLM 过滤可能引入自身偏置;改进方向是多裁判投票或与人工标注校准。其六,图谱人工核验成本高(12 专家全量三人标注),难频繁迭代;改进方向是主动学习只让专家复核低置信边。其七,K12-Bench 与 K12-Train 同源会放大图缺陷——某错误边同时污染评测与训练;改进方向是对两者用不同图子集分割降低同源耦合。

未来方向

作者明确提出与基于成果可延伸的方向包括:第一,扩展到更多学科与学段(人文社科、英语、艺术),并探索跨学科前置关系(如物理对数学的工具性前置)。第二,把 K12-Train 从 SFT 扩展到偏好优化(DPO/RLHF)与检索增强生成(RAG),用 KG 作为检索索引构建可溯源辅导系统,让模型答题时主动遍历前置链与实验证据。第三,做图条件生成(graph-conditional generation),把整张课程子图作为上下文输入,生成个性化学习路径与讲解。第四,验证方法论对其他国家课程体系的可迁移性(如美国 Common Core、新加坡 syllabus)。第五,研究样本高效性的扩展曲线,在更大预算下对比 K12-Train 与通用语料的相对优势是否保持。第六,把课程认知能力纳入通用大模型的对齐目标,而不仅作为教育专项能力。第七,基于 supports_edge 等视觉证据关系,研究多模态 agent 能否在解题时主动「查阅」教材插图并引用,把静态图谱转为动态教学 agent 的 backbone。

复现评估

复现性整体良好但存在门槛。代码、数据集与项目主页均已开源,所有抽取/过滤/合成提示词在附录完整给出,训练超参与公平性控制(分层子采样、随机种子 42、相同超参)在 Table 12/13 详述。硬件门槛适中:文本全参数 SFT 用 8×A100(80GB) 与 DeepSpeed ZeRO-3,单次约 0.4–1.7 小时;多模态 LoRA 同样 8 卡。然而完全从零重建 K12-KGraph 较难:OCR 用 MinerU 默认管线可复现,但抽取依赖 GPT-5.2 闭源 API(产生费用且随版本变化),问答合成依赖 Qwen3-235B;更关键的是图谱需十二名学科专家做全量三人独立标注(Fleiss' $\kappa=0.84$)并人工消解环冲突,人工成本对独立研究者偏高。若仅复现下游训练(直接用已发布数据集),门槛较低,约一张 8 卡机器即可。附录还提供随机种子稳定性与泄漏分析。综合:下游训练高度可复现,图谱从零构建中等偏难。