K12-KGraph:面向教育 LLM 的课程对齐知识图谱基准

  • 关联论文:2605.09635
  • 作者:Tom
  • 更新:2026-07-25

一句话结论

K12-KGraph 首次将中国 K-12 教材中的知识点结构(先修链、概念分类、实验关联、教学排序、视觉定位)显式建模为知识图谱,并由此导出 23,640 道选择题的评测基准 K12-Bench——当前最强模型 Gemini-3-Flash 仅得 57%,Gemma-4-31B-IT 仅 46%,Prereq 和 Neighbor 任务最难,证明"课程认知"(curriculum cognition)仍是 LLM 的显著短板。


解决什么真问题

LLM 在 K-12 教育场景的应用日益广泛,但现有评测存在一个根本性盲区:

现有基准只测"答题",不测"理解知识结构"。

具体来说,LLM 在教育场景需要具备一种论文称之为 curriculum cognition(课程认知)的能力,包括:

  1. 先修链(Prerequisite chains):知识点 A 是 B 的先修,没有 A 就不能学 B;
  2. 概念分类法(Concept taxonomies):知识点之间的层级和归属关系;
  3. 实验-概念关联(Experiment-concept links):物理/化学实验与背后原理的对应;
  4. 教学排序(Pedagogical sequencing):知识点应该按什么顺序教才是合理的;
  5. 视觉定位(Visual grounding):图中这个实验装置对应哪个知识点。

这些问题在标准 QA 基准里完全测不到,因此 LLM 的课程认知能力实际上是盲区——K12-KGraph 填补了这一空白。


核心方法

知识图谱构建:K12-KGraph

数据来源:人民教育出版社官方教材,覆盖小学、初中、高中的数学、物理、化学、生物。

节点类型:9 种节点(注:原文摘要未列出具体类型,推测包括知识点、章节、实验、图表、概念等) 关系类型:14 种关系(涵盖上述 5 大课程认知维度)

构建流程:

官方教材(人教版)
    ↓  NLP 提取 + 专家校验
知识图谱 K12-KGraph
    9 种节点 × 14 种关系
    ↓
K12-Bench(评测集)+ K12-Train(训练集)

评测集:K12-Bench

  • 23,640 道多选题,5 个任务家族:
任务家族 考察内容
Ground 将知识点关联到对应教材位置
Prereq 判断先修关系(A 是不是 B 的先修)
Neighbor 找邻居知识点(在先修链/分类树中相邻的节点)
Evidence 为给定结论找教材证据
Locate 在教材中定位某个概念的出处

训练集:K12-Train

  • 7,335 条样本,由 K12-KGraph 导出:
  • 2,267 条纯文本 QA 对;
  • 5,068 条多模态 VQA 对(图+文)。

关键实验与数据

K12-Bench 基线评测

模型 K12-Bench Exact Match
Gemini-3-Flash 57%
Gemma-4-31B-IT 46%

⚠️ 存疑项:原文仅在摘要中给出上述两个数据点;完整基线表格(含所有模型各任务分项分)未在摘要页公开,以下分析均基于摘要可见数据二次解读,读者请以原文第 5 节为准。

最难任务:Prereq(先修判断)和 Neighbor(邻居节点查找)——这说明 LLM 对知识结构的系统性理解最弱。

K12-Train 训练效果

  • 2,300 样本预算下:K12-Train-Text 在 GaokaoBench 和 EduEval 上,一致超越等量的 8 个主流 instruction-tuning 语料库子集;
  • 多模态版 K12-Train-Full:在 Gaokao-MM、MDK12-medium、K12Vista 三个 benchmark 上取得最佳综合结果;
  • 文本+视觉监督互补:K12-Train-Full 同时超越纯文本版和纯多模态版,说明两类监督信号相互补足。

亮点与局限

亮点

  1. 课程认知(Curriculum Cognition)的问题定义:首次系统定义了 LLM 在教育场景需要但现有基准测不到的能力维度;
  2. 官方教材来源:人民教育出版社教材是权威来源,知识结构的标注质量有保证;
  3. 知识图谱作为中间表示:图谱不仅用于生成评测题,还可作为 RAG 的结构化检索层,延展性强;
  4. 开源完整 pipeline:图谱、benchmark、训练数据、构建 pipeline 全部开源,为后续工作提供基础设施;
  5. 多模态 VQA 数据:5,068 条多模态 VQA 对,填补了教育场景多模态数据的空白;
  6. 课程认知仍是 SOTA 短板:57% 和 46% 的结果说明即便是最强闭源模型在这一任务上也有很大提升空间。

局限

  1. 中国课程体系:基于人教版教材,对其他国家/课程体系(如 IB、AP、A-Level)的泛化性未知;
  2. 选择题格式:K12-Bench 是多选题,与开放式问答的教学场景仍有差距;
  3. 专家校验范围:原文未明确"专家校验"覆盖了多少比例的图谱内容,可能存在噪声;
  4. 模型覆盖不全:摘要仅给出 Gemini-3-Flash 和 Gemma-4-31B-IT 两个数据点,GPT-4o、Claude 3.5 等主流模型的表现未公开;
  5. 图谱更新机制:教材会改版,图谱的长期维护成本未讨论;
  6. Prereq / Neighbor 最难的根因:是 LLM 推理能力不足,还是知识图谱本身构建质量问题,原文未深入分析。

对工程落地的启发

  1. 教育 RAG 的新范式:将知识图谱作为结构化检索层,比纯向量检索更符合"课程认知"的需求——可以先定位知识点节点,再在节点内做细粒度检索;
  2. 教学排序验证:知识图谱中的先修关系可用来验证 AI 生成的"学习路径"是否合理;
  3. 多模态教育的标配:K12-Train-Full 的成功说明图文配对是教育数据的天然形式,多模态 LLM 在教育场景必须同时具备文本和视觉理解能力;
  4. 评测即数据:K12-Train 由 K12-KGraph 导出——构建评测基准的过程同时也是在构建高质量训练数据,两者互为正循环;
  5. 微调 v.s. RAG:实验显示领域特定微调可以缩小差距,但未说明微调 + RAG 的组合效果,组合方案是值得探索的方向。

与同方向工作的关系

工作 核心贡献 与 K12-KGraph 的关系
GaokaoBench 高考真题评测 测"会不会做题",K12-KGraph 测"是否理解知识结构"
EduEval 教育 LLM 评测 通用教育评测,不测课程认知维度
MMLU 跨学科知识 测知识量,不测知识结构关系
MathVista 数学视觉理解 K12-KGraph 覆盖数学+物理+化学+生物,范围更广
MiniGPT-4 / LLaVA 多模态 LLM K12-Train 提供多模态教育 VQA 训练数据

K12-KGraph 的差异化价值在于:不是测 LLM"知道什么",而是测 LLM 是否理解"知识点之间的关系和呈现方式"——这是此前所有教育基准都没有触及的维度。


适合谁读

  • 教育 AI 研究者:探索 LLM 在 K-12 场景的课程认知能力边界;
  • 知识图谱工程师:如何从教材中抽取结构化知识,用于 RAG 或智能问答;
  • EdTech 产品经理:评估 LLM 是否能真正辅导学生(而非仅能答题);
  • 评测基准设计者:如何将隐式能力(课程认知)转化为可测量的图谱驱动基准;
  • 多模态训练数据构建者:K12-Train 的图文配对策略可迁移到其他垂直领域。

信息来源

  • arxiv abstract 页面(https://arxiv.org/abs/2605.09635)
  • 论文卡(/shared/research-kb/organized/paper_cards/572-2605-09635.md)
  • 注:完整基线评测表格(各模型各任务分数)、9 种节点/14 种关系的具体类型列表、专家校验比例等原文未在摘要页公开,文中已标注"原文未明确"

工程落地与核查(Jay)

1. 事实核查记录

核查项 状态 说明
Gemini-3-Flash 57% / Gemma-4-31B-IT 46% ✅ 可信 来自摘要,数据源明确
23,640 道多选题 ✅ 可信 来自摘要
7,335 条训练样本(2,267 文本 + 5,068 多模态) ✅ 可信 来自摘要
9 种节点 × 14 种关系 ✅ 可信(但类型未公开) 来自摘要,数量明确,类型未列出
"K12-Train-Text 超越 8 个主流 instruction-tuning 语料库子集" ⚠️ 未逐项核实 仅知 2,300 样本预算设置,各子集具体对比数字需读原文第 5 节
专家校验比例 ⚠️ 未明确 原文未给出覆盖比例,图谱噪声水平未知

2. 实际系统怎么用

评测接入:K12-Bench 以选择题格式提供,可直接作为教育 LLM 的自动化评估集。企业内部可在此基础上扩展: - 加入开放式问答题(将选择题 Prompt 改为"请解释为什么 X 是 Y 的先修") - 用 CoT prompting 测模型的推理过程,而非仅测最终答案

图谱驱动 RAG

# 伪代码示例
def retrieve_for_question(question, kgraph):
    # 1. 从图谱找到相关知识点节点
    nodes = kgraph.query_nodes(tags=["力学", "高中"])
    # 2. 按先修链排序,确定检索优先级
    sorted_nodes = topological_sort(nodes)
    # 3. 在排序后的节点内做细粒度向量检索
    chunks = [retrieve_from_node(n) for n in sorted_nodes]
    return chunks

此模式比纯向量 RAG 更适合"先修判断"、"教学路径生成"类任务。

训练数据复用:K12-Train 可直接作为教育领域 instruction tuning 数据,其中 5,068 条多模态 VQA 可用于训练教育多模态模型。

3. 坑与教训

  1. 图谱与教材版本强绑定:人教版教材每年小改、若干年大改,图谱需同步维护。一次性构建无法长期使用,需建立教材版本跟踪机制(建议每学期结束前更新一次图谱)。
  2. Prereq / Neighbor 任务错误率高 ≠ 一定是 LLM 问题:可能是图谱构建时专家标注噪声引入。实际部署前建议人工抽检 100–200 条 Prereq 关系是否与教学实际相符。
  3. 选择题基准的局限性被低估:多选题有选项作为提示,LLM 可以通过"排除法"提高得分。真正的开放式教学辅导(无选项)表现可能远低于 57%。产品评估不能直接引用 K12-Bench 分数。
  4. 国际课程泛化存疑:如果 EdTech 产品面向 IB/AP/A-Level 体系,基于人教版的图谱直接迁移效果未知,可能需要从对应教材重建图谱。
  5. 多模态 VQA 的图像质量依赖:5,068 条多模态数据的效果受图像质量影响较大,若教材插图本身分辨率低或语义信息稀疏,VQA 训练效果会受限。

4. 可复现性

  • 开源状态:K12-KGraph / K12-Bench / K12-Train / pipeline 均已开源(GitHub 链接见原论文)
  • 硬件要求:图谱构建依赖 NLP pipeline(文本提取、实体识别、关系抽取),单次构建约需 1–2 GPU 日;评测推理与模型尺寸相关
  • 复现难度:中等(图谱构建流程已开源,但专家校验环节需人工介入,无法完全自动化)
  • 引用建议K12-KGraph: A Curriculum-Aligned Knowledge Graph Benchmark for Educational LLM Evaluation. arXiv:2605.09635, 2026.