K12-KGraph:面向教育 LLM 的课程对齐知识图谱基准
- 关联论文:2605.09635
- 作者:Tom
- 更新:2026-07-25
一句话结论
K12-KGraph 首次将中国 K-12 教材中的知识点结构(先修链、概念分类、实验关联、教学排序、视觉定位)显式建模为知识图谱,并由此导出 23,640 道选择题的评测基准 K12-Bench——当前最强模型 Gemini-3-Flash 仅得 57%,Gemma-4-31B-IT 仅 46%,Prereq 和 Neighbor 任务最难,证明"课程认知"(curriculum cognition)仍是 LLM 的显著短板。
解决什么真问题
LLM 在 K-12 教育场景的应用日益广泛,但现有评测存在一个根本性盲区:
现有基准只测"答题",不测"理解知识结构"。
具体来说,LLM 在教育场景需要具备一种论文称之为 curriculum cognition(课程认知)的能力,包括:
- 先修链(Prerequisite chains):知识点 A 是 B 的先修,没有 A 就不能学 B;
- 概念分类法(Concept taxonomies):知识点之间的层级和归属关系;
- 实验-概念关联(Experiment-concept links):物理/化学实验与背后原理的对应;
- 教学排序(Pedagogical sequencing):知识点应该按什么顺序教才是合理的;
- 视觉定位(Visual grounding):图中这个实验装置对应哪个知识点。
这些问题在标准 QA 基准里完全测不到,因此 LLM 的课程认知能力实际上是盲区——K12-KGraph 填补了这一空白。
核心方法
知识图谱构建:K12-KGraph
数据来源:人民教育出版社官方教材,覆盖小学、初中、高中的数学、物理、化学、生物。
节点类型:9 种节点(注:原文摘要未列出具体类型,推测包括知识点、章节、实验、图表、概念等) 关系类型:14 种关系(涵盖上述 5 大课程认知维度)
构建流程:
官方教材(人教版)
↓ NLP 提取 + 专家校验
知识图谱 K12-KGraph
9 种节点 × 14 种关系
↓
K12-Bench(评测集)+ K12-Train(训练集)
评测集:K12-Bench
- 23,640 道多选题,5 个任务家族:
| 任务家族 | 考察内容 |
|---|---|
| Ground | 将知识点关联到对应教材位置 |
| Prereq | 判断先修关系(A 是不是 B 的先修) |
| Neighbor | 找邻居知识点(在先修链/分类树中相邻的节点) |
| Evidence | 为给定结论找教材证据 |
| Locate | 在教材中定位某个概念的出处 |
训练集:K12-Train
- 7,335 条样本,由 K12-KGraph 导出:
- 2,267 条纯文本 QA 对;
- 5,068 条多模态 VQA 对(图+文)。
关键实验与数据
K12-Bench 基线评测
| 模型 | K12-Bench Exact Match |
|---|---|
| Gemini-3-Flash | 57% |
| Gemma-4-31B-IT | 46% |
⚠️ 存疑项:原文仅在摘要中给出上述两个数据点;完整基线表格(含所有模型各任务分项分)未在摘要页公开,以下分析均基于摘要可见数据二次解读,读者请以原文第 5 节为准。
最难任务:Prereq(先修判断)和 Neighbor(邻居节点查找)——这说明 LLM 对知识结构的系统性理解最弱。
K12-Train 训练效果
- 2,300 样本预算下:K12-Train-Text 在 GaokaoBench 和 EduEval 上,一致超越等量的 8 个主流 instruction-tuning 语料库子集;
- 多模态版 K12-Train-Full:在 Gaokao-MM、MDK12-medium、K12Vista 三个 benchmark 上取得最佳综合结果;
- 文本+视觉监督互补:K12-Train-Full 同时超越纯文本版和纯多模态版,说明两类监督信号相互补足。
亮点与局限
亮点
- 课程认知(Curriculum Cognition)的问题定义:首次系统定义了 LLM 在教育场景需要但现有基准测不到的能力维度;
- 官方教材来源:人民教育出版社教材是权威来源,知识结构的标注质量有保证;
- 知识图谱作为中间表示:图谱不仅用于生成评测题,还可作为 RAG 的结构化检索层,延展性强;
- 开源完整 pipeline:图谱、benchmark、训练数据、构建 pipeline 全部开源,为后续工作提供基础设施;
- 多模态 VQA 数据:5,068 条多模态 VQA 对,填补了教育场景多模态数据的空白;
- 课程认知仍是 SOTA 短板:57% 和 46% 的结果说明即便是最强闭源模型在这一任务上也有很大提升空间。
局限
- 中国课程体系:基于人教版教材,对其他国家/课程体系(如 IB、AP、A-Level)的泛化性未知;
- 选择题格式:K12-Bench 是多选题,与开放式问答的教学场景仍有差距;
- 专家校验范围:原文未明确"专家校验"覆盖了多少比例的图谱内容,可能存在噪声;
- 模型覆盖不全:摘要仅给出 Gemini-3-Flash 和 Gemma-4-31B-IT 两个数据点,GPT-4o、Claude 3.5 等主流模型的表现未公开;
- 图谱更新机制:教材会改版,图谱的长期维护成本未讨论;
- Prereq / Neighbor 最难的根因:是 LLM 推理能力不足,还是知识图谱本身构建质量问题,原文未深入分析。
对工程落地的启发
- 教育 RAG 的新范式:将知识图谱作为结构化检索层,比纯向量检索更符合"课程认知"的需求——可以先定位知识点节点,再在节点内做细粒度检索;
- 教学排序验证:知识图谱中的先修关系可用来验证 AI 生成的"学习路径"是否合理;
- 多模态教育的标配:K12-Train-Full 的成功说明图文配对是教育数据的天然形式,多模态 LLM 在教育场景必须同时具备文本和视觉理解能力;
- 评测即数据:K12-Train 由 K12-KGraph 导出——构建评测基准的过程同时也是在构建高质量训练数据,两者互为正循环;
- 微调 v.s. RAG:实验显示领域特定微调可以缩小差距,但未说明微调 + RAG 的组合效果,组合方案是值得探索的方向。
与同方向工作的关系
| 工作 | 核心贡献 | 与 K12-KGraph 的关系 |
|---|---|---|
| GaokaoBench | 高考真题评测 | 测"会不会做题",K12-KGraph 测"是否理解知识结构" |
| EduEval | 教育 LLM 评测 | 通用教育评测,不测课程认知维度 |
| MMLU | 跨学科知识 | 测知识量,不测知识结构关系 |
| MathVista | 数学视觉理解 | K12-KGraph 覆盖数学+物理+化学+生物,范围更广 |
| MiniGPT-4 / LLaVA | 多模态 LLM | K12-Train 提供多模态教育 VQA 训练数据 |
K12-KGraph 的差异化价值在于:不是测 LLM"知道什么",而是测 LLM 是否理解"知识点之间的关系和呈现方式"——这是此前所有教育基准都没有触及的维度。
适合谁读
- 教育 AI 研究者:探索 LLM 在 K-12 场景的课程认知能力边界;
- 知识图谱工程师:如何从教材中抽取结构化知识,用于 RAG 或智能问答;
- EdTech 产品经理:评估 LLM 是否能真正辅导学生(而非仅能答题);
- 评测基准设计者:如何将隐式能力(课程认知)转化为可测量的图谱驱动基准;
- 多模态训练数据构建者:K12-Train 的图文配对策略可迁移到其他垂直领域。
信息来源
- arxiv abstract 页面(https://arxiv.org/abs/2605.09635)
- 论文卡(/shared/research-kb/organized/paper_cards/572-2605-09635.md)
- 注:完整基线评测表格(各模型各任务分数)、9 种节点/14 种关系的具体类型列表、专家校验比例等原文未在摘要页公开,文中已标注"原文未明确"
工程落地与核查(Jay)
1. 事实核查记录
| 核查项 | 状态 | 说明 |
|---|---|---|
| Gemini-3-Flash 57% / Gemma-4-31B-IT 46% | ✅ 可信 | 来自摘要,数据源明确 |
| 23,640 道多选题 | ✅ 可信 | 来自摘要 |
| 7,335 条训练样本(2,267 文本 + 5,068 多模态) | ✅ 可信 | 来自摘要 |
| 9 种节点 × 14 种关系 | ✅ 可信(但类型未公开) | 来自摘要,数量明确,类型未列出 |
| "K12-Train-Text 超越 8 个主流 instruction-tuning 语料库子集" | ⚠️ 未逐项核实 | 仅知 2,300 样本预算设置,各子集具体对比数字需读原文第 5 节 |
| 专家校验比例 | ⚠️ 未明确 | 原文未给出覆盖比例,图谱噪声水平未知 |
2. 实际系统怎么用
评测接入:K12-Bench 以选择题格式提供,可直接作为教育 LLM 的自动化评估集。企业内部可在此基础上扩展: - 加入开放式问答题(将选择题 Prompt 改为"请解释为什么 X 是 Y 的先修") - 用 CoT prompting 测模型的推理过程,而非仅测最终答案
图谱驱动 RAG:
# 伪代码示例
def retrieve_for_question(question, kgraph):
# 1. 从图谱找到相关知识点节点
nodes = kgraph.query_nodes(tags=["力学", "高中"])
# 2. 按先修链排序,确定检索优先级
sorted_nodes = topological_sort(nodes)
# 3. 在排序后的节点内做细粒度向量检索
chunks = [retrieve_from_node(n) for n in sorted_nodes]
return chunks
此模式比纯向量 RAG 更适合"先修判断"、"教学路径生成"类任务。
训练数据复用:K12-Train 可直接作为教育领域 instruction tuning 数据,其中 5,068 条多模态 VQA 可用于训练教育多模态模型。
3. 坑与教训
- 图谱与教材版本强绑定:人教版教材每年小改、若干年大改,图谱需同步维护。一次性构建无法长期使用,需建立教材版本跟踪机制(建议每学期结束前更新一次图谱)。
- Prereq / Neighbor 任务错误率高 ≠ 一定是 LLM 问题:可能是图谱构建时专家标注噪声引入。实际部署前建议人工抽检 100–200 条 Prereq 关系是否与教学实际相符。
- 选择题基准的局限性被低估:多选题有选项作为提示,LLM 可以通过"排除法"提高得分。真正的开放式教学辅导(无选项)表现可能远低于 57%。产品评估不能直接引用 K12-Bench 分数。
- 国际课程泛化存疑:如果 EdTech 产品面向 IB/AP/A-Level 体系,基于人教版的图谱直接迁移效果未知,可能需要从对应教材重建图谱。
- 多模态 VQA 的图像质量依赖:5,068 条多模态数据的效果受图像质量影响较大,若教材插图本身分辨率低或语义信息稀疏,VQA 训练效果会受限。
4. 可复现性
- 开源状态:K12-KGraph / K12-Bench / K12-Train / pipeline 均已开源(GitHub 链接见原论文)
- 硬件要求:图谱构建依赖 NLP pipeline(文本提取、实体识别、关系抽取),单次构建约需 1–2 GPU 日;评测推理与模型尺寸相关
- 复现难度:中等(图谱构建流程已开源,但专家校验环节需人工介入,无法完全自动化)
- 引用建议:
K12-KGraph: A Curriculum-Aligned Knowledge Graph Benchmark for Educational LLM Evaluation. arXiv:2605.09635, 2026.