Knowledge-Gated Verifiable Tasks:把"无知的失败"与"无能的失败"在 benchmark 里分开

  • 关联论文:2608.30322
  • 作者:spark
  • 更新:2026-09-04

一句话结论

本文提出一套 knowledge-gated 任务构造协议:把任务指令与"私有规约 / 参考表 / 工具算子"的 compact artefact 解耦,并在提供 / 扣留 artefact 两个条件下做 byte-identical 任务对照,让"agent 失败是因为不知道规约"与"agent 失败是因为能力不够"在评测层面被显式区分。

解决什么真问题

专业 agent 任务高度依赖未公开规约:企业内部命名规则、API 错误码表、特定行业的合规术语……这些规约不在公开语料里。但主流 agent benchmark 几乎不控制 agent 是否能接触这些规约。

这导致两类失败被混在一起:

  1. Ignorance(无知):agent 能力够,但缺规约知识 → 拿不到规约时 0 分、给规约时高分。
  2. Incompetence(无能):agent 能力本身不足 → 给不给规约都低分。

两类失败的归因完全不同:前者补知识、后者要更强模型 / 训练。但当前 benchmark 把它们糊在一起,导致"加 RAG / 知识库就涨点"的归因常常是 noise——到底涨的是知识缺口的填补、还是模型本身能力的展现?说不清。

核心方法

任务构造协议:四件套

task_unit = {
    instruction:        任务正文(不含规约知识),
    artefact: {
        conventions:    私有命名/调用规约,
        reference_tables: 参考表,
        utility_operators: 工具函数,
    },
    provenance:         规约来源审计链,
    leak_audit:         是否泄露到公开语料,
    executable_witness: 可执行验证脚本,
    criterion_rubrics:  命名化的评分维度,
}

四件套关键设计:

  • byte-identical instruction:在"提供 artefact"与"扣留 artefact"两种条件下,任务正文逐字节相同。变量只有 artefact 是否暴露——这使差分归因成为可能。
  • construction-time provenance:每个 artefact 都记录规约来源,避免 agent 在预训练中已见过而污染对照。
  • leak audits:检测规约是否意外进入公开语料,确保对照有效。
  • executable witnesses:对结构化任务,附可执行验证脚本,提供 exact ground truth;对不可完全自动判分的输出,使用命名 criterion-level rubrics。

知识闸门筛:five-trial empirical knowledge-gating screen

for each task t:
    pass_rate_with    = avg(pass over 5 trials with artefact)
    pass_rate_without = avg(pass over 5 trials without artefact)
    if pass_rate_with - pass_rate_without > threshold:
        retain t  # 知识闸门成立:失败可归因于知识缺口
    else:
        discard t # 知识闸门不成立:失败无法清晰归因

配置相对校准(configuration-relative calibration screen)

同一任务在多种 agent 配置上跑,保留至少 7 个通过知识闸门筛选的任务,作为最终评测集。

关键实验与数据

维度 关键结论(abstract verbatim)
校准任务总数 15 个
极差对照 "one frontier agent configuration achieves a 68.0% pass rate with the artefact and 0% without it"
负样本有效性 "on one task, a plausible but incorrect artefact also yields 0% across five trials"——错误规约不涨点,反向证明 agent 真在用规约
最终保留任务数 7 个(通过 five-trial 知识闸门筛选)
开源 "we publicly release part of the task suite and supporting tooling at https://github.com/DatagridsAI/Knowledge-Gated-Task-Construction"

⚠️ 原文未明确具体的 15 → 7 筛选阈值、7 个保留任务的主题分布、其他 agent configuration 的具体表现。

亮点与局限

亮点

  1. 首次把"知识 vs 能力"在 benchmark 里显式分离:byte-identical instruction + artefact 暴露 / 扣留的对照设计是干净的方法学贡献。
  2. 错误规约反向验证:用"看起来合理但错误的 artefact 仍 0%"排除"agent 涨分靠幻觉 / 模式匹配"的假阳性。
  3. 5 次 trial + executable witness:让评测本身有统计意义和可重复性,比单次跑分更可信。
  4. 配置相对校准:保留任务通过多 agent 配置的稳定筛选,避免某个特定模型的偏置。
  5. GitHub 公开:https://github.com/DatagridsAI/Knowledge-Gated-Task-Construction ,可直接复用任务构造工具链。

局限

  1. 作者明确自承局限:"These experiments validate the behavior of the construction protocol; they do not establish that the retained tasks improve post-training"——本工作只验证"协议本身是否有效",不验证"用这些任务训练能否提升 agent"。
  2. 评测维度偏窄:保留 7 个任务,主题覆盖度与统计功效有限;abstract 未给出任务主题分布。
  3. artefact 构造成本:每任务需人工配规约 + 工具 + provenance + leak audit,规模化困难。
  4. 依赖规约可形式化:对于高度依赖隐性知识 / 模糊判断的任务(谈判、创意),executable witness 设计本身是开放问题。
  5. 未测多种 agent 类型:仅"frontier agent configuration"作为对照,open-source 小模型 vs frontier 模型的差分表现未在 abstract 给出。

对工程落地的启发

  • agent 评测必须控制知识变量:内部评测时把"给文档 vs 不给文档"做成两套对照,避免把 RAG / 知识库的功劳算到模型能力头上。
  • 协议层面的工具链值得借鉴:provenance + leak audit + executable witness 的四件套对任何专业 agent benchmark 都通用。
  • 错误规约是负样本:自评时加入"看起来合理但故意错误"的规约,能筛掉"模型靠常识 / 幻觉硬答"的伪涨点。
  • 5 次 trial 比单次稳:单次跑分随机性大,对小样本评测尤其要重复。

与同方向工作的关系

  • 与 SWE-bench / HumanEval / MMLU 等通用基准:后者不区分知识 vs 能力,本文是"评测方法学补丁"。
  • 与 HAL, ToolBench 等工具调用基准:本文给"工具调用是否依赖私有规约"提供了差分框架。
  • 与 agent 失败归因研究(如 Why Agents Fail 类工作):本文是评测侧的解法,把归因前置到任务构造阶段。
  • 与 RAG 评测(如 RGB / RAGAS):本文方法可被 RAG 评测借鉴——"给文档涨点 vs 不给文档涨点"本身就能区分 RAG 价值与模型能力。

适合谁读

  • 做 agent benchmark 设计 / 评测方法学的学者——"知识闸门 + byte-identical instruction" 是值得抄的方法学。
  • 内部 AI 系统评测负责人——评估自家 agent 短板时,"知识 vs 能力"分离是诊断利器。
  • RAG / 知识库方向研究者——衡量 RAG 价值时避免与模型能力混淆。
  • 对 agent 可信度 / 可解释性有兴趣的产品 / 合规人员——理解失败归因是责任划定的前提。