AI 读论文 9.6% 的准确率:它连"方法章节哪里缺了一块"都指不出来,更别说复现论文了

  • 关联论文:2609.10539

你有没有试过让 ChatGPT、Claude 复现一篇学术论文?十次里大概九次跑出来跟论文报告的数对不上。不是模型不够聪明,是论文本身写得"跳"——方法章节看上去自洽、新颖,但缺实现细节:超参没给全、数据预处理没写、评估协议只字未提……复现者只能靠猜或去 GitHub issue 区问作者。

2026 年前这还是"圈内吐槽",现在变成系统性问题——AI 智能体正被大规模用于自动化科研(Agent for Science、Literature-to-Code),这些 Agent 要"读论文 → 写代码",论文写得"跳"直接变成代码 bug。

arXiv 2609.10539 的 IdeaAMBIG 是第一个把这个痛点量化的工作。它构造了 660 条方法规范缺口实例(163 条来自真实复现报告 + GitHub issue,497 条受控合成),评测 13 个主流 LLM,结果:

即使最强模型,在真实缺口上的"定位准确率"只有 9.6%。

不是模型修不好——一旦把缺口告诉它,修复成功率能到 80.6%。瓶颈不在修复,在定位


它把"复现"拆成了三步

IdeaAMBIG 把"给定一篇方法章节,模型能把它实现成代码"拆成三个独立能力,分别打分:

  • 第一步:编码就绪度判断(二分类)——够不够实现。决定要不要继续。
  • 第二步:缺口定位(最关键)——不告诉它哪里缺,让模型指出"哪个段落 / 哪个要素缺东西"。这就是 9.6% 的环节。
  • 第三步:澄清 / 修复动作(已知缺口)——告诉它缺口,让它生成澄清问题或修订建议。这是 80.6% 的环节。

第二步和第三步输入故意不对称:定位时不给答案,修复时给答案——这样能单独归因失败:是找不到,还是修不好?

13 个模型一致:找不到 >> 修不好


一个对照实验把这件事拍死了

论文做了 oracle 对照:人工把 gold resolution(标准缺口标注 + 标准修复方案)直接喂给模型下游。结果:

  • 没 oracle 时,完整规范的编码就绪率只有 14%
  • 给 oracle 后,就绪率跳到 98%

84 个百分点的鸿沟不是"模型差"——是模型找不到缺口所在


为什么这事重要

"AI 复现论文"正在变成科研 Agent 的核心能力(Anthropic、Meta、阿里、字节的内部 paper-to-code 系统都在做)。IdeaAMBIG 给的 9.6% 是这些系统的真实上限——如果你的科研 Agent 跑出来效果差,问题大概率不在模型本身,而在它根本没找到论文里缺的那块

这件事给所有"长文本规范化" AI 划了一条线——AI 不是"读不懂长文",是"找不到长文里缺的那一段"。同样的能力可外推到法律合同起草、医疗病历规范化、合规文档评审。


落地前几个 P0

  • 13 个模型名单 abstract 未披露:GPT-4 / Claude / Gemini / Llama 具体版本未列。LLM 升级极快,9.6% 可能已被新版打破——严肃落地前用最新模型在 3-5 篇自己领域论文上重跑
  • 660 条偏小 + 采样偏差:偏向有 GitHub 仓库 + 社区活跃的英文 NLP/ML 论文。多模态 / 纯理论 / 医疗 / 金融几乎无覆盖——别把 9.6% 泛化到所有 SOTA 论文
  • oracle 不可直接实现:98% 是"人类给 gold annotation"实现的。模型 self-correction 通常只有 30-50%,离 98% 差远了——别把 oracle 上限当工程目标
  • 评测对象只覆盖文本规范:方法章节嵌入的图、公式、超链接变体没纳入——遇到这类变体的论文定位准确率会更低。
  • GitHub / leaderboard 状态 abstract 未明:复现 9.6% 基准数字至少要等 artifact 公开。

给工程团队的具体建议

  • 如果你的 paper-to-code Agent 在修复阶段出错,先检查定位阶段是否已失败——大多数 Agent 默认跳过定位直接猜,这是最高频的失败模式。
  • 把流水线显式拆成"定位 → 修复"两步,定位失败时主动向用户提问,比"定位失败 → 随便猜"结果好一个数量级。"缺则问"应成为默认策略。
  • 单独优化定位能力时,用 497 条合成缺口做 SFT,不要用 GSM8K / MATH——后者训练的是数学 CoT,不是论文缺口定位。
  • 长篇规范默认先按节切做定位,找到可疑节后再扩大上下文做细粒度排查。
  • 在 RLHF 里给"承认不知道"明确奖励,否则模型会学会"不承认 + 继续猜"。

一句话总结

IdeaAMBIG 把"AI 复现不了论文"这件模糊的事第一次量化成可比较的数字。9.6% 是上限,瓶颈在定位不在修复——提升科研 Agent 自动编码能力的关键,是先让模型学会在长篇规范中找到缺失的细节

对所有"长文本规范化" AI(法律、医疗、合规、代码评审)都成立——AI 找得到缺什么,比修得好不好重要一个数量级


三个标题变体

  1. 数字钩子版:9.6% vs 80.6%:AI 修论文比找问题强 8 倍,但找不到就修不了
  2. 拟人化版:让 AI"复现论文"是欺负它——9.6% 暴露的不是笨,是它压根不知道从哪开始看
  3. 类比版:相当于给 AI 装了个"论文 linter"——它能挑刺,但前提是你告诉它在哪一页挑

小红书风格卡片文案(可直接发布)

🤖 AI 复现论文,准确率只有 9.6%

你以为让 ChatGPT、Claude "照着论文写代码"很简单?十次有九次跑出来跟论文对不上——不是模型笨,是论文本身写得"跳":超参没给全、数据预处理没写、评估协议只字未提……

arXiv 2609.10539 的 IdeaAMBIG 把这件事第一次量化👇

📊 评测 13 个 LLM 在 660 条论文缺口上,结果: - 真实缺口定位准确率 9.6% ← 最强模型上限 - 已知缺口后的修复成功率 80.6% ← 高得多 - Oracle 上限 14% → 98% ← 给 gold annotation 直接起飞

🔍 关键洞察:瓶颈不在"修不好",在"找不到"。AI 不是读不懂论文,是找不到论文里缺的那一段在哪

🧠 三步拆解: 1. 编码就绪度判断(够不够实现) 2. 缺口定位(不告诉答案,让它自己找)← 9.6% 这关 3. 澄清 / 修复动作(已知缺口,怎么修)← 80.6% 这关

第二步输入故意"不对称"——不喂缺口标注,只给规范——这样能单独归因失败:到底是找不到还是修不好?

💡 工程含义: - 做科研 Agent 的团队:"定位失败 → 主动问用户"比"定位失败 → 随便猜"好一个数量级。"缺则问"应成为 paper-to-code Agent 的默认策略。 - 做法律 / 医疗 / 合规文档 AI 的:AI 找得到缺什么,比修得好不好重要 10 倍。 - 论文写作工具团队:在投稿前用 loc 类模型扫描方法章节,提示哪些段落缺少实现细节——类比 linter

⚠️ 坑别忽略: - 13 个模型名单 abstract 未列,LLM 升级快,9.6% 可能已被新版打破——严肃落地前用最新模型在 3-5 篇自己领域论文上重跑 - 660 条偏小 + 偏向英文 NLP/ML 论文 + 社区活跃项目,别泛化到所有 SOTA 论文 - Oracle 98% 是"人类给 gold annotation"实现的,模型自己 self-correction 通常只有 30-50%,别把 oracle 当工程目标 - v1 无开源仓库状态明示,等 artifact 公开再复现基准数字

🎯 一句话:IdeaAMBIG 把"AI 复现不了论文"这件事第一次量化成可比较数字,揭示出瓶颈在定位不在修复——这是科研 Agent + 长文本规范化 AI 的共同转折点。

AI科研 #论文复现 #Agent评测 #LLM评测 #基准测试 #paper2code #arXiv2609.10539 #每天学点AI