AI 读论文 9.6% 的准确率:它连"方法章节哪里缺了一块"都指不出来,更别说复现论文了
- 关联论文:2609.10539
你有没有试过让 ChatGPT、Claude 复现一篇学术论文?十次里大概九次跑出来跟论文报告的数对不上。不是模型不够聪明,是论文本身写得"跳"——方法章节看上去自洽、新颖,但缺实现细节:超参没给全、数据预处理没写、评估协议只字未提……复现者只能靠猜或去 GitHub issue 区问作者。
2026 年前这还是"圈内吐槽",现在变成系统性问题——AI 智能体正被大规模用于自动化科研(Agent for Science、Literature-to-Code),这些 Agent 要"读论文 → 写代码",论文写得"跳"直接变成代码 bug。
arXiv 2609.10539 的 IdeaAMBIG 是第一个把这个痛点量化的工作。它构造了 660 条方法规范缺口实例(163 条来自真实复现报告 + GitHub issue,497 条受控合成),评测 13 个主流 LLM,结果:
即使最强模型,在真实缺口上的"定位准确率"只有 9.6%。
不是模型修不好——一旦把缺口告诉它,修复成功率能到 80.6%。瓶颈不在修复,在定位。
它把"复现"拆成了三步
IdeaAMBIG 把"给定一篇方法章节,模型能把它实现成代码"拆成三个独立能力,分别打分:
- 第一步:编码就绪度判断(二分类)——够不够实现。决定要不要继续。
- 第二步:缺口定位(最关键)——不告诉它哪里缺,让模型指出"哪个段落 / 哪个要素缺东西"。这就是 9.6% 的环节。
- 第三步:澄清 / 修复动作(已知缺口)——告诉它缺口,让它生成澄清问题或修订建议。这是 80.6% 的环节。
第二步和第三步输入故意不对称:定位时不给答案,修复时给答案——这样能单独归因失败:是找不到,还是修不好?
13 个模型一致:找不到 >> 修不好。
一个对照实验把这件事拍死了
论文做了 oracle 对照:人工把 gold resolution(标准缺口标注 + 标准修复方案)直接喂给模型下游。结果:
- 没 oracle 时,完整规范的编码就绪率只有 14%;
- 给 oracle 后,就绪率跳到 98%。
84 个百分点的鸿沟不是"模型差"——是模型找不到缺口所在。
为什么这事重要
"AI 复现论文"正在变成科研 Agent 的核心能力(Anthropic、Meta、阿里、字节的内部 paper-to-code 系统都在做)。IdeaAMBIG 给的 9.6% 是这些系统的真实上限——如果你的科研 Agent 跑出来效果差,问题大概率不在模型本身,而在它根本没找到论文里缺的那块。
这件事给所有"长文本规范化" AI 划了一条线——AI 不是"读不懂长文",是"找不到长文里缺的那一段"。同样的能力可外推到法律合同起草、医疗病历规范化、合规文档评审。
落地前几个 P0
- 13 个模型名单 abstract 未披露:GPT-4 / Claude / Gemini / Llama 具体版本未列。LLM 升级极快,9.6% 可能已被新版打破——严肃落地前用最新模型在 3-5 篇自己领域论文上重跑。
- 660 条偏小 + 采样偏差:偏向有 GitHub 仓库 + 社区活跃的英文 NLP/ML 论文。多模态 / 纯理论 / 医疗 / 金融几乎无覆盖——别把 9.6% 泛化到所有 SOTA 论文。
- oracle 不可直接实现:98% 是"人类给 gold annotation"实现的。模型 self-correction 通常只有 30-50%,离 98% 差远了——别把 oracle 上限当工程目标。
- 评测对象只覆盖文本规范:方法章节嵌入的图、公式、超链接变体没纳入——遇到这类变体的论文定位准确率会更低。
- GitHub / leaderboard 状态 abstract 未明:复现 9.6% 基准数字至少要等 artifact 公开。
给工程团队的具体建议
- 如果你的 paper-to-code Agent 在修复阶段出错,先检查定位阶段是否已失败——大多数 Agent 默认跳过定位直接猜,这是最高频的失败模式。
- 把流水线显式拆成"定位 → 修复"两步,定位失败时主动向用户提问,比"定位失败 → 随便猜"结果好一个数量级。"缺则问"应成为默认策略。
- 单独优化定位能力时,用 497 条合成缺口做 SFT,不要用 GSM8K / MATH——后者训练的是数学 CoT,不是论文缺口定位。
- 长篇规范默认先按节切做定位,找到可疑节后再扩大上下文做细粒度排查。
- 在 RLHF 里给"承认不知道"明确奖励,否则模型会学会"不承认 + 继续猜"。
一句话总结
IdeaAMBIG 把"AI 复现不了论文"这件模糊的事第一次量化成可比较的数字。9.6% 是上限,瓶颈在定位不在修复——提升科研 Agent 自动编码能力的关键,是先让模型学会在长篇规范中找到缺失的细节。
对所有"长文本规范化" AI(法律、医疗、合规、代码评审)都成立——AI 找得到缺什么,比修得好不好重要一个数量级。
三个标题变体
- 数字钩子版:9.6% vs 80.6%:AI 修论文比找问题强 8 倍,但找不到就修不了
- 拟人化版:让 AI"复现论文"是欺负它——9.6% 暴露的不是笨,是它压根不知道从哪开始看
- 类比版:相当于给 AI 装了个"论文 linter"——它能挑刺,但前提是你告诉它在哪一页挑
小红书风格卡片文案(可直接发布)
🤖 AI 复现论文,准确率只有 9.6%
你以为让 ChatGPT、Claude "照着论文写代码"很简单?十次有九次跑出来跟论文对不上——不是模型笨,是论文本身写得"跳":超参没给全、数据预处理没写、评估协议只字未提……
arXiv 2609.10539 的 IdeaAMBIG 把这件事第一次量化👇
📊 评测 13 个 LLM 在 660 条论文缺口上,结果: - 真实缺口定位准确率 9.6% ← 最强模型上限 - 已知缺口后的修复成功率 80.6% ← 高得多 - Oracle 上限 14% → 98% ← 给 gold annotation 直接起飞
🔍 关键洞察:瓶颈不在"修不好",在"找不到"。AI 不是读不懂论文,是找不到论文里缺的那一段在哪。
🧠 三步拆解: 1. 编码就绪度判断(够不够实现) 2. 缺口定位(不告诉答案,让它自己找)← 9.6% 这关 3. 澄清 / 修复动作(已知缺口,怎么修)← 80.6% 这关
第二步输入故意"不对称"——不喂缺口标注,只给规范——这样能单独归因失败:到底是找不到还是修不好?
💡 工程含义: - 做科研 Agent 的团队:"定位失败 → 主动问用户"比"定位失败 → 随便猜"好一个数量级。"缺则问"应成为 paper-to-code Agent 的默认策略。 - 做法律 / 医疗 / 合规文档 AI 的:AI 找得到缺什么,比修得好不好重要 10 倍。 - 论文写作工具团队:在投稿前用 loc 类模型扫描方法章节,提示哪些段落缺少实现细节——类比 linter。
⚠️ 坑别忽略: - 13 个模型名单 abstract 未列,LLM 升级快,9.6% 可能已被新版打破——严肃落地前用最新模型在 3-5 篇自己领域论文上重跑 - 660 条偏小 + 偏向英文 NLP/ML 论文 + 社区活跃项目,别泛化到所有 SOTA 论文 - Oracle 98% 是"人类给 gold annotation"实现的,模型自己 self-correction 通常只有 30-50%,别把 oracle 当工程目标 - v1 无开源仓库状态明示,等 artifact 公开再复现基准数字
🎯 一句话:IdeaAMBIG 把"AI 复现不了论文"这件事第一次量化成可比较数字,揭示出瓶颈在定位不在修复——这是科研 Agent + 长文本规范化 AI 的共同转折点。