2026-10-03 · ClaroAI-Bench 短审稿(flyP)

主题:面向真实生物医学论文复现的 Agent 评测基准 检索范围:bioRxiv(首选,被 Cloudflare 限流,改用搜索引擎摘要)+ 横向对比 REPRO-Bench / ReplicatorBench / BiomniBench / Latch.bio 长程单细胞基准 候选条目: 1. ClaroAI-Bench (bioRxiv 2026-05, NIH 资助 35 篇真实生物医学论文) ← 本轮精读 2. REPRO-Bench (arXiv:2409.11363, 社会科学复现评估) 3. ReplicatorBench (arXiv:2602.11354, KDD 2026 AI4Science) 4. BiomniBench (生物医学过程级评测, Nature/Cell/Science 100 题) 5. Latch.bio 单细胞长程基准 (21 评测 / 1068 trajectories, 最佳 25.4%)


一、核心信息(基于摘要级证据)

  • 来源:bioRxiv, 2026-05-08, DOI 10.64898/2026.05.08.723611v1,机构未在摘要中明示
  • 任务集:35 个真实 NIH 资助的生物医学论文复现任务(2025–2026 出版),覆盖基因组学、影像、临床/EHR、流行病学、湿实验 5 个模态
  • 评分维度 D1–D5:数据可发现性 / 数据可访问性 / 代码可获得性 / 环境可重建性 / 结果可复现性
  • 关键结果(摘要):
  • 全工具栈 agent 可复现 60.6% 的 NIH 计算论文
  • 纯 bash-only agent 复现率 0%
  • 上游元数据质量 (D1–D4) 与最终复现 (D5) 强相关;数据/代码可访问的论文复现成功率高 2.9×
  • 核心论断:「可复现性本质是数据共享问题」

二、方法拆解(按摘要推断,待补查)

  • 任务不是合成题,而是「论文 + 数据 deposit + 代码仓库 + 方法描述」的真实闭环
  • 评分采用五维 rubric,关注过程而非单一答案
  • 通过 bash-only 与 rich-tool 的对比,证明工具栈深度是关键变量
  • 作者明确承认「时间衰减」:仓库/链接会变,计划每年版本化

三、主要问题与风险(批判性)

  1. 样本量与代表性:35 篇规模偏小,5 个模态均摊后每模态仅 7 题,跨子领域方差会被放大;摘要未给 bootstrap 或置信区间
  2. 基线缺失:摘要自陈「无人类基线」,无法判断 60.6% 是 agent 强还是任务偏易;需与人类复现对比
  3. 「bash-only 0%」的可解释性:可能是工具隔离过严,也可能是 prompt/上下文不足;需要消融(不同 prompt、不同模型同工具栈)
  4. 评分客观性:D1–D2 偏客观,但 D4/D5 需人工或 LLM-as-judge;作者未披露评分者一致性与 judge 模型
  5. 时间衰减:bioRxiv 与代码链接半年内可能 404,作者承诺年度版本化,但短期内分数可比性差
  6. 未声明开源:摘要未明确代码/数据/任务卡是否公开;若不公开则复用价值低
  7. 领域局限:聚焦 NIH 资助的英语论文,对国际合作、非英语、临床试验注册库(ClinicalTrials.gov)等覆盖不足

四、与同类基准的横向对比(用于定位价值)

基准 学科 任务数 关键差异
ClaroAI-Bench 生物医学 35 五维 rubric、真实 NIH 任务、强调数据可及性
BiomniBench 生物医学 100 过程级 6 维评分(数据处理/方法选择/统计/解释/推理/源可靠性),顶级配置 73.34/100
REPRO-Bench 社科 — 评估 agent 给论文打复现分(meta 任务),不是端到端复现
ReplicatorBench 社科行为 — KDD 2026 AI4Science 录用;聚焦可复现性
Latch.bio 单细胞 21 eval / 1068 traj 长程 trajectory,最佳 25.4%,强调交互过程

定位判断:ClaroAI-Bench 与 BiomniBench 互补——前者偏「端到端跑通 + 评分真实论文」,后者偏「过程 rubric + 顶级期刊题目」。两者建议同时入库做对比。

五、可信度判断

  • 方法可信度:中上。五维 rubric 设计合理,强调真实任务而非合成
  • 结果可信度:中。核心数字(60.6% / 2.9× / 0%)可信,但样本小、无置信区间、无人类基线
  • 可复现性:待补查——需确认代码/数据是否公开、是否给出 prompt 与 agent 配置

六、是否建议入库

  • ✅ 建议入库,分类到 reviews/benchmarks/,与 BiomniBench、REPRO-Bench 联动
  • ⚠️ 入库前需补查:代码仓库地址、评分脚本、agent harness 配置、是否有 v2 更新
  • 📝 同主题另起一篇 BiomniBench 精读(顶级 73.34/100,且有 harness 切换 +13.5 分的洞察)

七、后续验证动作

  1. 检索作者/机构,确认是否有 GitHub 仓库或 HuggingFace 数据集
  2. 在 bioRxiv 等限流恢复后,抓取「Results / Limitations / Data Availability」三个段落原文
  3. 与 BiomniBench 联合做一篇主题页:reviews/topics/2026-biomed-agent-benchmarks.md
  4. 跟踪年度版本化承诺是否兑现(2027-Q2)

Substack / 博客线索(仅作记录,本轮未深挖)

  • latch.bio 博客《Benchmarking AI Agents on Long-Horizon Single-Cell Biology》— 与 ClaroAI-Bench 互补视角,建议下轮做 Substack 精读候选
  • phylo.bio《Evaluating AI Agents in Biology》— BiomniBench 子集复核后分数普涨,说明基准质量本身是变量,可作为方法学讨论素材

输出文件:/shared/research-kb/inbox/flyp/2026-10-03-ClaroAI-Bench-short-review.md 未执行 GitHub 写入(按 cron 规则) 未抓取全文:bioRxiv Cloudflare 限流(429),已用摘要级证据完成审稿,方法与实验细节标记「待补查」