2026-10-03 · ClaroAI-Bench 短审稿(flyP)
主题:面向真实生物医学论文复现的 Agent 评测基准 检索范围:bioRxiv(首选,被 Cloudflare 限流,改用搜索引擎摘要)+ 横向对比 REPRO-Bench / ReplicatorBench / BiomniBench / Latch.bio 长程单细胞基准 候选条目: 1. ClaroAI-Bench (bioRxiv 2026-05, NIH 资助 35 篇真实生物医学论文) ← 本轮精读 2. REPRO-Bench (arXiv:2409.11363, 社会科学复现评估) 3. ReplicatorBench (arXiv:2602.11354, KDD 2026 AI4Science) 4. BiomniBench (生物医学过程级评测, Nature/Cell/Science 100 题) 5. Latch.bio 单细胞长程基准 (21 评测 / 1068 trajectories, 最佳 25.4%)
一、核心信息(基于摘要级证据)
- 来源:bioRxiv, 2026-05-08, DOI
10.64898/2026.05.08.723611v1,机构未在摘要中明示 - 任务集:35 个真实 NIH 资助的生物医学论文复现任务(2025–2026 出版),覆盖基因组学、影像、临床/EHR、流行病学、湿实验 5 个模态
- 评分维度 D1–D5:数据可发现性 / 数据可访问性 / 代码可获得性 / 环境可重建性 / 结果可复现性
- 关键结果(摘要):
- 全工具栈 agent 可复现 60.6% 的 NIH 计算论文
- 纯 bash-only agent 复现率 0%
- 上游元数据质量 (D1–D4) 与最终复现 (D5) 强相关;数据/代码可访问的论文复现成功率高 2.9×
- 核心论断:「可复现性本质是数据共享问题」
二、方法拆解(按摘要推断,待补查)
- 任务不是合成题,而是「论文 + 数据 deposit + 代码仓库 + 方法描述」的真实闭环
- 评分采用五维 rubric,关注过程而非单一答案
- 通过
bash-only与rich-tool的对比,证明工具栈深度是关键变量 - 作者明确承认「时间衰减」:仓库/链接会变,计划每年版本化
三、主要问题与风险(批判性)
- 样本量与代表性:35 篇规模偏小,5 个模态均摊后每模态仅 7 题,跨子领域方差会被放大;摘要未给 bootstrap 或置信区间
- 基线缺失:摘要自陈「无人类基线」,无法判断 60.6% 是 agent 强还是任务偏易;需与人类复现对比
- 「bash-only 0%」的可解释性:可能是工具隔离过严,也可能是 prompt/上下文不足;需要消融(不同 prompt、不同模型同工具栈)
- 评分客观性:D1–D2 偏客观,但 D4/D5 需人工或 LLM-as-judge;作者未披露评分者一致性与 judge 模型
- 时间衰减:bioRxiv 与代码链接半年内可能 404,作者承诺年度版本化,但短期内分数可比性差
- 未声明开源:摘要未明确代码/数据/任务卡是否公开;若不公开则复用价值低
- 领域局限:聚焦 NIH 资助的英语论文,对国际合作、非英语、临床试验注册库(ClinicalTrials.gov)等覆盖不足
四、与同类基准的横向对比(用于定位价值)
| 基准 | 学科 | 任务数 | 关键差异 |
|---|---|---|---|
| ClaroAI-Bench | 生物医学 | 35 | 五维 rubric、真实 NIH 任务、强调数据可及性 |
| BiomniBench | 生物医学 | 100 | 过程级 6 维评分(数据处理/方法选择/统计/解释/推理/源可靠性),顶级配置 73.34/100 |
| REPRO-Bench | 社科 | — | 评估 agent 给论文打复现分(meta 任务),不是端到端复现 |
| ReplicatorBench | 社科行为 | — | KDD 2026 AI4Science 录用;聚焦可复现性 |
| Latch.bio | 单细胞 | 21 eval / 1068 traj | 长程 trajectory,最佳 25.4%,强调交互过程 |
定位判断:ClaroAI-Bench 与 BiomniBench 互补——前者偏「端到端跑通 + 评分真实论文」,后者偏「过程 rubric + 顶级期刊题目」。两者建议同时入库做对比。
五、可信度判断
- 方法可信度:中上。五维 rubric 设计合理,强调真实任务而非合成
- 结果可信度:中。核心数字(60.6% / 2.9× / 0%)可信,但样本小、无置信区间、无人类基线
- 可复现性:待补查——需确认代码/数据是否公开、是否给出 prompt 与 agent 配置
六、是否建议入库
- ✅ 建议入库,分类到
reviews/benchmarks/,与 BiomniBench、REPRO-Bench 联动 - ⚠️ 入库前需补查:代码仓库地址、评分脚本、agent harness 配置、是否有 v2 更新
- 📝 同主题另起一篇 BiomniBench 精读(顶级 73.34/100,且有 harness 切换 +13.5 分的洞察)
七、后续验证动作
- 检索作者/机构,确认是否有 GitHub 仓库或 HuggingFace 数据集
- 在 bioRxiv 等限流恢复后,抓取「Results / Limitations / Data Availability」三个段落原文
- 与 BiomniBench 联合做一篇主题页:
reviews/topics/2026-biomed-agent-benchmarks.md - 跟踪年度版本化承诺是否兑现(2027-Q2)
Substack / 博客线索(仅作记录,本轮未深挖)
- latch.bio 博客《Benchmarking AI Agents on Long-Horizon Single-Cell Biology》— 与 ClaroAI-Bench 互补视角,建议下轮做 Substack 精读候选
- phylo.bio《Evaluating AI Agents in Biology》— BiomniBench 子集复核后分数普涨,说明基准质量本身是变量,可作为方法学讨论素材
输出文件:/shared/research-kb/inbox/flyp/2026-10-03-ClaroAI-Bench-short-review.md
未执行 GitHub 写入(按 cron 规则)
未抓取全文:bioRxiv Cloudflare 限流(429),已用摘要级证据完成审稿,方法与实验细节标记「待补查」