Inherent Faraday:让27B模型学会做科研复现 · 干货攻略
- 链接: https://x.com/omarsar0/status/2088309745740591429
- 分类: x-tips
- 来源: X @omarsar0
- 作者: Jay
- 更新: 2026-08-15
这是什么
Faraday 是伦敦 AI 创业公司 Inherent(2026年8月14日刚从 stealth 模式浮出水面,Index Ventures 与 Radical Ventures 联合注资 $50M seed round)发布的 27B 参数"AI Scientist"智能体。其核心能力是复现学术论文中的图表——给定一篇论文(不带原图),Faraday 需要通过实验重新生成对应图表,完整走一遍科研人员的工作流程:决定做什么实验、写代码、跑代码、判断结果是否可信。
该项目配套推出了 Replica 基准——一个包含 310 个任务的评测套件,涵盖 100 篇 ML 与 AI-for-Science 论文,领域横跨自然语言处理、材料科学、气象预报等。评测方式为:删除原论文中某张图的原始数据,要求智能体重建该图,在有限时间和算力预算内完成,且没有标准答案参考。
论文标题为 Training AI Scientists to Replicate Research,arXiv:2608.13331(2026年8月13日提交,47页,12图),作者来自 Inherent 与 University of Illinois Urbana–Champaign。
注:Inherent 官网域名为
inherentlabs.ai,论文 PDF 托管于arxiv.org/abs/2608.13331,这两个是本项目的官方权威来源。
为什么值得关注
解决什么问题
LLM 智能体在长程任务中往往缺乏真正的"科研品味"——它们擅长执行指令,但不擅长判断应该做什么实验、什么时候该简化、什么时候结果看起来不对。Faraday 的出现直接回应了这一瓶颈。
传统 AI Scientist 方案(如 AI Scientist-V2 等)依赖手写的 evolutionary harness,测试时 reward 完全由人工设计的规则给出,这意味着智能体没有真正学到"科研判断"本身。Faraday 则尝试从根本上改变这一点:不给测试时 reward,靠训练过程内化科研能力。
关键创新点
- Auto-rubric Judge:不依赖 LLM 作为随机 judge(噪声大),而是用 per-task 预生成的 rubric 对复现质量打分,一致性更高、噪声更低。
- 长程 RL 训练配方:multi-sample aggregation + turn-level credit assignment,解决长程 RL 训练的不稳定性问题。
- harness annealing:训练过程中,智能体逐渐将反复出现的 harness 使用模式内化为模型权重,从频繁调用工具转向选择性地访问外部状态。
- Faraday 作为 director 而非 coder:Faraday 本身不写代码,而是指挥 GPT-5.5 Codex 执行具体实验,自己专注于判断实验方向和评估结果可信度。训练时用 GPT-5.4-mini,测试时可泛化到 GPT-5.5 Codex。
核验过程
官方来源: - Inherent 官网介绍页:https://inherentlabs.ai/research/training-to-replicate - 论文 arXiv 摘要页:https://arxiv.org/abs/2608.13331 - 论文全文(HTML 实验版):https://arxiv.org/html/2608.13331v1
交叉验证: - daily.dev 报道(2026年8月15日)独立引述了 Replica 评测细节,确认了关键数字:Faraday 0.791 vs Claude Opus 4.8 0.748 vs GPT-5.5 0.729(在 68 个 unseen AI-for-science 任务上),Faraday 单独胜出 60% 任务。 - the-decoder / Artificial Analysis 等第三方确认了 Claude Opus 4.8 的 benchmark 表现(SWE-Bench Pro 69.2%、GDPval-AA 1890分等),可间接佐证对比基准的真实性。
原帖与官方说法对照: | 说法 | 原帖主张 | 官方来源 | 核验结论 | |------|---------|---------|---------| | 27B 参数 | ✅ 有 | 官方官网 + arXiv abstract | 确认 | | 超越 Claude Opus 4.8 与 GPT-5.5 | ✅ 有 | Replica 评测数据 | 确认(0.791 vs 0.748/0.729) | | 310 tasks / 100 papers | ✅ 有 | 官方官网 | 确认 | | 使用 GPT-5.5 Codex 作为 coding agent | ✅ 有 | 官方官网 | 确认 | | 无 test-time reward | ✅ 有 | 官方官网 | 确认 | | 2026年8月14日发布 | ✅ 有 | Dealroom 报道 | 确认(独立第三方来源) |
上手步骤
1. 阅读论文
先通读 arXiv:2608.13331 全文,重点关注: - Replica 任务空间的设计细节(如何从论文生成任务) - Rubric judge 的构建流程 - Harness annealing 与 harness evolution 的具体表现
arXiv 链接: https://arxiv.org/abs/2608.13331
HTML 全文: https://arxiv.org/html/2608.13331v1
PDF: https://arxiv.org/pdf/2608.13331
2. 理解 Replica 评测设计
Replica 的核心思想:把论文复现变成 RL 可扩展问题。每个任务只需:(a) 给一篇论文;(b) 删除其中一张图的原始数据;(c) 要求智能体重建该图。评分由 auto-rubric judge 给出。
关键设计细节: - 无标准答案:智能体看不到原始图的真实数据,必须从物理/科学规律出发重建 - 资源受限:时间和算力有上限,逼着智能体在方向判断上做取舍 - hypothesis-driven:必须从论文中推断作者可能用了什么方法,而非直接搜索答案
3. 关注 Faraday 的两大核心现象
Harness Annealing:训练初期智能体频繁调用 harness(外部工具/内存);随着训练推进,模型逐渐将常见 harness 模式内化,对外部状态从"频繁读取"转为"选择性访问"。这说明 RL 过程确实学到了科研直觉。
Harness Evolution:随着任务推进,progress updates 和 experience consolidation 会逐步压缩 harness 状态,使其更紧凑、任务适配性更强。相当于 harness 本身也在随任务进化。
4. 关注架构设计(Director vs Coder)
Faraday 的设计哲学值得借鉴:把"判断该做什么"和"执行具体操作"分开。Faraday 专注科研判断,将代码执行委托给更强的大模型。这为"小模型 + 大工具"的 Agent 范式提供了一条新路径。
坑与适用边界
当前局限
- Benchmark 覆盖范围有限:Replica 310 个任务来自 100 篇论文,主要集中在 ML 和 AI-for-Science,尚未覆盖生物实验、物理模拟等更依赖精密仪器的领域。
- ** rubric judge 的局限**:rubric 本身是 auto-generated 的,对"科学上合理但与原论文方法不同的复现路径"可能给出不一致评分。
- 成本问题:Faraday 依赖 GPT-5.5 Codex 作为底层 coder,每次复现任务都是"Faraday 指挥 + GPT-5.5 执行"的组合,推高了单次复现成本。
- 发布时无开源权重:截至 2026年8月15日,Faraday 仅发布论文,权重和代码尚未开源,无法直接复现。
适用边界
- ✅ 学术研究辅助:帮助科研人员快速探索某篇论文的扩展方向
- ✅ AI Agent 架构参考:director/coder 分离的设计模式值得借鉴
- ✅ Benchmark 设计:Replica 的任务生成方式为构建可控 RL 任务空间提供了范本
- ❌ 直接部署:无开源权重,需等官方发布
- ❌ 完全自主科研:Faraday 仍需人类监督,离真正的 autonomous scientist 有距离
一句话结论
Faraday 证明了 27B 模型通过长程 RL 可以学会"科研判断"——不是替代科学家写代码,而是指挥大模型执行实验、评估结果可信度,为 AI Scientist 范式提供了无 test-time reward 的新路径;Replica 将论文复现变成可量化的 RL 任务空间,值得关注后续开源动态。
核验来源:inherentlabs.ai 研究介绍页、arXiv:2608.13331(2026-08-13)、daily.dev 报道;Claude Opus 4.8/GPT-5.5 基准数据经 the-decoder / Artificial Analysis 交叉验证。