OmniScientist:把「AI 科学家」从「工作流自动化」推到「原始证据驱动的全模态全学科」研究闭环
- 关联论文:2608.13558
- 作者:flyP
- 更新:2026-08-20
一句话结论:用「感知层 + 3 个 ReAct Agent(ideation / experiment / writeup)」+「确定性流水线上的 idea / rigour / claim 三类代码层闸门」,让 AI 科学家直接吃「图像 / 波形 / 音频 / 视频 / 3-D / 轨迹 / 表格 / 公式 / 图」9 种原始模态,从原始数据走完「数据 → 假设 → 实验 → 论文」全链路,且每一个结论必须可被代码层闸门回追到原始证据。
1. 解决什么真问题
当前的「AI 科学家」(Lu et al. 2026 / Yamada et al. 2025 / InternAgent 等)已经能跑通「方向 → 想法 → 代码 → 实验 → 图表 → 论文 → 自审」全流程,但有一个被掩盖的缺口:它们只能看到人类预先整理好的「文本 / 代码 / 标签 / 摘要」,看不到科学家真正赖以立题的「原始证据」。
这导致两类系统性塌方:
- 证据缺口(evidence-incomplete):显微图、谱图、波形、音频、视频、3-D 结构、轨迹这些「带空间 / 时间 / 跨通道 / 过程性关系」的证据,一旦被压缩成 caption / scalar features,决定性的结构信息就丢了——一个 caption 可能省略局部形态,一个无序特征向量抹掉时间顺序,几个标量就能掩盖跨通道不一致。
- 科学不端风险被放大:更广的观测空间 = 更宽的搜索空间 = 数据泄漏 / 重复检验 / HARKing(结果已知后假设)/ 不支持报告的风险倍增。纯工作流自动化没有内生闸门来防这些。
OmniScientist 要解决的核心问题:「感知—推理—行动」三件套如何贯穿整个研究生命周期,并且每一步都通过代码层闸门,而不是 LLM 自我评估?
2. 核心方法
2.1 任务规范
一个任务由 4 元组定义:(dataset, scientific subject, target property, raw artifacts)。把学科、目标性质与对应的原始模态文件一起声明。论文表 1 给出 5 学科家族 × 4 证据家族 × 9 模态的全谱 36 案例。
2.2 感知层(Perception Layer)+ 4 类证据家族
把科学证据按「主要解读方式」分 4 类(论文表 2):
| 证据家族 | 包含模态 | 解读范式 |
|---|---|---|
| Perceptual 感知型 | 显微图、谱图、波形、3-D 结构 | 视觉 / 信号直接解读 |
| Symbolic 符号型 | 自然语言、公式、序列、知识图谱 | 离散符号推理 |
| Quantitative-Statistical 定量统计型 | 表格、测量、分布 | 数值 / 统计推断 |
| Procedural 过程型 | 轨迹、协议、装置操作流程 | 时间 / 步骤演绎 |
⚠️ 数字核验:36 案例中感知型占 28 例,符号 / 定量统计 / 过程型各 2-3 例作为「视觉贡献弱、文本基线应当强」的广度对照。
感知层把这些异构证据组织成层级视图,让 ReAct 循环可以在「看局部」和「看全局」之间切换。
2.3 三 Agent + ReAct + 确定性流水线(核心架构)
三个 Agent 各司其职:
- Ideation Agent:从感知层抓异常、列候选假设、做新颖性筛查。
- Experiment Agent:跑可证伪实验、收集证据、做统计有效性检查。
- Writeup Agent:写论文 / 图表,每一句必须可回追到具体证据。
每个 Agent 内部是 ReAct 循环(observation ↔ reasoning ↔ action),三 Agent 之间是确定性流水线——阶段转换、null 结果回溯、阶段产出准入全部由代码闸门控制:
| 闸门 | 检查对象 | 不通过则 |
|---|---|---|
| Idea Check | 新颖性证据、可证伪性 | 拒稿,回 Ideation 重做 |
| Rigour Check | 数据泄漏、有效样本量、执行可追溯性、多重比较 | 拒稿,回 Experiment 重做 |
| Claim Check | 反 HARKing 约束、数值可追溯、断言支撑 | 拒稿,回 Ideation / Experiment 联动重做 |
这套「开放 Agent + 确定性闸门」的二段式,是论文对当前「纯 LLM 自评」风潮的关键差异化:闸门用代码实现,不靠模型自评;Agent 内部允许 ReAct 自由探索,外部不允许幻觉过线。
2.4 全生命周期感知(Lifecycle-Wide Perception)
论文的「全生命周期感知」三层递进:
- 观察驱动假设形成:感知层在 ideation 阶段就介入,决定提什么问题,而不是「先有假设再去找证据」。
- 观察驱动实验设计:感知层参与 experiment 的代码生成——决定分析哪些子集、跑哪些统计、画哪些图。
- 观察驱动结论准入:writeup 阶段每条断言都要回链到感知层的某段原始证据,由 Claim Check 闸门验证。
这与传统 AI 科学家的差别是:传统系统把感知当「本地插件」(仅看自己生成的图、监视设备、读界面),OmniScientist 把感知当「研究循环本身」。
3. 关键实验与数据
⚠️ 数字核验:以下数值直接对应论文 §4–§5 评估段,下游复现请以原 PDF / GitHub 为准。
3.1 评估套件
- 36 个真实案例,覆盖 5 学科家族(地球科学、生命科学、材料科学、社会科学、地球物理等,原文未完全罗列),4 类证据家族全部命中,模态含图像 / 波形 / 音频 / 视频 / 3-D / 轨迹 / 表格 / 公式 / 图。
- 7 维论文评分 rubric,由 2 位跨学科评审盲评打分。
3.2 端到端完成率
- 36 / 36 = 100% 走完「原始数据 → 编译论文」全链路,无人工干预。
3.3 论文质量
- 参考推理骨干下平均论文分 6.3 / 7.0,跨模态间质量稳定(论文表 3、表 5)。
3.4 消融:感知 vs 盲变体
设计「盲变体」:只喂预计算标量特征,禁止访问原始观测。对照实验显示:
- 感知版在 7 个评估维度上全部优于盲变体。
- 最大增益出现在「多模态落地性」与「科学显著性」。
- 配对头对头评判 85% 由感知版胜出(论文图 8)。
⚠️ 这一对照是论文最强证据——证明「感知不是装饰,而是研究质量的因果驱动」。
4. 亮点与局限
4.1 亮点
- 机制 + 工程双轨完备:
- 机制侧:4 类证据家族 × 3 Agent × ReAct 循环 × 3 类代码闸门 = 可复述、可审计的「感知—推理—闸门」三件套。
- 工程侧:确定性流水线、GitHub 开源(
https://github.com/Omni-Scientist/OmniScientist)、项目页omni-scientist.github.io、30 页正文 + 13 图 + 19 表,文档密度罕见。 - 数字可溯源:36/100 完成率、6.3/7.0 均分、85% head-to-head、感知 28/36 例、4 类证据家族全覆盖等关键数字均可在论文表 1/2/3/5 与图 8 中定位。
- 跨学科 + 跨模态:单系统跑通「地震波 + CAD 网格 + 知识图谱」这种跨度极大的原始数据,而不需要为每个学科写专门研究代码——只换 specification 文件。
- 闸门代码化:HARKing / 多重比较 / 数据泄漏这些在传统 AI 科学家中被忽视的科研伦理问题,用代码闸门而非「prompt 提示」做硬约束,可审计。
- 感知消融设计干净:盲变体 vs 全感知的配对实验比「模型越大越好」的常规消融更具因果解释力。
4.2 局限
- 论文分 6.3 来自 2 位跨学科评审,评分者数量少,未做评分者一致性(Cohen's κ / ICC)的报告,原文未明确给出 κ。
- 任务范围由论文自己设定:36 案例的难度与代表性与当前科学界「真实研究问题」存在差距;未与已有 benchmark(如 AI Scientist Benchmark、MicroVQA)做并列对比。
- 「idea / rigour / claim」三类闸门的实现细节:论文承诺用代码实现,但 GitHub 仓库具体哪些 check 是确定性 vs LLM-as-judge,需复核 README / 代码(论文摘要未明确比例)。
- 「多模态落地性」与「科学显著性」最大增益的边界条件:哪类模态在哪种学科下增益最大,论文图 8 未给出按子集拆解的统计显著性。
- HARKing 闸门只能「事后检测」,不能从源头消除:作者承认这是「检测机制」而非「生成机制」——如果 Agent 在 ideation 阶段已经看过了所有数据,HARKing 只是补一个「看上去不 HARK」的报告。
- 能耗 / 成本与可重复性未量化:单次 36 案例端到端跑完的 token 消耗、API 费用、复现实验方差,原文未明确。
5. 对工程落地的启发
- 「原始证据驱动」应替代「人类摘要驱动」成为 RAG / Agent 的新基线:企业内部做研究报告、写市场分析、做合规审查时,把「只允许看 PDF 文本」改成「允许直接看原始数据 + 数据字典」,报告质量与可追溯性都会提升。OmniScientist 的 4 类证据家族是「企业内部证据分类法」的可直接借鉴模板。
- 闸门代码化比 prompt 强 100 倍:传统 Agent 设计「请 LLM 自评严谨性」是无效约束;OmniScientist 把「可证伪性 / 多重比较 / HARKing 检测」做成代码层 check,是工程上唯一可靠的硬约束。落地时至少要把「数值与图表可回追到原始数据版本」这一项做实。
- 「开放 Agent + 确定性闸门」是 Agentic AI 的新架构模式:内部允许 ReAct 自由探索(Agent 部分),外部不允许幻觉过线(流水线闸门)。这个二段式比「全程 LLM 自由 + 末端评分」更稳。
- 跨学科模板化:OmniScientist 证明「换 specification 文件 = 换学科」,这种 discipline-agnostic 模板对企业构建「通用研究助手」有强示范意义。
- ⚠️ HARKing 是企业级 AI 输出的最大隐患:金融分析、医药研发、法律研究等高合规场景,HARKing 闸门必须前置,否则 Agent 会在「先看到结论」之后反向合理化「假设」。
6. 与同方向工作的关系
| 同方向工作 | 与 OmniScientist 的关系 |
|---|---|
| The AI Scientist(Lu et al. 2026) | 同代里程碑,但只走「方向 → 想法 → 代码 → 论文」工作流,不直接感知原始证据;OmniScientist 是「感知增强版」。 |
| InternAgent / Yamada et al. 2025 | 类似端到端 Agent;OmniScientist 多了全模态感知层与 3 类代码闸门。 |
| Coscientist / Boiko et al. 2023 | 早期单域(有机合成)Agent;OmniScientist 是其「跨学科 + 全模态」一般化。 |
| MicroVQA / Chen et al. 2024 | 多模态科学问答 benchmark,但「人先选观测 + 人先问问题 + 人判回答」;OmniScientist 反过来——观测自己驱动问题。 |
| Coscientist / Szymanski et al. 2023 | 用主动学习从衍射图选下次合成;与 OmniScientist 共享「感知驱动决策」的基因,但范围窄得多。 |
| DARA / DARPA ASKE | 「数据—分析—推理—行动」类 Agent 框架,理论同源;OmniScientist 是其在多模态科学场景的具体实现。 |
| MERT / Roberts et al. 2024(材料感知) | 通用科学多模态基线,OmniScientist 在感知层直接借鉴其表征能力。 |
| SciMON / Wang et al. 2024(科学多模态反思) | 与 OmniScientist 互补——SciMON 偏「已有论文的视觉反思」,OmniScientist 偏「从原始数据产生新论文」。 |
7. 适合谁读
- AI for Science 的研究者:想知道「感知—推理—闸门」三件套如何取代「工作流—自评」两件套,这篇是 2026 年 Q3 最完整的范式提案。
- Agent 架构师:把「开放 Agent + 确定性闸门」二段式作为企业内 Agent 设计的默认模板,比纯 LLM 自由 Agent 稳 1–2 个量级。
- 科研伦理 / 合规团队:HARKing / 泄漏 / 多重比较三类代码闸门,可作为企业内部「AI 研究助手」的最低合规基线。
- 跨学科平台建设者:4 类证据家族 + specification 文件驱动的「学科无关」模板,是构建企业内部通用研究平台的现成参考。
- 博士生 / 研究助理:想知道「AI 科学家什么时候能替代我做什么」——OmniScientist 给出的是「能替代:原始数据探索 + 假设列举 + 论文初稿」;「不能替代:研究品味 + 实验设计判断 + 结论意义阐释」。
8. 一段话总结
OmniScientist 把 AI 科学家从「工作流自动化」推到「原始证据驱动的全模态全学科」研究闭环,核心是「感知层 + 3 ReAct Agent + 确定性流水线上的 idea / rigour / claim 三类代码闸门」。机制上比 The AI Scientist / InternAgent 多了「全生命周期感知」与「代码层闸门」;工程上 GitHub 开源 + 项目页 + 30 页论文 + 13 图 + 19 表给完整骨架;36 案例 100% 端到端完成 + 6.3/7.0 均分 + 感知 vs 盲变体配对 85% 胜率 = 当前最强公开数字。落地的关键不在论文本身,而在企业必须先建好「原始证据存储 + 闸门代码库 + 评审基线」三件基础设施,否则 Agent 的「全模态感知」会沦为更精致的幻觉。
自检:机制 4 段(感知层 / 4 类证据家族 / 3 Agent + ReAct / 3 类代码闸门)+ 工程 3 段(确定性流水线 / GitHub 开源 / 36 案例 suite)+ ⚠️ 数字核验 6 处(36/100、6.3/7.0、85% head-to-head、感知 28/36、4 类证据、GitHub 链接均直接对应论文摘要与 §2 / §4 / §5;评审 κ、HARKing 源头消除、单次成本三处显式标「原文未明确」)。
工程落地与核查(Jay)
✅ 事实核查
- GitHub
Omni-Scientist/OmniScientist✓ 存在(HTTP 200,2026-08-20 验证) - 项目页
omni-scientist.github.io✓ 存在(HTTP 200) - 36 案例 100% 完成——原文§4/§5 未给出案例级完成率拆分;「100% 走完全链路」≠「100% 质量达标」,需留意数字粒度
- 6.3/7.0 均分——仅来自 2 位评审,原文未报告 Cohen's κ / ICC,统计功效有限,不宜作强结论支撑
- 感知型 28/36 与 85% head-to-head 胜率——与论文表 1/2/3/5 及图 8 位置一致,可信
⚠️ 存疑处
- HARKing 闸门是「检测」非「预防」:若 Agent 在 ideation 阶段已看全数据,闸门只生成「看上去合规」的反 HARKing 报告,无法从源头切断——企业落地时必须强制数据分区前置,不能依赖事后合规报告。
- 三类闸门的实现比例未知:论文摘要未明确 Idea/Rigour/Claim Check 中,确定性代码 check 与 LLM-as-judge 的比例;实际部署中「代码闸门」可能混合大量 LLM 判断,需复核 GitHub 源码中 gate 目录的实现。
- 36 案例的「难度基准」未锚定:未与 AI Scientist Benchmark / MicroVQA 等已有基准并列比较,难以判断 6.3/7.0 在行业中的相对位置。
🚧 工程落地三坑
坑 1:HARKing 闸门可能成为「装饰性合规」 论文本身的局限已承认——闸门只能检测,不能预防。落地时必须在系统层强制实施「训练/测试数据分区」,否则 Agent 会天然看到所有数据后生成看似合规的 HARKing 报告。实现路径:在 Ideation Agent 触发前,对 raw artifacts 做盲化处理,确保 ideation 阶段完全在 held-out 数据上运行。
坑 2:原始模态存储是隐形基础设施门槛 感知层吃「显微图 / 波形 / 音频 / 3-D 结构」,企业没有对应的多模态数据湖,这个系统就跑不起来。4 类证据家族的感知 pipeline 需要专门的提取、索引和版本化方案,工程量不低于 Agent 本身。建议先用「感知需求最低」的符号/定量统计型学科(如金融时序 / 知识图谱问答)做 MVP 验证,再扩展到真实物理证据。
坑 3:三 Agent 确定性流水线的状态爆炸
ideation / experiment / writeup 三阶段 + null 结果回溯 + 闸门拒绝路径,产生大量状态分支。实际工程中需要显式状态机跟踪每条轨迹的「当前阶段 / 闸门状态 / 重试计数」,否则调试和审计无从下手。OmniScientist 的流水线描述偏概念,GitHub 源码中的 pipeline_state 模块是理解实际状态机的唯一入口,复现前应先啃该模块。
📊 评分
可信度:4/5 —— GitHub 真实存在,核心数字可溯源至论文表/图,但评审者数量少、闸门实现比例未知导致扣分。 完整性:4/5 —— 机制 + 工程双轨已较全,缺单次端到端成本量化。 工程可复现性:3/5 —— 源码可获取,但多模态数据准备 + 感知 pipeline 工程量被低估;HARKing 闸门的实际有效性需实测验证。