synthetic-sciences/openscience · 上手攻略

  • 仓库:synthetic-sciences/openscience
  • 链接:https://github.com/synthetic-sciences/openscience
  • 分类:AI 辅助科研 · Agent 工具链
  • 作者:Jay
  • 更新:2026-07-26

它是什么

OpenScience 是 Synthetic Sciences(YC W26 入选团队)出品的开源 AI 科研工作台。用户给定一个研究目标,它就以"能力型合作者"的方式走完完整研究闭环——读文献、提假设、写代码、跑实验、查数据库、写报告,全程在一个浏览器 Workspace 里完成。

它于 2026 年 7 月 5 日正式发布,定位是 Claude Science 的开源替代:Apache 2.0 许可、模型任意切换、不绑平台、数据留在本地。README 明确注明与 Anthropic 无关联,"Claude" 商标仅用于描述兼容性。


解决什么问题

传统科研 AI 工具普遍存在三个痛点:

第一,工具碎片化。 查文献用一个工具,跑代码用另一个 IDE,写论文又换一个环境,Agent 在工具之间来回切换,上下文丢失。OpenScience 把全链路做成了一个连续 Session,不存在跨工具的上下文迁移问题。

第二,厂商锁定。 Claude Science 只能跑 Claude,换不了。OpenScience 是模型无关的路由层,按请求切换模型——这次用 Claude 跑蛋白分析,下次换 GPT-4o 做文献综述,都不需要改工作流。

第三,科研工具缺失。 通用 Agent 不认识 UniProt、PDB、ChEMBL、RDKit 这些专业数据库和工具链。OpenScience 预置了 290+ 科研技能和 30+ 科学数据库作为 Agent 可调用的标准工具,Agent 直接用自然语言就能驱动它们。


快速安装

环境要求

  • Node.js:建议 Node 18 及以上,npm 随 Node 附赠
  • 浏览器:Chrome / Edge / Firefox 均可,Workspace 在浏览器中运行
  • API Key(三选一,不设 Key 也能用演示模型体验): 1. 自带 Key:设置 ANTHROPIC_API_KEY / OPENAI_API_KEY / GEMINI_API_KEY 等环境变量 2. Atlas 托管:运行 openscience login 连接 Atlas 平台(预付钱包,按量计费) 3. 跳过:首次引导选"免费演示模型"直接体验,无需任何 Key

安装命令

# 全局安装(推荐)
npm install -g @synsci/openscience

# 启动 Workspace(自动在浏览器打开 http://localhost:5173)
openscience

# 免安装,一行 npx 跑(效果相同)
npx synsci
# 指定项目目录启动
openscience ~/code/my-research-project

# 查看当前连接状态(连的哪个 provider、用哪个模型)
openscience status

# 断开 Atlas 连接
openscience logout

# 更换监听端口(默认 5173)
openscience --port 8080

Linux 特殊说明

  • 内核要求 ≥ 5.1,glibc ≥ 2.17
  • CentOS 7 虽然 glibc 版本满足,但内核只有 3.10,官方明确不支持,需使用新内核主机或 VM
  • Alpine Linux 等 musl 环境有独立构建:从 GitHub Releases 下载 musl 版本

从源码运行(如需二次开发)

源码用 Bun 构建(非 npm):

git clone https://github.com/synthetic-sciences/openscience.git
cd openscience
bun install
bun dev          # 开发模式运行 Workspace
bun run typecheck
bun run --cwd backend/cli test

核心用法详解

1. 启动与 Key 配置流程

首次运行 openscience 会进入引导流程,屏幕提示三个选项:

  • Atlas Managed:使用 Synthetic Sciences 托管的前沿模型,通过 Atlas 预付钱包扣费,不需要各厂商 API Key
  • Bring Your Own Key:自行设置环境变量,或在 Workspace UI 的 Credentials 面板中录入 Key
  • Skip / Demo:使用免费演示模型,无需任何配置

配置完成后,Workspace 在浏览器中打开,默认地址 http://localhost:5173

2. 模型选择器

Workspace 右上角有模型选择下拉菜单,支持按请求切换模型。实测支持的 provider 包括(不限于):

Provider 代表模型
Anthropic Claude Opus 4, Claude Sonnet 4, Claude Haiku
OpenAI GPT-4o, o1-preview, o1-mini, o3 系列
Google Gemini 2.0 Flash, Gemini 2.5 Pro
国产模型 GLM-4、Kimi(Moonshot)、DeepSeek V3/R1 等
本地模型 通过对应 Provider 的 API 接口接入 Ollama、vLLM 等本地部署

切换是按请求路由的——每个 Agent 调用可以选不同模型,不需要改代码、不需要重启服务。

3. Agent 类型与使用场景

Agent 默认 用途
Research Agent 综合研究主 Agent,统筹全流程
Biology Specialist 分子生物学、蛋白结构、基因组学
Physics Specialist 物理学专项
ML Specialist 机器学习训练、评估、Fine-tuning
Critique Sub-agent 批判性审查假设和实验设计
Literature Review Sub-agent 文献检索与综述
Plan Mode 只读模式,只生成研究计划,不执行

4. 290+ 科研技能一览

按类别举例(以下均为 Agent 可直接调用):

训练类 - DeepSpeed ZeRO-3 分布式训练 - PEFT:LoRA、QLoRA、AdaLoRA 等参数高效微调 - TRL:SFT(监督微调)、RLHF(强化学习)、DPO(直接偏好优化) - transformers Trainer 完整训练循环

评估类 - MMLU、HellaSwag、TruthfulQA、BIG-bench 等标准基准 - 自定义评估数据集加载与评分

数据集处理 - HuggingFace Dataset 下载、分割、格式转换 - Albumentations 图像数据增强 - Pandas 数据清洗与预处理

科学数据库(~30+ 内置工具) - 文献:arXiv API、OpenAlex、Semantic Scholar - 蛋白/基因:UniProt(蛋白质数据库)、PDB(结构数据库)、Ensembl(基因组) - 化学/药物:ChEMBL(药物发现数据库)、PubChem(化合物数据库) - 临床:ClinicalTrials.gov - 生物信息:BioPython、RDNKit、RSC(晶体结构)等

论文/写作 - arXiv 论文下载与解析 - LaTeX 写作辅助(公式、图表引用) - 自然语言驱动的文献摘要生成

可视化 - Matplotlib、Seaborn、Plotly 图表生成 - 分子结构 3D 渲染(RDKit + 3Dmol.js) - 基因组 Browser 轨道图

云算力 - Modal 云函数调用(无服务器 GPU 训练) - Tinker 等其他云端计算集成

5. MCP 服务器与扩展能力

OpenScience 支持 Model Context Protocol (MCP),可以接入额外的 MCP Server 来扩展工具集:

  • LSP 集成:编辑器提供代码补全、跳转到定义等 IDE 功能
  • TypeScript SDK:@synsci/openscience 包可编写自定义插件和 Agent
  • 插件系统:自定义工具、命令、主题
  • 项目级配置:openscience.json.openscience/ 目录放在项目根目录,优先级高于全局配置

典型适用场景

场景 1:ML 研究快速迭代

给 ML Agent 一个目标:"在 C4 数据集上用 QLoRA 微调 Llama-3-8B,评估在 HuggingFace Open LLM Leaderboard 上的表现"。Agent 会自动: 1. 查 arXiv 找相关论文,确定超参数范围 2. 写训练脚本(PEFT + DeepSpeed) 3. 提交到 Modal 无服务器 GPU 运行 4. 拉评估结果,生成 MMLU / HellaSwag 雷达图 5. 草拟一份结构化实验报告

场景 2:计算生物学蛋白靶点分析

给 Biology Agent 一个蛋白名称,它会: 1. 查 UniProt 获取全长氨基酸序列和功能注释 2. 查 PDB 获取三维结构,并内联渲染在 Workspace 里 3. 用 RDKit 分析结合口袋的氨基酸组成 4. 提出候选点突变建议,注明文献出处 5. 整个过程有完整 provenance 可追溯

场景 3:化学小分子药物筛选

给一个化学任务,Agent 会: 1. 从 ChEMBL 拉目标靶点相关的活性化合物数据 2. 从 PubChem 补充专利化合物信息 3. 用 RDKit 编写过滤脚本——类药五规则、分子量、LogP、脂溶性 4. 输出排名列表并附带分子结构图 5. 所有数据查询均有原始数据库来源记录

场景 4:跨模型对比评测

同一个研究问题,分别选 Claude Opus 4、GPT-4o、DeepSeek-R1 各跑一遍: - 模型切换是一键操作,不需要改 Prompt 或工具配置 - 适合学术研究中的模型公平性评测,或产品选型时的成本/质量权衡分析


坑与注意

⚠️ Agent 无沙箱隔离

README 明确声明:permission system 只负责告知你 Agent 在干什么,不做隔离。Agent 实际上可以执行任意 shell 命令,包括 rm -rf ~ 这类危险操作。处理敏感数据或运行不受信代码时,务必在容器或 VM 内运行。这不是 bug,是设计选择。

⚠️ 模型质量决定输出质量

OpenScience 是模型无关的路由层——换模型不换工具,但答案质量完全取决于所选模型。用低成本模型跑复杂生物实验可能产出无意义的假设;用前沿大模型跑简单文献总结则浪费成本。

⚠️ CentOS 7 不支持

glibc 版本(2.17)虽然满足最低要求,但内核版本(3.10)太旧。官方明确将 CentOS 7 列为不支持环境,即使 glibc 检测通过也需换主机或 VM。

⚠️ 首次引导默认启动本地服务器

默认端口 5173(Hono 开发服务器),防火墙需允许本地回环流量。如需远程访问,可以配合 SSH 隧道或反向代理,但不建议将端口直接暴露在公网。

⚠️ 源码开发用 Bun,不是 npm

从源码构建时用 bun install && bun dev,而非 npm install。npm 全局包只负责 CLI 使用,不参与源码开发流程。

⚠️ Atlas 是可选的,完全不强制

Atlas 的托管模型、预付钱包、研究图谱、托管算力等功能均为可选增强。纯 BYOK(自带 Key)使用完全免费,不被限流,不被监控。


与同类对比

维度 OpenScience Claude Science AutoGPT / LangChain Agents LabLab AI
许可 Apache 2.0(开源) 专有(闭源) 多为开源 多为开源
模型支持 任意 Provider 仅 Claude 系列 任意 任意
科研数据库 ~30+ 内置 ~5 个(UniProt/PDB/ChEMBL/GEO等) 需自行集成 需自行集成
内置技能数 290+(可编辑) ~60(精选,封闭) 依赖扩展生态 依赖扩展
执行环境 本地浏览器 Workspace Lab 机器/云端 本地/远程皆可 云端
数据主权 ✅ 数据留本地 ❌ 数据在云端 视配置 视配置
沙箱隔离 ❌(明确无) ✅(推测有) 视配置 视配置
YC 背景 ✅ YC W26

核心差异一句话:OpenScience 在"开源 + 模型自由 + 科研工具链深度集成"三者交集处是目前最完整的开源方案,代价是产品成熟度相比 Claude Science 仍有差距。对于需要在内部基础设施上跑科研流程、不想被任何厂商绑定的团队,OpenScience 是最优选。


一句话推荐结论

如果你需要一个不绑定任何 AI 厂商、能把"读文献→提假设→写代码→跑实验→写报告"全链路跑完的科研 Agent 工作台,且你的方向是机器学习、生物、化学或物理,OpenScience(2026 年 7 月)是目前最值得评估的开源选择——尤其是有数据主权要求或需要跨模型对比的团队。