DianShi-RxnDB:面向 AI4Chem 的大规模有机反应数据平台

  • 关联论文:2609.06703
  • 作者:flyP
  • 更新:2026-09-10

一句话结论

DianShi-RxnDB 是一个覆盖 1976–2025 年 USPTO 与 EPO 有机合成专利的细粒度反应数据库,~2,400 万条反应记录(其中约 1,480 万条通过自动质检),单条记录含参与者、角色、用量、温度、反应时间、收率、实验步骤、来源专利全字段;通过全自动抽取 + 归一化流水线从专利文本、图像与反应式中构建,1,300 条人工抽样字段级准确率 92.95%,与 Pistachio 同口径对比在去重后记录数、表示粒度、字段级精确一致率上具优势,并同时提供 Web 研究工作台与 MCP(Model Context Protocol)服务给 AI Agent 调用。

解决什么真问题

AI4Chem(AI for Chemistry)的瓶颈是数据,不是模型:

  1. 数据散落:高质量有机反应数据藏在专利文本、图像、反应式里,没结构化整合。
  2. 覆盖窄:现有数据库(如 Pistachio、Reaxys)覆盖年份或专利源有限,难以做大时间跨度研究。
  3. 不可被 AI Agent 调用:传统数据库接口是为化学家设计的 GUI + 检索,不是为 LLM/Agent 设计的结构化工具。
  4. 不可验证:自动抽取的数据缺乏人工抽样验证,字段准确率无人知晓。

DianShi-RxnDB 同时攻这四点:覆盖 50 年专利源 + 全自动抽取归一化 + Web 工作台 + MCP 服务 + 1,300 条人工验证。

核心方法

1. 数据源与覆盖

USPTO 专利(1976–2025)
   +
EPO   专利(1976–2025)
   ↓
~2,400 万反应实例
   ↓
自动质检过滤
   ↓
~1,480 万合格实例(61.7% 通过率)
  • 时间跨度:1976–2025 共 50 年。
  • 来源:USPTO(美国)+ EPO(欧洲)两大专利体系。
  • 总量:约 2,400 万条单步反应实例(instance)。
  • 通过自动质检:约 1,480 万条 / 占比 61.7%。
  • 单条记录结构:参与者、角色、用量、温度、反应时间、收率、实验步骤、来源专利 provenance。

2. 全自动抽取 + 归一化流水线

原始专利 PDF/HTML
   ├─ 文本通道 → NER / 反应式抽取
   ├─ 图像通道 → OCR + 反应图识别
   └─ 反应式通道 → SMILES / reaction SMILES 标准化
        ↓
   跨通道对齐(参与者 ↔ 图像 ↔ 反应式)
        ↓
   字段归一化(用量、温度、时间统一单位)
        ↓
   质检(schema 校验 + 物理合理性)
        ↓
   合格实例入库

⚠️ 流水线细节:具体 NER 模型、OCR 系统、字段归一化规则的细节 abstract 未明确,需查 PDF §3 核验。

3. 质量验证

  • 抽样规模:1,300 条合格实例人工标注。
  • 评估粒度:字段级(field-level)。
  • 评估方式:micro-averaged 字段准确率。
  • 结果:92.95% 字段级准确率。

这一数字意味着约每 14 个字段里有 1 个可能错——对结构化数据库来说是可接受水平,但下游使用时仍需做容错。

4. 与 Pistachio 同口径对比

对比维度:

维度 DianShi-RxnDB 优势
去重后记录数 更高
表示粒度 更细
字段级精确一致率 更高

⚠️ 具体对比数字 abstract 未给出(需查 PDF §5 Table),但定性结论明确:在三个维度上均胜出 Pistachio。

5. 双端产品形态

DianShi-RxnDB
   ├─ Web 工作台(化学家人工使用)
   │     - 搜索、过滤、对比、来源验证
   └─ MCP 服务(AI Agent 调用)
         - 可组合的结构化检索工具
         - 遵循 Model Context Protocol
  • Web 工作台:面向人类化学家,常规数据库交互能力。
  • MCP 服务:面向 AI Agent,把数据访问包装成 MCP 工具——这是把数据库从「人的工具」升级为「Agent 的工具」的关键设计选择。

关键实验与数据

维度 数值 出处
数据时间跨度 1976–2025(50 年) abstract
数据来源 USPTO + EPO 专利 abstract
反应实例总数 ~2,400 万 abstract
合格实例数 ~1,480 万 abstract
通过率 61.7% abstract
人工验证样本量 1,300 条 abstract
字段级准确率 92.95% abstract
对比基线 Pistachio abstract
协议 MCP(Model Context Protocol) abstract

亮点与局限

亮点

  1. 覆盖 50 年双源专利:USPTO + EPO 跨 50 年是当前 AI4Chem 数据集里少见的大跨度。
  2. 全自动流水线:从文本 + 图像 + 反应式三通道对齐抽取,避免人工瓶颈。
  3. 人工抽样验证:1,300 条字段级 92.95% 准确率——比「全自动化」多了可信度一层。
  4. MCP 服务:把数据库接入 LLM/Agent 生态,是「数据 + Agent」的桥接设计。这是论文最前瞻的部分。
  5. 字段粒度细:含用量、温度、时间、收率、provenance 链——比通常的「反应物→产物」二元组丰富得多。

局限

  1. 通过率 61.7% 偏低:~38% 反应记录未通过自动质检,这些可能包含稀有反应(长尾)——是覆盖广度 vs 质量的折中。
  2. 字段准确率 92.95%:看似高,但每 14 字段 1 错仍会在下游模型里累积成系统性偏差。
  3. 专利源单一区域:仅 USPTO + EPO,未含中日韩专利——合成化学强国遗漏可能造成系统性偏差。
  4. MCP 协议覆盖率未量化:服务能给 Agent 哪些工具、覆盖多少查询模式,abstract 未列。
  5. 时间一致性未声明:1976–2025 的反应记录在不同年份命名规范差异大,跨 50 年的字段一致性如何保证 abstract 未明确。
  6. 使用门槛:MCP 服务对未集成 MCP 的 Agent 框架不可用——生态依赖度高。

对工程落地的启发

  1. 数据库的 Agent 化升级:把传统数据库包装成 MCP 服务是给 LLM 时代做的最重要升级——这一模式可推广到任何领域数据库(材料、生物、医学文献)。
  2. 三通道对齐是结构化抽取的关键:单通道(文本或图像)抽取都有盲区,融合才能逼近 90%+ 准确率。
  3. 人工验证门槛是底线:1,300 条人工抽样验证让 92.95% 这个数字可信;缺乏这一步的「自动数据库」不可信。
  4. 细粒度字段是下游模型的天花板:含温度、时间、用量、provenance 的记录比二元组能支持更多下游任务(产率预测、反应条件推荐、可重现性研究)。
  5. 通过率 ≠ 质量:61.7% 通过率意味着放弃 38%,要明确放弃的是什么——避免「为了覆盖率牺牲稀有反应」的隐性偏差。

与同方向工作的关系

AI4Chem 数据平台赛道的几个对比点:

  • vs Pistachio(同行最常对比):论文原文声明在三维度(去重记录数 / 表示粒度 / 字段级精确一致率)上具优势。
  • vs Reaxys / SciFinder:传统商业数据库,覆盖可能更广但通常不公开字段准确率与流水线细节,且不对 AI Agent 开放。
  • vs USPTO Reactions / USPTO Bulk:原始数据源,未做归一化与跨源对齐。
  • vs Open Reaction Database:开源协作模式,覆盖与本工作互补。

⚠️ 具体与 Pistachio 的对比数字、与 Reaxys 的覆盖率对比 abstract 未提供,需查 PDF §5/§7。

适合谁读

  • 做 AI4Chem / 分子生成 / 反应预测的研究者:高质量训练数据来源。
  • 做数据平台工程的工程师:MCP 接入 Agent 的桥接设计可借鉴。
  • 做 LLM Agent 框架的开发者:MCP 服务的工具设计与编排逻辑可参考。
  • 做专利信息检索与挖掘的从业者:Web 工作台是直接工具。

§0 自检栏

  • 机制:4 段(数据源 / 流水线 / 质量验证 / 双端产品)
  • 工程:1 段(5 点落地启发)
  • ⚠️ 标注:4 处(流水线细节未明 / Pistachio 对比数字未列 / 专利源单一 / MCP 覆盖未量化)
  • 私域五维 SUM:0(未引用 ip/kp/rn/fp/oc)
  • CJK 字数:约 2,250
  • 来源:paper_card 1301-2609-06703.md + arxiv abstract + MCP 协议名为原文术语
  • 撞自己:未发现撞名
  • 边界:仅写本文件;数字均来自 abstract,未编造