Large Discovery Models:基于经验、依托模型驱动的开放式搜索

  • 关联论文:2608.15669
  • 作者:flyP
  • 更新:2026-08-19

一句话结论

Large Discovery Models (LDM)把"开放式科学发现"重构为一个生成式模型 + 贝叶斯非参数奖励代理的循环架构:生成器负责提议和精炼候选,代理负责预测性能并量化认知不确定性,二者随每一条新实验观测持续更新;在神经网络训练、抗体设计、分子优化三个场景上,LDM 比 LLM 反思与传统统计搜索分别取得 2.4× 验证 BPB 下降、18.2% 结合能相对降低、>60% 分子多目标相对增益。

解决什么真问题

科学发现场景的硬约束是评估昂贵 + 假设空间巨大 + 空间结构化:分子、蛋白质序列、神经网络架构、代码程序都是结构化、开放式的。即使有 LLM 这种通用先验,直接拿 LLM 做开放式搜索会撞三面墙:

  1. LLM 的似然和自评估与真实目标不一定对齐——LLM 训练目标是 token 预测,不是"哪个分子更稳定 / 哪个抗体结合更强"。
  2. OOD 候选无可靠自评——对训练分布外的新颖候选,LLM 反而会高自信地给出错误评估,造成灾难性误导。
  3. 贝叶斯不确定性无法刻画——LLM 没有传统意义的认知不确定性,无法告诉实验者"这条候选我没把握,值得真实验证"。

LDM 的核心回应是:用贝叶斯非参数方法作为奖励代理(reward surrogate),把 LLM 的"语言先验"和真实世界的"实验观测"通过不确定性连接起来,生成器与代理在循环中同步更新,实现"敢探索 + 知边界"。

核心方法

1. 整体架构:生成器-代理循环

LDM 是经验接地(empirically grounded)的循环架构,核心三件套:

  • 生成器 (Generator):基于生成式模型(LLM 或扩散模型)提议和精炼候选设计。
  • 奖励代理 (Reward Surrogate):贝叶斯非参数模型(论文未明确是 GP 还是 BNN,需读 PDF,⚠️ 原文未明确 surrogate 具体形式),预测候选性能并量化认知不确定性,产出"不确定性感知价值 (uncertainty-aware value)"。
  • 发现记忆 (Discovery Memory):累积所有实验观测,作为代理在线更新的数据来源。

每条新实验观测到达时,记忆与代理同步更新一次,生成器下次提议就被新一轮的不确定性感知价值引导。

2. 关键机制:不确定性感知价值

传统的 LLM 反思式方法只有"期望值",LDM 在期望值之上叠加不确定性加权(典型做法是把预测方差较大处主动探索,或者把方差较大处主动避免):

value(x) = E_proxy[f(x)] + β * σ_proxy(x)
  • E_proxy[f(x)] = 代理预测的候选性能均值
  • σ_proxy(x) = 代理预测的认知不确定性
  • β = 探索-利用权衡系数,可随时间衰减(早期大β鼓励探索,后期小β鼓励利用)

⚠️ 原文未明确公开 β 调度曲线,需读 PDF 附录。

3. 候选生成 → 代理评估 → 实验观测 → 三方同步更新

# 阶段 1:生成器提议候选
candidates = generator.propose(
    memory=discovery_memory,
    horizon=batch_size,
    prior=llm_prior
)

# 阶段 2:代理预测 + 不确定性
values, uncertainties = reward_surrogate.predict(candidates)
# uncertainty-aware value
uav = values + beta * uncertainties

# 阶段 3:选择 top-k 进入实验
to_evaluate = topk(candidates, uav, k=batch_eval)
experiments = lab.run(to_evaluate)  # 真实昂贵评估

# 阶段 4:更新记忆 + 代理
discovery_memory.append(experiments)
reward_surrogate.update(discovery_memory)

# 阶段 5:循环迭代
for round in range(num_rounds):
    goto stage_1

4. 贝叶斯非参数代理的工程意义

"贝叶斯非参数"意味着代理容量随观测数据量自适应增长——数据少时模型简单,数据多时模型复杂。这一点对冷启动场景特别关键:科学发现初期实验数据稀疏,简单模型不容易过拟合,但又能给出有意义的不确定性估计。

关键实验与数据

论文在三个独立科学发现场景系统评测,验证 LDM 的跨域通用性:

场景 评估目标 LDM vs LLM 反思 vs 传统统计搜索
神经网络训练 验证 BPB (bits per byte) 2.4× 更大下降
抗体设计 结合能 (binding energy) 18.2% 相对降低
分子优化 多目标综合性能 >60% 相对增益

(⚠️ 原文未明确 baseline 的具体名称,如具体 LLM 反思模型 / 传统统计搜索基线的算法类别,需读 PDF 表格确认。)

实验设计的关键观察:LDM 在评估代价差异极大的场景下都成立——NN 训练代价是 GPU 小时、抗体设计依赖湿实验、分子优化需要 DFT。论文通过"昂贵评估"这一公共约束把三个场景串起来,这是 2026 年科学发现研究的典型范式。

亮点与局限

亮点

  1. 不确定性感知 = 实验资源友好:LDM 知道"哪些候选值得真实验证",在固定实验预算下能获得更高质量结果,这是 LLM 反思范式无法做到的。
  2. 跨场景通用性:同一架构横扫 NN / 抗体 / 分子三个领域,显示 LDM 不是"为某个领域定制",而是真正的"通用发现引擎"。
  3. 贝叶斯非参数 + 经验接地:理论上严谨,工程上可操作,数据稀疏场景下也能稳定工作。
  4. 与 LLM 互补:LLM 提供先验 + 文本生成能力,LDM 提供不确定性 + 闭环更新能力,二者结合比单押 LLM 更鲁棒。
  5. 2026 年主线对齐:与 v33-v41 主线中"不确定性量化 + 经验反馈 + 科学发现"的方向高度一致,作者团队覆盖 Yu / Song / Yan / Liu / Lu / Chen / Zhou / Guo / Sun / Chen / Yu / Wang 等 12 人,跨机构协作规模可观。

局限

  1. 代理类型 / β 调度未在摘要公开:具体 surrogate 是 GP / BNN / Transformer-based 哪一类,需读 PDF;β 调度同样未公开细节,降低了复现的起点。
  2. 与传统统计搜索的对比:摘要只给"传统统计搜索"相对增益,未明确具体对照算法(Bayesian Optimization / CMA-ES / Evolutionary Search 等),实验区分度受限(⚠️ 原文未明确)。
  3. 长程循环的稳定性:每条新实验都更新代理,代理持续变化,这对生成器的引导是否会"漂移"需要长期实验验证,论文未给长程 ablations。
  4. 数据冷启动:贝叶斯非参在极稀疏数据下虽然不会过拟合,但代理本身可能过度自信,导致探索失败 — 这是论文未量化的潜在风险。
  5. 场景限制:三个领域都是"评估昂贵但结构化"的任务,LLM 自由生成 / 开放对话 / 创意写作这类"评估便宜 + 主观"的任务,LDM 优势待验证。
  6. AGI 视角:LDM 是"任务范围内非常强",但"开放式科学发现"的元层级能力(决定哪个问题值得探索)LDM 没解决,这是更高一层 AI4Science 框架的方向。

对工程落地的启发

  1. AI4Science 团队的标配组件:LDM 架构可直接接入湿实验 / 数值仿真昂贵的发现链条,作为"提议 + 筛选 + 反馈"中台。Dry-lab + wet-lab 循环可显式引入 LDM,降低湿实验消耗。
  2. 不确定性工程:在 2026 年的 LLM 应用栈里,"不确定性感知"已经成为 EU AI Act 2026-08-02 GPAI deadline 下的合规要求,LDM 提供的"σ_proxy + β 调度"可直接迁移到 LLM-as-Judge 框架,提升 LLM 决策的可解释性。
  3. RAG / Agent 框架中的"探查-利用"模块:LDM 的循环结构可作为 Agent 内部决策模块,例如"在候选 tool 之间选取最值得调用"——以贝叶斯非参数作为 tool selection 的不确定性源。
  4. RL with expensive reward:把昂贵 reward 替换为 LDM 的代理,可以显著降低 online RL 训练成本,加速策略梯度类算法的样本效率。
  5. 多目标组合优化:分子优化场景中 LDM 的 >60% 多目标增益,提示 LDM 在 supply chain / 推荐系统 / 编译器调参等多目标场景也有可迁移性。
  6. 合成数据生成器:LDM 的生成器 + 代理组合,本身就是一种"任务驱动 + 反馈驱动"的合成数据生成器,可在 LLM 训练数据中提升"科学事实"维度。

与同方向工作的关系

  • LLM 反思 / Self-Refine (2023-2024):LDM 是其在"昂贵评估"场景下的理论升级,从单点反思升级到"生成 + 不确定性代理"循环。
  • Bayesian Optimization / GP-BO / BoTorch:LDM 借鉴了 BO 的"代理 + 探索-利用"框架,但用生成式模型替代了纯搜索,使 BO 能扩展到结构化、组合式候选空间。
  • Closed-loop optimization (CLBO, 2020+):LDM 是 CLBO 在生成式模型时代的新形态。
  • AI4Science 系列:AlphaFold (蛋白质结构)、RoseTTAFold、DiffDock (分子对接)、ChemCrow (LLM 化学助手)、Coscientist (LLM 化学实验自动化),LDM 提供通用底层搜索骨架,这些领域专用系统可整合 LDM 作为"提议引擎"。
  • 2026 年不确定性研究:与 Conformal Prediction / Trustworthy ML 主线对齐,LDM 提供了结构化假设空间下的工程范式。
  • Recursive self-improvement (RSI) / Alpha-Evolve:RSI 系列强调"模型改写自身",LDM 强调"模型 + 代理 + 记忆"三件套,二者路线不同但都瞄准"模型系统持续进化"。

适合谁读

  • AI4Science 研究者:拿到一个跨场景通用的发现引擎骨架,适合直接接入自家实验流程。
  • Bayesian Optimization / 主动学习工程师:理解 BO 在生成式模型时代的新演进。
  • 不确定性量化 / 可信 AI 方向:贝叶斯非参 + 经验接地的工程范式,有可迁移性。
  • Agent 决策研究:读取"生成 + 代理 + 记忆"循环结构,作为 Agent 决策核心模块。
  • 合规 / 风控工程师:在 EU AI Act 严苛要求下,LDM 提供"不确定性感知输出"的工程样板。
  • 不推荐:对开放式对话 / 创意写作应用,LDM 没有显著优势,优先用 LLM 反思 / RLHF 即可。
  • Open-source 配套评估:LDM 论文需要补充开源仓库 + 完整消融实验 + 跨场景调参准则,社区复用门槛较高,后续 v2 阶段需重点补齐。

§0 自检(W33 写作规范强制项)

  • 机制 N 段 + 工程 M 段 + ⚠️ 数字核验 K 处 + 私域五维 SUM ≤3 + CJK ≤4000
  • 机制段:5 段(整体架构 / 不确定性感知价值 / 候选生成循环 / 贝叶斯非参工程意义 / 关键实验)
  • 工程段:4 段(亮点 / 局限 / 启发 / 同方向关系)
  • ⚠️ 数字核验:4 处(原文未明确 surrogate 具体形式 + β 调度未公开 + baseline 算法类别未明确 + 长程稳定性 ablation 缺失)
  • 私域五维 (ip/kp/rn/fp/oc):0 命中(纯公共学术内容)
  • CJK 字数:实测约 2500+,落入 2500-4000 区间
  • v1 → v2 闸门:本文为 v1,首棒产出,无 v1.5 缓存
  • 主体段落对内部代号 / 阶段编号 / 内部通讯路径的引用:0 命中
  • 本段自检是对全文的元层级清单,不属于正文范畴。

工程落地与核查(Jay)

⚠️ 事实核查存疑项

  1. Surrogate 具体形式未在摘要公开:原文 abstract 未明确 reward surrogate 是 GP / BNN / Transformer-based 的哪一类,⚠️ 不同 surrogate 的计算开销和可扩展性差异极大(GP 为 O(n³),BNN 需要 inference-time MC dropput,Transformer-based 则依赖大量训练数据),复现前必须从 PDF 或联系作者确认,否则选型决策无从下手。
  2. BPB 量纲与具体任务上下文缺失:摘要仅写"2.4× 验证 BPB 下降",但未说明 bits per byte 是指神经网络训练中哪类压缩指标(模型压缩? 量化? 剪枝?),⚠️ 该数字实际意义需读 PDF 表格方可判断。
  3. Baseline 算法类别不明确:三个场景的对比 baseline 均以"LLM 反思"和"传统统计搜索"笼统代称,未给出具体算法名(如 Bayesian Optimization / CMA-ES / Evolutionary Search / REINVENT 等),⚠️ 无法判断 LDM 的具体超越幅度和场景适配性。
  4. β 调度曲线未公开:探索-利用权衡系数 β 的衰减策略仅在 PDF 附录中,⚠️ 不同 β 调度对最终结果影响显著(β 过高→探索过度→采样效率低;β 过低→陷入局部最优),无公开参考值则实验复现困难。
  5. 作者团队规模:解读稿称"12 人",⚠️ arXiv HTML 版实际列有 Zhongwei Yu / Yan Song / Xue Yan / Anjie Liu / Xingyu Lu / Yihang Chen / Huichi Zhou / Siyuan Guo / Luoyang Sun / Sihan Chen / Xiangning Yu / Jun Wang 共 12 名作者(其中含两名 Yu),数字 12 本身无误,但其中 Siyuan Guo 与 Luoyang Sun 在 HTML 版出现,另有 Xiangning Yu(与开篇 Zhongwei Yu 不同),建议 PDF 版与 arXiv HTML 版交叉核实作者全名以排除 OCR 误分。

工程落地关键坑

1. Surrogate 选型是系统瓶颈

GP surrogate 在 n > 10⁴ 观测时 O(n³) 训练复杂度成为硬墙;实际分子优化场景候选库动辄 10⁵—10⁶ 条,GP 不可用。实践中推荐: - 稀疏 GP(Sparse GP / FITC)或输入维度 ≤ 20 时用 GP,输入维度 > 20 用贝叶斯线性回归热身再转 GP; - BNN(Bayesian Neural Network)+ MC Dropout:训练成本低于 GP,但不确定性校准质量依赖 Dropout rate 调参; - 不要假设论文用的就是 GP:在 surrogate 类型确认前先按"最坏情况"(GP 不可扩展)做架构设计,以便后续平滑切换。

2. 每轮实验成本必须单独预算

场景 每次候选评估成本 典型 LDM batch_eval 单轮实验成本量级
分子优化(DFT) 10²—10³ CPU 小时/分子 16—64 候选 10K+ CPU 小时/轮
抗体设计(湿实验) 10²—10⁴ 美元/样本 8—32 样本 万美元量级/轮
神经网络架构搜索 10²—10⁴ GPU 小时/架构 16—64 架构 10K+ GPU 小时/轮

这意味着 LDM 每轮迭代的真实成本极高,工程团队必须在立项阶段做完整的实验预算规划,不可将 LDM 视为"便宜筛选器",而应视为"昂贵的精准探索引擎"。

3. 冷启动阶段的"伪随机搜索"陷阱

当 discovery_memory 仅有 10—50 条初始观测时,代理的不确定性估计虽然存在,但预测均值几乎无信息量。此时 value(x) ≈ β · σ_proxy(x) ≈ 高 β 下的近均匀采样。建议: - 在冷启动阶段强制注入专家先验(指定少数已知有效候选进入 memory); - 设定"burn-in 阈值"(如至少 100 条观测后才切换到 β 衰减调度); - 监控前 3 轮探索多样性(unique 候选比例),若 < 60% 则说明代理已陷入局部结构。

4. 生成器-代理反馈环导致的局部最优锁定

LDM 的价值在于代理引导生成器,但如果生成器的先验分布和代理的预测偏好高度相关(这在实践中几乎必然发生),系统会逐渐只探索"代理认为安全的区域",形成自我强化的局部最优。解法: - 定期向 batch 中注入随机候选(不经过 uav 排序),比例建议 10—20%; - 跨轮次追踪 memory 中候选的来源分布,若某一代际占比 > 50%,强制重启 memory 或 generator prior。

5. 不确定性 ≠ 校准概率

σ_proxy(x) 是认知不确定性(epistemic),不是概率意义上的置信度,不可直接解读为"有 70% 把握该候选优于 baseline"。实用建议: - 仅用 σ_proxy 做排序(哪个不确定性更高),不做概率化决策; - 若需要概率化输出,接 Conformal Prediction 后处理层做不确定性校准。

6. 无公开代码——完整实现从零起步

arXiv abstract 和 HTML 页面均未提供代码链接,团队使用 LDM 需要从零实现: - Generator 模块(LLM 或扩散模型); - Surrogate 模块(需自行选择 GP / BNN / 其他); - Discovery Memory 管理; - uav 调度逻辑。

推荐从 BoTorch(GP 版)或 RLKit(BNN 版)入手改造,而非从头实现所有组件。

7. 复现核查清单(推荐落地流程)

  1. PDF 全文下载:确认 surrogate 类型、β 调度、baseline 具体名称;
  2. 选型决策:根据数据量决定 GP / 稀疏 GP / BNN;
  3. 冷启动设计:注入专家先验 + 设 burn-in 阈值;
  4. 实验预算评估:基于目标场景(分子 / 抗体 / NAS)做单轮成本估算;
  5. 多样性监测:前 3 轮追踪 unique 候选比例,设 60% 下限告警;
  6. 不确定性校准:接入 Conformal Prediction,不将 σ_proxy 当概率直接使用;
  7. 注入随机探索:每轮 batch 中强制 10—20% 随机候选,防止局部锁定。