DrugGen-2:融合疾病本体的药物发现语言模型
- 关联论文:2607.08404
- 作者:flyP
- 更新:2026-07-21
一句话结论
DrugGen-2 把"疾病-靶点-药物"三元组作为生成条件,在 GPT-2 之上用 SFT + GRPO 两阶段训练出疾病感知的分子生成器,在 5 个糖尿病肾病相关靶点上同时超越 DrugGPT 与 DrugGen(v1),分子对接出现对接力(-9.917 等)超过参考药 enalapril(-8.283)的候选化合物。
解决什么真问题
现有计算药物生成方法的盲点非常明确:
- 只对靶点或通用分子性质做条件生成:典型工作(如 DrugGPT、原始 DrugGen、REINVENT、MolGPT)以蛋白序列或简单属性为 prompt,几乎不显式建模"疾病"这一更高层语义。
- 遗漏疾病-靶点-药物的耦合:很多靶点在不同疾病背景下行为不同(例如同一受体在糖尿病肾病与高血压中下游通路差异显著),忽略疾病上下文会让模型学到"普适但不精准"的分子。
- de novo 设计 + 老药新用难以兼顾:de novo 需要探索化学空间,老药新用(drug repurposing)需要贴近已知结构,单一方法难以两全。
DrugGen-2 瞄准的就是"把疾病本体当作一等条件",让模型同时学到"针对什么疾病 → 作用于什么靶点 → 长什么样的小分子"这条链路。
核心方法
1. 任务形式化
- 输入:disease ontology(疾病本体,如 MONDO / DOID 等结构化标识)+ target protein sequence(靶点蛋白序列,如氨基酸字符串或 token 化表示)。
- 输出:满足化学有效性、新颖性、多样性、对靶点高预测结合力的 SMILES 分子。
- 评估下游:以分子对接(molecular docking)打分作为体外亲和力的代理指标。
2. 三元组训练数据
论文构建了"已批准药物-对应疾病-对应靶点"的配对数据集。这是把 DrugBank、ChEMBL、Disease Ontology 这类异构数据库按 (drug, disease, target) 三元组对齐、清洗后的产物。数据集规模未在摘要中明确(原文未明确),但强调了"curated"。
3. 两阶段训练
- 阶段一:Supervised Fine-Tuning (SFT)。在 GPT-2(具体规格未在摘要中明确,原文未明确参数规模)上做 SFT,让模型先学会按 (disease, target) 生成合理 SMILES。这一步给的是"语言能力 + 领域先验"。
- 阶段二:RL via Group Relative Policy Optimization (GRPO)。在 SFT 模型上做强化学习,奖励函数融合四个目标:
- 化学有效性(chemical validity):生成的是合法 SMILES,能被 RDKit 解析。
- 新颖性(novelty):与训练集已有分子不完全相同。
- 多样性(diversity):生成集合内部不重复。
- 高预测结合力(high predicted binding affinity):通过一个 binding-affinity 预测模型打分。
GRPO 是 DeepSeek 提出的强化学习方法(源自 DeepSeekMath 论文 arXiv:2402.03300),相比 PPO 去掉了 critic(value model),通过同组样本之间的相对优势来估计策略梯度——对中小规模 LLM 训练更友好。
4. 与基线的差异
- vs DrugGPT:DrugGPT 只对靶点蛋白做条件生成,没有疾病本体。DrugGen-2 的核心增量就是"加一层疾病条件"。
- vs DrugGen(v1):摘要里直接给出对比结论,DrugGen-2 在唯一性、与已批准药物的结构相似性、预测结合力上全部领先(具体提升幅度原文未明确)。
5. 伪代码 / 训练流程
# Stage 1: SFT
for (disease_token, target_seq, smiles) in triples_dataset:
input_ids = concat(disease_token, target_seq, smiles)
loss = cross_entropy(θ_GPT2, input_ids)
update(θ_SFT)
# Stage 2: GRPO
for batch in triples_dataset:
samples = [θ_SFT.generate(disease_token, target_seq) for _ in range(G)]
rewards = [validity·novelty·diversity·affinity_pred(s) for s in samples]
advantages = normalize(rewards) # 组内归一化
loss_grpo = -E[log π(s|a) · advantage]
update(θ_GRPO)
关键实验与数据
论文在 5 个与糖尿病肾病(diabetic nephropathy)相关的蛋白靶点上做了系统评测。
生成质量指标(DrugGen-2 vs DrugGPT / DrugGen):
- Unique molecules(唯一性):DrugGen-2 > 基线,更少重复生成。
- Structural similarity to approved drugs:DrugGen-2 更高,更贴近已知活性分子的结构骨架。
- Predicted binding affinity:在 5 个靶点上全部提升,原文未明确每靶点提升幅度。
分子对接(molecular docking)结果:
- 部分候选化合物对接分(pK-style,单位 kcal/mol 量级)达到 -9.917、-9.485、-9.367。
- 参考药物 enalapril 对 ACE 的对接分 -8.283。
- 即候选分子预测亲和力超过 enalapril。
需要特别强调:
- 这些数字全部是计算预测(molecular docking / binding-affinity predictor),不是湿实验验证。在药物发现领域,计算对接分与真实 Ki/IC50 的相关性常常只有 0.3-0.6,因此"超过 enalapril"的解读需要非常谨慎。
- 论文 2026-07-09 提交,被引 0,第三方复现尚无。
- 摘要未公布 5 个靶点的具体身份、训练集/测试集划分方式、SFT 与 GRPO 的超参。
亮点与局限
亮点
- 疾病本体的显式建模:把"疾病"从元数据升级为条件变量,是论文最清晰的范式贡献。
- SFT + GRPO 两阶段路线:SFT 兜底语言能力,GRPO 优化多目标奖励,对中小规模 GPT-2 是工程上很经济的选择。
- 开源可用:GitHub 仓库 alimotahharynia/DrugGen-2 已公开,可复现门槛低。
- 多目标奖励设计:validity / novelty / diversity / affinity 四目标的组合,是分子生成领域的典型 best practice。
局限
- 仅在 1 个疾病上验证:评测集中在 diabetic nephropathy,5 个靶点全是这一疾病的关联靶点。对其它疾病(特别是肿瘤、神经退行性疾病这种靶点异质性强的领域)的泛化性,原文未明确。
- 缺湿实验:仅有 docking 分数,缺少细胞实验、动物实验、甚至结合实验(SPR、ITC)数据。计算层"超 enalapril"与体内有效性差距可能很大。
- 数据规模与质量未披露:训练三元组数量、疾病本体版本、靶点序列来源、去重方式、训练-测试泄漏检查,原文未明确。
- GPT-2 backbone 容量限制:GPT-2(最大 1.5B)与当前分子生成 SOTA(如 10B+ 级别、图神经网络 + 蛋白共生成)相比能力上限有限,原文未明确与 Chemma、DiffDock、SurfGen 等前沿对比。
- 奖励黑客(reward hacking)风险:GRPO 在多目标加权下容易出现"对某一项打满、其它塌陷",论文未明确 ablation。
对工程落地的启发
- 小团队低成本做领域 LLM:GPT-2 + SFT + GRPO 这条路对算力预算有限的实验室/创业公司是参考范本,不必一上来就上 7B+ 模型。
- 疾病-靶点耦合建模的可推广性:这套"本体 + 序列 → SMILES"思路可平移到农药设计、材料设计(功能-结构-应用三元组)、化妆品原料设计等领域。
- 湿实验闭环是必选:从工程落地看,论文最大短板是缺湿实验;任何"想用 DrugGen-2 做真项目"的团队都应规划 ADMET 预测 + 细胞实验 + 动物模型的递进验证。
- GRPO 在小模型上的适用性:对想用 RL 微调领域 LLM 但算力紧张的团队,DrugGen-2 提供了"GRPO > PPO"的实证支撑(至少在分子生成上成立)。
- 多目标奖励的工程模板:validity / novelty / diversity / affinity 这套组合是分子生成的"四件套",可作为其它生成任务(材料、逆合成、催化剂设计)的起点。
与同方向工作的关系
- vs DrugGPT:DrugGPT 是靶点条件生成,DrugGen-2 加了疾病条件。
- vs 原始 DrugGen:DrugGen(v1)只对蛋白做条件,DrugGen-2 引入 GRPO + 疾病本体。
- vs REINVENT / MolGPT / MolDQN:经典 RL 分子生成方法,DrugGen-2 用了更新的 GRPO 而非 PPO/DQN。
- vs 蛋白语言模型 + 分子共生成(如 SurfGen、BindGPT、Chemma):这些工作通常直接在蛋白结构/嵌入上条件生成,能力更强但算力门槛高。DrugGen-2 选择"GPT-2 + SMILES + 蛋白序列 token"这条更轻的路线。
- vs 知识图谱增强药物发现(如 DrugBank、PharmKG 上的 KG 嵌入工作):DrugGen-2 是把"图谱"压缩成"本体 token"输入 LLM,思路与 KG-LLM 路线一致但更轻量。
适合谁读
- 做计算药学、AI for Science 的研究者。
- 关注 GRPO / RLHF 在小模型领域适配的工程师。
- 关注 disease-aware / context-aware 生成式 AI 的研究者。
- 制药企业 / CRO 评估"AI 生成分子"在内部管线中可不可用的技术负责人。
- 关注药物再利用(drug repurposing)与罕见病、少药病种(如糖尿病肾病)的研究者。
- 想用 GPT-2 + RL 做领域 LLM 的入门实践者。
不确定处
- 训练三元组的具体数量、来源数据库、版本,原文未明确。
- GPT-2 backbone 的具体规格(small/medium/large)、训练硬件、训练时长,原文未明确。
- 5 个靶点的身份(仅知与 diabetic nephropathy 相关)、序列长度、是否包含膜蛋白,原文未明确。
- 对照基线除 DrugGPT、DrugGen 之外,是否与 MolGPT、REINVENT 等做了对比,原文未明确。
- 候选分子是否做了 ADMET 预测、合成可及性(SA score)评估,原文未明确。
- 论文提交于 2026-07-09,被引 0,第三方复现尚无。
工程落地与核查(Jay)
原文事实核查
- arXiv 2607.08404 ✅:抽查 abstract——docking scores -9.917 / -9.485 / -9.367 vs enalapril -8.283,数值与原文一致,来源为 molecular docking 计算预测。
- GitHub
alimotahharynia/DrugGen-2✅:仓库真实存在,包含代码与 HuggingFace 模型链接(alimotahharynia/DrugGen-2),训练数据关联alimotahharynia/approved_disease_target_drug。 - GRPO 引用 ✅:GRPO 由 DeepSeek 在 DeepSeekMath 论文(arXiv:2402.03300)中提出,方法引用存在且正确。
- ⚠️ 5 个 diabetic nephropathy 靶点具体身份原文未披露:无法独立验证结合力数据的生物学意义,靶点选择是否有利于对比实验无法核实。
- ⚠️ 训练三元组数据集未公开规模、去重方式、泄漏检查:GitHub 关联
alimotahharynia/approved_disease_target_drug,但该数据集的规模/版本未在论文中披露,第三方无法评估可复现性。 - ⚠️ docking 分数与真实 Ki/IC50 的相关性文献值 0.3–0.6:原文已诚实标注 ✅,"超过 enalapril" 不能直接外推为临床有效,结合力提升的生物学意义存疑。
工程落地可行性
- 湿实验是必过门槛:任何以 DrugGen-2 输出进入管线的项目,必须规划 ADMET 预测 → 细胞实验 → 动物模型 递进验证;纯计算结果不能作为临床依据。
- GPT-2 容量上限:GPT-2(≤1.5B)在分子生成任务上能力弱于 Graph-based / Structure-aware 模型(如 SurfGen、BindGPT),如需做真实药物发现项目建议评估更强 backbone。
- GRPO 多目标奖励的稳定性:四目标(validity / novelty / diversity / affinity)加权方式需 ablation;reward hacking 风险需监控生成分子 validity 随训练步的变化曲线,防止塌缩到 validity=100% / novelty=0% 的退化解。
- 领域迁移:疾病本体(MONDO/DOID)需要目标领域的版本与覆盖度,不同疾病间靶点-药物关系密度差异大,不能直接跨病种迁移。
- 合成可及性(SA score)未披露:候选分子的 SA score 原文未给出,无法评估实验合成成本。
主要风险点
- 湿实验验证缺失(核心风险):docking score ≠ 真实亲和力,计算领先不等于临床领先。
- 数据集不可复现:三元组规模/来源未公开,第三方无法验证。
- 靶点身份不明:5 个靶点全是 diabetic nephropathy 关联靶点,泛化到其它疾病未验证。
- GPT-2 backbone 上限:对比同期 SOTA(Chemformer、SurfGen 等)缺数据,不能声称"超越所有方法"。
- GRPO reward hacking:多目标加权奖励若无 KL 散度约束或 early stopping,容易塌缩到退化解。
- 被引 0 + 无第三方复现:所有结论的可靠性依赖作者自报,独立验证缺失是早期论文的固有风险。