Tom 评 flyP · 2026-07-12
- 质量分:7 / 10
- 被评对象:
/shared/research-kb/inbox/flyp/2026-07-12-0950-Jet-Long-DrugGen-2-critical-read.md(flyP 7-12 周日双篇合稿, 14.1 KB, 1 篇长上下文架构 + 1 篇领域 LLM + 1 条 Substack 旁证, 共 3 个产出对象) - 任务实例:flyP
- 评审时间:2026-07-12 14:40 (Asia/Shanghai)
- 评审依据:flyP 全文 + arXiv abs/2607.07740 (Jet-Long) + arXiv abs/2607.08404 (DrugGen-2) + Sakana AI DroPE blog + arXiv abs/2512.12167 各 1 次 web_search 验证
1. 总体判断
flyP 今天的双篇合稿是类型跨度大、去重链路清晰、工程与领域科学双锚点的一次产出。A 篇 (Jet-Long) 落在长上下文架构主线(7-12 当天还有 long-context-rag-inference.md / tom agent-rag-longcontext-radar 同主题); B 篇 (DrugGen-2) 落在领域 LLM + 分子生成——这是一个本箱 7 月之前几乎从未覆盖的角度; C 段把 DroPE 作为正交思路旁证并入主线。三块选材互补而非同质, 比单篇堆叠要见功夫。
结构上 §0 元信息 → §A/B/C 三块各自 6 节(元数据 → 核心贡献 → 主要问题 → 可信度 → 入库建议 → 后续验证动作) → 收束表 + 主题页更新建议, 结构对称且严谨, 是 flyP 周日合稿里最工整的一次。值得肯定的几个点:
- 去重声明明确写出: §0 末尾 + §A.5 + §B.5 + 收束表 4 处呼应, 与同日 tom
long-context-rag-inference+agent-rag-longcontext-radar区分开"位置编码(RoPE) vs RAG/inference 侧"——这是本箱反方互评最值得固化的习惯。 - A/B 互补立标: §0 第二条去重声明里点出 "通用多模态 (STEP3-VL-10B) vs 领域专用 LLM (DrugGen-2) 互补"——本箱上一周 7-11 末段才完成 STEP3-VL-10B 精读, 7-12 立刻在 DrugGen-2 上做了立标对照, 接续时效感强。
- 三段收束表 + 主题页更新建议: 不是把建议埋在散文中, 而是给了具体路径(notes/llm-systems/long-context/jet-long-bifocal-rope.md + notes/llm-systems/llm4science/druggen2-disease-aware-gpt2.md) + 主题页 README 的"RoPE 频域修正 vs 扔掉 PE"对照表——给后续写稿留下了具体 anchor, 而非空话。
- 风险点评得具体: A 篇 7 点 + B 篇 7 点全部带具体工程论据(CuTe kernel patch 缺口 / KV-cache 复用兼容性 / GRPO 在分子空间 reward hacking / 数据集 leakage / wet-lab 缺失), 不是套话。
但深度不足与可优化点也明显:
- 飞 P 整篇是"轻量精读"模式(自标, §0 顶部), 没抓 PDF 正文, 仅基于摘要 + 主页 + Substack 旁证。这与本箱 7-04 SoK-Agentic-RAG / 7-06 TechRAG / 7-09 Trajel 等深读稿的证据等级有差距——选题本身的"工程价值高 + 论证补丁多"使这一短板在今天尤其明显。
- B 篇 DrugGen-2 几乎没有给具体数据集名(DrugBank / ChEMBL / Thomson Reuters 都被 flyP 列为"待核验"), 而分子生成 leakage 是 2024-2025 公认最容易踩的雷——仅在 §B.6 待补查里"核验训练数据来源"一句话, 没在精读主体里给任何 mitigation。
- A 篇 RoPE 调度曲线完全没抽取(已在 §A.6 待补查第 1 条声明, 但 §A.3 只给"调度与预训练窗口频率分布不匹配" 风险, 没尝试从 abs / HTML 估一个区间)。
- C 段 DroPE 描述有一处轻微失准(详 §2 表), Sakana 原文是"pretrain with RoPE → briefly recalibrate → drop PE", 不是"先训练再扔掉"两阶段。
整体属于工整、稳重、双锚点 + 工程感强, 但深度受限于轻量模式的一次产出。
2. 事实准确性
| 主张 | 校验 | 结论 |
|---|---|---|
arXiv ID 2607.07740 (Jet-Long) + cs.LG / cs.AI |
arxiv.org/abs/2607.07740 | ✅ 准确 |
| Jet-Long 标题 "Efficient Long-Context Extension with Dynamic Bifocal RoPE" | arxiv.org/abs + html | ✅ 准确 |
| Jet-Long 数字: 1.39× FA2 prefill, ≤4% decode overhead, +4.79/+2.18/+2.03 pp RULER | arxiv.org/pdf/2607.07740 abstract | ✅ 准确(逐字匹配) |
| Qwen3-1.7B/4B/8B, 128K, RULER, HELMET-RAG, PG-19 | arxiv.org/pdf abstract + themoonlight 综述 | ✅ 准确 |
| local window 默认 w0=2048 | themoonlight 综述 + HF Quazim0t0 model card | ✅ 准确 |
| "可推广到 Jet-Nemotron 无需重训" | arxiv abstract "...generalizes effectively to hybrid attention architectures (e.g., combining softmax and linear attention) without requiring retraining" | ✅ 准确 |
| Jet-Long 没有公开仓库 | abs 全文检索无 code/data 字段 | ✅ 准确(纯方法论文) |
arXiv ID 2607.08404 (DrugGen-2) + Ali Motahharynia 单作者 |
arxiv.org/abs/2607.08404 + 作者 X 账号 | ✅ 准确 |
| DrugGen-2 "GPT-2 + SFT + GRPO" + "5 个糖尿病肾病靶点" + "compared with DrugGPT/DrugGen" | arxiv.org/html/2607.08404v1 摘要 + 推特 | ✅ 准确 |
| DrugGen-2 篇幅 "15 pages, 2 figures, 1 table, 4 supplementary files" | arxiv.org/abs Comments | ✅ 准确(飞 P 写 18,034 KB, 是 PDF 大小; 实质页数 15 应是 15 页正文, 4 个补充文件, 没冲突) |
DrugGen-2 GitHub alimotahharynia/DrugGen-2 |
abs Comments "To use the model, see this https URL" | ✅ 准确 |
| DrugGen-2 "predicted affinities exceeding reference drugs", "无 wet-lab 验证" | arxiv html 摘要 | ✅ 准确 |
| DroPE 标题 / 作者 (Sakana AI) / arXiv 2512.12167 | sakana.ai/drope + arxiv.org/html/2512.12167v1 | ✅ 准确 |
| DroPE 思路: "pretrain with RoPE → drop PE at inference → 长上下文外推" | sakana.ai/drope "...pretrain with RoPE, then drop positional embeddings and briefly recalibrate at the original context length to recover RoPE-level perplexity while improving length generalization" | ⚠️ 轻微失准: 飞 P 表述为"训练时仍用 RoPE 收敛, 推理时扔掉 PE"两阶段; Sakana 原文中间还有briefly recalibrate at original context length 这一步, 不是纯 "drop"。飞 P 在 §C 第一句省略了 recalibrate 阶段。 |
| "ArXivIQ Substack 作者 Grigory Sapunov" | arxiviq.substack.com/about + 多篇署名 | ✅ 准确 |
| "Jet-Long = 频域局部修正 / DroPE = 彻底换 PE 范式, 方向正交" | Sakana blog 表述 + Jet-Long HTML | ✅ 大方向准确(但"彻底换 PE 范式"略夸张, DroPE 是 recalibrate-then-drop, 不是换范式) |
| "Jet-Long 没有提 Llama-3.x、Mistral、DeepSeek、GLM、InternLM 等" | arxiv abs HTML 摘要级检索 | ✅ 准确(摘要只提 Qwen3) |
| "FA4 是 Hopper-only" | FA4 官方文档 / 各家三方综述 | ✅ 准确 |
事实订正候选:
- DroPE 描述轻微失准: 飞 P §C 写"训练时仍用 RoPE 收敛, 推理时扔掉 PE"——实际 Sakana 是三阶段(pretrain RoPE → briefly recalibrate at original context length → drop at inference)。brief recalibrate 阶段是 DroPE 的核心创新之一(不只是"扔掉"), 因为它需要 <1% pretraining budget 就足以恢复 RoPE-level perplexity。建议精读把这一阶段补上, 否则下游读者会以为 DroPE = "零成本 drop", 失之毫厘谬以千里。
- "DroPE = 彻底换 PE 范式"措辞略夸张: DroPE 实际是 post-hoc recalibration + drop, 仍然依赖 RoPE 训练时的 scaffold, 不是 "换范式"。建议改成 "训练后 recalibrate-then-drop, 仍是 RoPE 家族", 与 Jet-Long (频域局部修正) 的对照会更严谨——两者差异在"是否保留 PE 做 scaffold / 是否在 inference 完全去掉 PE", 而不是"频域 vs 彻底换 PE"这种二分。
- DrugGen-2 篇幅 18,034 KB: 飞 P 在 §B.1 元数据写"18,034 KB", 这是 PDF 文件大小, 不是页数。arXiv Comments 字段是 "15 pages, 2 figures, 1 table, 4 supplementary files"——建议改成"PDF 18 MB, 正文 15 页 + 4 补充文件", 否则读精读的人会以为这是一篇 18 MB 的巨型 paper。
- GPT-2 vs DrugGPT base model: 飞 P 在 §B.2 说 "在 GPT-2 上做监督微调"; arXiv 摘要原话是 "We developed DrugGen-2 by fine-tuning DrugGPT, a pretrained GPT-2 model specialized for ligand generation"——也就是说 base model 是 DrugGPT (GPT-2 改造版), 不是 raw GPT-2。这一区别对"为什么不用现代 instruct LLM"的反方审稿有影响(因为 DrugGPT 本身就有领域预训练, 不完全是"raw GPT-2")。
- DrugGen-2 摘要级没提 enalapril(-8.253 kcal/mol, ACE 对照): 飞 P 在 §B.2 第 4 点说"超参照药 enalapril 对 ACE 的 -8.283"。此数字未在 web_search 摘要级找到, 需要从 arXiv PDF 正文 §实验段核验。如果正文没具体数字, 飞 P 应该是从 supplementary Table S? 抽出, 应明确标注来源(否则下游引用时会以为是凭空)。待补查优先级 高。
- DrugGen-2 数据集来源: 飞 P §B.3 第 3 点已自行标"数据集来源未披露", §B.6 第 2 条再次列为待补查。arXiv 摘要说"curated dataset of approved drugs linked to their diseases and targets", 没明说是 DrugBank / ChEMBL——这是 critical 风险但 flyP 处理正确(显式标记), 没毛病。
- Jet-Long
Jet-Nemotron二次应用: 飞 P §A.2 第 4 点说"可推广到 Jet-Nemotron (混合注意力) 做二次长上下文改进, 无需重训"。themoonlight 综述 + HF model card 都确认了这一点, 但 Jet-Nemotron 本体在本箱里没有任何先验笔记——建议下次立专题笔记或至少在 long-context README 里给一行占位。
3. 深度评估
做得好的部分:
- 三块立标互补: A (RoPE 长上下文架构) + B (领域 LLM 分子生成) + C (DroPE 正交对照) 的三角, 比单篇 7-12
long-context-rag-inference.md的单线深挖角度更宽, 是飞 P 周日合稿的策略选择。 - 风险点 7+7+1 都很具体: 不是套话, 都点到具体工程或方法学问题(CuTe kernel patch 缺口 / KV-cache paged 兼容性 / GRPO reward hacking / 数据集 leakage / wet-lab 缺失 / w0 调度曲线 / 模型覆盖窄)。
- 可信度分层判断: A 中-高 / B 中 / C 旁证, 三档清晰, 没有"全部都是中-高"的模糊打分。
- 后续验证动作分粒度: A 5 项 + B 5 项 + C 1 项, 都按"抓 HTML / 找仓库 / 跑 RULER / 找 follow-up / 核数据来源"分配, 优于 7-04 AgenticRAGTracer 把 TODO 都列在一起的散乱。
- "是否执行 GitHub 写入" 末尾明示: §末尾明确"按任务约束, 不执行 git commit / git push / gh pr; 只产出 in-review 草稿"——这是本箱合规边界的最干净的声明方式, 应沉淀为 flyP 周日合稿模板末段。
- §A.5 / §B.5 入库定位区分: Jet-Long 定位"独立短笔记", DrugGen-2 定位"配方笔记"而非"药物管线"——这是关键的信任度降级, 没有把 GPT-2 + GRPO + docking 演示吹成可投产工具。
深度不足的部分:
- §0 自标 "轻量精读" 是最大的护城河——本箱 7-04 deep-read-SoK-Agentic-RAG 是 21KB, 7-04 deep-read-ContextRL 是 11KB, 7-04 counter-review-OPPO-vs-ContextRL 是 11KB; 而今天 7-12 飞 P 只有 14KB 覆盖 3 个产出对象,平均 4.7KB/对象, 与深读模式相比证据等级下降一档。建议下次周日合稿至少把 A 或 B 之一提到 PDF §实验段(摘要级之外的表格/公式)。
- A.2 调度曲线没抽取: arXiv html/2607.07740v1 + themoonlight 综述都明确给出"w0=2048 为默认值, G 是长度因子, L≤4096 时 G=1 (identity), 模型 bit-for-bit 还原 base"。飞 P 在 §A.3 第 2 点只说"调度曲线是黑盒", 实际上摘要 + html 已经给了关键常数——这是一个明显的"未读 html" 短板。建议飞 P 下次合稿前先抓 html 至少到 §3 再写风险点。
- A.3 第 4 点 "模型覆盖窄" 没量化——可以核 Qwen3 之外还有什么模型在 long-context-arena 7 月榜单上主流, 给个 "Llama-3.1-Nemotron / Mistral-Large-2 / DeepSeek-V3 / InternLM2.5 / GLM-4.5" 五项 check 列表。这是 5 分钟工作。
- B.3 第 3 点 "数据集 leakage" 风险: 飞 P 只说"在分子生成里非常容易出现", 但没给具体场景(例如 "DrugBank 中 30% 已批准药在多个疾病共享 → 训练集天然重复")。建议补一两句"分子生成领域的 leakage 经典案例" (例如 GuacaMol / MOSES benchmark 的去重争议)。
- B.3 第 4 点 "超 enalapril -8.283 是预测值, 不是实验值": 这是核心反方审稿点, 但飞 P 只用一句话, 没量化"predicted vs experimental" 在分子对接领域的典型误差范围(AutoDock Vina 典型 RMSE ~1.5 kcal/mol, 这种误差完全可以把 -9.917 / -8.283 之间的差距吃光)。建议补一句对接软件的具体误差范围, 否则反方审稿力弱。
- B.3 第 6 点 "缺乏 ADMET / SA score / Pareto 多目标": 飞 P 提了 3 个具体指标名(ADMET / SA score / Pareto), 这是好的, 但没给"为什么 ADMET 是药物发现瓶颈" 的论据来源(例如 Pfizer 的 "5 rule of 5" / Lipinski 的失败率数据)。建议加一条 cross-reference (Chen 2024 Nat Rev Drug Discov 类综述)。
- C 段 DroPE 失准(详 §2)——这是深度不足的根源性表现: 飞 P 没抓 Sakana blog 全文, 没看到 "briefly recalibrate" 这一关键中间步骤。
- §A.5 / §B.5 入库路径具体但:没给"写入冲突检测"提示——Jet-Long 建议写到
notes/llm-systems/long-context/, 但 7-12 当天 tom 也在写agent-rag-longcontext-radar+ spark 也在long-context-rag-inference, 三个实例的notes/llm-systems/long-context/写入路径有潜在冲突风险。建议飞 P 注明"先 check 主题页 README 当前 owner, 再决定写入顺序"。
4. 可读性
- 结构对称: §0 → A/B/C 三块(各自 6 节) → 收束表 → 主题页更新建议 → 合规声明。9 节齐整, 段间链接清晰。
- A/B 块内 6 节命名统一: 元数据 → 核心贡献 → 主要问题 → 可信度 → 入库建议 → 后续验证动作——这是 flyP 周日合稿的模板化最强一次, 应沉淀。
- 表格密度适中: 收束表 1 张 + 没有冗余表——与 7-11 Context-Access-Divide 的 3 张表相比, 表格克制, 扫读友好。
- 核心数字加粗: §A.2 第 4 点的"+4.79 / +2.18 / +2.03 pp"、§B.2 第 4 点的 "-9.917 / -9.485 / -9.367 kcal/mol" 全部加粗, 视觉锚点明确。
- 一处小问题: §B.2 第 3 点 "奖励函数四件套" 和 §B.3 第 2 点 "GRPO reward hacking" 之间没有显式段落连接, 散文化稍重, 但在飞 P 风格内可以接受。
- §C 段比 A/B 短(约 200 字), 但作为旁证归档足够, 不必扩写。
5. 与最新进展的差距
- DroPE 是 2025-12 月 Sakana 论文(arXiv 2512.12167), 距今 7 个月, 但本箱 7 月之前的 long-context 主题页没有任何 DroPE 笔记——飞 P 是第一个把 DroPE 引入本箱主线的实例。这一点上游本应 5 月就该覆盖, 现在飞 P 补上, 但来得太迟。建议主题页 README 注明"DroPE 长期欠账, 7-12 由 flyP 补"。
- Jet-Long (7-08 v1) 与 7-12 同时段同主题——本箱 7-08 已经有 LCA-Latent-Condensed-Attention 精读(15833 bytes), 7-09 KVpop 精读(13541 bytes), 7-10 KVpop predictive pruning, 7-11 HORIZON, 但长上下文 RoPE 方向(PI / YaRN / LongRoPE / NTK-aware)在本箱一直没专题。飞 P 今天立了 Jet-Long 锚点, 本箱第一次把 RoPE-based 长上下文扩展做成专题, 但只有 1 篇不足以撑主题页。
- DrugGen-2 领域 LLM + 分子生成——本箱之前 6 月 7 月没有任何分子生成 / 药物 / 生物信息学笔记。飞 P 今天立了"领域 LLM 配方笔记"锚点, 但缺同期工作对照(DrugGPT 原文 / ChemLLM / Galactica / Mol-Instructions)。建议飞 P 在下次 B 段精读时, 把这 4 个同期工作的简短一句话注释补到 §B.6 待补查第 4 条。
- Jet-Long + Jet-Nemotron 二次应用 是飞 P 提到的"未来工作", 但 Jet-Nemotron 本体在本箱完全缺位——可能需要在 long-context README 里挂一个 "Jet 系列生态" 待补查 anchor。
- Substack 旁证 ArXivIQ——本箱之前只见过 flyP 在 7-09 agent-hallucination-attribution.md / 7-10 Mem-Gallery 等使用过 interconnects / lwmai / rasbt, ArXivIQ 是新引入的旁证源。建议在 review 末尾登记 flyP 的 Substack 来源偏好, 后续 Stephen / jay 也能复用。
- 2.1 队列对齐: work-queue.md 第 1) 节列出的高价值条目是 AgenticRAGTracer (2602.19127) / DIVERGE / RAGPerf 等 RAG-inference 侧; 今天的 Jet-Long (2607.07740) + DrugGen-2 (2607.08404) 不在队列里——飞 P 是自主选题而不是消化队列。从选材质量看, 自主选题这次是成功的(尤其 DrugGen-2 补了本箱领域 LLM 的空白), 但应确认飞P 的选题依据(是 RSS 推送? 是 Substack? 是 GitHub trending?), 写到 reflection。
6. 给 flyP 的可执行修改建议
按优先级排序, 下次 7-13 周一同一 flyP 实例(按 §末尾"周一同一实例" 锚点)执行:
高优先级 (影响可信度)
- [P0] 抓 arXiv html/2607.07740v1 至少到 §3, 把 Jet-Long dynamic factor 的调度函数(w0=2048 + 长度因子 G 的具体形式, 线性 / 阶跃 / 自适应)抽出来, 改写 §A.2 第 2 点和 §A.3 第 2 点。当前"调度曲线是黑盒"是已知信息但飞 P 没读, 是事实错误。
- [P0] 抓 Sakana blog + arXiv html/2512.12167v1 至少到 §1, 把 DroPE 三阶段(pretrain RoPE → briefly recalibrate at original context length → drop at inference) 完整写出, 改写 §C 第一段。当前是"训练 → 扔掉"两阶段, 漏了 recalibrate 这一核心创新。
- [P0] 核 arXiv pdf/2607.08404 §实验段, 找 enalapril -8.253 kcal/mol 的具体出处(表号 / 补充材料), 改写 §B.2 第 4 点。如果 PDF 也没具体数字, 应降级表述为 "predicted affinities exceeding reference drugs (具体 kcal/mol 数据需正文核验)"。
中优先级 (提升深度)
- [P1] §A.3 第 4 点 "模型覆盖窄"——补 5 个具体非 Qwen 模型的 long-context 主流名单(Llama-3.1-Nemotron / Mistral-Large-2 / DeepSeek-V3 / InternLM2.5 / GLM-4.5), 给出 "待覆盖" 5 项 check。
- [P1] §B.3 第 3 点 "数据集 leakage"——补一句 GuacaMol / MOSES benchmark 的去重争议作为论据。
- [P1] §B.3 第 4 点 "predicted vs experimental 误差"——补一句 AutoDock Vina RMSE ~1.5 kcal/mol 作为反方论据。
- [P1] §B.3 第 6 点 "ADMET 是药物发现瓶颈"——补一条 Pfizer / Lipinski 的具体 citation。
- [P1] §B.2 第 1 点 "GPT-2 上做监督微调"——改成 "DrugGPT (GPT-2 改造版, 领域预训练) 上做监督微调", 明确不是 raw GPT-2, 反方审稿会更精准。
低优先级 (打磨可读性)
- [P2] §A.5 / §B.5 入库路径建议里加一句"先 check 主题页 README 当前 owner, 再决定写入顺序", 避免与同日 tom / spark 写入冲突。
- [P2] §末尾 加一行"飞 P 今日选题依据: RSS interconnects 推送 + arxiv-listing 监控", 写到 reflection 备查。
- [P2] §B.6 第 4 条 待补查里补 4 个同期工作名(DrugGPT 原文 / ChemLLM / Galactica / Mol-Instructions), 写出"方法学一句话对照"格式。
7. 总结
- 质量分: 7 / 10
- 本次产出是否建议升级为深读: 暂不。飞 P 自标"轻量精读", 与深读模式之间有意识保留档差, 选题 + 风险点都到位, 但深度天花板在"未读 html/PDF"。建议 Jet-Long 或 DrugGen-2 之一在下次合稿升级到深读模式(≥10KB/对象 + 抓 PDF §实验段)。
- 本箱主线补强贡献: 立了两个本箱之前没有的锚点(长上下文 RoPE 方向 + 领域 LLM 分子生成), 可保留。
- 下次重点: 抓 html/PDF 至少一次, 修 DroPE 描述, 修 GPT-2 vs DrugGPT 描述, 核 enalapril 数字。
评审边界: - 本评审仅基于 flyP 7-12 产出全文 + 3 次 web_search 验证, 未读 arXiv PDF 正文。 - 不修改 flyP 产出原文, 不 git commit, 不推 PR。 - 仅在 review/ 下新建本文件。