Jet-Long + DrugGen-2 · 短审稿(双篇合稿)

  • 实例: flyP
  • 轮次: 2026-07-12 09:50 (Asia/Shanghai)
  • 审稿模式: 轻量精读(不抓正文 PDF,仅基于摘要 + 主页 + 同主题对照 + 1 条 Substack 旁证)
  • 范围: 1 篇长上下文架构 / 1 篇领域 LLM + 1 条 Substack
  • 去重:
  • 2026-07-12-0950-long-context-rag-inference.md、tom agent-rag-longcontext-radar 是同主题线索,但本稿聚焦位置编码(RoPE)方向而不是 RAG/inference 侧。
  • DrugGen-2 是垂直领域 LLM,与最近审过的 STEP3-VL-10B(紧凑多模态基础模型)形成"通用多模态 vs 领域专用 LLM"互补。

A. Jet-Long — 动态双焦 RoPE 的零样本长上下文扩展

1. 元数据与来源

  • 标题:Jet-Long: Efficient Long-Context Extension with Dynamic Bifocal RoPE
  • 作者/机构:Haozhan Tang 等(提交记录 view-email 可联系)· 2026-07-08 v1
  • 链接:
  • arXiv: https://arxiv.org/abs/2607.07740 | HTML: https://arxiv.org/html/2607.07740v1
  • 主题:cs.LG / cs.AI
  • 篇幅:699 KB(PDF 较紧凑)
  • Substack 旁证:arxiviq.substack.com《Extending the Context of Pretrained LLMs by Dropping Their Positional Embeddings》—— 介绍 Sakana AI 的 DroPE("扔掉位置编码"),作为 Jet-Long 的正交思路对照

2. 核心贡献(基于摘要判断)

  1. 诊断痛点:现有 zero-shot 上下文扩展方法(PI、YaRN、RoPE-NTK、LongRoPE 等)需要事先固定一个 rescaling factor: - 激进因子 → 短上下文失真 - 保守因子 → 长上下文塌陷
  2. 方案:Dynamic Bifocal RoPE: - 把 RoPE 拆成短程保真窗口(local RoPE-faithful)长程可缩放窗口(long-range, dynamic factor)。 - 因子随当前序列长度动态调整,短输入时严格还原 base model,长输入时干净外推。
  3. 推理几乎免费: - inclusion-exclusion attention merge 把两个窗口的 attention 结果合并,无额外前向开销。 - on-the-fly RoPE correction rotation 在线补偿相位。 - 融合到单个 CuTe kernel,H100 上长上下文 prefill 达 FA2 的 1.39× 吞吐(逼近 Hopper-only FA4)。 - 单 batch 生成在各长度上额外开销 ≤ 4%
  4. 实验结论(摘要声明): - Qwen3-1.7B/4B/8B 上扩展到 128K,RULER 比最强 baseline 分别领先 +4.79 / +2.18 / +2.03 pp。 - 在 HELMET-RAG(HELMET 评测中最能预测下游长上下文表现的子集)取得综合最佳。 - PG-19 困惑度最低(语言建模侧证据)。 - 可推广到 Jet-Nemotron(混合注意力)做二次长上下文改进,无需重训。 - 标榜 "hyperparameter-resilient",部署门槛低。

3. 主要问题 / 风险点

  1. 没有微调成本 ≠ 没有工程成本: - "tuning-free" 指的是模型权重不动,但 CuTe kernel 替换、inclusion-exclusion 算子需要改推理栈(vLLM / SGLang / TRT-LLM 都不一定直接支持)。需要核验是否给出现成 patch 或 fork。
  2. Dynamic factor 的"动力学"是黑盒: - 摘要给出"短输入严格还原、长输入干净外推",但调度曲线(什么长度开始放大、放大速率、是否和 base 训练窗口对齐)没有披露。如果调度与模型预训练窗口的 RoPE 频率分布不匹配,可能在中间长度出现"中段失真"。
  3. benchmark 选择偏向"鲁棒性指标": - RULER / HELMET-RAG / PG-19 都是社区公认的长上下文鲁棒性评测,没有提真实长 agent / 工具调用任务(SWE-Bench、MTEB-Long、LongBench v2 agentic 子集、Repo-level coding)。 - 与我之前审的 HORIZON / LifeBench(长 horizon agent 评测)相比,Jet-Long 的评测任务语义浅,是否真能解决"agent traces 累积超 100K"这种痛点不确定。
  4. 模型覆盖窄: - 只验证 Qwen3-1.7B/4B/8B。摘要没提 Llama-3.x、Mistral、DeepSeek、GLM、InternLM 等。RoPE 变体在不同家族的 base θ / dim 不一样,外推到非 Qwen 族模型的可移植性需要后续核验。
  5. "逼近 FA4" 的论断: - FA4 是 Hopper-only,用 FA4 当上限是合理选择,但没有和 FlashAttention-3、FlashInfer、SageAttention 等做横评,说服力打折。
  6. "无需重训"是相对概念: - 即便权重不动,inclusion-exclusion attention merge 改变了 attention 输出,相当于在推理图上做了一层"软融合"。对需要 KV-cache 复用的 serving 框架(vLLM paged、SGLang Radix)有兼容性挑战,需要核验。
  7. 可复现性: - 699 KB 的 v1 + 摘要里没提代码仓库。需要核验作者是否在 GitHub 放了 CuTe kernel 实现、benchmark 脚本、对不同模型的 yaml 配置。

4. 可信度判断

  • 方法新颖性:中-高。把"双窗口 + inclusion-exclusion"做进单个 CuTe kernel 的工程味很浓,但学术创新点(dynamic factor scheduling)相对克制,更多是"对 PI/YaRN 类的工程优化"。和 arxiviq 提到的 DroPE(直接扔掉 PE) 比,Jet-Long 是频域局部修正、DroPE 是彻底换 PE 范式,方向正交。
  • 实验说服力:中。RULER/HELMET/PG-19 都成立,但缺乏 agentic / coding / RAG-in-the-loop 评测
  • 工程价值:高。对正在用 Qwen3 长上下文做 RAG / agent 推理的团队,部署收益(1.39× prefill、≤4% decode overhead)非常直接
  • 整体可信度中-高。论文逻辑自洽,数字具体,但需要看正文确认调度曲线 + 真实工程 patch 链接。

5. 是否建议入库

建议入库。建议写到: - notes/llm-systems/long-context/jet-long-bifocal-rope.md(一篇独立短笔记) - notes/llm-systems/long-context/README.md 增补一行:Jet-Long(动态双焦 RoPE,零样本,Qwen3-128K 验证)+ 链接 arxiviq DroPE 旁证

6. 后续验证动作

  • [ ] 抓 HTML(https://arxiv.org/html/2607.07740v1)核对 dynamic factor 的调度函数(是线性 / 阶跃 / 自适应?)
  • [ ] 在 GitHub 搜 Jet-Long 或作者 Haozhan Tang官方仓库 / 第三方实现(如附)
  • [ ] 与 SGLang / vLLM 社区的对应 PR / issue 交叉核验 CuTe kernel 集成路径
  • [ ] 在 agentic 任务上做一次最小复现:选 Qwen3-4B-Base + 128K context,跑一个 RULER 子集 + 一个 SWE-bench 长 context 子集,对照 YaRN
  • [ ] 把 arxiviq Substack 链接归档为 Substack 旁证(作者 Grigory Sapunov,2025 年底发表,可信度中-高)

B. DrugGen-2 — 把"疾病本体"塞进 GPT-2 微调的领域 LLM

1. 元数据与来源

2. 核心贡献(基于摘要判断)

  1. 明确批评现状: - 现有计算药物设计主流是"以 target 或通用分子属性为条件的生成",忽略了疾病上下文对 target 行为和治疗结果的影响
  2. 方案 DrugGen-2: - 在 GPT-2(注意是 base GPT-2,不是 GPT-3/4)上做监督微调,输入是"疾病本体 + 靶蛋白序列",输出是 SMILES / 分子。 - 训练管线:SFT → GRPO 强化学习。 - 奖励函数四件套:化学有效性、新颖性、多样性、预测结合亲和力。
  3. 评测(摘要声明): - 在 5 个糖尿病肾病(diabetic nephropathy)相关靶点上对比 DrugGPT / DrugGen 基线。 - 优势:生成唯一分子更多结构相似度更接近已批准药物全部 5 个靶点预测结合亲和力提升。 - 分子对接(molecular docking)佐证:发现候选配体预测亲和力 -9.917 / -9.485 / -9.367 kcal/mol超过参照药 enalapril 对 ACE 的 -8.283
  4. 定位:de novo design + drug repurposing,强调"疾病特异性"。

3. 主要问题 / 风险点

  1. base model 是 GPT-2: - GPT-2 与当代 LLM(Qwen3、Llama-3.1、DeepSeek、InternLM2.5-7B-Chem)相比,表示能力、in-context 能力、SMILES 语法归纳能力都明显落后。摘要里没解释为什么不上现代 instruct LLM。这是个"小模型完成大任务"型工作,门槛低但天花板也低
  2. GRPO 在分子空间的有效性存疑: - GRPO 在数学 / 代码上有效,是因为奖励信号紧贴最终正确性。在分子生成上,结合亲和力来自外部 docking / ML 预测器,奖励有偏、容易 reward hacking(生成 ML 预测器喜欢的、但 docking 真跑得分很差的分子)。摘要里没提 reward hacking 防护。
  3. 数据集是"已批准药物 + 疾病 + 靶点"三元组: - 数据规模、来源(DrugBank? ChEMBL? Thomson Reuters?)、是否去重 / 去泄漏 都没有在摘要里披露。这是一个 critical 风险:训练-测试 leakage 在分子生成里非常容易出现(药物本体反复出现)。
  4. "超 enalapril" 是预测值,不是实验值: - 摘要明确说 "predicted affinities exceeding those of reference drugs"。没有 wet-lab 验证。要等体外/体内实验才能判断价值。
  5. 任务域极窄: - 5 个糖尿病肾病靶点——疾病域 + 靶点域都窄。这是个纵向深、横向窄的工作,外推到其他疾病、其他靶点类别的可迁移性未验证
  6. 评估指标单一: - 主要看 predicted binding affinity(对接 / ML 预测)和 结构相似度没有看 ADMET(吸收 / 分布 / 代谢 / 排泄 / 毒性)、合成可及性(SA score)、Pareto 多目标。药物发现真正瓶颈往往在 ADMET 而非 binding。
  7. 复现性较好: - 给了 GitHub 仓库链接,这一点比 Jet-Long 好。但需要核验:仓库是否包含训练数据、Docking 软件版本(AutoDock Vina? Glide?)、GRPO 训练超参。

4. 可信度判断

  • 方法新颖性:低-中。SFT + GRPO + 多奖励 + 分子生成在 2024-2025 已是"配方级"成熟流水线,新增点是"疾病本体作为条件"。但因为只用 GPT-2 + 单一疾病,novelty 边际有限
  • 实验说服力:低-中。预测值主导、wet-lab 缺失、靶点域窄,是典型的"分子生成 demo"型工作,需要看正文 + 仓库后才能判断是否只是"对超参的胜利"。
  • 工程价值:中。仓库如果真包含完整 SFT/GRPO/docking 脚本,对学习"小模型 + 领域本体 + RLHF"管线有价值。
  • 整体可信度。结论的方向合理,但目前阶段不适合作为药物候选分子的真正筛选依据

5. 是否建议入库

建议入库,但定位为"领域 LLM 配方笔记",而非"药物管线"。 - 建议写到:notes/llm-systems/llm4science/druggen2-disease-aware-gpt2.md - 主题页 notes/llm-systems/llm4science/README.md 增补:"DrugGen-2(GPT-2 + SFT + GRPO,疾病本体条件生成,分子空间奖励多目标)"

6. 后续验证动作

  • [ ] 看 GitHub 仓库 https://github.com/alimotahharynia/DrugGen-2 是否有完整数据 + docking 脚本
  • [ ] 核验训练数据来源和去重逻辑
  • [ ] 在 1-2 个非糖尿病肾病靶点上做 zero-shot 测试(如果仓库允许),看外推性
  • [ ] 找同期工作(如 DrugGPT、ChemLLM、Galactica、Mol-Instructions)做方法学对照,写到笔记末尾
  • [ ] 关注是否有 wet-lab follow-up(PubMed 搜 "Motahharynia" 或 "DrugGen-2" 一年内的实验验证)

C. Substack 旁证:DroPE(ArXivIQ / Grigory Sapunov)

  • 链接: https://arxiviq.substack.com/p/extending-the-context-of-pretrained
  • 作者/专栏: Grigory Sapunov 的 ArXivIQ Substack(AI 论文速读专栏)
  • 发布时间: 2025 年底(与 Sakana AI DroPE 论文 2512.12167 同步)
  • 核心观点: Sakana AI 提出 DroPE(Dropping Positional Embeddings)—— 先用标准 RoPE 预训练,再"扔掉 PE"做一个 recalibration 阶段,让模型以 NoPE 形式推理。声称避免了 YaRN / RoPE-NTK 在压缩低频分量时带来的"语义失真"
  • 可信度: 中-高。ArXivIQ 是技术摘要专栏,作者是 ML 工程师;摘要内容与 Sakana AI 官方 blog 描述一致,但属于二手转述,不替代原文
  • 与本稿的关系: DroPE 与 Jet-Long 方向正交
  • Jet-Long = "保留 RoPE,但分窗口 + 动态因子"
  • DroPE = "训练时仍用 RoPE 收敛,推理时扔掉 PE"
  • 两种思路对"长上下文扩展是否需要显式位置编码"给出了相反答案——这正是知识库长上下文主题页值得并置的两条线索。
  • 后续行动: 把 ArXivIQ 链接 + DroPE 论文 ID(2512.12167)一同归档到 notes/llm-systems/long-context/README.md 的"正交方案对照表"。

收束

条目 是否入库 建议路径 后续动作
Jet-Long notes/llm-systems/long-context/jet-long-bifocal-rope.md 抓 HTML + 找仓库 + 跑 RULER 复现
DrugGen-2 ✅(定位为配方笔记) notes/llm-systems/llm4science/druggen2-disease-aware-gpt2.md 核验仓库 + 找 wet-lab follow-up
ArXivIQ / DroPE ✅(旁证归档) notes/llm-systems/long-context/README.md 旁证段 监控 Sakana 后续工作

主题页更新建议: - notes/llm-systems/long-context/README.md 增加"RoPE 频域修正 vs 扔掉 PE"对照表。 - 新建 notes/llm-systems/llm4science/README.md,把 DrugGen-2 作为"小模型 + 领域本体 + RLHF"配方的代表条目。

是否执行 GitHub 写入:❌ 按任务约束,不执行 git commit / git push / gh pr;只产出 in-review 草稿。