Tom 视频脚本镜像 · arXiv 2607.07740 · Jet-Long

  • 日期与轮次:2026-07-13 R1
  • arxiv 链接:https://arxiv.org/abs/2607.07740
  • video-kb 脚本原路径/shared/video-kb/scripts/tom/2026-07-13_R1_jet-long-dynamic-bifocal-rope-128k-short-video-script.md

本镜像为 best-effort 副本,仅含视频生产所需的 3 节(标题与观众 / 口播稿 / 镜头分镜)。完整脚本含 §0/§2/§5/§6/§7/§8/§9 等详见 video-kb 脚本原路径。

1. 标题与观众

标题:Jet-Long 双焦 RoPE · Qwen3 零样本扩到 128K · H100 长上下文 prefill 1.39× FA2 · RULER +4.79 pp · HELMET-RAG 综合最佳

  • 目标观众:AI 工程师 / 大模型架构师 / 推理优化工程师(关心 RoPE 实战 / 长上下文扩展工程代价 / Qwen3 部署 / vLLM-HF 推理栈集成)
  • 一句话核心观点:Jet-Long 用 Dynamic Bifocal RoPE 把 RoPE 拆成短程保真 + 长程动态两个窗口,因子随当前序列长度动态调整 —— 在 Qwen3-1.7B/4B/8B 上零样本扩到 128K,H100 长上下文 prefill 达 FA2 的 1.39× 吞吐。

3. 45-90 秒口播稿

把大模型的上下文窗口从 32K 拉到 128K,工程上一直在踩一个坑:现有 zero-shot 扩展方法 —— PI、YaRN、RoPE-NTK、LongRoPE —— 都得提前敲定一个 rescaling factor。因子激进,短上下文失真;保守,长上下文塌陷。这是一道「固定因子 + 全局折中」的工程两难。

Jet-Long 这篇 arXiv 2607.07740 提了一个新打法:Dynamic Bifocal RoPE。它把 RoPE 拆成两个窗口 —— 短程保真窗口(local RoPE-faithful)+ 长程可缩放窗口(long-range, dynamic factor)。因子随当前序列长度动态调整:短输入时严格还原 base model,长输入时干净外推。短长分区,不再全局折中。

数字侧:H100 长上下文 prefill 达 FA2 的 1.39× 吞吐,逼近 Hopper-only FA4;单 batch 生成在各长度上额外开销 ≤ 4%。Qwen3-1.7B/4B/8B 上扩展到 128K,RULER 比最强 baseline 分别领先 +4.79 / +2.18 / +2.03 pp,HELMET-RAG 综合最佳,PG-19 困惑度最低。

工程拐点:inclusion-exclusion attention merge 合并两个窗口的 attention,无额外前向开销;on-the-fly RoPE correction rotation 在线补偿相位,整套融合到单个 CuTe kernel。唯一超参 w₀ 高度鲁棒,部署门槛低。

边界:仅验证 Qwen3 三个尺寸,未覆盖 Llama-3.x / DeepSeek / 闭源模型;评测缺 agentic / Repo-level coding 任务;tuning-free 指模型权重不动,但 CuTe kernel 替换需要改 vLLM / SGLang 推理栈。

正交对照:Sakana AI 的 DroPE 走相反方向 —— 训练用 RoPE,推理扔掉 PE。动态双焦 RoPE vs 扔掉 PE,两条独立的长上下文路径。

给 AI 工程师:下次做 Qwen3 长上下文 RAG,先看 1.39× prefill 和 ≤ 4% decode overhead —— 这是不是你要的拐点。

4. 镜头分镜

  • scene-1 hero(8s)
  • 屏幕文字:双焦 RoPE · 128K 零样本
  • 画面元素:标题卡 + arXiv 2607.07740 标识 + Qwen3 模型 chip 图标
  • 运动方式:标题卡从中心放大进入,副标题 stagger 入场
  • scene-2 cards(8s)
  • 屏幕文字:短保真 + 长程动态 = 双窗口
  • 画面元素:左右双窗对照卡(左 local RoPE-faithful 短程保真 / 右 long-range dynamic factor 长程可缩放)+ 动态因子公式 $G = \max(1, \lceil L / w_{pretrained} \rceil)$
  • 运动方式:双窗 stagger 入场,公式从下往上浮现
  • scene-3 flow(8s)
  • 屏幕文字:FA2 → 1.39× · decode ≤ 4%
  • 画面元素:3 节点吞吐 pipeline(FA2 基准 → Jet-Long 1.39× → 逼近 FA4)+ 单 batch 开销柱状对比图
  • 运动方式:从左到右 stagger 高亮,吞吐数字 96px 突出
  • scene-4 evidence(8s)
  • 屏幕文字:RULER +4.79 / +2.18 / +2.03 pp
  • 画面元素:Qwen3 三尺寸成绩柱(1.7B / 4B / 8B)+ HELMET-RAG 综合最佳标识 + PG-19 困惑度最低徽章
  • 运动方式:三柱 stagger 上升,对比 baseline 横线
  • scene-5 risk(8s)
  • 屏幕文字:tuning-free ≠ 改推理栈
  • 画面元素:风险卡 topic-specific #01-#04(#01 仅 Qwen3 三尺寸 / #02 缺 agentic 评测 / #03 GitHub 仓库未公开 / #04 vLLM/SGLang 集成路径待核验)
  • 运动方式:风险卡逐张滑入,停留 1.5 秒
  • scene-6 checklist(8s)
  • 屏幕文字:工程师评估三问
  • 画面元素:3 行 checklist(Qwen3 长上下文 RAG 场景 / vLLM 集成可行性 / 128K 以上窗口是否需要)
  • 运动方式:清单自上而下逐行 reveal,勾选图标逐个点亮
  • scene-7 closing(8s)
  • 屏幕文字:双焦 RoPE vs 扔掉 PE
  • 画面元素:双路对照卡(Jet-Long 动态双焦 / DroPE NoPE 推理)+ arXiv 2607.07740 / 2512.12167 双链接 + 「拐点是工程选型」字幕水印
  • 运动方式:双路 stagger 收束,水印从透明渐显