• 日期:2026-07-15 R2
  • arxiv 链接:https://arxiv.org/abs/2607.07386
  • video-kb 脚本原路径:/shared/video-kb/scripts/tom/2026-07-15_R2_sparse-delta-memory-linear-rnn-sparse-state-capacity-short-video-script.md

1. 标题与观众

标题Sparse Delta Memory · arXiv:2607.07386 · Meta 一手实现 · GDN 稀疏推广 · 状态容量天花板释放层 · isoFLOP 1M tokens 长召回显著超过 GDN/Mamba2

目标观众:AI 研究工程师 / LLM 系统架构师(关心长上下文效率 + linear RNN 状态容量 + 稀疏化杠杆 + isoFLOP 严谨性 + hybrid 架构)

一句话核心观点:用 PKM 稀疏寻址把 GDN 的密集 K-V 外积换成稀疏读 / 稀疏写到 ~10⁶ 显式 memory,等参数等算力下状态容量从 10³ 拉到 10⁷(取决于 H),1M tokens 长召回显著超过 GDN。

脚本作者基于 arXiv:2607.07386 abstract + §3.1 verbatim 转述 · 非作者声明

3. 45-90 秒口播稿

「脚本作者基于 arXiv:2607.07386 abstract + §3.1 verbatim 转述 · 非作者声明 · 含推断成分 · 缺独立 ablation 印证。」

一篇 arXiv 论文(arXiv:2607.07386 · 2026-07 submission · CC BY 4.0 · Meta 一手实现 github.com/facebookresearch/sparse-delta-memory)拆出线性 RNN 状态容量天花板正在被释放 —— 脚本作者基于 arXiv:2607.07386 abstract + §3.1 verbatim 转述 · 非作者声明

问题:GDN/Mamba2 用固定大小循环状态解决 KV 线性膨胀,但状态太小被 Arora et al. 2025 实证证明「linear RNN 类架构『无限 context』叙事背后的真实短板 = 状态容量天花板」(双源标识 · 论文 RULER 实测 vs Arora 2025 论断 · 二者来源不同)· 直接扩状态 = 每 token FLOPs 同步增大 = 性能被算力约束反噬。

机制:Sparse Delta Memory(SDM)把 GDN 的「密集 K-V 外积更新」换成「Product-Key Memory 稀疏寻址 · 稀疏读 / 稀疏写到一个 ~10⁶ 量级的大容量显式 memory」· 用 PKM top-k 恒等式(top_k(s₁ ⊕ s₂) = top_k(top_k(s₁) ⊕ top_k(s₂)))· 复杂度 O(√N · d + W² + R²) · N = 10⁶ 量级高效。

严格 isoFLOP · 不靠算力换性能:参数对齐(W_q, W_k ∈ ℝ^{d × d_qk^total} + W_v ∈ ℝ^{d × d_v^total} GDN 与 SDM 相同)+ 算力对齐(GDN O(H · d_qk^GDN · d_v^GDN) vs SDM O(H^SDM · (W + R) · d_v^SDM) 与 N 无关)+ PKM top-k 额外算力 < 1% · 具体数字 d_qk^GDN = 64 + d_v^GDN = 128论文 §3.2 verbatim · 算力对齐分句拆解)。

数字 verbatim(arXiv §3.3 + §4.2):3 阶容量扩展 · 取决于 head 数 H论文自报 · 缺独立 ablation 印证 · GDN ≈ 10³–10⁴ → SDM ≈ 10⁶–10⁷)+ state 公式 M_size = (d_qk^total)² · d_v^total / (4H²) = O(d³) 增长 · 比参数 O(d²) 还快 + 1M tokens 长召回 · 论文 RULER 自报 · 缺跨论文 cross-eval 复现 + 8B activated × 1T+ tokens isoFLOP 训练 loss 一致低于 GDN + 短上下文 accuracy 略优于 full attention Transformer baseline(类比 · 论文未直接对比同规模 full-attention)。

退化路径锚定:当 N = d_qk, W = R = d_qk,稀疏 k_t^{(i)} 退化为稠密向量时 · SDM 更新公式完全退化为 GDN = GDN 严格稀疏推广。学到的初始状态 M₀ 让 memory 同时承担在线 KV + 参数化知识库两职(论文 §3.1 自报 · 缺独立 ablation 印证 · 厂商未公开声明战略意图)· 推理时不增加 FLOPs。

与 Mamba-3 正交不构成替代:R2 07-14 Mamba-3 改 SSM 核心(exponential-trapezoidal + complex state + MIMO)· 本轮 SDM 改记忆层(GDN 稀疏化 + PKM 寻址 + learnable M₀)· 二者技术路径正交 · 不构成替代字幕层务必显式声明正交 · grep 锚点 修订: PR8-...-vs-mamba3-orthogonal)。

中文样本边界 · 字幕层透明标注:中文样本 token 增幅边界可能小于长召回指标 · 论文未提供多语言覆盖度证据沿用 R1 07-15 D-RW6 · grep 锚点 PR6-...-chinese-coverage)· 本研究聚焦状态容量天花板释放层而非 tokenizer 经济学。

工程实证:github.com/facebookresearch/sparse-delta-memory(M2 · Meta Lingua fork · Triton + CUDA kernels)+ fla-org/flash-linear-attention(FLA 训练库 SDM 与 GDN 共享 WY 表示)+ state-spaces/mamba 上游仓库。

今天能带走什么:① 关注 GDN/Mamba2/SDM 三者在 7B+ isoFLOP 跨论文 cross-eval 复现 · ② 关注 PKM top-k 在 N = 10⁶ kernel-level benchmark 独立验证(论文 §3.1 自报 · 需独立验证 · grep 锚点 PR9-pkm-topk-overhead)· ③ 关注 learnable M₀ 作为参数化记忆的 ablation 印证 · ④ 关注 hybrid SDM 架构在 7B-70B 规模的开源实现 · ⑤ 关注 SDM 在 agentic 长上下文(代码库阅读 / 多轮工具调用 / 长链 reasoning)的工程落地。

4. 镜头分镜

  • scene-1 hero(8s)
  • 屏幕文字(≤ 22 字符压缩版):SDM · 状态容量天花板释放
  • 画面元素:标题卡 + arXiv:2607.07386 标识 + Meta facebookresearch/sparse-delta-memory GitHub logo + FLA fla-org 训练库 logo + state-spaces/mamba 链路徽章 + 「GDN 稀疏推广」副卡
  • 运动方式:标题卡从中心放大进入,arXiv + Meta logo + FLA + Mamba 徽章 stagger 入场
  • scene-2 cards(8s)
  • 屏幕文字:linear RNN 状态容量天花板
  • 画面元素:双路对照卡(上排 GDN/Mamba2 · O(1) · 状态太小 · Arora 2025 实证锁死 vs 下排 SDM · 稀疏读/稀疏写 · 显式 memory ≈ 10⁶)+ Arora 2025 论断副卡
  • 运动方式:双路 stagger 滑入,Arora 2025 副卡从下方淡入
  • scene-3 flow(8s)
  • 屏幕文字:SDM 层三步流程
  • 画面元素:3 卡流程(① Sparse Key Selection · W_k, W_q ∈ ℝ^{d × 2√N} + PKM 外积和 ② Gated Delta Write · forget gate α_t = exp(−A · softplus(W_a x_t + b_dt)) + input gate β_t = σ(W_b x_t) · 未命中 slot 保持原值 ③ Sparse Read · y_t = M_t^⊤ q_t = Σ q_t^{(i)} · M_t[i] · RMS-Norm → element-wise gating g → 输出投影 W_o
  • 运动方式:3 卡 stagger 滑入,每步流程数字标号从下方浮起
  • scene-4 isoFLOP(8s)
  • 屏幕文字:严格 isoFLOP · 不靠算力换性能
  • 画面元素:3 张对齐卡(参数对齐 · W_q, W_k + W_v GDN/SDM 相同 + 算力对齐 · GDN O(H · d_qk^GDN · d_v^GDN) vs SDM O(H^SDM · (W + R) · d_v^SDM) 与 N 无关 + PKM top-k 额外算力 < 1%)+ 数字卡 d_qk^GDN = 64 + d_v^GDN = 128
  • 运动方式:对齐卡逐张揭示,PKM top-k < 1% 数字脉冲高亮
  • scene-5 evidence(8s)
  • 屏幕文字:数字三连发 · 硬指标 verbatim
  • 画面元素:硬指标卡(3 阶容量扩展 · GDN 10³–10⁴ → SDM 10⁶–10⁷ · 取决于 H + 1M tokens RULER · SDM 显著高于 GDN + 8B × 1T tokens isoFLOP · loss < GDN · 短超 Transformer)+ RULER 长召回曲线(GDN 退化 vs SDM 维持对比)
  • 运动方式:硬指标卡逐张揭示,曲线对比从右侧推入
  • scene-6 risk(8s)
  • 屏幕文字:边界限定语 · 9 类不可引用风险
  • 画面元素:9 张风险卡(#01 arXiv preprint · ICLR 待披露 / #02 8B × 1T 论文自报 · 权重未公开 / #03 Arora 2025 间接证据 / #04 hybrid 3:1 + SWA 128 论文自报 · 缺模型卡片 / #05 PKM top-k 边界 < 1% 论文自报 · 需 kernel benchmark / #06 1M tokens RULER 论文自报 · 缺跨论文 cross-eval / #07 Learnable M₀ 论文自报 · 缺独立 ablation 印证 / #08 linear RNN 整体快速演进 · 不可长期架构拐点断言 / #09 SDM vs Mamba-3 技术路径正交 · 不构成替代)
  • 运动方式:风险卡逐张滑入,停留 1.5 秒,橙色警示角标
  • scene-7 closing(8s)
  • 屏幕文字:今天能带走什么 · 5 行动
  • 画面元素:5 行 checklist(① 关注 7B+ isoFLOP 跨论文 cross-eval 复现 ② 关注 PKM top-k kernel-level benchmark ③ 关注 learnable M₀ ablation 印证 ④ 关注 hybrid SDM 在 7B-70B 开源实现 ⑤ 关注 SDM 在 agentic 长上下文工程落地)+ 主源卡(arXiv:2607.07386 · github.com/facebookresearch/sparse-delta-memory · github.com/fla-org/flash-linear-attention · github.com/state-spaces/mamba)+ 双源标识卡(论文 §4.2 RULER 实测 vs Arora 2025 论断 · 来源不同)
  • 运动方式:清单自上而下逐行 reveal,勾选图标逐个点亮,主源 + 双源标识双层 stagger 收束