当 AI 读百万字资料就开始"糊",靠什么把它救回来?

  • 关联论文:2607.07386

你有没有过这种崩溃瞬间——

把一本 30 万字的技术书丢给 AI,问它第 28 万字那里到底讲了什么。它说:"根据上下文,这段讲的是……"

——然后自信地给你一个完全错的答案

不是它偷懒,是因为它根本记不住那么远的东西

这件事 2026 年正在卡住所有做 AI 产品的人:

  • 代码 Agent 看不到几千行代码库
  • 长视频多轮问答 在 1 小时以上的视频里开始胡说
  • 深度研究助手 在 100 篇论文里串不起来

最近 arXiv:2607.07386 做了一件很有戏的事——它用一种叫 "稀疏外积记忆" 的方法,把线性 RNN 的"长上下文短板"直接拉到接近全注意力 Transformer 的水平,并且不让算力爆掉

这件事对做 agent、长文档分析、检索增强系统的人都值得关注。

为什么这件事值得大众关注

这两年大模型圈对"长上下文"非常焦虑,有两条对抗路线:

路线 A:把注意力做大、做便宜(Full Attention 派) - 代表:FlashAttention、Ring Attention、MQA/GQA - 缺点:KV cache 随序列长度线性膨胀,100 万字让 GPU 显存直接爆

路线 B:换成固定大小的循环状态(Linear RNN 派) - 代表:Mamba2、Gated DeltaNet (GDN)、RWKV - 优点:每 token 算力和显存是常数——多长都不卡 - 致命缺点:状态太小,长上下文能力被锁死,"无限 context" 是个骗局

这就尴尬了。现实是:

  • 你需要的"长"——往往是 agent 的多轮工具调用、整个代码仓库、几十篇论文
  • 但你有的资源——是有限的 GPU 显存、有限的 token 费用

能不能"既要状态够大、又要算力不爆"?

arXiv:2607.07386 答:。核心一招是"稀疏化 GDN 的更新规则"——不是所有记忆槽都需要每次更新,只需要命中一小撮稀疏索引即可。这种"用稀疏换容量"既保住了常数 FLOPs,又把状态从 ~10³–10⁴ 拉到 ~10⁶–10⁷,三个数量级的跃迁

这篇论文核心讲了什么

一句话:用"稀疏寻址 + 大容量显式 memory"改造 GDN

SDM(Sparse Delta Memory)每个 token 走三步:

  1. 稀疏选 Key:把要读/写的"地址"用 Product-Key Memory 拆成两半做外积,再 top-k 选出几个稀疏索引——这一步和 memory size 大小几乎无关
  2. 稀疏写入:对被选中的那几个记忆槽,执行"遗忘门 + delta 增量更新"。没选中的原样不动。
  3. 稀疏读出:从被选中的几个槽做加权和,得到当前 token 的输出。

这套设计的核心严谨性是 isoFLOP——同样参数、同样算力下,SDM 把隐状态容量三阶跃迁地拉大:

架构 每 token 算力 状态大小 长召回能力
Full Attention O(L·d) O(L)
Mamba2 / GDN O(1) ~10³–10⁴ 差(天花板)
SDM(本文) O(1) ~10⁶–10⁷ 接近 Full

——这是 linear RNN 第一次在 isoFLOP 设定下同时击败 GDN 和 Full Attention 的工作。

一个额外的彩蛋:把"初始状态"也学出来

论文还做了一个精彩的设计——把 memory 的初始值 M₀ 也作为可学习参数。这一下让 memory 同时承担两个角色:

  • 在线 KV cache:推理时动态更新的工作记忆
  • 参数化知识库:M₀ 本身就编码了预训练学到的世界知识

换句话说,"模型权重"和"工作记忆"的界限开始模糊——这是未来 agentic memory 设计的重要参考。

实验结果一句话总结

  • 长上下文召回(RULER 基准):在所有长度(最长 1M tokens)上 SDM 一致高于 GDN,且 state 越大、in-context 学习能力越强。
  • 百万 token 上下文:SDM 仍然可用,GDN 在该尺度上几乎退化为随机
  • 8B activated 参数、1T+ tokens 训练:训练 loss 一致低于 GDN,短上下文准确率略优于 Full Attention baseline。
  • learnable M₀:在常识问答、推理任务上整体再涨——证明大状态不仅能做"在线 KV",还能装"参数化知识"。

为什么这件事对 2026 年的 AI 工程至关重要

如果你在做下面任何一种产品,这篇几乎都直接相关:

  • Agent / 工具调用系统:避免长上下文爆显存,constant FLOPs 是真正的省钱
  • 代码仓库级 AI 助手:能不能喂整个 monorepo 进去,就看长召回
  • 长视频多轮 QA:1 小时视频 = ~10k tokens,但 agent 多轮调用会膨胀到百万级
  • RAG 系统的隐式化:稀疏读本身就是"按 query 检索最相关的几个记忆槽"——SDM 可以被理解成"内化到模型权重中的 RAG",无需外挂向量库
  • Open-source LLM 选型:Qwen / LLaMA 系还在卷 Full Attention,SDM 类架构的 hybrid 变体很可能是下一代开源主力

它真正的价值不是"又一个 linear RNN",而是把"模型权重"和"工作记忆"的工程界限重新打开——未来你设计 agent 记忆系统时,会重新审视"哪些该外挂到向量库、哪些该烧进模型状态"。

三个工程落地风险别踩

风险 1:稀疏核支持还没成熟

PKM 的 top-k 索引在 N=10⁶ 量级上没有现成的高效 CUDA/Triton kernel。这是当前最直接的落地瓶颈——不是论文不行,而是 GPU 生态跟不上。从 FasterTransformer / FlashAttention 的稀疏接口扩展是必经一步。

风险 2:动态稀疏度破坏 batch 并行

不同 token 命中的 slot 可能不同,打破了标准 batch GEMM 的规律访存。Tensor Core 利用率会显著下降。生产部署必须做按最大 W 补零到固定形状,或用 vLLM 的 paged 思路管理 slot table。

风险 3:寻址坍缩(addressing collapse)

极端情况下训练可能 collapse 到少数几个 slot 全被命中("寻址坍缩")。必须监控各 slot 更新频率直方图,发现 90% 更新集中在少数 slot 时及时调整 key/query 投影的初始化或加 entropy 辅助损失。


延伸阅读 - 论文:arXiv 2607.07386(Sparse Delta Memory,Scaling the State of Linear RNNs through Sparsity) - 同方向工作:Gated DeltaNet (Yang 2025)、Mamba2 (Dao & Gu 2024)、Product-Key Memory (Lample 2019)、Fast-Weight PKM (Zhao & Jones 2026)、Memorizing Transformer、Landmark Attention - 工程起点:先在 1.4B 量级复现 hybrid (3:1 SWA:SDM) 配置做 ablation,再决定是否上 7B+ - 相关阅读:isoFLOP 设计哲学、WY 表示在 chunk-wise 并行训练里的复用方式

三个标题变体

  1. 当 AI 读百万字资料就开始"糊",靠什么把它救回来?——Sparse Delta Memory 把 linear RNN 的长上下文短板补上了
  2. 小模型也能撑住百万 token 长上下文:arXiv 2607.07386 给出"稀疏换容量"的工程答案
  3. 别再为 KV cache 买单了!这篇论文把隐状态容量拉到三个数量级,还不让算力爆掉

小红书风格卡片文案(可直接发布)

🧠 AI 读 100 万字就开始"糊"?

KV cache 撑不住 💥,长文档全是幻觉 ❌

不是模型不够大!是记忆架构不对!🔧

arXiv 2607.07386 给了答案 📄:Sparse Delta Memory (SDM)

🎯 一句话说清:

把 GDN 的"密集 K-V 外积更新"换成"稀疏寻址 + 大容量显式 memory"—— 同等参数、同等算力 下,把状态从 10³–10⁴ 拉到 10⁶–10⁷三阶跃迁

🔑 核心三招:

1️⃣ 稀疏选 Key(PKM 寻址) - 把地址拆两半做外积 → top-k 选索引 - 复杂度和 memory size 几乎无关

2️⃣ 稀疏写 + 稀疏读 - 只更新命中的几个槽 - 别的原样不动 → 常数 FLOPs 保住了

3️⃣ learnable M₀(彩蛋) - 初始状态也是可学习参数 - 让 memory 同时做在线 KV + 参数化知识库! - "模型权重"和"工作记忆"的界限开始模糊 🤯

📊 关键成绩:

isoFLOP 严格匹配——不靠算力换性能! ✅ RULER 长召回:所有长度(最长 1M tokens)显著高于 GDN百万 token:GDN 退化为随机,SDM 仍然可用! ✅ 8B × 1T+ tokens:训练 loss 低于 GDN,短任务略优于 Full Attention

🏗️ 架构对比表:

架构 算力 状态大小 长召回
Full Attention O(L·d) O(L)
Mamba2 / GDN O(1) ~10³–10⁴ 差(天花板)
SDM(本文) O(1) ~10⁶–10⁷ 接近 Full

🛠️ 工程落地清单:

Month 1:1.4B hybrid (3:1 SWA:SDM) ablation 复现 ✅ Month 2~3:上 7B+,解决 sparse kernel(从 FlashAttention 稀疏接口扩展) ✅ Month 6+:Agent 场景端到端验证(代码库、多轮工具调用、长链 reasoning)

⚠️ 三个关键踩坑点:

1️⃣ 稀疏核还没成熟 —— PKM top-k 在 N=10⁶ 没现成高效 kernel,自研是必经一步 2️⃣ 动态稀疏破坏 batch 并行 —— 命中率不规则,Tensor Core 利用率会掉;要做按最大 W 补零或 paged slot 管理 3️⃣ 寻址坍缩风险 —— 训练中少数 slot 可能吞掉 90% 更新;要监控更新频率直方图 + 加 entropy 辅助损失

💡 一句话总结:

用稀疏换容量——这就是 SDM 给 linear RNN 的解药。8B 模型也能撑百万 token 不糊,长上下文 Agent 终于不再"忘东忘西"。这套思路还将影响未来 agentic memory 设计——哪些该外挂向量库、哪些该烧进模型状态,值得重新想清楚。

📎 论文 ID:2607.07386

💬 评论区聊聊:你做 Agent 时被长上下文坑过吗?KV cache 爆显存?长召回胡说八道?欢迎分享踩坑经验 🤝