当 AI 读百万字资料就开始"糊",靠什么把它救回来?
- 关联论文:2607.07386
你有没有过这种崩溃瞬间——
把一本 30 万字的技术书丢给 AI,问它第 28 万字那里到底讲了什么。它说:"根据上下文,这段讲的是……"
——然后自信地给你一个完全错的答案。
不是它偷懒,是因为它根本记不住那么远的东西。
这件事 2026 年正在卡住所有做 AI 产品的人:
- 代码 Agent 看不到几千行代码库
- 长视频多轮问答 在 1 小时以上的视频里开始胡说
- 深度研究助手 在 100 篇论文里串不起来
最近 arXiv:2607.07386 做了一件很有戏的事——它用一种叫 "稀疏外积记忆" 的方法,把线性 RNN 的"长上下文短板"直接拉到接近全注意力 Transformer 的水平,并且不让算力爆掉。
这件事对做 agent、长文档分析、检索增强系统的人都值得关注。
为什么这件事值得大众关注
这两年大模型圈对"长上下文"非常焦虑,有两条对抗路线:
路线 A:把注意力做大、做便宜(Full Attention 派) - 代表:FlashAttention、Ring Attention、MQA/GQA - 缺点:KV cache 随序列长度线性膨胀,100 万字让 GPU 显存直接爆
路线 B:换成固定大小的循环状态(Linear RNN 派) - 代表:Mamba2、Gated DeltaNet (GDN)、RWKV - 优点:每 token 算力和显存是常数——多长都不卡 - 致命缺点:状态太小,长上下文能力被锁死,"无限 context" 是个骗局
这就尴尬了。现实是:
- 你需要的"长"——往往是 agent 的多轮工具调用、整个代码仓库、几十篇论文
- 但你有的资源——是有限的 GPU 显存、有限的 token 费用
能不能"既要状态够大、又要算力不爆"?
arXiv:2607.07386 答:能。核心一招是"稀疏化 GDN 的更新规则"——不是所有记忆槽都需要每次更新,只需要命中一小撮稀疏索引即可。这种"用稀疏换容量"既保住了常数 FLOPs,又把状态从 ~10³–10⁴ 拉到 ~10⁶–10⁷,三个数量级的跃迁。
这篇论文核心讲了什么
一句话:用"稀疏寻址 + 大容量显式 memory"改造 GDN
SDM(Sparse Delta Memory)每个 token 走三步:
- 稀疏选 Key:把要读/写的"地址"用 Product-Key Memory 拆成两半做外积,再 top-k 选出几个稀疏索引——这一步和 memory size 大小几乎无关。
- 稀疏写入:对被选中的那几个记忆槽,执行"遗忘门 + delta 增量更新"。没选中的原样不动。
- 稀疏读出:从被选中的几个槽做加权和,得到当前 token 的输出。
这套设计的核心严谨性是 isoFLOP——同样参数、同样算力下,SDM 把隐状态容量三阶跃迁地拉大:
| 架构 | 每 token 算力 | 状态大小 | 长召回能力 |
|---|---|---|---|
| Full Attention | O(L·d) | O(L) | 优 |
| Mamba2 / GDN | O(1) | ~10³–10⁴ | 差(天花板) |
| SDM(本文) | O(1) | ~10⁶–10⁷ | 接近 Full |
——这是 linear RNN 第一次在 isoFLOP 设定下同时击败 GDN 和 Full Attention 的工作。
一个额外的彩蛋:把"初始状态"也学出来
论文还做了一个精彩的设计——把 memory 的初始值 M₀ 也作为可学习参数。这一下让 memory 同时承担两个角色:
- 在线 KV cache:推理时动态更新的工作记忆
- 参数化知识库:M₀ 本身就编码了预训练学到的世界知识
换句话说,"模型权重"和"工作记忆"的界限开始模糊——这是未来 agentic memory 设计的重要参考。
实验结果一句话总结
- 长上下文召回(RULER 基准):在所有长度(最长 1M tokens)上 SDM 一致高于 GDN,且 state 越大、in-context 学习能力越强。
- 百万 token 上下文:SDM 仍然可用,GDN 在该尺度上几乎退化为随机。
- 8B activated 参数、1T+ tokens 训练:训练 loss 一致低于 GDN,短上下文准确率略优于 Full Attention baseline。
- learnable M₀:在常识问答、推理任务上整体再涨——证明大状态不仅能做"在线 KV",还能装"参数化知识"。
为什么这件事对 2026 年的 AI 工程至关重要
如果你在做下面任何一种产品,这篇几乎都直接相关:
- Agent / 工具调用系统:避免长上下文爆显存,constant FLOPs 是真正的省钱
- 代码仓库级 AI 助手:能不能喂整个 monorepo 进去,就看长召回
- 长视频多轮 QA:1 小时视频 = ~10k tokens,但 agent 多轮调用会膨胀到百万级
- RAG 系统的隐式化:稀疏读本身就是"按 query 检索最相关的几个记忆槽"——SDM 可以被理解成"内化到模型权重中的 RAG",无需外挂向量库
- Open-source LLM 选型:Qwen / LLaMA 系还在卷 Full Attention,SDM 类架构的 hybrid 变体很可能是下一代开源主力
它真正的价值不是"又一个 linear RNN",而是把"模型权重"和"工作记忆"的工程界限重新打开——未来你设计 agent 记忆系统时,会重新审视"哪些该外挂到向量库、哪些该烧进模型状态"。
三个工程落地风险别踩
风险 1:稀疏核支持还没成熟
PKM 的 top-k 索引在 N=10⁶ 量级上没有现成的高效 CUDA/Triton kernel。这是当前最直接的落地瓶颈——不是论文不行,而是 GPU 生态跟不上。从 FasterTransformer / FlashAttention 的稀疏接口扩展是必经一步。
风险 2:动态稀疏度破坏 batch 并行
不同 token 命中的 slot 可能不同,打破了标准 batch GEMM 的规律访存。Tensor Core 利用率会显著下降。生产部署必须做按最大 W 补零到固定形状,或用 vLLM 的 paged 思路管理 slot table。
风险 3:寻址坍缩(addressing collapse)
极端情况下训练可能 collapse 到少数几个 slot 全被命中("寻址坍缩")。必须监控各 slot 更新频率直方图,发现 90% 更新集中在少数 slot 时及时调整 key/query 投影的初始化或加 entropy 辅助损失。
延伸阅读 - 论文:arXiv 2607.07386(Sparse Delta Memory,Scaling the State of Linear RNNs through Sparsity) - 同方向工作:Gated DeltaNet (Yang 2025)、Mamba2 (Dao & Gu 2024)、Product-Key Memory (Lample 2019)、Fast-Weight PKM (Zhao & Jones 2026)、Memorizing Transformer、Landmark Attention - 工程起点:先在 1.4B 量级复现 hybrid (3:1 SWA:SDM) 配置做 ablation,再决定是否上 7B+ - 相关阅读:isoFLOP 设计哲学、WY 表示在 chunk-wise 并行训练里的复用方式
三个标题变体
- 当 AI 读百万字资料就开始"糊",靠什么把它救回来?——Sparse Delta Memory 把 linear RNN 的长上下文短板补上了
- 小模型也能撑住百万 token 长上下文:arXiv 2607.07386 给出"稀疏换容量"的工程答案
- 别再为 KV cache 买单了!这篇论文把隐状态容量拉到三个数量级,还不让算力爆掉
小红书风格卡片文案(可直接发布)
🧠 AI 读 100 万字就开始"糊"?
KV cache 撑不住 💥,长文档全是幻觉 ❌
不是模型不够大!是记忆架构不对!🔧
arXiv 2607.07386 给了答案 📄:Sparse Delta Memory (SDM)
🎯 一句话说清:
把 GDN 的"密集 K-V 外积更新"换成"稀疏寻址 + 大容量显式 memory"—— 同等参数、同等算力 下,把状态从 10³–10⁴ 拉到 10⁶–10⁷,三阶跃迁!
🔑 核心三招:
1️⃣ 稀疏选 Key(PKM 寻址) - 把地址拆两半做外积 → top-k 选索引 - 复杂度和 memory size 几乎无关!
2️⃣ 稀疏写 + 稀疏读 - 只更新命中的几个槽 - 别的原样不动 → 常数 FLOPs 保住了
3️⃣ learnable M₀(彩蛋) - 初始状态也是可学习参数 - 让 memory 同时做在线 KV + 参数化知识库! - "模型权重"和"工作记忆"的界限开始模糊 🤯
📊 关键成绩:
✅ isoFLOP 严格匹配——不靠算力换性能! ✅ RULER 长召回:所有长度(最长 1M tokens)显著高于 GDN ✅ 百万 token:GDN 退化为随机,SDM 仍然可用! ✅ 8B × 1T+ tokens:训练 loss 低于 GDN,短任务略优于 Full Attention
🏗️ 架构对比表:
| 架构 | 算力 | 状态大小 | 长召回 |
|---|---|---|---|
| Full Attention | O(L·d) | O(L) | 优 |
| Mamba2 / GDN | O(1) | ~10³–10⁴ | 差(天花板) |
| SDM(本文) | O(1) | ~10⁶–10⁷ | 接近 Full |
🛠️ 工程落地清单:
✅ Month 1:1.4B hybrid (3:1 SWA:SDM) ablation 复现 ✅ Month 2~3:上 7B+,解决 sparse kernel(从 FlashAttention 稀疏接口扩展) ✅ Month 6+:Agent 场景端到端验证(代码库、多轮工具调用、长链 reasoning)
⚠️ 三个关键踩坑点:
1️⃣ 稀疏核还没成熟 —— PKM top-k 在 N=10⁶ 没现成高效 kernel,自研是必经一步 2️⃣ 动态稀疏破坏 batch 并行 —— 命中率不规则,Tensor Core 利用率会掉;要做按最大 W 补零或 paged slot 管理 3️⃣ 寻址坍缩风险 —— 训练中少数 slot 可能吞掉 90% 更新;要监控更新频率直方图 + 加 entropy 辅助损失
💡 一句话总结:
用稀疏换容量——这就是 SDM 给 linear RNN 的解药。8B 模型也能撑百万 token 不糊,长上下文 Agent 终于不再"忘东忘西"。这套思路还将影响未来 agentic memory 设计——哪些该外挂向量库、哪些该烧进模型状态,值得重新想清楚。
📎 论文 ID:2607.07386
💬 评论区聊聊:你做 Agent 时被长上下文坑过吗?KV cache 爆显存?长召回胡说八道?欢迎分享踩坑经验 🤝