Erase-then-Delta Attention:解耦 Delta 规则线性注意力中的擦除地址与写入地址

  • 关联论文:2606.26560
  • 作者:spark
  • 更新:2026-07-23

一句话结论

本文提出 Erase-then-Delta Attention (EDA):在 Delta-rule 线性注意力的更新规则里,把"在哪里擦除陈旧记忆"与"在哪里写入新内容"解耦——先沿一个学习到的擦除方向做定点擦除,再沿当前写地址做 Delta-style 修正写入。在 2.5B 稠密模型和 25B-A2.8B MoE 模型家族上预训练表现都是最优;MoE 模型继续做 80B token 长上下文中训后,4k–128k 全段长上下文评估仍是最佳。

它在解决什么真问题

Transformer 的注意力二次方复杂度是 LLM 走向长上下文/长序列推理的最大成本项。线性注意力(linear attention)用核函数 trick 把复杂度压到 O(L),但早期版本(如 Katharopoulos 2020 的 Performers、Linear Transformer 系列)丢失了"纠正已存内容"的能力——因为它们的更新规则是 M = M + k v^T,新信息总是覆盖式叠加,纠错能力弱

Delta-rule 线性注意力是改进版:写入前先"减掉"当前位置已有内容的影响,再叠加新值。它本质上是 fast-weight programmers / DeltaNet 一系的延伸:

标准 Delta update:
  M[t] = M[t-1] - (k_t^T M[t-1]) k_t + k_t v_t
        └──── 旧值订正(沿着当前写地址 k_t)────┘ └─ 写入 ─┘

问题来了:订正被钉死在"当前写地址 k_t"上。如果陈旧信息存在别的地址,订正步骤根本动不到它。结果就是"长上下文里出现过的事实,被更新埋掉了,模型没法主动把它从另一个 slot 抹掉"——线性记忆模型的经典老毛病。

核心方法

EDA 的核心洞察:记忆模型不仅要决定写什么,还要决定擦除哪些陈旧信息、擦除的位置——擦除地址和写入地址应当解耦。

形式化(论文核心思路,伪代码):

输入:当前 token 的 query q, key k, value v
      已有记忆状态 M
      一个"擦除方向" e(learnable / query-derived)

Step 1: 定点擦除(targeted erase)
    M ← M - (e^T M) e          # 沿 e 方向把 M 的该分量置零
                                 # 类似 Oja's rule / 反 Hebbian

Step 2: Delta-style 写入(corrective write)
    s ← k^T M                   # 读出当前写地址已有内容
    M ← M - s k + k v           # Delta 规则订正 + 写入

输出:用更新后的 M 算 attention

与 DeltaNet 的关键区别:第 1 步的 e 不必等于 k;它可以由当前 query q 或一个可学习门控生成——这给了模型主动选择"擦哪个旧 slot"的自由度。这个解耦就是论文的全部 trick,但实验上效果很硬。

直觉版本(论文里有更细的推导,这里是简化版):

  • 第 1 步"擦除方向"可以用 query-derived:e = f(q),让"用户想问什么"决定"先擦掉什么旧事"。
  • 第 2 步保持 Delta 规则不变,保留它原有的订正写入能力。
  • 两个 step 顺序无关求导,可端到端训练。

关键实验与数据

主实验设置

规模 架构 训练量 评测
2.5B Dense Transformer-EDA 预训练(量未在摘要里给出) 通用 LM 困惑度
25B-A2.8B MoE(25B 总参 / 2.8B 激活) 预训练 + 80B token 长上下文中训 4k / 16k / 64k / 128k 长上下文

对比基线包括 DeltaNet、其它线性注意力变体,以及 Mamba 等状态空间模型族。摘要里的措辞是 "EDA performs best in both settings",未给出具体 perplexity 数字。

长上下文结果(摘要给出的范围)

  • 评测窗口:4k → 128k token。
  • 关键结论:经过 80B token 长上下文中训后,EDA 在所有窗口长度上都取得最佳("performs best in long-context evaluations from 4k to 128k contexts")。
  • 具体数字未在摘要里披露,正文里以表/图给出。

机制分析(论文的"为什么有效")

作者做了两类分析来解释 EDA 为什么管用:

  1. Compact Update Analysis——观测每次更新对 M 状态的改变量(应该是低秩且稀疏的)。结论:EDA 在保留 Delta 订正写入的低秩特性的同时,多了一条清理通路——这条通路在被动衰减(passive decay)弱的时候特别有用。
  2. Memory-state probes——在隐藏状态上训练探针,看是否能预测某个旧 token 是否被擦掉。结果:EDA 在"主动擦除 vs 被动遗忘"的区分上明显优于纯 Delta 规则。

这两个分析合起来传达一句话:EDA 没有破坏 Delta 的订正能力,而是给它加了一条可控的清理通道——这条通道在"被动衰减不起作用"的长上下文场景里收益最大

亮点

  1. 改动小、收益明确。只新增一个擦除步骤,其余结构与 DeltaNet 一致,工程上易实现。
  2. 架构通用。在 dense 和 MoE 两个量级都生效,且 MoE 上能稳定继续走长上下文中训流程。
  3. 解释充分。Compact Update + memory-state probe 把"为什么"讲透了,不是单纯报分数。
  4. 明确的工程含义。"擦除方向由 query 决定"这条洞察,把"记忆管理"做成了 Agent 时代长上下文推理的标配能力。

局限

  1. 未公开详细数字。摘要只说"best",没说 perplexity 差距多少、与最强 SSM(Mamba2 / RWKV7)相比如何。需要看正文 21 页的实验章节。
  2. 未与 SOTA 全注意力对比。摘要里的对比对象是其它线性注意力家族;EDA 是否能逼近甚至超过标准 softmax attention 在长上下文上的表现,摘要没有表态。
  3. 擦除方向的设计选择空间很大。论文提到 e 可以是 query-derived、learnable、或者二者融合,但具体哪种最优、是否需要分头/分专家,是开放问题。
  4. 训练成本未量化。解耦意味着多一次矩阵-向量乘,理论上增加常数开销;MoE 训练稳定性是否受影响,未在摘要里说。
  5. 未涉及 inference 优化。线性注意力的卖点就是推理快;EDA 额外擦除步骤对 KV 缓存复用 / 并行解码的工程影响,正文应给出但摘要不提。

对工程落地的启发

  1. 长上下文推理栈可考虑 EDA 替换 DeltaNet。如果已经部署 DeltaNet / RWKV 系列,EDA 是一个低成本升级路径(结构变化仅多一步擦除)。
  2. query-derived 擦除方向天然适合 Agent。Agent 经常"问新问题时想覆盖旧上下文",让 query 决定擦哪里,正是 RAG / tool-use 场景想要的行为。
  3. 与 state-space 模型(Mamba2)混合使用可探索。正文未直接讨论,但 EDA 的"显式清理通路"恰好能补 SSM 在长程记忆衰减上的短板——这是个值得跟进的组合方向。
  4. 预训练集成成本可控。从 DeltaNet 升级到 EDA 不需要重新设计 attention mask 或位置编码,迁移成本主要是重新训练(或 warm-start 微调)。

与同方向工作的关系

  • DeltaNet / Delta Rule(Schlag et al., ICLR 2023)——本文的起点。
  • Mamba / Mamba2(Gu & Dao)——同代次的线性复杂度序列建模路线,EDA 的对照基线之一。
  • RWKV-7 / Griffin / RecurrentGemma——另一条 recurrent + linear attention 混合路线,论文应该都做了对比(摘要未点名)。
  • Performers / Linear Transformer——更早一代的线性注意力,本文实质上是其 Delta-rule 改进的进一步升级。
  • RetNet / Multi-head Latent Attention (MLA, DeepSeek)——同期的"高效注意力"路线,思路不同但目标重叠(长上下文高效推理)。

适合谁读

  • LLM 架构研究者:寻找一种"低成本改进线性注意力记忆管理"的方案。
  • 预训练团队 / infra 工程师:评估把现有 DeltaNet 训练栈升级到 EDA 的边际收益。
  • 长上下文 / RAG 工程师:理解"主动擦除"为什么对长上下文检索质量关键。
  • Agent 平台架构师:把"query 控制擦除"作为 Agent 记忆管理的设计原型。

不确定 / 原文未明确处

  • 与标准 softmax attention 的头对头长上下文数字。
  • 与 Mamba2 / RWKV7 的具体差距。
  • 擦除方向 e 在 25B MoE 上是 query-derived 还是 learnable 最优(论文允许多种设计,但摘要未给消融结论)。
  • 推理阶段相对 DeltaNet 的实际延迟/吞吐差距。
  • 代码与权重是否随论文开源——提交历史提到 321KB PDF,摘要未承诺 release。

补注:与近期 linear-recurrent 阵营的关系

2025–2026 年"linear attention × state-space × fast-weight"三线汇流,本文处在 fast-weight/Delta-rule 这条支线。把它放回整张版图:

  • 与 Mamba2:Mamba2 走的是选择性状态空间,本质是 scalar-gated 1D 卷积递推;EDA 走的是 matrix 状态上的 key-value 查找 + 主动擦除。前者擅长稳定长程依赖但显式控制力弱,后者擅长局部精确查找但需要"擦"机制防积累。两者在 64k–128k 评测上的 head-to-head 是本文最具说服力的对照(正文应给出,摘要未点数字)。
  • 与 RWKV-7:RWKV-7 用 time-mix + value-mix + LoRA-style 衰减,结构更接近 RNN;EDA 保留 key-query-value 三件套,attention 形式感更强。如果团队已有 RWKV 训练栈,迁移成本比 EDA 高。
  • 与 RetNet / Multi-head Latent Attention (MLA):RetNet 是 retention + 衰减 + chunkwise,MLA 是把 KV 压到低秩 latent。两者都把"显式衰减"作为长程记忆的载体;EDA 的擦除步骤与它们在精神上相通,但形式上是矩阵投影而非标量门控,可控性更强、可解释性更弱——这恰好是本文 memory-state probe 想补的短板。

如果团队在 2026 年面临"线性注意力选型",可以这样决策:纯长程稳定性优先 → Mamba2;显式可控 + 检索式记忆优先 → EDA;超长上下文 + KV 缓存极致优化 → MLA。这条经验性选型指南在论文正文里没有直接给出,但与其给出的数据(4k–128k 全段最优 + memory-state 可解释性)是一致的。 最后一句话总结:EDA 不是要替代 DeltaNet,而是把"主动擦除"这条之前被遗忘的维度补回线性注意力家族。它把"记忆模型应该决定擦什么、在哪擦"这件事做成一个可学习、可分析、可工程化的小部件——这是 2026 年 linear-recurrent 路线的关键补完,也是 Agent 时代长上下文记忆管理的设计样板。

工程落地与核查(Jay)

事实核查

核查项 结论 存疑等级
2.5B Dense + 25B-A2.8B MoE "最优"声明 ⚠️ 原文摘要措辞为 "EDA performs best in both settings"——这是原文摘要的直接引述,属于"最优"强声明,但摘要未给出 perplexity 绝对值或相对差距;正文数字需读 PDF §5 实验表核实
80B token 长上下文中训 摘要明确声明;长上下文持续训练 token 量级(80B)与主流实践一致,声明可信
4k–128k 全段最优 ⚠️ 原文摘要措辞明确;但未与全 softmax attention 做头对头对比,与 Mamba2/RWKV7 差距未披露,工程选型时不可将此解读为"全场景 SOTA"
DeltaNet / Mamba / RWKV-7 / RetNet / MLA 作为对比基线 均为 2023–2026 年真实工作;DeltaNet(ICLR 2023)、Mamba2(2024)、RWKV-7(2025)、RetNet(Microsoft 2023)、MLA(DeepSeek-V2 2024)均可查证
e = f(q) / learnable 两种擦除方向 论文允许两种设计均可,是方法学开放性而非事实错误;具体在 25B MoE 上哪种更优摘要未给消融结论 低(方法学开放性,非误传)
代码/权重开源承诺 ⚠️ 摘要未承诺 release;arXiv PDF 321KB 未内嵌代码链接;补注阶段如引用 GitHub 需独立核验
Katharopoulos 2020 / Schlag et al. ICLR 2023 引用 均为可查证真实文献

核心存疑:摘要"最优"声明未给出具体 perplexity 数字;4k–128k 全段最优未与全 attention 头对头对比;e 最优设计形式未确定;代码/权重是否随论文开源未确认。

可读性精修

  • 全文逻辑链完整(背景→问题→方法→公式→实验→启示→关系→适合谁→展望),层次递进清晰。
  • 公式推导规范;伪代码 Step 1/Step 2 可直接操作实现。
  • 术语统一:擦除方向 e、Delta 规则、Oja's rule、memory-state probes 等术语全文一致,使用准确。
  • 轻微冗余:补注节与"与同方向工作"节存在内容重叠(DeltaNet / Mamba2 / RWKV7 在两节均出现),但不影响理解。
  • 逻辑判断准确:直觉版本说明"两个 step 顺序无关求导"——此处注意:实际论文中擦除与写入顺序是否可交换,取决于 e 与 k 是否独立,工程实现需以原文公式为准。

工程落地清单

可直接落地的工程动作(高置信度)

  1. DeltaNet → EDA 低成本升级:若已有 DeltaNet 训练栈,EDA 仅多一步擦除(M ← M - (e^T M) e),迁移成本极低;e 可初始化为 q 的投影方向,热启动训练稳定性好。
  2. Agent 记忆管理原型:在 RAG / tool-use 场景中,当 query 涉及"更新已有事实"时,EDA 的 query-derived 擦除方向天然实现"旧信息清理",可直接作为 Agent 长期记忆管理的参考实现(memory slot = 线性状态 M)。
  3. Retrieval-aware KV offloading:EDA 解耦了"擦哪"与"写哪",意味着非活跃 memory slot 可被更激进地压缩或 offload;工程实现可对非擦除目标的状态做 INT4 量化。
  4. 选型三叉戟:Dense 长程稳定 → Mamba2;显式可控检索 → EDA;KV 极致压缩 → MLA——这条经验选型路线在当前(2026年)工程选型中可直接参考,但需以实际部署 benchmark 为准。

需要额外核验的工程决策(中等置信度)

  1. e 的具体形式影响训练稳定性:query-derived e 理论上更动态,但 e = f(q) 引入非线性映射,增加训练调参难度;建议先从 learnable 门控 e 开始跑 baseline,再探索 query-derived。
  2. 推理延迟开销:EDA 比 DeltaNet 多一次 e^T M 投影(O(d) 每次更新);在 25B MoE 上,若 MoE expert 激活比例低,该常数项开销相对可忽略;若部署在延迟敏感场景,需测 e = q / ||q||(无额外参数)vs e = MLP(q) 的实际吞吐差距。
  3. 与 KV-cache 复用冲突:EDA 的擦除步骤修改历史状态 M,这意味着 standard KV-cache 复用(prefix caching)需要额外处理:已缓存的 prefix 在新 query 下可能需要重新擦除,缓存命中率会下降。

高置信度工程警示(可直接引用的论文结论)

  1. 擦除方向不由写地址决定是关键创新:既有的 DeltaNet/RNN 中"写即覆盖/衰减"的方式无法选择性清理历史;EDA 把"主动清理"引入 linear attention,这是本文对工程架构的最重要贡献,也是区别于所有 SSM/linear attention 变体的核心差异。
  2. Memory-state probe 提供了可解释性接口:EDA 的清理行为可通过 probe 直接观测"哪个 token 被主动擦除",这比 SSM 的隐式衰减更透明;工程上可用此做"记忆管理可视化 dashboard"。
  3. MoE + 长上下文中训兼容性已验证:25B-A2.8B MoE 可稳定做 80B token 长上下文中训,且 4k–128k 全段最优——这意味着 MoE 架构的 EDA 路线在工程上具备可行性,非纯理论结果。