Erase-then-Delta Attention:解耦 Delta 规则线性注意力中的擦除地址与写入地址
- 关联论文:2606.26560
- 作者:spark
- 更新:2026-07-23
一句话结论
本文提出 Erase-then-Delta Attention (EDA):在 Delta-rule 线性注意力的更新规则里,把"在哪里擦除陈旧记忆"与"在哪里写入新内容"解耦——先沿一个学习到的擦除方向做定点擦除,再沿当前写地址做 Delta-style 修正写入。在 2.5B 稠密模型和 25B-A2.8B MoE 模型家族上预训练表现都是最优;MoE 模型继续做 80B token 长上下文中训后,4k–128k 全段长上下文评估仍是最佳。
它在解决什么真问题
Transformer 的注意力二次方复杂度是 LLM 走向长上下文/长序列推理的最大成本项。线性注意力(linear attention)用核函数 trick 把复杂度压到 O(L),但早期版本(如 Katharopoulos 2020 的 Performers、Linear Transformer 系列)丢失了"纠正已存内容"的能力——因为它们的更新规则是 M = M + k v^T,新信息总是覆盖式叠加,纠错能力弱。
Delta-rule 线性注意力是改进版:写入前先"减掉"当前位置已有内容的影响,再叠加新值。它本质上是 fast-weight programmers / DeltaNet 一系的延伸:
标准 Delta update:
M[t] = M[t-1] - (k_t^T M[t-1]) k_t + k_t v_t
└──── 旧值订正(沿着当前写地址 k_t)────┘ └─ 写入 ─┘
问题来了:订正被钉死在"当前写地址 k_t"上。如果陈旧信息存在别的地址,订正步骤根本动不到它。结果就是"长上下文里出现过的事实,被更新埋掉了,模型没法主动把它从另一个 slot 抹掉"——线性记忆模型的经典老毛病。
核心方法
EDA 的核心洞察:记忆模型不仅要决定写什么,还要决定擦除哪些陈旧信息、擦除的位置——擦除地址和写入地址应当解耦。
形式化(论文核心思路,伪代码):
输入:当前 token 的 query q, key k, value v
已有记忆状态 M
一个"擦除方向" e(learnable / query-derived)
Step 1: 定点擦除(targeted erase)
M ← M - (e^T M) e # 沿 e 方向把 M 的该分量置零
# 类似 Oja's rule / 反 Hebbian
Step 2: Delta-style 写入(corrective write)
s ← k^T M # 读出当前写地址已有内容
M ← M - s k + k v # Delta 规则订正 + 写入
输出:用更新后的 M 算 attention
与 DeltaNet 的关键区别:第 1 步的 e 不必等于 k;它可以由当前 query q 或一个可学习门控生成——这给了模型主动选择"擦哪个旧 slot"的自由度。这个解耦就是论文的全部 trick,但实验上效果很硬。
直觉版本(论文里有更细的推导,这里是简化版):
- 第 1 步"擦除方向"可以用 query-derived:
e = f(q),让"用户想问什么"决定"先擦掉什么旧事"。 - 第 2 步保持 Delta 规则不变,保留它原有的订正写入能力。
- 两个 step 顺序无关求导,可端到端训练。
关键实验与数据
主实验设置
| 规模 | 架构 | 训练量 | 评测 |
|---|---|---|---|
| 2.5B | Dense Transformer-EDA | 预训练(量未在摘要里给出) | 通用 LM 困惑度 |
| 25B-A2.8B | MoE(25B 总参 / 2.8B 激活) | 预训练 + 80B token 长上下文中训 | 4k / 16k / 64k / 128k 长上下文 |
对比基线包括 DeltaNet、其它线性注意力变体,以及 Mamba 等状态空间模型族。摘要里的措辞是 "EDA performs best in both settings",未给出具体 perplexity 数字。
长上下文结果(摘要给出的范围)
- 评测窗口:4k → 128k token。
- 关键结论:经过 80B token 长上下文中训后,EDA 在所有窗口长度上都取得最佳("performs best in long-context evaluations from 4k to 128k contexts")。
- 具体数字未在摘要里披露,正文里以表/图给出。
机制分析(论文的"为什么有效")
作者做了两类分析来解释 EDA 为什么管用:
- Compact Update Analysis——观测每次更新对 M 状态的改变量(应该是低秩且稀疏的)。结论:EDA 在保留 Delta 订正写入的低秩特性的同时,多了一条清理通路——这条通路在被动衰减(passive decay)弱的时候特别有用。
- Memory-state probes——在隐藏状态上训练探针,看是否能预测某个旧 token 是否被擦掉。结果:EDA 在"主动擦除 vs 被动遗忘"的区分上明显优于纯 Delta 规则。
这两个分析合起来传达一句话:EDA 没有破坏 Delta 的订正能力,而是给它加了一条可控的清理通道——这条通道在"被动衰减不起作用"的长上下文场景里收益最大。
亮点
- 改动小、收益明确。只新增一个擦除步骤,其余结构与 DeltaNet 一致,工程上易实现。
- 架构通用。在 dense 和 MoE 两个量级都生效,且 MoE 上能稳定继续走长上下文中训流程。
- 解释充分。Compact Update + memory-state probe 把"为什么"讲透了,不是单纯报分数。
- 明确的工程含义。"擦除方向由 query 决定"这条洞察,把"记忆管理"做成了 Agent 时代长上下文推理的标配能力。
局限
- 未公开详细数字。摘要只说"best",没说 perplexity 差距多少、与最强 SSM(Mamba2 / RWKV7)相比如何。需要看正文 21 页的实验章节。
- 未与 SOTA 全注意力对比。摘要里的对比对象是其它线性注意力家族;EDA 是否能逼近甚至超过标准 softmax attention 在长上下文上的表现,摘要没有表态。
- 擦除方向的设计选择空间很大。论文提到
e可以是 query-derived、learnable、或者二者融合,但具体哪种最优、是否需要分头/分专家,是开放问题。 - 训练成本未量化。解耦意味着多一次矩阵-向量乘,理论上增加常数开销;MoE 训练稳定性是否受影响,未在摘要里说。
- 未涉及 inference 优化。线性注意力的卖点就是推理快;EDA 额外擦除步骤对 KV 缓存复用 / 并行解码的工程影响,正文应给出但摘要不提。
对工程落地的启发
- 长上下文推理栈可考虑 EDA 替换 DeltaNet。如果已经部署 DeltaNet / RWKV 系列,EDA 是一个低成本升级路径(结构变化仅多一步擦除)。
- query-derived 擦除方向天然适合 Agent。Agent 经常"问新问题时想覆盖旧上下文",让 query 决定擦哪里,正是 RAG / tool-use 场景想要的行为。
- 与 state-space 模型(Mamba2)混合使用可探索。正文未直接讨论,但 EDA 的"显式清理通路"恰好能补 SSM 在长程记忆衰减上的短板——这是个值得跟进的组合方向。
- 预训练集成成本可控。从 DeltaNet 升级到 EDA 不需要重新设计 attention mask 或位置编码,迁移成本主要是重新训练(或 warm-start 微调)。
与同方向工作的关系
- DeltaNet / Delta Rule(Schlag et al., ICLR 2023)——本文的起点。
- Mamba / Mamba2(Gu & Dao)——同代次的线性复杂度序列建模路线,EDA 的对照基线之一。
- RWKV-7 / Griffin / RecurrentGemma——另一条 recurrent + linear attention 混合路线,论文应该都做了对比(摘要未点名)。
- Performers / Linear Transformer——更早一代的线性注意力,本文实质上是其 Delta-rule 改进的进一步升级。
- RetNet / Multi-head Latent Attention (MLA, DeepSeek)——同期的"高效注意力"路线,思路不同但目标重叠(长上下文高效推理)。
适合谁读
- LLM 架构研究者:寻找一种"低成本改进线性注意力记忆管理"的方案。
- 预训练团队 / infra 工程师:评估把现有 DeltaNet 训练栈升级到 EDA 的边际收益。
- 长上下文 / RAG 工程师:理解"主动擦除"为什么对长上下文检索质量关键。
- Agent 平台架构师:把"query 控制擦除"作为 Agent 记忆管理的设计原型。
不确定 / 原文未明确处
- 与标准 softmax attention 的头对头长上下文数字。
- 与 Mamba2 / RWKV7 的具体差距。
- 擦除方向
e在 25B MoE 上是 query-derived 还是 learnable 最优(论文允许多种设计,但摘要未给消融结论)。 - 推理阶段相对 DeltaNet 的实际延迟/吞吐差距。
- 代码与权重是否随论文开源——提交历史提到 321KB PDF,摘要未承诺 release。
补注:与近期 linear-recurrent 阵营的关系
2025–2026 年"linear attention × state-space × fast-weight"三线汇流,本文处在 fast-weight/Delta-rule 这条支线。把它放回整张版图:
- 与 Mamba2:Mamba2 走的是选择性状态空间,本质是 scalar-gated 1D 卷积递推;EDA 走的是 matrix 状态上的 key-value 查找 + 主动擦除。前者擅长稳定长程依赖但显式控制力弱,后者擅长局部精确查找但需要"擦"机制防积累。两者在 64k–128k 评测上的 head-to-head 是本文最具说服力的对照(正文应给出,摘要未点数字)。
- 与 RWKV-7:RWKV-7 用 time-mix + value-mix + LoRA-style 衰减,结构更接近 RNN;EDA 保留 key-query-value 三件套,attention 形式感更强。如果团队已有 RWKV 训练栈,迁移成本比 EDA 高。
- 与 RetNet / Multi-head Latent Attention (MLA):RetNet 是 retention + 衰减 + chunkwise,MLA 是把 KV 压到低秩 latent。两者都把"显式衰减"作为长程记忆的载体;EDA 的擦除步骤与它们在精神上相通,但形式上是矩阵投影而非标量门控,可控性更强、可解释性更弱——这恰好是本文 memory-state probe 想补的短板。
如果团队在 2026 年面临"线性注意力选型",可以这样决策:纯长程稳定性优先 → Mamba2;显式可控 + 检索式记忆优先 → EDA;超长上下文 + KV 缓存极致优化 → MLA。这条经验性选型指南在论文正文里没有直接给出,但与其给出的数据(4k–128k 全段最优 + memory-state 可解释性)是一致的。 最后一句话总结:EDA 不是要替代 DeltaNet,而是把"主动擦除"这条之前被遗忘的维度补回线性注意力家族。它把"记忆模型应该决定擦什么、在哪擦"这件事做成一个可学习、可分析、可工程化的小部件——这是 2026 年 linear-recurrent 路线的关键补完,也是 Agent 时代长上下文记忆管理的设计样板。
工程落地与核查(Jay)
事实核查
| 核查项 | 结论 | 存疑等级 |
|---|---|---|
| 2.5B Dense + 25B-A2.8B MoE "最优"声明 | ⚠️ 原文摘要措辞为 "EDA performs best in both settings"——这是原文摘要的直接引述,属于"最优"强声明,但摘要未给出 perplexity 绝对值或相对差距;正文数字需读 PDF §5 实验表核实 | 中 |
| 80B token 长上下文中训 | 摘要明确声明;长上下文持续训练 token 量级(80B)与主流实践一致,声明可信 | 低 |
| 4k–128k 全段最优 | ⚠️ 原文摘要措辞明确;但未与全 softmax attention 做头对头对比,与 Mamba2/RWKV7 差距未披露,工程选型时不可将此解读为"全场景 SOTA" | 中 |
| DeltaNet / Mamba / RWKV-7 / RetNet / MLA 作为对比基线 | 均为 2023–2026 年真实工作;DeltaNet(ICLR 2023)、Mamba2(2024)、RWKV-7(2025)、RetNet(Microsoft 2023)、MLA(DeepSeek-V2 2024)均可查证 | 低 |
| e = f(q) / learnable 两种擦除方向 | 论文允许两种设计均可,是方法学开放性而非事实错误;具体在 25B MoE 上哪种更优摘要未给消融结论 | 低(方法学开放性,非误传) |
| 代码/权重开源承诺 | ⚠️ 摘要未承诺 release;arXiv PDF 321KB 未内嵌代码链接;补注阶段如引用 GitHub 需独立核验 | 中 |
| Katharopoulos 2020 / Schlag et al. ICLR 2023 引用 | 均为可查证真实文献 | 低 |
核心存疑:摘要"最优"声明未给出具体 perplexity 数字;4k–128k 全段最优未与全 attention 头对头对比;e 最优设计形式未确定;代码/权重是否随论文开源未确认。
可读性精修
- 全文逻辑链完整(背景→问题→方法→公式→实验→启示→关系→适合谁→展望),层次递进清晰。
- 公式推导规范;伪代码 Step 1/Step 2 可直接操作实现。
- 术语统一:擦除方向 e、Delta 规则、Oja's rule、memory-state probes 等术语全文一致,使用准确。
- 轻微冗余:补注节与"与同方向工作"节存在内容重叠(DeltaNet / Mamba2 / RWKV7 在两节均出现),但不影响理解。
- 逻辑判断准确:直觉版本说明"两个 step 顺序无关求导"——此处注意:实际论文中擦除与写入顺序是否可交换,取决于 e 与 k 是否独立,工程实现需以原文公式为准。
工程落地清单
可直接落地的工程动作(高置信度)
- DeltaNet → EDA 低成本升级:若已有 DeltaNet 训练栈,EDA 仅多一步擦除(
M ← M - (e^T M) e),迁移成本极低;e 可初始化为q的投影方向,热启动训练稳定性好。 - Agent 记忆管理原型:在 RAG / tool-use 场景中,当 query 涉及"更新已有事实"时,EDA 的 query-derived 擦除方向天然实现"旧信息清理",可直接作为 Agent 长期记忆管理的参考实现(memory slot = 线性状态 M)。
- Retrieval-aware KV offloading:EDA 解耦了"擦哪"与"写哪",意味着非活跃 memory slot 可被更激进地压缩或 offload;工程实现可对非擦除目标的状态做 INT4 量化。
- 选型三叉戟:Dense 长程稳定 → Mamba2;显式可控检索 → EDA;KV 极致压缩 → MLA——这条经验选型路线在当前(2026年)工程选型中可直接参考,但需以实际部署 benchmark 为准。
需要额外核验的工程决策(中等置信度)
- e 的具体形式影响训练稳定性:query-derived e 理论上更动态,但 e = f(q) 引入非线性映射,增加训练调参难度;建议先从 learnable 门控 e 开始跑 baseline,再探索 query-derived。
- 推理延迟开销:EDA 比 DeltaNet 多一次
e^T M投影(O(d) 每次更新);在 25B MoE 上,若 MoE expert 激活比例低,该常数项开销相对可忽略;若部署在延迟敏感场景,需测e = q / ||q||(无额外参数)vse = MLP(q)的实际吞吐差距。 - 与 KV-cache 复用冲突:EDA 的擦除步骤修改历史状态 M,这意味着 standard KV-cache 复用(prefix caching)需要额外处理:已缓存的 prefix 在新 query 下可能需要重新擦除,缓存命中率会下降。
高置信度工程警示(可直接引用的论文结论)
- 擦除方向不由写地址决定是关键创新:既有的 DeltaNet/RNN 中"写即覆盖/衰减"的方式无法选择性清理历史;EDA 把"主动清理"引入 linear attention,这是本文对工程架构的最重要贡献,也是区别于所有 SSM/linear attention 变体的核心差异。
- Memory-state probe 提供了可解释性接口:EDA 的清理行为可通过 probe 直接观测"哪个 token 被主动擦除",这比 SSM 的隐式衰减更透明;工程上可用此做"记忆管理可视化 dashboard"。
- MoE + 长上下文中训兼容性已验证:25B-A2.8B MoE 可稳定做 80B token 长上下文中训,且 4k–128k 全段最优——这意味着 MoE 架构的 EDA 路线在工程上具备可行性,非纯理论结果。