MemoryAthena:Adaptive Routing over Latent and Generated Memories

authored_by:Jay · R2 09-25 中午档自撰 explainer · 首篇自撰 explainer(沿用 daily-plan §4 范式) date:2026-09-25 触发:cron fff1e548-57b5-4da1-a4e7-09b7de706448 · 视频矩阵 · Jay 选题雷达 R2 · 每天12:55 arXiv 链接:https://arxiv.org/abs/2609.25853 arXiv PDF:https://arxiv.org/pdf/2609.25853(v1 · 2,266 KB · 实测本日 web_fetch 字面) DOI:https://doi.org/10.48550/arXiv.2609.25853 释出时间:2026-09-22 08:17:43 UTC(实测本日 arXiv submission history 字面) 释出到现在:arXiv 官方 v1 release_age ≈ 62.1h(约 2.59 天)· ⚠️ 48h freshness 窗口越界 14h 边际 · 本 explainer 更新时间 ≈ 0h · 48h freshness 窗口内 PASS · 两个时间维度务必显式区分


一句话结论

生成式记忆不是检索的替代品,而是带条件的修正项 —— 它在某些上下文里能补直接检索 E,在另一些上下文里会干扰 E;所以 MemoryAthena 不选边,而是显式训练一个轻量因果路由头,让模型自己决定什么时候让生成路径介入 E。


核心方法(三路机制 E / GE / GH)

  • E(direct Engram retrieval):直接查表的 Engram 检索路径。学习记忆方法把信息存在一张显式表里,E 就是「读那张表」的纯检索路径。
  • GE(generation from retrieved Engram cues):先检索出 Engram 线索再生成。模型从表里取到线索后,用自身能力把这些线索重新组合成新的记忆表达。
  • GH(generation from causal backbone states without consulting the memory table):不看表,直接用因果主干状态生成。这条路径完全不依赖显式记忆表,只从 backbone 自身的隐藏状态里生成"记忆"。
  • 关键反直觉:生成路径 GE / GH 不是 E 的简单替代;abstract 字面「generated memory is conditionally useful」—— 同一个生成器在一种上下文里能补 E,在另一种上下文里会砸 E。

路由器怎么决定介入(论文字面机制)

  • 训练时:backbone、记忆表、生成器、reader 全部冻结,只训练一个轻量的因果路由头(routing head)。
  • 训练信号:GE 和 GH 相对于 E 的反事实未来 token 似然优势(counterfactual future-token likelihood advantages of GE and GH relative to E)。
  • 推理时被采纳的候选:通过"有界插值"(bounded interpolation)修改 E 的残差(residual)。
  • 推理时被拒绝的候选:直接退回到 E 路径,逐字恢复(原文「rejection recovers the direct pathway exactly」)。

数字字面(实测本日 abstract)

  • 五任务问答平均:从 E 直接路径的 37.65 → MemoryAthena 路由后的 39.28(提升 +1.63)。
  • 六任务通用 NLP 平均:从 E 直接路径的 76.73 → MemoryAthena 路由后的 79.13(提升 +2.40)。
  • 记忆侧系统参数:约 201M(不含冻结的 backbone)· 实测 abstract 字面。

适用边界(字幕层务必叠加)

  • 路由只在 Engram 类表格记忆 + LLM 自身 hidden state 同源框架内被论文验证。跨模型 / 跨底座 / 跨部署形态(在线 / 离线 / 流式)的泛化性 abstract 未明。
  • 路由器触发条件是 learned,abstract 用「conditionally useful」未给硬阈值;字幕层务必叠加「路由器触发条件 abstract 未明」限定语。
  • 优化问题显式数学形式 abstract 未给(目标函数 + 约束表达式未明)· 字幕层务必叠加「优化问题显式数学形式 abstract 未明」限定语。

撞名风险(字幕层务必叠加)

MemoryAthena ≠ Engram ≠ Latent Memory ≠ KV Cache ≠ Memory Bank: - Engram:显式表格学习记忆(本论文沿用,但 MemoryAthena 是其之上的路由层) - Latent Memory / KV Cache:另一类存储形态,与本论文机制方向不同 - Memory Bank / MemGPT / Awesome-Memory:框架命名相似但实现路径不同 - 字幕层务必叠加首次出现限定语「MemoryAthena(arXiv 2609.25853)· first author = Mingyuan Li · 作者 list 7 人」避免撞名


与跨档统一议题的对齐(第 24 档)

沿用 R1 09-25 GeoPair(第 23 档)+ R2 09-22 MoME + R2 09-23 CKDA + R2 09-24 LatentPort + R3 09-24 JitMem 跨档 method 主轴续命中第 4 档:

「X = 默认做法不够用 = 业内『默认 RAG 检索 + 默认 LLM 自身记忆全量生成』实则『三路自适应路由(直接检索 E / 检索后生成 GE / 不查表生成 GH) + 显式路由器判定介入 + 冻结底模 + 轻量路由头 + 反事实似然优势训练信号』足够」


元信息

  • arXiv 官方分类实测:cs.CL primary · 仅 1 类 · 无 cs.AI / cs.IR cross-listed(实测本日 web_fetch 字面)· ⚠️ 与 paper_card 字面 rag 主分类不一致 · 两个分类务必显式区分
  • paper_card 字面:主分类 = rag · 形态 = method(实测本日 /shared/research-kb/organized/paper_cards/1505-2609-25853.md)
  • first author:Mingyuan Li · 作者 list = 7 人(Mingyuan Li, Guangsheng Yu, Juyuan Zhang, Xu Wang, Zhibo Man, Haonan Zhang, Shaoxiong Ji · 实测本日 web_fetch 字面)
  • 顶会 anchor:未实测(arXiv-only Preprint · 无 NeurIPS / ICLR / ACL anchor 字面)
  • GitHub 仓库:abstract 未给(实测本日 arXiv abs Comments 字段字面未给 GitHub URL)· license 字面未实测(沿用 license-file-github-fetch-required-observation-v1 范式 · 累计 7 档连续失守 · 本 R2 09-25 MemoryAthena 第 7 档务必实测)
  • 释出时间:Tue, 22 Sep 2026 08:17:43 UTC(实测本日 arXiv submission history 字面)
  • PDF 文件大小:2,266 KB(实测本日 arXiv submission history 字面 · 内容密度正常)