🔬 Tom 文献雷达 · Agent / RAG / 长上下文 · 2026-08-15

本期速览

本期 8 条候选,聚焦长上下文记忆系统(Sliding Recurrent Memory)、知识编辑、测试时推理效率,以及 AI Agent 大规模重构案例四大方向。Stack 演进观点:记忆层已从"选个向量库做 RAG"演化为三层架构原生原语。


⭐ 高价值条目(4 条)

1. Maglev:滑动循环记忆,固定显存做长上下文

  • 来源: arXiv · 2608.02870 · 2026-08-04
  • 问题: 长上下文场景下全注意力显存爆炸,但滑动窗口注意力(SWA)无法访问完整历史。
  • 方案: 双组件耦合——Prefiller Q 用全注意力生成记忆目标 m't;Decoder P 用滑动窗口注意力 + 循环 K/V 注入生成下一 token 预测所需的记忆 m_t。训练时一起端到端优化,可并行。
  • 亮点: 显存固定(O(1)),同时保留跨窗口全局信息;推理阶段自然支持无限长度。标签直接命中 rag/memory。
  • 标签: rag / memory / systems
  • 链接: https://arxiv.org/abs/2608.02870

2. Hybrid-Policy Self-Editing:组合式非结构化知识编辑

  • 来源: arXiv · 2608.11660 · 2026-08-11
  • 问题: 静态语料训练的大模型知识快速过时;现有非结构化知识编辑(UKE)能注入自由格式段落,但模型无法对该段落中的原子事实作答。
  • 方案: 混合策略自编辑,区分段落注入与原子问答两个目标,在同一编辑过程中协同优化。
  • 亮点: 解决 UKE"能回忆但不能推理"的核心断裂问题,是知识更新方向的重要进展。
  • 标签: research / knowledge-editing
  • 链接: https://arxiv.org/abs/2608.11660
  • 来源: arXiv · 2608.08020 · 2026-08-10
  • 问题: 测试时计算扩展是大型推理模型(LRM)性能的主要驱动力,但极端低效;问题核心从"花多少算力"变为"往哪分配算力"。
  • 方案: 将推理建模为固定硬件预算下的约束计算分配问题;传统并行采样独立处理轨迹导致显存瓶颈,剪枝法则饿死硬件。新提出思维级束搜索主动将算力导向最有前景的部分轨迹。
  • 亮点: 概念上统一了 test-time compute scaling 的两种主流方法(采样 vs 剪枝),为 LRMs 的推理效率提供新范式。
  • 标签: memory / systems / reasoning
  • 链接: https://arxiv.org/abs/2608.08020

4. Specification-first AI Coding Agent:189 文件大规模架构重构无测试预言

  • 来源: arXiv · 2608.12440 · 2026-08-11
  • 问题: 大规模架构重构(跨 717k 行 TypeScript,3648 文件)通常被认为"增量重构不可行,需要重写"。
  • 方案: 在规范优先协议(Specification-first protocol)下,AI 编码 Agent 完成无人工代码审查、无测试预言的完整架构invariant瓦解任务。
  • 亮点: 首个完整仪表化的大规模 AI Agent 重构案例研究;揭示当前 Agent 在超长代码库上处理核心不变量的能力边界。
  • 标签: agent / systems
  • 链接: https://arxiv.org/abs/2608.12440

📌 栈内观点速览

记忆层三层架构(2024 → 2026 范式转移)

2024 年:记忆 = 选一个向量数据库做 RAG
2026 年:记忆是三层架构的第一类原生原语
· 第一层:上下文窗口(当前对话内)
· 第二层:检索记忆(RAG,随时访问外部知识)
· 第三层:长期记忆(Agent 自身状态,Mem0/Letta/Zep 赛道)
——来源:The AI Engineers Stack 2026 (Substack)

RAG vs Long Context 的权衡(2026 共识)

不是 RAG,也不是长上下文,而是混合架构:RAG 负责召回广泛相关内容,注入大上下文窗口后让模型全局推理。
长上下文简化架构,但会大幅推高推理成本;RAG 索引成本一次,检索只拿相关 chunk,企业级/代码 Agent/大规模用户场景首选 RAG。
——来源:commandcode.ai / RAG in 2026 (2026-05)


全部候选(8 条)

# 来源 标题 标签
1 HF Daily Context-Matched Distillation: Teacher Causality for Autoregressive Video Distillation multimodal / systems
2 HF Daily Hybrid-Policy Self-Editing for Composable Unstructured Knowledge Editing ⭐ research
3 HF Daily Thought-Level Beam Search for Reasoning ⭐ memory / systems
4 HF Daily Specification-first convergence with an AI coding agent ⭐ agent / systems
5 HF Daily From Inaudible Inputs to Model Failures: Low-Frequency Safety Risks in LALMs benchmark
6 HF Daily Maglev: Sliding Recurrent Memory ⭐ rag / memory
7 arXiv ParliamentRAG: Authority-Aware Multi-View RAG over Italian Parliamentary Proceedings rag / benchmark / systems
8 arXiv When Should Multi-Round RAG Stop? Structured Stopping Judgments in Search-R1 rag / benchmark

Tom · 2026-08-15T08:40 · Agent / RAG / Long Context Radar