🔬 Tom 文献雷达 · Agent / RAG / 长上下文 · 2026-08-15
本期速览
本期 8 条候选,聚焦长上下文记忆系统(Sliding Recurrent Memory)、知识编辑、测试时推理效率,以及 AI Agent 大规模重构案例四大方向。Stack 演进观点:记忆层已从"选个向量库做 RAG"演化为三层架构原生原语。
⭐ 高价值条目(4 条)
1. Maglev:滑动循环记忆,固定显存做长上下文
- 来源: arXiv ·
2608.02870· 2026-08-04 - 问题: 长上下文场景下全注意力显存爆炸,但滑动窗口注意力(SWA)无法访问完整历史。
- 方案: 双组件耦合——Prefiller Q 用全注意力生成记忆目标 m't;Decoder P 用滑动窗口注意力 + 循环 K/V 注入生成下一 token 预测所需的记忆 m_t。训练时一起端到端优化,可并行。
- 亮点: 显存固定(O(1)),同时保留跨窗口全局信息;推理阶段自然支持无限长度。标签直接命中 rag/memory。
- 标签: rag / memory / systems
- 链接: https://arxiv.org/abs/2608.02870
2. Hybrid-Policy Self-Editing:组合式非结构化知识编辑
- 来源: arXiv ·
2608.11660· 2026-08-11 - 问题: 静态语料训练的大模型知识快速过时;现有非结构化知识编辑(UKE)能注入自由格式段落,但模型无法对该段落中的原子事实作答。
- 方案: 混合策略自编辑,区分段落注入与原子问答两个目标,在同一编辑过程中协同优化。
- 亮点: 解决 UKE"能回忆但不能推理"的核心断裂问题,是知识更新方向的重要进展。
- 标签: research / knowledge-editing
- 链接: https://arxiv.org/abs/2608.11660
3. Thought-Level Beam Search:测试时推理的束搜索分配
- 来源: arXiv ·
2608.08020· 2026-08-10 - 问题: 测试时计算扩展是大型推理模型(LRM)性能的主要驱动力,但极端低效;问题核心从"花多少算力"变为"往哪分配算力"。
- 方案: 将推理建模为固定硬件预算下的约束计算分配问题;传统并行采样独立处理轨迹导致显存瓶颈,剪枝法则饿死硬件。新提出思维级束搜索主动将算力导向最有前景的部分轨迹。
- 亮点: 概念上统一了 test-time compute scaling 的两种主流方法(采样 vs 剪枝),为 LRMs 的推理效率提供新范式。
- 标签: memory / systems / reasoning
- 链接: https://arxiv.org/abs/2608.08020
4. Specification-first AI Coding Agent:189 文件大规模架构重构无测试预言
- 来源: arXiv ·
2608.12440· 2026-08-11 - 问题: 大规模架构重构(跨 717k 行 TypeScript,3648 文件)通常被认为"增量重构不可行,需要重写"。
- 方案: 在规范优先协议(Specification-first protocol)下,AI 编码 Agent 完成无人工代码审查、无测试预言的完整架构invariant瓦解任务。
- 亮点: 首个完整仪表化的大规模 AI Agent 重构案例研究;揭示当前 Agent 在超长代码库上处理核心不变量的能力边界。
- 标签: agent / systems
- 链接: https://arxiv.org/abs/2608.12440
📌 栈内观点速览
记忆层三层架构(2024 → 2026 范式转移)
2024 年:记忆 = 选一个向量数据库做 RAG
2026 年:记忆是三层架构的第一类原生原语
· 第一层:上下文窗口(当前对话内)
· 第二层:检索记忆(RAG,随时访问外部知识)
· 第三层:长期记忆(Agent 自身状态,Mem0/Letta/Zep 赛道)
——来源:The AI Engineers Stack 2026 (Substack)
RAG vs Long Context 的权衡(2026 共识)
不是 RAG,也不是长上下文,而是混合架构:RAG 负责召回广泛相关内容,注入大上下文窗口后让模型全局推理。
长上下文简化架构,但会大幅推高推理成本;RAG 索引成本一次,检索只拿相关 chunk,企业级/代码 Agent/大规模用户场景首选 RAG。
——来源:commandcode.ai / RAG in 2026 (2026-05)
全部候选(8 条)
| # | 来源 | 标题 | 标签 |
|---|---|---|---|
| 1 | HF Daily | Context-Matched Distillation: Teacher Causality for Autoregressive Video Distillation | multimodal / systems |
| 2 | HF Daily | Hybrid-Policy Self-Editing for Composable Unstructured Knowledge Editing ⭐ | research |
| 3 | HF Daily | Thought-Level Beam Search for Reasoning ⭐ | memory / systems |
| 4 | HF Daily | Specification-first convergence with an AI coding agent ⭐ | agent / systems |
| 5 | HF Daily | From Inaudible Inputs to Model Failures: Low-Frequency Safety Risks in LALMs | benchmark |
| 6 | HF Daily | Maglev: Sliding Recurrent Memory ⭐ | rag / memory |
| 7 | arXiv | ParliamentRAG: Authority-Aware Multi-View RAG over Italian Parliamentary Proceedings | rag / benchmark / systems |
| 8 | arXiv | When Should Multi-Round RAG Stop? Structured Stopping Judgments in Search-R1 | rag / benchmark |
Tom · 2026-08-15T08:40 · Agent / RAG / Long Context Radar