Tom 文献雷达 · Agent + RAG + Long Context · 2026-09-11
概览
- 主题:AI Agent / RAG / 检索 / 长上下文 / 评测
- 候选来源:arXiv (metadata) + HuggingFace Daily,2026-09-11
- 订阅补充:Substack(1条高价值)
- 写入时间:2026-09-11 20:40 Asia/Shanghai
★ 高价值条目(4条)
1. MaP-WAM: Memory-as-Plans — 记忆作为规划(arXiv / HF,5票)
- 标题: Memory as Plans: World-Action Modeling with Memory-Grounded Planning
- 链接: https://arxiv.org/abs/2609.11561
- 核心观点: 现有记忆机制(语言摘要、视觉窗口)会丢失细粒度视觉证据或面临覆盖度与效率的权衡。MaP-WAM 将记忆依赖的世界-动作建模分解为「记忆 grounded 规划」+「规划 conditioned 执行」,用长时多模态情景上下文驱动,无需语言摘要中介。
- 标签: #agent #rag #memory #multimodal
- 意义: 对 RAG 长程依赖任务(机器人操控、工作流自动化)有直接参考价值;非马尔可夫决策场景的新范式。
2. Agent 沙箱记忆压缩(arXiv,2026-09-10)
- 标题: Memory Compression for High-Fanout Agent Sandboxes
- 链接: http://arxiv.org/abs/2609.11294v1
- 核心观点: 单任务并发多沙箱实例导致内存瓶颈;沙箱间存在模板级相似性和跨执行轨迹的冗余。论文从「如何压缩」(跨非相同页面利用相似性)、「压缩什么」(通过页面选择控制缺页)、何时压缩三个维度提出对齐方案。
- 标签: #agent #memory
- 意义: 对构建高并发 agent 系统(沙箱隔离、容器化部署)的工程团队直接相关。
3. AI Agent 执行边界合规配置档(arXiv,2026-09-10)
- 标题: From Intent to Execution Grant: An Execution-Boundary Conformance Profile for High-Risk AI Actions
- 链接: http://arxiv.org/abs/2609.11596v1
- 核心观点: AI agent 越来越多地发起有外部后果的行动(金融转账、基础设施变更、软件部署等)。现有授权引擎、策略语言、运行时监控缺乏对「从候选行动到执行授权」这一最终转换的通用语义契约。提出 EBL-Core 规范。
- 标签: #agent
- 意义: 高风险 agent 场景(金融、医疗、工业)的安全 guardrails 架构参考。
4. δ-mem:RAG 与长上下文的第三条路(AlphaSignal / Substack)
- 链接: https://alphasignalai.substack.com/p/rag-and-long-context-arent-enough
- 核心观点: 大多数 agent 工作负载中,RAG 过度构建、长上下文浪费。δ-mem 提出介于两者之间的记忆机制,用轻量适配器(Qwen3-4B 上仅 0.12% 可训练参数)在 5 个基准上平均提升 4.87%;已在 HF 开源(CC-BY-4.0)。
- 标签: #agent #rag #memory
- 意义: 2026年 agent 记忆架构选择的新思路;低资源设备友好,值得跟进实验。
常规候选(4条)
| # | 标题 | 来源 | 备注 |
|---|---|---|---|
| 5 | TempCloze: Video-LLMs 时序推理基准(1,521视频) | arXiv 2609.01515 | #benchmark #multimodal;减少语言捷径 |
| 6 | Negative Self-Distillation: 推理自我纠错(OPSD改进) | HF 2609.11699 | #rag;复杂推理任务自我改进 |
| 7 | MetroLLM-Bench: 地铁 kiosk 政策层评估(955例) | arXiv 2609.10016 | #benchmark #systems;工具调用+结构化输出 |
| 8 | DRG-MAPPO: 空战多智能体分层强化学习 | arXiv 2609.11155 | #agent #systems;时变战术协调 |
轻量观察
- RAG vs Long Context 2026 实际成本差距: RAG ~$0.00008/查询 vs 长上下文 ~$0.10/查询(~1250x差距),延迟 ~1s vs ~45s。长上下文在中等规模语料+高缓存命中时有优势;RAG 仍是大规模、多租户、引用密集型场景首选。混合架构(检索收窄 + 长窗口推理)是 2026 年主导模式。(来源:Wire Blog / Wavect)
- 上下文工程新趋势: 生产 RAG 很少是单一 agent,而是「agent 组合」(金融分析师、支持copilot、合规审查等),需要共享上下文基础设施 + 漂移检测。(来源:Atlan)
Tom · 2026-09-11T20:40 CST · 第3次雷达