Tom 文献雷达 · Agent RAG LongContext · 2026-07-05

本期概览

本期候选 8 条(arXiv + HF Daily),高价值 3 条,Substack 1 条。


高价值候选

1. LOCOS:长上下文中非字面检索头的检测(arXiv 2607.01002)⭐

核心发现:LLM 在长上下文场景中从上下文语义合成答案,而非字面复制粘贴。现有检测器只看"读回路"(attended token 匹配),无法识别"写回路"(OV circuit)层面的合成机制。LOCOS 从输出值回路角度精确定位非字面检索头。

为什么值得看:这是 RAG 系统"为什么模型没字面抄文档却能正确回答"的机制解剖——给 RAG debug 提供全新视角,可定位"模型开始编造"的那个注意力头。

工程含义: - RAG 系统调试别只看答案对错,要看答案来自哪个回路 - LOCOS 需要计算 OV circuit 的 logit 贡献,算力成本约为 attention head 的 N 倍,工程化前需评估 - 可做成"你的 RAG 在哪一刻停止读文档"的可视化工具

接口arXiv:2607.01002


2. DuoMem:终端设备的双空间记忆蒸馏(arXiv 2606.29961)⭐

核心发现:将大型教师模型的程序性任务解决能力蒸馏到紧凑学生模型,同时保持 episodic + semantic 双记忆空间。通过 context-space 和 parametric-space 双重蒸馏路径,在设备端实现记忆增强 Agent。

为什么值得看端侧实时 Agent 的记忆工程选型——语音 Agent(实时响应 + 流式补推理)+ DuoMem(实时响应 + 本地记忆)合流为端侧实时 Agent 产品基础。

工程含义: - 记忆管理走云端 vs 本地:延迟 + 隐私的双重取舍 - 双空间存储对设备端存储有压力,需要压缩或淘汰策略 - 对应三个规模阈值:10K 以下纯 Agent Memory 失效 / 500K 以上纯 RAG 失效 / 1M 混合架构稳态

接口arXiv:2606.29961


3. Scaling Laws for Grid-Based ANN in High Dimensions(arXiv 2607.01283)⭐

核心发现:系统刻画了 multiprobe grid 算法在数据集规模 N 和维度 d 下的表现——在 GloVe 上发现d-scaling crossover:multiprobe grid 在高维保持近似恒定 scaling exponent,而 graph/tree/partitioning 方法 throughput 随维数退化。

为什么值得看RAG 向量检索工程选型——ANN 方法的 d-scaling 特性直接影响高维 embedding 场景下的检索效率。Grid-based 方法此前缺席现代 scaling 分析,本研究填补了这个空白。

工程含义: - 维度 d 较高时(>768),优先选 multiprobe grid 而非 graph-based(HNSW) - indexing 成本低于竞争方法,但 query 随 N 近似线性增长 - 对 billion-scale 向量库的架构选型有直接指导意义

接口arXiv:2607.01283


一般候选(5 条)

# 标题 来源 标签
4 AutoMem: Automated Learning of Memory as Cognitive Skill(2607.01224) arXiv agent, memory
5 Know Your Source: Public Knowledge Store for Media Background Checks(2607.02383) arXiv rag, benchmark
6 WARP: Weight-Space Analysis for Recovering Training Data Portfolios(2607.01686) arXiv systems
7 AGVBench: Data Augmentation Benchmark for Vein Recognition(2607.02271) arXiv multimodal, benchmark
8 Parameter-Efficient Quantum-Inspired Fast Weight Programmers(2606.27821) arXiv memory

Substack 线索

Designing Agentic Memory in 2026(The Nuanced Perspective)
URL: https://thenuancedperspective.substack.com/p/designing-agentic-memory-in-2026
要点:将 Agent 记忆分为 5 类认知记忆类型,每类有独立检索逻辑;安全研究发现90%+ Agent 存在记忆污染漏洞,且在对话中纠正后复发率 100%——决策存储/检索/更新/丢弃都是架构决策,不会默认正确。


趋势速览

  1. RAG 质量保障四件套(2026 H2):LOCOS(机制)+ CheckRLM(推理链验证)+ Know Your Source(来源审计)+ AutoMem(记忆自动化)
  2. 端侧 Agent 记忆双路线合流:DuoMem(本地记忆)+ 语音 Agent(流式推理)→ 端侧实时产品基础
  3. ANN 选型窗口:multiprobe grid 在高维场景优势凸显,对 billion-scale RAG 检索架构有直接影响

生成时间:2026-07-05 08:40 Asia/Shanghai · Tom 文献雷达轻量版