Tom 文献雷达 · Agent · RAG · 长上下文 · 2026-09-27

本期速览

本期共 8 条候选,高价值 4 条。arXiv 接口 406 富化失败,纯靠 HF Daily 裸 Metadata 撑场。补充 1 条 Substack。


🔥 高价值(4 条)

1. Transformer 的线性叠加假说

Your Transformer Can Hold Two Thoughts at Once: Evidence of Linear Superposition in LLMs - 链接:https://arxiv.org/abs/2609.29845 - 来源:HF Daily(70 票)| 2026-09-23 - 要点:当两个文本流线性组合输入时,Transformer 输出的是各自 next-token 分布的叠加。研究者称之为"叠加线性假说"。发现这是架构内在特性而非训练涌现,且随预训练推进反而趋于减弱。提出可通过轻量微调恢复线性。 - 为什么重要: RAG 和长上下文的置信度评估本质依赖模型对"多个信息源同时激活"的处理——这篇工作从机制上拆解了这一点,对理解上下文利用上限有直接意义。 - 标签:LLM 机制 / RAG 基础


2. Coding Agents 自动化求解 TAMP 问题

Coding Agents for Generalized Task and Motion Planning Problems - 链接:https://arxiv.org/abs/2609.30233 - 来源:HF Daily(9 票)| 2026-09-23 - 要点:TAMP(任务与运动规划)即使在全观测下也非常难,因为离散决策与几何/运动约束强耦合。现有方法需要大量 TAMP 专用工程。研究探索让 coding agent 自动合成跨实例泛化的程序——给任务描述和模拟器访问权限,agent 自主决定如何交互。 - 为什么重要: Coding agent + 物理规划的第一个严肃端到端方案,对具身 Agent 架构有标杆意义。 - 标签:Agent / Coding Agent / 具身智能


3. δ-mem:RAG 和长上下文的第三条路

δ-mem: Efficient Online Memory for Large Language Models - 链接:https://alphasignalai.substack.com/p/rag-and-long-context-arent-enough - 来源:AlphaSignal Substack | 2026-05 - 要点:大多数 agent 工作负载里,RAG 过重、长上下文浪费。δ-mem 提出用极小的 8×8 关联记忆状态存储历史信息——仅 4.87M 可训练参数(Qwen3-4B 的 0.12%),5 个 benchmark 平均提升 +4.87%。 - 为什么重要: 精准命中当前 agent 记忆的主流痛点,提供了一个不需要向量数据库也不需要百万 token 窗口的实用替代。 - 标签:Agent 记忆 / 轻量架构


4. AI Agent Stack 2026 全景图

The AI Agents Stack (2026 Edition) — The AI Engineer - 链接:https://theaiengineer.substack.com/p/the-ai-agents-stack-2026-edition - 来源:The AI Engineer Substack | 2026 - 要点: - 2024 年记忆 = "选个向量库做 RAG";2026 年记忆是一等公民,有三层架构 - Agent guardrails 从 I/O 过滤器演变为工具授权、限速、行为验证 - RAG 失败瓶颈不在向量库,在检索质量——先做 evals 再做基础设施 - 为什么重要: 当前最完整的 2026 Agent 基础设施认知框架,有直接工程参考价值。 - 标签:Agent 架构 / 工程实践 / 记忆系统


📋 其他候选(4 条)

# 标题 亮点
5 Parts-of-Speech as Emergent Categories in SAE Latent Space SAE 可解释性:PoS 类别高度可恢复但不与单个 latent 一一对应;开/闭类差异显著
6 RGBD20K: A Large-Scale RGB-D Benchmark(160 类) 新 benchmark,数据侧与 RAG 检索质量评估有间接关联
7 RLCDAlignBench: Jev 模型零样本检测 AI 对齐失败 对齐失败的生成式裁判基准,含 10 类对齐失败
8 AV-GRPO: 音视频生成的模态解耦强化学习 多模态 RL post-training,跨模态同步 reward 难题

📌 近期去重提示

近期(7 天内)已覆盖:Agent 记忆系统(Mem0/Zep/Letta 对比)、LongMemEval 长程对话记忆评估、RAG 检索质量 evals。δ-mem 本期首次出现,与 Mem0/Zep 系列属同一问题域的不同方案。


Tom 文献雷达 · 轻量版 · 2026-09-27 · agent-rag-longcontext · 8 候选 · 4 高价值 · 1 Substack · 0 CSDN