Tom 文献雷达 · Agent · RAG · 长上下文 · 第三轮 · 2026-09-27
本期速览
8 条候选,高价值 3 条。arXiv 富化因接口 406 失败,依赖 HF Daily Metadata。补充 1 条 Substack 线索。无 CSDN。
🔥 高价值(3 条)
1. Transformer 的线性叠加假说
Your Transformer Can Hold Two Thoughts at Once: Evidence of Linear Superposition in LLMs - 链接:https://arxiv.org/abs/2609.29845 - 来源:HF Daily(70 票)| 2026-09-23 - 要点:当两个文本流线性组合输入时,LLM 输出 next-token 分布的叠加,而非非线性混合。叠加性是架构内在特性,随预训练推进反而减弱,但可通过轻量微调恢复。 - 为什么重要: RAG 与长上下文的置信度评估,核心在于模型对"多个信息源同时激活"的处理机制——本文从机制层面直接拆解,对理解上下文利用上限有直接意义。 - 标签:LLM 机制 / RAG 基础
2. Coding Agents 自动化求解 TAMP 问题
Coding Agents for Generalized Task and Motion Planning Problems - 链接:https://arxiv.org/abs/2609.30233 - 来源:HF Daily(10 票)| 2026-09-23 - 要点:TAMP(任务与运动规划)在全观测下仍极难——离散决策与几何/运动约束强耦合。现有方法需大量 TAMP 专用工程。本文探索让 coding agent 自动合成跨实例泛化的程序:给任务描述和模拟器访问权限,agent 自主决定交互方式。 - 为什么重要: Coding agent + 物理规划的首次严肃端到端探索,对具身 Agent 架构有标杆意义。 - 标签:Agent / Coding Agent / 具身智能
3. Agent Memory:2026 年状态全景
What is Agent Memory? — The AI Engineer (Paolo Perrone) - 链接:https://theaiengineer.substack.com/p/what-is-agent-memory - 来源:The AI Engineer Substack | 2026-09 - 要点: - 2024 年记忆 = "选个向量库做 RAG";2026 年记忆是一等公民,有三层架构 - Salesforce 2025 benchmark:AI Agent 端到端解决多轮客服任务仅 35%,最大失败模式是 context loss——两轮前客户说的话 agent 就忘了 - In-context memory 在跨实例共享或跨 provider 切换时崩溃,专用记忆基础设施(Letta/Zep/Mem0)在此场景赢得存在空间 - 为什么重要: 当前最完整的 2026 Agent 记忆认知框架,直接解释为什么 RAG 不够用、memory infrastructure 值得单独建设。 - 标签:Agent 记忆 / 工程实践
📋 其他候选(5 条)
| # | 标题 | 亮点 |
|---|---|---|
| 4 | Parts-of-Speech as Emergent Categories in SAE Latent Space | SAE 可解释性:PoS 高度可恢复但不与单个 latent 一一对应;开/闭类差异显著 |
| 5 | RGBD20K: 160 类 RGB-D 语义分割 benchmark | 新 benchmark,与 RAG 检索质量评估有间接关联 |
| 6 | RLCDAlignBench: Jev 零样本检测 AI 对齐失败 | 对齐失败的生成式裁判基准,含 10 类对齐失败 |
| 7 | AV-GRPO: 音视频生成的模态解耦强化学习 | 多模态 RL post-training,跨模态同步 reward 难题 |
| 8 | DeltaWAM: δ 世界动作模型用于双手操作 | 视频生成器视觉/运动 prior 迁移到机器人控制,稀疏 delta 预测 |
📌 去重参考
今日前两轮已覆盖:Linear Superposition、Coding Agents TAMP、δ-mem(AlphaSignal)、AI Agents Stack 2026(The AI Engineer)、LongMemEval。本轮新增:Paolo Perrone "What is Agent Memory?" Substack,以及 AV-GRPO/DeltaWAM/RGBD20K/RLCDAlignBench 4 条 benchmark 候选。
Tom 文献雷达 · 轻量版 · 2026-09-27 T3 · agent-rag-longcontext · 8 候选 · 3 高价值 · 1 Substack · 0 CSDN