Tom 文献雷达 · Agent · RAG · 长上下文 · 2026-09-26

本期概况

arXiv API 本轮返回 406,候选全部来自 HuggingFace Daily 策展,共 8 条。补充 1 条 Substack 高价值线索。


候选条目(8 条)

高价值 ⭐

  1. Your Transformer Can Hold Two Thoughts at Once: Evidence of Linear Superposition in LLMs - arXiv:2609.29845 | HF 55票 | 2026-09-23 - 核心发现:Transformer 对两个线性组合输入的输出 = 各输入 next-token 分布的线性叠加(Superposition Linearity Hypothesis)。这是 Transformer 架构的内生属性,非训练涌现,且随预训练推进趋弱,但可通过轻量微调恢复。 - Agent/RAG 关联:直接挑战"模型一次只能处理一个推理链"的假设,对多跳 Agent 记忆复用、多上下文窗口交互有重要意涵。 - ⭐ 强烈推荐优先阅读

  2. Coding Agents for Generalized Task and Motion Planning Problems - arXiv:2609.30233 | HF 6票 | 2026-09-23 | tag: agent - 研究 Coding Agent 能否自动合成跨实例泛化的 TAMP 程序,减少 TAMP 专项工程。给定任务描述 + 仿真器访问权限,Agent 自主决定环境交互方式。 - 实践价值:对 Agent 工具调用泛化能力有参考意义。

  3. Just Ask Jev: RLCD 在零样本检测 AI 对齐失效 - arXiv:2609.29429 | HF 2票 | 2026-09-23 | tag: benchmark - 用 RL for Calibrated Decisions (RLCD) 的 Jev 模型,一次调用回答多类typed question并给出校准概率。Benchmark 覆盖 10 种对齐失效:谄媚、越狱、欺骗、提示注入、幻觉等。 - 对 Agent 安全评测有参考价值。

一般候选

  1. Parts-of-Speech as Emergent Categories in SAE Latent Space — arXiv:2609.29362 | HF 10票,SAE 可解释性研究,PoS 类别由紧凑特征群支持,非单一 latent 映射。对理解 LLM 表征结构有参考。

  2. RGBD20K: A Large-Scale Benchmark for RGB-D Semantic Segmentation — arXiv:2609.29028 | HF 6票。RAG/检索相关性低,仅 tag 含 rag。

  3. AV-GRPO: 音频-视频生成的模态解耦扩散强化学习 — arXiv:2609.29816 | HF 2票。多模态生成强化学习,与 Agent 记忆/推理关联弱。

  4. DeltaWAM: 双臂操作的 Delta World Action Models — arXiv:2609.28811 | HF 2票。机器人控制,World-Action Model 架构创新(非 RAG/长上下文方向)。

  5. Learning to Discover Interesting Mathematics — arXiv:2609.28603 | HF 4票。LLM 数学定理"内在趣味性"量化,与 Agent/RAG 关联有限。


Substack 补充线索

Inside Mem0, Supermemory, and Letta — Agentic AI Memory 演进 - 来源:kenhuangus.substack.com - 关键点:Mem0 v3 从两阶段 LLM pass(提取+协调)简化为单次调用,改为 append-only 策略(不覆写旧记忆),将冲突解决推迟到检索时处理。语义+BM25+实体匹配三重融合检索。 - 对 Agent 记忆架构选型有直接实践参考价值。


去重备注

与近期(7天内)候选无重复。arXiv API 406 问题持续,建议关注 HF Daily 策展作为备用采集源。


Tom 文献雷达 · 每日3次 · 2026-09-26 08:40 CST