📡 Tom 文献雷达 · Agent × RAG × Long Context

日期: 2026-09-19 (14:40 UTC+8) | 轮次: 下午档


💡 本期高价值

1. Self-Evolving Search Index(自进化检索索引)

  • 来源: arXiv → HF Daily | Votes: 7
  • 标签: agent rag benchmark
  • 摘要: LLM Agent 执行复杂任务时依赖索引暴露知识的能力。现有索引表示在不同检索环境下效果差异大,手动优化成本高。Self-Evolving Index 让索引自主适应目标检索环境,由 Agent 自动诊断失败并迭代优化策略。
  • 意义: RAG 系统的索引层长期依赖人工调参,本文提出全自动化闭环,对 Agent 驱动的知识密集型任务有直接价值。
  • 链接: https://arxiv.org/abs/2609.19656

2. Fuse: Verifiable Social Reasoning for LLM Assistants(可验证社会推理)

  • 来源: arXiv → HF Daily | Votes: 13
  • 标签: agent benchmark
  • 摘要: 引入多 Agent 模拟框架研究用户介入式社会推理。目标 Agent 有隐藏动机,与其他 Agent 交互,用户向被测助手咨询以推断目标 Agent 意图。解决了社会推理中"意图无客观 ground truth"的评测难题。
  • 意义: Agent 社会推理评测的新范式,对需要人际交互的 Agent 系统(客服、咨询、社交陪伴)有直接评测基准价值。
  • 链接: https://arxiv.org/abs/2609.17496

3. Don't Mask the Environment(不要遮蔽环境)

  • 来源: arXiv → HF Daily | Votes: 3
  • 标签: agent rag multimodal
  • 摘要: 提出 ActObs 方法,在标准 SFT 只监督 action token 的基础上,同时监督轨迹中的 observation token(Agent 从不生成观测,但预测观测能促使策略建模动作后果)。无需额外数据、参数或 forward pass。
  • 意义: Agent 探索与规划的基础训练方法改进,对多模态 Agent 环境感知能力的提升有参考价值。
  • 链接: https://arxiv.org/abs/2609.20715

4. δ-mem: Efficient Online Memory for LLMs(轻量在线记忆)

  • 来源: AlphaSignal Substack(2026-05-15)
  • 摘要: 提出用极小的 8×8 关联记忆状态(64 个数值)存储历史信息,在 Qwen3-4B-Instruct 上将 5 个基准的平均分从 46.79% 提升至 51.66%,仅新增 4.87M 可训练参数(0.12% 模型参数)。对比 RAG(过重)和长上下文(浪费),提出第三条路。
  • 意义: Agent 长期记忆的轻量化解决方案,对资源受限场景的在线记忆系统设计有直接参考意义。
  • 链接: https://alphasignalai.substack.com/p/rag-and-long-context-arent-enough

📋 候选清单(8 条)

# 标题 来源 Votes 标签
1 Self-Evolving Search Index HF Daily 7 agent,rag,benchmark
2 Fuse: Verifiable Social Reasoning HF Daily 13 agent,benchmark
3 Don't Mask the Environment HF Daily 3 agent,rag,multimodal
4 δ-mem: Efficient Online Memory Substack agent,memory
5 Can MiniMax-H3 Reason About the Physical World? HF Daily 23 benchmark,multimodal
6 Sample Count Is Not Enough (Test-time Scaling) HF Daily 2 systems
7 FAMOS: 3D Articulation from Sparse Observations HF Daily 5 research
8 VākQA: Telugu Spoken Factoid QA HF Daily 1 benchmark

🔍 行业动态(Substack)

"RAG 已死" 的真相(2026): 多个技术博客指出,2026 年流行的"RAG 已死"论是标题党。对于大规模文档、生产级知识库、可审计性要求和成本敏感场景,RAG 仍在演进——方向是 Agentic RAG、GraphRAG 和混合检索。Long Context 与 RAG 不是竞争关系,是互补的。核心瓶颈不在向量数据库本身,而在检索质量(选 chunk、排序、上下文召回),应优先将检索当评测问题而非基础设施问题来对待。

2026 AI Agent Stack 新分层: 知识层(外部可检索数据)与记忆层(Agent 自有状态)已明确分离。记忆不再等于知识,是两条独立的技术路径。


⚠️ 本期说明

  • arXiv API 本轮全部返回 406,候选全部来自 HF Daily
  • CSDN 未使用(无明确源码/排障/复现内容)
  • Substack 使用 1 条(δ-mem)

采集时间: 2026-09-19 06:40 UTC | Candidats JSON: /shared/research-kb/inbox/tom/_candidates/2026-09-19-agent-rag-longcontext-candidates.json