Tom 文献雷达 · AI Agent / RAG / 长上下文 · 2026-09-20

本期概况

来源:HuggingFace Daily(arXiv API 本期异常,部分查询 406),共采集 8 条候选。


🔥 高价值(3 条)

1. Self-Evolving Search Index(自进化检索索引)

  • 来源:HF Daily · arXiv:2609.19656 · votes: 26
  • 标签:agent · rag · benchmark
  • 核心:提出索引键(index keys)需随检索环境自适应演化,目前依赖人工诊断+调优。作者框架让索引在目标检索环境中自动优化,无需人工干预。对 RAG 系统和 LLM Agent 信息索引有直接参考价值。
  • 链接:https://arxiv.org/abs/2609.19656

2. δ-mem: Agent 记忆的第三路径

  • 来源:AlphaSignal Substack · 2026-05-15(补充)
  • 标签:agent · memory
  • 核心:RAG 和长上下文都不是 Agent 长期记忆的最优方案。δ-mem 用 tiny 8×8 associative memory state(仅 4.87M 可训练参数,Qwen3-4B 的 0.12%)实现高效在线记忆,在 5 个 benchmark 上平均提升 ~5pp。与本次 HF 候选中 ActObs(观察监督)形成互补:一个解决记忆,一个改进探索策略。
  • 链接:https://alphasignalai.substack.com/p/rag-and-long-context-arent-enough

3. Fuse: LLM 社交推理可验证评估框架

  • 来源:HF Daily · arXiv:2609.17496 · votes: 33
  • 标签:agent · benchmark
  • 核心:用户向 LLM 助手描述社交情境(主观叙事),助手需推断他人意图——这类场景缺乏客观 ground truth,难以评估。Fuse 通过多智能体模拟(含隐藏动机的目标智能体 + 用户代理)解决该问题。是 agent 对齐与社会价值对齐的重要评估范式。
  • 链接:https://arxiv.org/abs/2609.17496

📋 候选列表(其余 5 条)

# 标题 票数 标签 备注
4 MiniMax-H3: Omni-Modal 物理世界推理评测 93 benchmark · multimodal 评测多模态对齐能否提升世界推理能力,4维度框架
5 ActObs: 观察监督改变 RL 下 Agent 探索方式 16 agent · rag · multimodal SFT 仅监督 action tokens,ActObs 同时监督 observation tokens,改善 RL 初始化
6 Sample Count Is Not Enough: 测试时 scaling 的策略维度 16 systems batched generation vs sequential 对 reasoning 准确率的影响,GSM8K 实验
7 VākQA: 泰卢固语口语问答评测基准 12 benchmark 低资源语言 SQA,验证 Gemini-as-judge 评估可靠性
8 FAMOS: 稀疏观测的 3D 关节建模 17 research 与 Agent/RAG 关联较弱,保留参考

附:arXiv API 异常说明

本期 arXiv 元数据查询(多组 query)均返回 HTTP 406,候选主力切换为 HuggingFace Daily。建议下轮观察 arXiv 是否恢复,或切换为 Semantic Scholar API 备选。


生成:Tom · 2026-09-20T08:40 UTC · candidates: /shared/research-kb/inbox/tom/_candidates/2026-09-20-agent-rag-longcontext-candidates.json