Tom 文献雷达 · AI Agent / RAG / 长上下文 · 2026-09-20
本期概况
来源:HuggingFace Daily(arXiv API 本期异常,部分查询 406),共采集 8 条候选。
🔥 高价值(3 条)
1. Self-Evolving Search Index(自进化检索索引)
- 来源:HF Daily · arXiv:2609.19656 · votes: 26
- 标签:agent · rag · benchmark
- 核心:提出索引键(index keys)需随检索环境自适应演化,目前依赖人工诊断+调优。作者框架让索引在目标检索环境中自动优化,无需人工干预。对 RAG 系统和 LLM Agent 信息索引有直接参考价值。
- 链接:https://arxiv.org/abs/2609.19656
2. δ-mem: Agent 记忆的第三路径
- 来源:AlphaSignal Substack · 2026-05-15(补充)
- 标签:agent · memory
- 核心:RAG 和长上下文都不是 Agent 长期记忆的最优方案。δ-mem 用 tiny 8×8 associative memory state(仅 4.87M 可训练参数,Qwen3-4B 的 0.12%)实现高效在线记忆,在 5 个 benchmark 上平均提升 ~5pp。与本次 HF 候选中 ActObs(观察监督)形成互补:一个解决记忆,一个改进探索策略。
- 链接:https://alphasignalai.substack.com/p/rag-and-long-context-arent-enough
3. Fuse: LLM 社交推理可验证评估框架
- 来源:HF Daily · arXiv:2609.17496 · votes: 33
- 标签:agent · benchmark
- 核心:用户向 LLM 助手描述社交情境(主观叙事),助手需推断他人意图——这类场景缺乏客观 ground truth,难以评估。Fuse 通过多智能体模拟(含隐藏动机的目标智能体 + 用户代理)解决该问题。是 agent 对齐与社会价值对齐的重要评估范式。
- 链接:https://arxiv.org/abs/2609.17496
📋 候选列表(其余 5 条)
| # | 标题 | 票数 | 标签 | 备注 |
|---|---|---|---|---|
| 4 | MiniMax-H3: Omni-Modal 物理世界推理评测 | 93 | benchmark · multimodal | 评测多模态对齐能否提升世界推理能力,4维度框架 |
| 5 | ActObs: 观察监督改变 RL 下 Agent 探索方式 | 16 | agent · rag · multimodal | SFT 仅监督 action tokens,ActObs 同时监督 observation tokens,改善 RL 初始化 |
| 6 | Sample Count Is Not Enough: 测试时 scaling 的策略维度 | 16 | systems | batched generation vs sequential 对 reasoning 准确率的影响,GSM8K 实验 |
| 7 | VākQA: 泰卢固语口语问答评测基准 | 12 | benchmark | 低资源语言 SQA,验证 Gemini-as-judge 评估可靠性 |
| 8 | FAMOS: 稀疏观测的 3D 关节建模 | 17 | research | 与 Agent/RAG 关联较弱,保留参考 |
附:arXiv API 异常说明
本期 arXiv 元数据查询(多组 query)均返回 HTTP 406,候选主力切换为 HuggingFace Daily。建议下轮观察 arXiv 是否恢复,或切换为 Semantic Scholar API 备选。
生成:Tom · 2026-09-20T08:40 UTC · candidates: /shared/research-kb/inbox/tom/_candidates/2026-09-20-agent-rag-longcontext-candidates.json