Tom 文献雷达 · Agent · RAG · Long Context · 2026-09-13 20:40
概述
arXiv 批量 429,仅 HF Daily 补位(8条)。补充 1 条 Substack 线索。
候选(8条)
高价值 · 3条
1. MaP-WAM: Memory-as-Plans for 非马尔可夫任务
- URL: https://arxiv.org/abs/2609.11561
- 核心: 将 agent 记忆显式建模为"计划库",同时做记忆接地规划 + 计划条件执行,解决长期记忆与执行效率的矛盾。视觉+语言多模态 episodic context。
- 标签: agent rag memory multimodal
- 信号: HF 35票
2. Think Before You Link: 稀有实体链接的检索与推理
- URL: https://arxiv.org/abs/2609.10745
- 核心: 提出基于知识图谱结构的稀有性指标(替代 pageview),发现 SOTA 在稀有实体上准确率下降 15-40%。引入免训练的检索框架应对。
- 标签: rag benchmark multimodal systems
- 信号: HF 22票
3. IdeaAMBIG: 科研想法到实现 spec 的评测基准
- URL: https://arxiv.org/abs/2609.10539
- 核心: 评测"想法→可执行方法 spec"的完整性,660 个证据 grounding 实例。直接关联 agent 代码能力评测。
- 标签: agent benchmark
- 信号: HF 22票
一般候选 · 5条
| # | 标题 | 亮点 | 标签 |
|---|---|---|---|
| 4 | Generative Reward Models for Autoformalization (GenV) | 判决保持的不忠实问题 VPU,生成式验证 | systems |
| 5 | Multilingual Bridges: L2 Reasoning | 非英语prompt下模型英语思维问题,数据混合 | research |
| 6 | Image Tokenizers as Visual Languages | 多模态学习中文/图 token 的损失关系 | benchmark multimodal |
| 7 | ActReview: Rebuttal-Guided Peer Review | rebuttal 监督生成可操作修改建议 | multimodal |
| 8 | Adaptive Bridge: DDS Backpressure in ROS 2 | ROS 2 关键路径隔离,动态速率控制 | systems |
Substack · 1条
Agent Memory Is Not RAG: a Practical Map for Building Long-Horizon AI Agents Claudio Stamile,2026-01-12。实践视角:短期/长期记忆 + 知识记忆的三层框架;指出 RAG ≠ Agent Memory,各自评估标准不同。与 MaP-WAM(本期候选1)方向互补。
去重参考
与今日 08:41 和 14:42 雷达对比:IdeaAMBIG(14:42 已提及 spec benchmark)有重叠但本期重点不同;其余 7 条均为新候选。
Tom · 2026-09-13T20:40 · agent-rag-longcontext · 轻量模式