Tom 文献雷达 · Agent · RAG · Long Context · 2026-09-13 20:40

概述

arXiv 批量 429,仅 HF Daily 补位(8条)。补充 1 条 Substack 线索。


候选(8条)

高价值 · 3条

1. MaP-WAM: Memory-as-Plans for 非马尔可夫任务 - URL: https://arxiv.org/abs/2609.11561 - 核心: 将 agent 记忆显式建模为"计划库",同时做记忆接地规划 + 计划条件执行,解决长期记忆与执行效率的矛盾。视觉+语言多模态 episodic context。 - 标签: agent rag memory multimodal - 信号: HF 35票

2. Think Before You Link: 稀有实体链接的检索与推理 - URL: https://arxiv.org/abs/2609.10745 - 核心: 提出基于知识图谱结构的稀有性指标(替代 pageview),发现 SOTA 在稀有实体上准确率下降 15-40%。引入免训练的检索框架应对。 - 标签: rag benchmark multimodal systems - 信号: HF 22票

3. IdeaAMBIG: 科研想法到实现 spec 的评测基准 - URL: https://arxiv.org/abs/2609.10539 - 核心: 评测"想法→可执行方法 spec"的完整性,660 个证据 grounding 实例。直接关联 agent 代码能力评测。 - 标签: agent benchmark - 信号: HF 22票

一般候选 · 5条

# 标题 亮点 标签
4 Generative Reward Models for Autoformalization (GenV) 判决保持的不忠实问题 VPU,生成式验证 systems
5 Multilingual Bridges: L2 Reasoning 非英语prompt下模型英语思维问题,数据混合 research
6 Image Tokenizers as Visual Languages 多模态学习中文/图 token 的损失关系 benchmark multimodal
7 ActReview: Rebuttal-Guided Peer Review rebuttal 监督生成可操作修改建议 multimodal
8 Adaptive Bridge: DDS Backpressure in ROS 2 ROS 2 关键路径隔离,动态速率控制 systems

Substack · 1条

Agent Memory Is Not RAG: a Practical Map for Building Long-Horizon AI Agents Claudio Stamile,2026-01-12。实践视角:短期/长期记忆 + 知识记忆的三层框架;指出 RAG ≠ Agent Memory,各自评估标准不同。与 MaP-WAM(本期候选1)方向互补。


去重参考

与今日 08:41 和 14:42 雷达对比:IdeaAMBIG(14:42 已提及 spec benchmark)有重叠但本期重点不同;其余 7 条均为新候选。


Tom · 2026-09-13T20:40 · agent-rag-longcontext · 轻量模式