📡 Tom 研究雷达 · Agent / RAG / Long-Context · 2026-09-12

轻量模式 · 来源:arXiv metadata + HF Daily + Substack 补充
覆盖:Agent 记忆与规划、RAG 评测、长上下文、Agent 执行边界


🔬 本期高价值(4 条)

1. MaP-WAM:记忆即规划——非马尔可夫任务的长时记忆新框架

Memory as Plans: World-Action Modeling with Memory-Grounded Planning
arXiv 2609.11561 · 2026-09-09 · HF votes: 21

现有 Agent 记忆机制(语言摘要、视觉窗口或二者混合)在非马尔可夫真实操作任务上存在精度-效率权衡。MaP-WAM 将记忆依赖的世界-动作建模分解为「记忆锚定的规划」+「规划条件下的执行」,利用长期多模态情景上下文解决精细视觉证据丢失问题。

为什么值得关注: 这不是又一个 RAG 变体,而是从根本上重新定义 Agent 如何在长时序任务中维护和调用记忆。对构建复杂操作型 Agent(如自动化实验室、长期机器人任务)的团队有直接参考价值。


Think Before You Link: Reticval in Multilingual Entity Linking
arXiv 2609.10745 · 2026-09-08 · HF votes: 11

现有实体链接系统依赖流行度指标(页面浏览量)衡量稀有性,导致很多 KG 结构上实际连接薄弱的实体被遗漏。论文引入 KG 结构指标,在稀有实体切片上 SOTA 准确率下降 15.4–39.9%,并提出无需训练的修复方案。

为什么值得关注: RAG 检索质量瓶颈往往被归咎于向量数据库,但根源是「检索目标定义不清」。这篇工作对设计更鲁棒的 RAG 管道、特别是垂直领域知识密集型应用有直接启发。


3. EBL-Core:AI Agent 行动执行授权的语义边界

From Intent to Execution Grant: An Execution-Boundary Conformance Profile for High-Risk AI Actions
arXiv 2609.11596 · 2026-09-10 · 作者:Mengting Wu, Lin Wang, Yong Zhang, Jiang Deng

AI Agent 越来越频繁地发起有外部后果的行动(金融转账、基础设施变更、软件部署等),但现有授权引擎、策略语言、运行时监控并未对「从候选行动到执行授权」的语义契约给出统一定义。EBL-Core 提出执行边界合规配置文件(conformance profile)。

为什么值得关注: 随着 Agent 进入高风险操作领域,授权边界的形式化定义是工程落地的前提。这篇论文填补了 Agent 安全栈中一个被长期忽视的空白,对构建生产级 Agent 管控层有直接意义。


4. IdeaAMBIG:研究 idea 到可实现代码的「实现缺口」基准

IdeaAMBIG: Benchmarking Implementation-Critical Gaps in Research-Idea Specifications
arXiv 2609.10539 · 2026-09-08 · HF votes: 10

一篇研究 idea 可能新颖、合理、科学上可信,但实现方法描述不足以让编码 Agent 忠实复现。IdeaAMBIG 提供 660 个基于证据的评估实例,涵盖论文、代码库、Issue 线程和复现产物。

为什么值得关注: 对 Agent 自动化研究工作流(让 Agent 读论文 → 实现 → 验证)有直接评测意义。这套基准填补了「研究 idea 完整性」评估的空白,有助于识别哪些论文实际上可以被自动化 Agent 处理。


📋 其余候选(4 条)

  1. Generative Verification (GenV) · arXiv 2609.11085 · 神经符号系统中错误形式编码却通过验证(VPU 问题)的检测与修复,非本轮重点方向。
  2. Image Tokenizers as Visual Languages · arXiv 2609.09143 · 多模态 tokenizer 在联合预训练中的行为分析,偏视觉-语言基础研究。
  3. ActReview:反驳引导的同行评审生成 · arXiv 2609.09076 · 评审改进建议生成,有一定创意但非核心方向。
  4. Adaptive Bridge (ROS2 DDS) · arXiv 2608.15380 · 机器人中间件层面的背压隔离,与 Agent/RAG 无直接关联。

📌 Substack 行业信号(1 条)

The AI Engineer · The AI Agents Stack: LLM to Production (2026 Edition)
theaiengineer.substack.com · 2026

核心判断: - 2024 → 2026 记忆范式转变: 2024 年「记忆 = 选个向量库做 RAG」;2026 年记忆是独立的三层架构原语(对话历史 / 结构化系统提示 → 向量搜索历史 → Agentic 记忆管理)。 - 长上下文没有杀死 RAG: 更大 context window 改变了 tradeoff(哪些塞进 context,哪些按需检索),但没有消除对专用记忆基础设施的需求。 - 实际建议: 大多数团队过度设计。从 Postgres 存对话历史 + 结构化系统提示开始;当历史超出 context 限制再加向量搜索;只有当 Agent 需要跨 session 学习时才引入专用记忆管理层。

全文附有详细 2026 Agent 技术栈图谱和评估框架。


🗓️ 去重参考

本期新出现的 arXiv ID:2609.115612609.107452609.105392609.115962609.110852609.09076
近期相关轮次(09-05 ~ 09-11)已覆盖 e1prep 系列、e1 inference、RAG 专题、Cohere/Mem0/Agent memory 栈等,本期聚焦新出炉的 9 月上旬论文,未与历史内容重复。


Generated by Tom · 2026-09-12T14:40 CST · topic: agent-rag-longcontext