📡 Tom 文献雷达 · Agent · RAG · 长上下文 · 2026-09-12

候选摘要(8 条)

# 来源 标题 标签 价值
1 HF Daily Think Before You Link: Rarity, Reasoning, and Retrieval in Multilingual Entity Linking (2609.10745) RAG, benchmark, multimodal ⭐⭐⭐
2 HF Daily IdeaAMBIG: Benchmarking Implementation-Critical Gaps in Research-Idea Specifications (2609.10539) agent, benchmark ⭐⭐⭐
3 HF Daily Memory as Plans: World-Action Modeling with Memory-Grounded Planning (2609.11561) agent, rag, memory, multimodal ⭐⭐(⚠️ 昨日雷达已收录)
4 HF Daily Studying Image Tokenizers as Visual Languages in Unified Multimodal Models (2609.09143) benchmark, multimodal ⭐⭐
5 HF Daily ActReview: Rebuttal-Guided Training Data and Rubric Rewards for Actionable Peer Review Generation (2609.09076) multimodal
6 HF Daily Beyond Solver Verdicts: Generative Reward Models for Autoformalization (2609.11085) systems
7 HF Daily Building Multilingual Bridges: Data Mixing for In-Language Reasoning (2609.10445) research
8 HF Daily Adaptive Bridge: DDS Backpressure Mitigation in ROS 2 (2608.15380) systems

高价值条目详解

核心: 多模态实体链接在罕见实体上准确率下降 15.4–39.9%,且现有 rarity 定义( popularity-based)遗漏大量结构性稀有实体。提出基于知识图谱结构指标的 rarity 量化方法 + 训练无关的改进方案。

为何值得关注: 这揭示了 RAG 系统中一个被低估的脆弱点——长尾实体。与主流"上下文窗口越大越好"叙事不同,论文表明检索质量比上下文长度更关键。对构建生产级 RAG 的团队有直接参考价值。

标签: rag benchmark multimodal systems


2. IdeaAMBIG (2609.10539) — Agent 实现能力缺口基准

核心: 研究 idea 论文的方法描述是否足以被忠实地实现出来(codification readiness)。提出 660 个证据支撑的基准实例,评估 agent/coder 能否在无额外假设下复现论文方法。

为何值得关注: 填补了"论文可复现性"评估的空白——当前 peer review 只评估 idea 质量,不评估方法描述的完备性。对 agent 系统构建者而言,这直接触及了"Agent 能否可靠执行研究任务"的核心问题。

标签: agent benchmark


3. MaP-WAM (2609.11561) — 记忆即规划(非马尔可夫任务)

核心: 将长期记忆显式建模为"规划结构"(Memory-as-Plans),而非语言摘要或视觉滑动窗口,解决非马尔可夫任务中历史覆盖与执行效率的权衡。

为何值得关注: 这是 9 月 9 日新上榜的 memory × agent 交叉工作。与 Mem0、Letta 等工程方案不同,论文从表征层面提出新的记忆建模思路。⚠️ 昨日雷达已收录,本次标记为重复,建议追踪引用情况。

标签: agent rag memory multimodal


Substack 线索

The 2026 AI Agent Stack, Drawn from Scratch (Brain Bytes / Coding with Roby) — 汇总了当前 Agent Memory 生态: - Mem0 "State of AI Agent Memory 2026" — 记忆层策展 - Letta (MemGPT 演进) — 长程记忆管理 - Zep — 新 SOTA agent memory 方案 - LongMemEval — 长程对话记忆 benchmark

原文链接:https://codingwithroby.substack.com/p/the-2026-ai-agent-stack-drawn-from

💡 核心观点:把 retrieval 当 eval 问题而非基础设施问题——先定义"什么算好检索",再设计系统。


采集说明

  • 来源: HF Daily(arXiv 富化受限于超时/429,实际为 HF 策展过滤)
  • 采集时间: 2026-09-12 08:40 UTC
  • 去重参考: 昨日雷达(2026-09-11T2040-agent-rag-longcontext-radar.md)已收录 2609.11561
  • CSDN: 未使用(搜索结果无版本/命令/源码/排障经验)
  • 本次高分关键词: agent rag benchmark memory

📋 本次候选 JSON:/shared/research-kb/inbox/tom/_candidates/2026-09-12-agent-rag-longcontext-candidates.json