📡 Tom 文献雷达 · Agent · RAG · 长上下文 · 2026-09-12
候选摘要(8 条)
| # | 来源 | 标题 | 标签 | 价值 |
|---|---|---|---|---|
| 1 | HF Daily | Think Before You Link: Rarity, Reasoning, and Retrieval in Multilingual Entity Linking (2609.10745) |
RAG, benchmark, multimodal | ⭐⭐⭐ |
| 2 | HF Daily | IdeaAMBIG: Benchmarking Implementation-Critical Gaps in Research-Idea Specifications (2609.10539) |
agent, benchmark | ⭐⭐⭐ |
| 3 | HF Daily | Memory as Plans: World-Action Modeling with Memory-Grounded Planning (2609.11561) |
agent, rag, memory, multimodal | ⭐⭐(⚠️ 昨日雷达已收录) |
| 4 | HF Daily | Studying Image Tokenizers as Visual Languages in Unified Multimodal Models (2609.09143) |
benchmark, multimodal | ⭐⭐ |
| 5 | HF Daily | ActReview: Rebuttal-Guided Training Data and Rubric Rewards for Actionable Peer Review Generation (2609.09076) |
multimodal | ⭐ |
| 6 | HF Daily | Beyond Solver Verdicts: Generative Reward Models for Autoformalization (2609.11085) |
systems | ⭐ |
| 7 | HF Daily | Building Multilingual Bridges: Data Mixing for In-Language Reasoning (2609.10445) |
research | ⭐ |
| 8 | HF Daily | Adaptive Bridge: DDS Backpressure Mitigation in ROS 2 (2608.15380) |
systems | ⭐ |
高价值条目详解
1. Think Before You Link (2609.10745) — RAG 实体链接冷门问题
核心: 多模态实体链接在罕见实体上准确率下降 15.4–39.9%,且现有 rarity 定义( popularity-based)遗漏大量结构性稀有实体。提出基于知识图谱结构指标的 rarity 量化方法 + 训练无关的改进方案。
为何值得关注: 这揭示了 RAG 系统中一个被低估的脆弱点——长尾实体。与主流"上下文窗口越大越好"叙事不同,论文表明检索质量比上下文长度更关键。对构建生产级 RAG 的团队有直接参考价值。
标签: rag benchmark multimodal systems
2. IdeaAMBIG (2609.10539) — Agent 实现能力缺口基准
核心: 研究 idea 论文的方法描述是否足以被忠实地实现出来(codification readiness)。提出 660 个证据支撑的基准实例,评估 agent/coder 能否在无额外假设下复现论文方法。
为何值得关注: 填补了"论文可复现性"评估的空白——当前 peer review 只评估 idea 质量,不评估方法描述的完备性。对 agent 系统构建者而言,这直接触及了"Agent 能否可靠执行研究任务"的核心问题。
标签: agent benchmark
3. MaP-WAM (2609.11561) — 记忆即规划(非马尔可夫任务)
核心: 将长期记忆显式建模为"规划结构"(Memory-as-Plans),而非语言摘要或视觉滑动窗口,解决非马尔可夫任务中历史覆盖与执行效率的权衡。
为何值得关注: 这是 9 月 9 日新上榜的 memory × agent 交叉工作。与 Mem0、Letta 等工程方案不同,论文从表征层面提出新的记忆建模思路。⚠️ 昨日雷达已收录,本次标记为重复,建议追踪引用情况。
标签: agent rag memory multimodal
Substack 线索
The 2026 AI Agent Stack, Drawn from Scratch (Brain Bytes / Coding with Roby) — 汇总了当前 Agent Memory 生态: - Mem0 "State of AI Agent Memory 2026" — 记忆层策展 - Letta (MemGPT 演进) — 长程记忆管理 - Zep — 新 SOTA agent memory 方案 - LongMemEval — 长程对话记忆 benchmark
原文链接:https://codingwithroby.substack.com/p/the-2026-ai-agent-stack-drawn-from
💡 核心观点:把 retrieval 当 eval 问题而非基础设施问题——先定义"什么算好检索",再设计系统。
采集说明
- 来源: HF Daily(arXiv 富化受限于超时/429,实际为 HF 策展过滤)
- 采集时间: 2026-09-12 08:40 UTC
- 去重参考: 昨日雷达(
2026-09-11T2040-agent-rag-longcontext-radar.md)已收录2609.11561 - CSDN: 未使用(搜索结果无版本/命令/源码/排障经验)
- 本次高分关键词:
agentragbenchmarkmemory
📋 本次候选 JSON:/shared/research-kb/inbox/tom/_candidates/2026-09-12-agent-rag-longcontext-candidates.json