Tom 文献雷达 · Agent × RAG × 长上下文 · 2026-07-16

本次候选:8 条(来自 arXiv + HF Daily)| 高价值:4 条 | Substack:1 条 | CSDN:0


🔴 高价值

1. SynthDocBench — 长视觉文档理解组合基准(HF Daily,52 票)⭐⭐⭐

视觉文档理解 SOTA 已覆盖 DocVQA / ChartQA / MMLongBench,但真实文档含多维度组合因子(长度 + 布局复杂度 + 模态 + 题目难度),难以归因具体失败原因。SynthDocBench 用组合设计构建全合成基准,系统控制长度 / 布局结构 / 模态组成 / 问题类型四个因子——每种因子独立可调,支撑细粒度归因评测。意义:2026 下半年长视觉文档 Agent 若走多因素组合路线,此基准是绕不开的评测锚点。

📎 https://arxiv.org/abs/2607.10400 · HF Daily 52 票


2. SearchGen-20K — 视觉生成的外部知识边界问题(HF Daily,30 票)⭐⭐⭐

视觉生成模型在训练截止后新实体 / 角色 / 事件上产生幻觉式错误,这是结构性瓶颈:生成器训练数据固定,视觉世界是开放集。SearchGen-20K(含 20,839 条 prompt,12 类失败场景,22 个领域)+ 预建 SearchGen-Corpus-1M 提供离线可复现研究基础设施。前沿开放模型在 SearchGen-Bench 仅 21–28/100 分。意义:2026 下半年视觉 Agent(多模态 RAG / 知识增强生成)若缺外部知识检索机制,此工作直接给出 baseline 缺口。

📎 https://arxiv.org/abs/2607.05382 · HF Daily 30 票


3. Function-Aware FIM — 编程 Agent 的工具返回整合难题(arXiv,13 票)⭐⭐⭐

Coding Agent 需将外部工具返回整合进持续推理——但标准左到右预训练只在正向暴露此能力。论文发现:Agent 的 action-observation-continuation 循环与函数调用结构同构——Caller 绑定参数,Callee 返回值,下游代码消费该值。Function-Aware FIM 用程序依赖分析选取被 mask 的函数进行自监督中间填充训练,在工具调用密集场景直接改善 Agent 推理链质量。意义:工具调用能力已是 Agent 基础层,此工作从预训练角度补短板,工程落地路径清晰。

📎 https://arxiv.org/abs/2607.12463v1 · arXiv 13 票


4. EvoGraph-R1 — 自演进多模态知识超图用于 Agentic RAG(arXiv)⭐⭐

现有 GraphRAG 方法将知识图谱视为离线静态结构,无法适应交互式迭代推理。EvoGraph-R1 引入自演进机制:(i)解决文本中心碎片化导致跨模态推理受阻;(ii)动态融合新证据或纠正错误;(iii)在交互循环中持续更新图结构。标签含 agent + rag + multimodal + benchmark,四重标签叠加说明该工作面向 Agentic RAG 全栈。意义:GraphRAG 从静态到自演进的范式转换若成立,是 RAG 系统架构层面的重要升级。

📎 https://arxiv.org/abs/2607.12764v1 · arXiv


🟡 一般候选(4 条)

# 标题 亮点
5 ChartCynics — 误导图表双路径 Agent 框架 VLM 感知与 OCR 数据验证解耦,skeptical reasoning 范式
6 SDABench — 科学发现能力定向评测 六类能力(描述 / 探索 / 推理 / 预测 / 因果 / 机制)× 五领域
7 MAGIC — LLM 生成可导航多场景 3D 游戏世界 多场景连贯性(portal 端点一致性 + 导航可达性),游戏 Agent
8 LakeQuest — 数据湖问答端到端评测 9,846 QA 对评估 retrieve-and-synthesize 全链路,覆盖 AI/医学/金融

📬 Substack 线索

Designing Agentic Memory in 2026(The Nuanced Perspective)— 综述五类认知记忆各自的检索逻辑;指出记忆中毒攻击可使 90%+ Agent 复现漏洞,且在对话中直接纠正无法根治。核心洞察:存储什么、何时检索、何时更新、何时丢弃——都是架构决策,不会默认做对。对应 SynthDocBench 的"组合控制"思路:评测 + 架构须共同设计,而非分头优化。

📎 https://thenuancedperspective.substack.com/p/designing-agentic-memory-in-2026


高价值:4 条 | 一般:4 条 | Substack:1 条 | CSDN:0 candidates JSON: /shared/research-kb/inbox/tom/_candidates/2026-07-16-agent-rag-longcontext-candidates.json