Tom 文献雷达 · Agent / RAG / 长上下文 · 2026-07-24

本轮来源:arXiv metadata + HF Daily | 去重参考:近 7 日文件 2026-07-21~23


本期高价值候选(4 条)

1. IteraSim RAG:面向 CFD 的多阶段检索增强 Agent

  • 来源:arXiv 2607.20346 | 2026-07-22
  • 核心:提出多阶段 RAG 解决 OpenFOAM CFD 配置难题;克服单次 flat query、单一检索策略、同 Agent 写评不自查三大缺陷。
  • 标签agent rag benchmark systems
  • 链接:http://arxiv.org/abs/2607.20346v1

2. DocOps:复杂文档操作的 Agent 可验证评测基准

  • 来源:arXiv 2607.19865 | 2026-07-21
  • 核心:提出层级分类法 + 确定性验证框架,系统评估 Agent 在真实数字文档工作流中的可靠性;涵盖多种开源/闭源模型。
  • 标签agent benchmark systems
  • 链接:https://arxiv.org/abs/2607.19865

3. ActiveVision:MLLM 主动视觉观察能力评测

  • 来源:arXiv 2607.16165 | 2026-07-16 | HF 18 票
  • 核心:17 项任务分 3 类,强制 MLLM 进行重复视觉感知而非单次静态描述,填补主动观察能力无法测量空白。
  • 标签benchmark multimodal
  • 链接:https://arxiv.org/abs/2607.16165

4. ENTRAP-VL:VLM 双重语境 entrainment 分类探测

  • 来源:arXiv 2607.20092 | 2026-07-21
  • 核心:研究 VLMs 中语境牵引现象(模型被无关/无意义上下文拉动输出),构建分类学结构探测工具,与语言模型中已发现机制对照。
  • 标签benchmark multimodal
  • 链接:https://arxiv.org/abs/2607.20092

全部候选(4 条)

# 标题 来源 日期 标签
5 Scaling Laws for Hypernetwork-Based Knowledge Injection HF Daily 2026-07-20 systems
6 FinMMEval 2026 Task 2: Multilingual Financial Short-Answer QA arXiv 2026-07-22 rag, benchmark, systems
7 Train the Model, Not the Reader: Decodability Supervision arXiv 2026-07-21 multimodal
8 Diff-Logic: Differentiable Logic Gate Networks for EEG Edge arXiv 2026-07-19 systems

Substack / 行业洞察

  • Agentic RAG in 2026: The UK/EU Enterprise Guide(datanucleu.dev,非纯 Substack,但内容翔实)
  • 链接:https://datanucleus.dev/rag-and-agentic-ai/agentic-rag-enterprise-guide-2026
  • 要点:Agentic RAG = 给他一个研究助理 + 浏览器 + 待办清单;整合 ReAct、Tree-of-Thoughts;McKinsey 数据:27% 用户全审输出,Agentic RAG 可自动化验证与引用。

统计:候选 8 条 | 高价值 4 条 | Substack 0(1 条行业洞察非纯 Substack)| CSDN 未使用