Tom 文献雷达 · Agent / RAG / 长上下文 · 2026-07-24
本轮来源:arXiv metadata + HF Daily | 去重参考:近 7 日文件 2026-07-21~23
本期高价值候选(4 条)
1. IteraSim RAG:面向 CFD 的多阶段检索增强 Agent
- 来源:arXiv 2607.20346 | 2026-07-22
- 核心:提出多阶段 RAG 解决 OpenFOAM CFD 配置难题;克服单次 flat query、单一检索策略、同 Agent 写评不自查三大缺陷。
- 标签:
agentragbenchmarksystems - 链接:http://arxiv.org/abs/2607.20346v1
2. DocOps:复杂文档操作的 Agent 可验证评测基准
- 来源:arXiv 2607.19865 | 2026-07-21
- 核心:提出层级分类法 + 确定性验证框架,系统评估 Agent 在真实数字文档工作流中的可靠性;涵盖多种开源/闭源模型。
- 标签:
agentbenchmarksystems - 链接:https://arxiv.org/abs/2607.19865
3. ActiveVision:MLLM 主动视觉观察能力评测
- 来源:arXiv 2607.16165 | 2026-07-16 | HF 18 票
- 核心:17 项任务分 3 类,强制 MLLM 进行重复视觉感知而非单次静态描述,填补主动观察能力无法测量空白。
- 标签:
benchmarkmultimodal - 链接:https://arxiv.org/abs/2607.16165
4. ENTRAP-VL:VLM 双重语境 entrainment 分类探测
- 来源:arXiv 2607.20092 | 2026-07-21
- 核心:研究 VLMs 中语境牵引现象(模型被无关/无意义上下文拉动输出),构建分类学结构探测工具,与语言模型中已发现机制对照。
- 标签:
benchmarkmultimodal - 链接:https://arxiv.org/abs/2607.20092
全部候选(4 条)
| # | 标题 | 来源 | 日期 | 标签 |
|---|---|---|---|---|
| 5 | Scaling Laws for Hypernetwork-Based Knowledge Injection | HF Daily | 2026-07-20 | systems |
| 6 | FinMMEval 2026 Task 2: Multilingual Financial Short-Answer QA | arXiv | 2026-07-22 | rag, benchmark, systems |
| 7 | Train the Model, Not the Reader: Decodability Supervision | arXiv | 2026-07-21 | multimodal |
| 8 | Diff-Logic: Differentiable Logic Gate Networks for EEG Edge | arXiv | 2026-07-19 | systems |
Substack / 行业洞察
- Agentic RAG in 2026: The UK/EU Enterprise Guide(datanucleu.dev,非纯 Substack,但内容翔实)
- 链接:https://datanucleus.dev/rag-and-agentic-ai/agentic-rag-enterprise-guide-2026
- 要点:Agentic RAG = 给他一个研究助理 + 浏览器 + 待办清单;整合 ReAct、Tree-of-Thoughts;McKinsey 数据:27% 用户全审输出,Agentic RAG 可自动化验证与引用。
统计:候选 8 条 | 高价值 4 条 | Substack 0(1 条行业洞察非纯 Substack)| CSDN 未使用