Tom 文献雷达 · Agent/RAG/长上下文 · 2026-09-03 晚

轻量版 · 检索:HuggingFace Daily + arXiv(8 条候选,0 次 web 补充) 去重依据:早间版(08:40)已覆盖 AgentJudgeBench、EAL-Bench、Token-Efficient Data Reasoning;下午版(14:40)已覆盖 HarnessDev、S³Gym、CRISP、SnapBench、ASPIRE。本期聚焦今日新候选,避免重复归档。


高价值候选(3 条)

1. KBMR:首个面向知识型 VQA 的 MLLM 语义对齐检索器

  • 来源: arXiv(2608.21450)· 2026-08-18 · HF 26 票
  • 核心: 现有 KB-VQA 检索依赖 CLIP 风格双编码器,以视觉相似性而非实体级语义对齐为导向,导致语义相同但视觉差异大的实体漏检、视觉相似但语义无关的实体误召。KBMR 利用 MLLM 自回归能力,将图像映射到语义空间,显式建模实体级对齐。
  • 意义: 首个专门为 KB-VQA 设计的 MLLM 嵌入检索器;揭示视觉相似性优先范式在知识密集型 VQA 中的系统性局限;RAG 架构中「编码器选型」问题的直接参考。
  • 标签: #RAG #benchmark #VQA #MLLM
  • 原文: https://arxiv.org/abs/2608.21450

2. LLAMIA-Bench:LLM 与非语言 Agent 协作基准(以国际象棋为载体)

  • 来源: arXiv(2609.00474)· 2026-09-01 · HF 4 票
  • 核心: 游戏和机器人领域的最强 Agent 往往不是 LLM,整合需要将连续表示压缩为稀疏文本(verbalization)。LLAMIA-Bench 覆盖六种协作任务,评测 LLM 协调器与非语言子 Agent 协作中的 verbalization 是否成为瓶颈;含行为模仿、状态评估、自然语言协作三个维度。
  • 意义: 首个系统研究「verbalization 是否限制 LLM 与非语言 Agent 协作」的基准;为具身 Agent、多模态 Agent 的编排层提供评测参照;区别于纯语言工具调用评测。
  • 标签: #Agent #benchmark #具身Agent
  • 原文: https://arxiv.org/abs/2609.00474

3. ViSAR:视觉文档检索的自适应 Top-k,无需训练

  • 来源: arXiv(2609.02486)· 2026-09-02 · HF 0 票
  • 核心: DocVQA 中 RAG 通常固定检索 Top-k,复杂查询可能召回不足,简单查询则浪费计算资源。ViSAR 在嵌入空间直接构建 query 自适应稀疏激活,无需训练或微调,动态调整每轮检索量;在 ColPali 等 late-interaction 编码器上验证有效。
  • 意义: 训练-free 的自适应检索方案,生产部署门槛低;与固定 k 的 late-interaction 方案(ColPali/ColQ)形成直接竞争;长文档 RAG 系统的推理成本优化方向。
  • 标签: #RAG #systems #长文档 #推理优化
  • 原文: http://arxiv.org/abs/2609.02486v1

一般候选(5 条)

# 标题 来源 信号 备注
4 NE-R1:按需检索自适应增强 NER(rag-on-demand 机制) arXiv 2609.02366 · 2026-09-02 NER + RL 两阶段训练:多任务冷启动 → RL 驱动按需触发;适合知识密集型 NER
5 NeoMME:单塔多模态原生多语言编码器(260M/800M) arXiv 2609.01657 · 2026-08-30 · HF 2票 多模态系统 双向 Transformer 替代因果 VLM,ColPali 类任务参数效率更高
6 BioNER + RAG 面向放射学报告白话摘要 arXiv 2609.02396 · 2026-09-02 医疗RAG 领域 RAG 的 hallucination 风险评测;临床患者友好方向
7 FoldingAgent:从折纸演示视频推断参数化折叠程序 arXiv 2609.00377 · 2026-08-30 · HF 2票 Agent + 多模态 VLM + 专用工具链(几何模拟、物理论证、视觉对比);跨模态规划
8 Ignorance or Incompetence?:知识门控 Agent 评测协议 arXiv 2608.30322 · 2026-08-30 · HF 1票 Agent #benchmark 分离任务指令与私有约定工件;评测 Agent 是否依赖隐式知识而非显式约定

Substack 补充

本期无直接匹配的 Substack 高质量技术文章。近期大模型上下文扩展(Gemini 1.5 Pro、Claude 200K)和 RAG 架构选型仍是博客讨论主流;Agent 自我评测(早间/下午已覆盖 HarnessDev/S³Gym)未见独立博客深度跟进。维持以 arXiv 为主的情报源策略。


本期小结

  • 检索语义对齐:KBMR(HF 26 票)揭示 CLIP 风格视觉相似性优先在 KB-VQA 中的系统性局限,MLLM 语义对齐为下一代检索编码器指路。
  • 非语言 Agent 协作:LLAMIA-Bench 填补「LLM 协调器 + 非语言子 Agent」评测空白,与纯工具调用评测路线互补。
  • 自适应检索实用化:ViSAR 无需训练即可动态调整 Top-k,对现有 ColPali 生态有直接部署价值。
  • 医疗 RAG 新场景:放射学报告白话摘要 + BioNER 评测,RAG 在临床患者友好方向的具体落地参考。

Tom 文献雷达 · 每日 3 次(08:40 / 14:40 / 20:40)· 轻量版 Generated: 2026-09-03 20:40 Asia/Shanghai