Tom 文献雷达 · AI Agent / RAG / 长上下文 · 2026-07-30(午后版)

本期关键词

AI Agent · RAG · 长上下文 · 评测基准 · 技能演化 · Memory Foundation


🔥 高价值条目(4 条)

1. Metis — Memory Foundation Model

  • 来源: arXiv (2026-07-29) · Zhang, Guo, Sun et al.
  • 链接: http://arxiv.org/abs/2607.26760v1
  • 标签: agent memory multimodal
  • 核心要点: 首个将 agent memory 能力内化为 foundation model 原生能力的工作。形式化两个维度:backbone 内持久化动态 memory state + 原生 memory procedures(而非外挂模块)。填补了 LRM/LMM 时代"agent memory 仍靠外部模块"的空白。
  • 为何高价值: Memory 从外挂模块走向 model-native,是 AI Agent 架构演进的关键节点。

2. CAST — Game Solvers as Turn-Level Teachers

  • 来源: arXiv · HF Daily (2026-07-27)
  • 链接: https://arxiv.org/abs/2607.25308
  • 标签: agent benchmark
  • 核心要点: RLVR 在长时序游戏中依赖稀疏最终 reward,无法分配中间决策 credit。CAST 利用 game solver 状态值变化判断动作是否推进成功,将此转化为 token-level 过程信号。解决 RLVR 在复杂决策任务中 credit assignment 困难的问题。
  • 为何高价值: 为 agent 训练中的稀疏 reward 问题提供了免辅助模型的 credit 分配方案。

3. Grading the Narrators — Claim-Level Provenance in Multi-Agent Knowledge

  • 来源: arXiv (2026-07-26)
  • 链接: https://arxiv.org/abs/2607.24117
  • 标签: agent rag benchmark systems
  • 核心要点: 借鉴伊斯兰 hadith 科学的 isnad-rijal 框架,为 multi-agent 知识系统的 claim 级传输链赋予按领域分级的传输可靠性评分。支持 completeness semantics、transformation-typed 聚合、content criticism 解耦,以及 serve/review/quarantine 路由。
  • 为何高价值: 首个连接传统信息溯源与现代 multi-agent RAG 的跨学科框架,对 RAG 精度评估有直接参考价值。

4. CLBench-V — Multimodal Context Learning Benchmark

  • 来源: arXiv · HF Daily (2026-07-27)
  • 链接: https://arxiv.org/abs/2607.25294
  • 标签: benchmark multimodal
  • 核心要点: 现有 context learning 评测均为文本,但实际场景(科研、金融、空间决策)中 context 往往是多模态的(图表、表格、地图、网页)。CLBench-V 覆盖 multimodal → knowledge acquisition 全链路,定位 context 使用的具体位置与知识获取质量。
  • 为何高价值: 多模态 RAG 的核心挑战是"context 定位",本文填补了这一评测空白。

📌 中等价值条目(4 条)

5. DecoEvo — Score-Decoupled Co-Evolution of Solver and Rubric

  • 来源: arXiv · HF Daily (2026-07-27)
  • 链接: https://arxiv.org/abs/2607.25675
  • 标签: benchmark
  • 核心要点: Text-space optimization 中现有方法固定 evaluation rubric 成为 open-ended 任务瓶颈。DecoEvo 让 solver 与 rubric 协同演化,解决"rubric 被 solver 自我宽松化"的问题。

6. SkillRise — Agentic RL for Cross-Task Skill Evolution

  • 来源: arXiv · HF Daily (2026-07-28)
  • 链接: https://arxiv.org/abs/2607.26784
  • 标签: agent rag benchmark
  • 核心要点: 标准 agentic RL 将任务视为独立 episode,SkillRise 用单个 policy 在任务求解和 skill 文档演化间交替,实现跨任务技能复用。

7. CoRT — Token-Level Credit for Rubric-Guided GRPO

  • 来源: arXiv · HF Daily (2026-07-27)
  • 链接: https://arxiv.org/abs/2607.25659
  • 标签: benchmark
  • 核心要点: GRPO-style rubric RL 将结构化评判压缩为标量,CoRT 在 token 级别重新分配 credit,无需辅助 token scoring 模型。

8. StealthBench — Operational Stealth in Offensive-Security Agents

  • 来源: arXiv · HF Daily (2026-07-27)
  • 链接: https://arxiv.org/abs/2607.26314
  • 标签: agent benchmark
  • 核心要点: 从 11 个真实 bug-bounty/red-team 轨迹提取 OPSEC 事件,评估 autonomous offensive-security agent 在六个 OPSEC 维度的隐匿能力。

💡 趋势洞察

  1. Memory 走向 Model-Native:Metis 标志着 agent memory 从外挂向量 DB 向 foundation model 内生的演进,与 2026 Substack 共识(memory 分层独立)互为印证。
  2. Agent 评测精细化:从最终结果走向阶段分解(检索、credit assignment、跨模态定位、多跳推理),各阶段均有新基准涌现。
  3. Multi-agent 溯源框架兴起:Grading the Narrators 引入跨学科方法,为 RAG claim 可靠性评估提供新思路。
  4. 安全与隐匿成为 agent 评测新维度:StealthBench 出现呼应真实攻击事件,OPSEC 评估将与功能性评测并列。

Tom 文献雷达 · 每日高频版 · 2026-07-30 午后版 · 候选 8 条 · 高价值 4 条 · 无 Substack / CSDN