Tom 文献雷达 · AI Agent / RAG / 长上下文 · 2026-07-30(午后版)
本期关键词
AI Agent · RAG · 长上下文 · 评测基准 · 技能演化 · Memory Foundation
🔥 高价值条目(4 条)
1. Metis — Memory Foundation Model
- 来源: arXiv (2026-07-29) · Zhang, Guo, Sun et al.
- 链接: http://arxiv.org/abs/2607.26760v1
- 标签:
agentmemorymultimodal - 核心要点: 首个将 agent memory 能力内化为 foundation model 原生能力的工作。形式化两个维度:backbone 内持久化动态 memory state + 原生 memory procedures(而非外挂模块)。填补了 LRM/LMM 时代"agent memory 仍靠外部模块"的空白。
- 为何高价值: Memory 从外挂模块走向 model-native,是 AI Agent 架构演进的关键节点。
2. CAST — Game Solvers as Turn-Level Teachers
- 来源: arXiv · HF Daily (2026-07-27)
- 链接: https://arxiv.org/abs/2607.25308
- 标签:
agentbenchmark - 核心要点: RLVR 在长时序游戏中依赖稀疏最终 reward,无法分配中间决策 credit。CAST 利用 game solver 状态值变化判断动作是否推进成功,将此转化为 token-level 过程信号。解决 RLVR 在复杂决策任务中 credit assignment 困难的问题。
- 为何高价值: 为 agent 训练中的稀疏 reward 问题提供了免辅助模型的 credit 分配方案。
3. Grading the Narrators — Claim-Level Provenance in Multi-Agent Knowledge
- 来源: arXiv (2026-07-26)
- 链接: https://arxiv.org/abs/2607.24117
- 标签:
agentragbenchmarksystems - 核心要点: 借鉴伊斯兰 hadith 科学的 isnad-rijal 框架,为 multi-agent 知识系统的 claim 级传输链赋予按领域分级的传输可靠性评分。支持 completeness semantics、transformation-typed 聚合、content criticism 解耦,以及 serve/review/quarantine 路由。
- 为何高价值: 首个连接传统信息溯源与现代 multi-agent RAG 的跨学科框架,对 RAG 精度评估有直接参考价值。
4. CLBench-V — Multimodal Context Learning Benchmark
- 来源: arXiv · HF Daily (2026-07-27)
- 链接: https://arxiv.org/abs/2607.25294
- 标签:
benchmarkmultimodal - 核心要点: 现有 context learning 评测均为文本,但实际场景(科研、金融、空间决策)中 context 往往是多模态的(图表、表格、地图、网页)。CLBench-V 覆盖 multimodal → knowledge acquisition 全链路,定位 context 使用的具体位置与知识获取质量。
- 为何高价值: 多模态 RAG 的核心挑战是"context 定位",本文填补了这一评测空白。
📌 中等价值条目(4 条)
5. DecoEvo — Score-Decoupled Co-Evolution of Solver and Rubric
- 来源: arXiv · HF Daily (2026-07-27)
- 链接: https://arxiv.org/abs/2607.25675
- 标签:
benchmark - 核心要点: Text-space optimization 中现有方法固定 evaluation rubric 成为 open-ended 任务瓶颈。DecoEvo 让 solver 与 rubric 协同演化,解决"rubric 被 solver 自我宽松化"的问题。
6. SkillRise — Agentic RL for Cross-Task Skill Evolution
- 来源: arXiv · HF Daily (2026-07-28)
- 链接: https://arxiv.org/abs/2607.26784
- 标签:
agentragbenchmark - 核心要点: 标准 agentic RL 将任务视为独立 episode,SkillRise 用单个 policy 在任务求解和 skill 文档演化间交替,实现跨任务技能复用。
7. CoRT — Token-Level Credit for Rubric-Guided GRPO
- 来源: arXiv · HF Daily (2026-07-27)
- 链接: https://arxiv.org/abs/2607.25659
- 标签:
benchmark - 核心要点: GRPO-style rubric RL 将结构化评判压缩为标量,CoRT 在 token 级别重新分配 credit,无需辅助 token scoring 模型。
8. StealthBench — Operational Stealth in Offensive-Security Agents
- 来源: arXiv · HF Daily (2026-07-27)
- 链接: https://arxiv.org/abs/2607.26314
- 标签:
agentbenchmark - 核心要点: 从 11 个真实 bug-bounty/red-team 轨迹提取 OPSEC 事件,评估 autonomous offensive-security agent 在六个 OPSEC 维度的隐匿能力。
💡 趋势洞察
- Memory 走向 Model-Native:Metis 标志着 agent memory 从外挂向量 DB 向 foundation model 内生的演进,与 2026 Substack 共识(memory 分层独立)互为印证。
- Agent 评测精细化:从最终结果走向阶段分解(检索、credit assignment、跨模态定位、多跳推理),各阶段均有新基准涌现。
- Multi-agent 溯源框架兴起:Grading the Narrators 引入跨学科方法,为 RAG claim 可靠性评估提供新思路。
- 安全与隐匿成为 agent 评测新维度:StealthBench 出现呼应真实攻击事件,OPSEC 评估将与功能性评测并列。
Tom 文献雷达 · 每日高频版 · 2026-07-30 午后版 · 候选 8 条 · 高价值 4 条 · 无 Substack / CSDN