Tom 文献雷达 · Agent/RAG/长上下文 · 2026-09-03 早

轻量版 · 检索:HuggingFace Daily(8 条候选,arXiv 超时) 去重依据:2026-09-02 08:40/14:40/20:40 三轮已覆盖 Safin-1、Agents in the Large、Harness-of-Harness、Adaptive Critical Token、From Production Traffic、Long Context vs RAG 成本文


高价值候选(3 条)

1. AgentJudgeBench: LLM Judge 可靠性基准——Agentic Tool-Calling 工作流评测

  • 来源: arXiv(2608.26623)· 2026-08-26 · HuggingFace 16 票
  • 核心: 首个系统研究"LLM-as-a-Judge"在 agentic tool-calling 上的可靠性。基准覆盖 6 种 DAG 拓扑 × 3 个难度层级 = 3,808 实例;评测了 5 个生成器(3B-70B + GPT-5.4)和 6 个 judge(20B 到 frontier 规模)。发现 ground-truth 存在时 vs 不存在时 judge 表现差异显著。
  • 意义: 为 Agent 评测提供标准化 judge 可靠性测试集;揭示现有 LLM judge 在结构化依赖工作流中的系统性偏差;对 Agent 系统评估方法论有直接影响。
  • 标签: #Agent #评测基准 #LLM-as-Judge
  • 原文: https://arxiv.org/abs/2608.26623

2. Agent Memory Is a Surface for Endogenous Authorization Laundering

  • 来源: arXiv(2609.01836)· 2026-08-31
  • 核心: 长期运行的 LLM Agent 依赖持久化记忆保存权限状态。论文定义"内生授权洗白"(EAL)——记忆中的虚假授权记录导致未经授权的行为,而其来源已被遗忘。提出 EAL-Bench,衡量持久化记忆是否准确保留动态授权状态。
  • 意义: 首次从安全角度审视 Agent 记忆系统的内生风险;为 Agent 记忆模块的可靠性评测提供新维度;长期记忆路由设计者需关注。
  • 标签: #Agent #记忆系统 #安全
  • 原文: https://arxiv.org/abs/2609.01836

3. Token-Efficient Data Reasoning Agents:非结构化数据的结构化预存储策略

  • 来源: arXiv(2608.31082)· 2026-08-30 · HuggingFace 3 票
  • 核心: 企业数据(网页/合同/财报)嵌入在非结构化文档中,Agent 问答每次打开大文档消耗高达百万 tokens。论文发现,若提前结构化存储,同等问题成本降低 28 倍(FanOutQA 基准);差距随文档规模增大而扩大。
  • 意义: 揭示"预结构化"vs"即时 RAG"在成本-质量上的Trade-off;对知识密集型 Agent 的数据管道设计有直接参考价值。
  • 标签: #Agent #RAG #成本优化
  • 原文: https://arxiv.org/abs/2608.31082

全部候选(5 条,含高价值)

# 标题 来源 票/信号 标签 状态
1 AgentJudgeBench HF Daily 16 票 #Agent #评测 #Judge ★ 高价值
2 Agent Memory EAL HF Daily 2 票 #Agent #记忆 #安全 ★ 高价值
3 Token-Efficient Data Reasoning HF Daily 3 票 #Agent #RAG #成本 ★ 高价值
4 CASTER: 无梯度测试时适应 HF Daily 4 票 #系统 #TTA 备选
5 Credit-Addressable Multimodal Reasoning HF Daily 3 票 #多模态 备选

注:DramaChain Bench、Imitation Learning、KD Mid-Training 因主题偏离(生成/操作类)未列入。


Substack 补充:Agent Memory 生态 2026

来源:The AI Engineer(2026)、Brain Bytes 等 - 记忆框架 Benchmark 乱象:LoCoMo 上最强框架运行成本是第二名的 340 倍,但 benchmark 不显示这个差距——生产选型时需同时看成本。 - 2026 新 Benchmark:LongMemEval(长程对话记忆)、Mem0 ECAI 2025 论文、Zep 声称新 SOTA;实际生产差距仍大。 - 关键认知:上下文窗口 ≠ 记忆。即使 200K token,每轮对话仍需支付完整上下文费用,跨会话无记忆。生产 Agent 在 2026 年将记忆层独立于 prompt 之外。


本期小结

  • Agent 评测升温:AgentJudgeBench 填补 LLM judge 在 agentic tool-calling 上的可靠性空白;EAL-Bench 则从安全角度为记忆系统建立评测维度。
  • RAG 成本优化有新思路:Token-Efficient 文揭示预结构化策略相比即时 RAG 可获 28 倍成本优势,适合知识密集型固定场景。
  • 记忆层独立已成 2026 共识:上下文窗口无法替代外部记忆系统,但 LoCoMo 等 benchmark 与生产现实差距巨大(340 倍算力差距),选型需双重验证。
  • arXiv 本轮超时(memory/agent/RAG 查询均 429/Timeout),候选全部来自 HF Daily;建议下次重试或降频查询。

生成时间:2026-09-03 08:40 Asia/Shanghai · Tom 文献雷达轻量版