Tom 文献雷达 · Agent/RAG/长上下文 · 2026-09-03 早
轻量版 · 检索:HuggingFace Daily(8 条候选,arXiv 超时) 去重依据:2026-09-02 08:40/14:40/20:40 三轮已覆盖 Safin-1、Agents in the Large、Harness-of-Harness、Adaptive Critical Token、From Production Traffic、Long Context vs RAG 成本文
高价值候选(3 条)
1. AgentJudgeBench: LLM Judge 可靠性基准——Agentic Tool-Calling 工作流评测
- 来源: arXiv(2608.26623)· 2026-08-26 · HuggingFace 16 票
- 核心: 首个系统研究"LLM-as-a-Judge"在 agentic tool-calling 上的可靠性。基准覆盖 6 种 DAG 拓扑 × 3 个难度层级 = 3,808 实例;评测了 5 个生成器(3B-70B + GPT-5.4)和 6 个 judge(20B 到 frontier 规模)。发现 ground-truth 存在时 vs 不存在时 judge 表现差异显著。
- 意义: 为 Agent 评测提供标准化 judge 可靠性测试集;揭示现有 LLM judge 在结构化依赖工作流中的系统性偏差;对 Agent 系统评估方法论有直接影响。
- 标签: #Agent #评测基准 #LLM-as-Judge
- 原文: https://arxiv.org/abs/2608.26623
2. Agent Memory Is a Surface for Endogenous Authorization Laundering
- 来源: arXiv(2609.01836)· 2026-08-31
- 核心: 长期运行的 LLM Agent 依赖持久化记忆保存权限状态。论文定义"内生授权洗白"(EAL)——记忆中的虚假授权记录导致未经授权的行为,而其来源已被遗忘。提出 EAL-Bench,衡量持久化记忆是否准确保留动态授权状态。
- 意义: 首次从安全角度审视 Agent 记忆系统的内生风险;为 Agent 记忆模块的可靠性评测提供新维度;长期记忆路由设计者需关注。
- 标签: #Agent #记忆系统 #安全
- 原文: https://arxiv.org/abs/2609.01836
3. Token-Efficient Data Reasoning Agents:非结构化数据的结构化预存储策略
- 来源: arXiv(2608.31082)· 2026-08-30 · HuggingFace 3 票
- 核心: 企业数据(网页/合同/财报)嵌入在非结构化文档中,Agent 问答每次打开大文档消耗高达百万 tokens。论文发现,若提前结构化存储,同等问题成本降低 28 倍(FanOutQA 基准);差距随文档规模增大而扩大。
- 意义: 揭示"预结构化"vs"即时 RAG"在成本-质量上的Trade-off;对知识密集型 Agent 的数据管道设计有直接参考价值。
- 标签: #Agent #RAG #成本优化
- 原文: https://arxiv.org/abs/2608.31082
全部候选(5 条,含高价值)
| # | 标题 | 来源 | 票/信号 | 标签 | 状态 |
|---|---|---|---|---|---|
| 1 | AgentJudgeBench | HF Daily | 16 票 | #Agent #评测 #Judge | ★ 高价值 |
| 2 | Agent Memory EAL | HF Daily | 2 票 | #Agent #记忆 #安全 | ★ 高价值 |
| 3 | Token-Efficient Data Reasoning | HF Daily | 3 票 | #Agent #RAG #成本 | ★ 高价值 |
| 4 | CASTER: 无梯度测试时适应 | HF Daily | 4 票 | #系统 #TTA | 备选 |
| 5 | Credit-Addressable Multimodal Reasoning | HF Daily | 3 票 | #多模态 | 备选 |
注:DramaChain Bench、Imitation Learning、KD Mid-Training 因主题偏离(生成/操作类)未列入。
Substack 补充:Agent Memory 生态 2026
来源:The AI Engineer(2026)、Brain Bytes 等 - 记忆框架 Benchmark 乱象:LoCoMo 上最强框架运行成本是第二名的 340 倍,但 benchmark 不显示这个差距——生产选型时需同时看成本。 - 2026 新 Benchmark:LongMemEval(长程对话记忆)、Mem0 ECAI 2025 论文、Zep 声称新 SOTA;实际生产差距仍大。 - 关键认知:上下文窗口 ≠ 记忆。即使 200K token,每轮对话仍需支付完整上下文费用,跨会话无记忆。生产 Agent 在 2026 年将记忆层独立于 prompt 之外。
本期小结
- Agent 评测升温:AgentJudgeBench 填补 LLM judge 在 agentic tool-calling 上的可靠性空白;EAL-Bench 则从安全角度为记忆系统建立评测维度。
- RAG 成本优化有新思路:Token-Efficient 文揭示预结构化策略相比即时 RAG 可获 28 倍成本优势,适合知识密集型固定场景。
- 记忆层独立已成 2026 共识:上下文窗口无法替代外部记忆系统,但 LoCoMo 等 benchmark 与生产现实差距巨大(340 倍算力差距),选型需双重验证。
- arXiv 本轮超时(memory/agent/RAG 查询均 429/Timeout),候选全部来自 HF Daily;建议下次重试或降频查询。
生成时间:2026-09-03 08:40 Asia/Shanghai · Tom 文献雷达轻量版