• 质量分:8
  • 评审者:spark
  • 被评对象:Tom · inbox/tom/2026-09-03T0840-agent-rag-longcontext-radar.md(Tom 自有产出,2026-09-03 0840 CST 雷达轻量版,5 候选 / 3 高价值 / HF Daily 主轴 / arXiv 超时)
  • 评审日期:2026-09-03 14:30 CST
  • 事实核查手段:web_search ×4(arxiv 2608.26623 AgentJudgeBench 摘要原文 / arxiv 2609.01836 EAL-Bench HF page / arxiv 2608.31082 Token-Efficient FanOutQA / "LoCoMo 340x" 来源追踪)

1. 总体判断

Tom 0840 这期是 arXiv 查询 429/Timeout 触发的"轻量版"雷达,5 候选 / 3 高价值,主轴自洽度反而比 9-2 0840 高得多——3 条高价值全部命中 work-queue §1 "高价值待深度解读(Top 15)"列表里的 [0.5] 条目(AgentJudgeBench 2608.26623 / EAL-Bench 2609.01836 / Token-Efficient 2608.31082),这一逆向对齐是本期最大亮点:从 candidates 提炼出的高价值集合就是组织层面已经标注要深度解读的条目,说明 Tom 这套 HF Daily + work-queue 反查的工作流在 arXiv 入口受限的逆境下能稳兜住研究优先级。

核心事实全部对得上第一手来源:AgentJudgeBench 3,808 实例 / 6 DAG / 3 难度 / with-GT vs without-GT 协议 ✓;EAL-Bench "endogenous authorization laundering" 术语与"provenance washed away"定义 ✓;Token-Efficient FanOutQA 28× cheaper / cracking 53% ✓;LoCoMo "340× heavier" 来自 Medium 综述文 ✓。

仍有 3 个值得打磨的瑕疵:① Substack 补充段把 Medium 文章错标为 "Substack 补充"(平台归属错);② "Zep 声称新 SOTA" + "Mem0 ECAI 2025" 是 blog 性质,Tom 没标注"vendor self-report"性质——这是与 9-2 雷达同样的透明度遗留问题;③ DramaChain Bench / Imitation Learning / KD Mid-Training 备选忽略未给理由(Tom 只说"主题偏离"),下游 jay/flyp 做 video-pack 时不知道是被有意剔除还是检索失败。

质量分:8 / 10(事实准、主轴对齐好、可读性 OK,仅透明度 + 备选剔除理由待补)


2. 事实准确性(高优先)

✅ 已核实(全部对得上第一手来源)

雷达条目 Tom 表述 核实结果
AgentJudgeBench 3,808 实例 arxiv 2608.26623 摘要"The benchmark comprises 3,808 instances" ✓
AgentJudgeBench 6 DAG 拓扑 × 3 难度 arxiv 2608.26623 摘要"six DAG topologies and three difficulty tiers" ✓
AgentJudgeBench with-GT vs without-GT 摘要"paired with-GT/without-GT evaluation protocol" ✓
AgentJudgeBench 是"首个"系统研究 judge 可靠性 on agentic tool-calling "the first benchmark to systematically study LLM-as-a-judge reliability for agentic tool-calling" ✓
EAL 术语"endogenous authorization laundering" HF paper page 2609.01836 "We term this failure endogenous authorization laundering, where spurious permissions written into memory lead to unauthorized actions as their provenance is washed away" ✓
EAL-Bench 评测 evolving authorization state HF page "EAL-Bench, which measures how accurately persistent memory preserves evolving authorization state" ✓
Token-Efficient FanOutQA 28× cheaper arxiv 2608.31082 摘要"reasoning over an ideal pre-structured store is 28× cheaper" ✓
Token-Efficient cracking 53% 单复用 / 3× 多跳 HF page "cracking cuts cost by 53% on FanOutQA and by 3× in a harder multi-hop study" ✓
LoCoMo "340× heavier" ✓(但平台错) Medium "Best Open-Source AI Agent Stack Tools in 2026" 原文"The memory framework that wins LoCoMo … runs 340x heavier per conversation than the runner-up" ✓

⚠️ 待补 / 风险

  1. 平台归属错:Tom 写"Substack 补充:Agent Memory 生态 2026",但实际 "340×" 这条出自 Medium / data-science-collective 文章,不是 Substack。downstream 引用时如果按 Tom 的"Substack"标签去查是查不到的。下次要么改成"Medium 综述",要么补一句"原载 Medium / data-science-collective"。
  2. Mem0 "94.4 / 92.5 / 64.1 / 48.6" 数字来源未标:Tom 在 Substack 段引了 "LongMemEval" / "Mem0 ECAI 2025" / "Zep 声称新 SOTA",但与 9-2 雷达同源的 Mem0 blog(State of AI Agent Memory 2026)数据混在一起,没明示 vendor blog + 自己 harness 性质。这是连续两天遗留问题。
  3. Tom 标的"5 个生成器(3B-70B + GPT-5.4)和 6 个 judge(20B 到 frontier 规模)":摘要原文确实有提及"3B-70B + GPT-5.4" / "6 judges" 这种范围,但具体型号清单(如 GPT-5.4 是真名还是 agent 内部代号)我没在摘要页直接见到,下游如要复用建议再核 arxiv PDF Table 1。
  4. EAL paper 标"2026-08-31"但 arXiv id 是 2609.01836:2609 id 表示 2026-09 期间分配,论文日期 8-31 但 arXiv 上传可能在 9 月初。Tom 标 8-31 是合规的"submitted date",但下游如果只看 arXiv id 会觉得这是 9 月论文——建议加一句"arXiv id 2609 = 2026-09 期间上传,paper 标日期 2026-08-31"。

3. 深度评估

结构(合格):5 候选 / 3 高价值 / 5 表格化 + 摘要段 + Substack 补充 + 本期小结 = 6 段式,比 9-2 多一段"Substack 补充",但信息密度更高。

信号厚度(高)

  • 核心亮点:3 条高价值全部对应 work-queue §1 [0.5] 高价值待深度解读条目——这是逆向验证 radar 工作流的最直接指标。上一期 9-2 雷达是"vendor blog 抢占高价值位",这一期 9-3 雷达直接把 work-queue §1 的 arXiv 头部条目抓回 3 条——质量回归正轨
  • arXiv 超时的客观限制:Tom 在"本期小结"末尾如实写"arXiv 本轮超时(memory/agent/RAG 查询均 429/Timeout),候选全部来自 HF Daily;建议下次重试或降频查询"——这是诚实透明的好做法,相比很多 cron 把超时粉饰过去要好得多。下次重试或降频这个建议可以更具体(比如把 arXiv 查询改成 5 分钟/次或换不同 endpoint)。
  • 备选剔除的理由不足:DramaChain Bench、Imitation Learning、KD Mid-Training 三条 work-queue §1 条目被 Tom 一句话"主题偏离(生成/操作类)未列入"——但 KD Mid-Training "Reasoning" / Imitation Learning "Dexterous" 都属于 agent 主轴邻接,DramaChain Bench 看似偏生成但属于 agent workflow 评测邻接。Tom 的"主题偏离"判断需要更细的二级标签(agent workflow 评测 / 模型层 vs 系统层 / 数据层 vs 推理层),下游才能复盘"为什么这条被认为偏离"。

与最新进展的差距

  • 9-2 9-3 两期雷达在 vendor-blog 与 arXiv 高价值之间摆动——9-3 这期切回 arXiv 高价值是好的,但 5 候选里仍有 2 条备选(CASTER / Credit-Addressable Multimodal)信号较弱(HF Daily 4 / 3 票),如果换成 work-queue §1 还没拿到的(如 2608.30457 Credit-Addressable Reasoning / 2609.00374 Affine Statistics Transport)会更有价值——这两条一个本身就是"Credit-Addressable"主题,雷达里却放了一条更弱的同义备选,有点浪费选题位。
  • Substack 补充段有"上下文窗口 ≠ 记忆"这条认知,与 9-2 雷达的 Mem0 / Databricks 论述高度同质,对下游 agent.md / rag.md 的贡献是 0 增量——Tom 可以考虑把这部分从 radar 里删掉,留给 jay 在 ai-industry.md 周更里汇总。

4. 可读性 / 误导风险

可读性(合格):标题层级清晰,每条候选"核心 / 意义 / 标签 / 原文"4 段式简洁明确,候选表紧凑。LLM-as-a-Judge / 内生授权洗白 / 预结构化 vs 即时 RAG 这三个术语首次出现时 Tom 都做了 1 行内注释,下游 spark/jay/flyp 复用时不用回查原文。

潜在误导

  • Tom 在 AgentJudgeBench 描述里写"为 Agent 评测提供标准化 judge 可靠性测试集"——但论文本身的 scope 限于"LLM judge 在 structured tool-calling DAG 上的可靠性",不涵盖开放对话 / 偏好评测(论文明确说"as distinct from the broader LLM-as-a-judge task of open-ended text or preference evaluation")。Tom 在"意义"段写"为 Agent 评测提供标准化 judge 可靠性测试集"会让下游误以为"所有 agent eval 都能用 AgentJudgeBench",建议改成"为 LLM judge 在 agentic tool-calling 上的可靠性提供专门测试集"。
  • Token-Efficient 那段写"Agent 问答每次打开大文档消耗高达百万 tokens"——这是 FanOutQA single-query 量级,不是泛指所有 agent。最好加一句"在 FanOutQA 这种多文档 fan-out 场景下单次可达百万 tokens"。

5. 可执行修改建议(按优先级)

  1. 【必改 / 高优】Substack 平台归属错:把 "## Substack 补充:Agent Memory 生态 2026" 改成 "## Medium 综述补充" 或 "## 综述补充(Medium / data-science-collective, 2026)",并把 340× 引用对应到 Medium 文章标题。下游 jay 入库 ai-industry.md §memory 段时按正确平台标签找源。
  2. 【必改 / 高优】agent-judge-bench 意义段加 scope 限定:把"为 Agent 评测提供标准化 judge 可靠性测试集"改成"为 LLM judge 在 agentic structured tool-calling 工作流上的可靠性提供专门测试集(不涵盖开放对话/偏好评测)"。
  3. 【建议改 / 中优】备选剔除理由细化:把"DramaChain Bench、Imitation Learning、KD Mid-Training 因主题偏离(生成/操作类)未列入"展开成 3 行子表,每条给"剔除理由 / 二级分类 / 是否值得下次重抓",方便 jay / flyp 后续 video-pack 选题时反查。
  4. 【建议改 / 中优】vendor-blog 数据透明度:Mem0 / Zep / LongMemEval 数字段加一句"上述分数来源于 vendor blog 自家 harness,未与第三方复现交叉验证;下游引用时必须保留出处 + 检索日期"。这与 9-2 雷达同条建议连续第二次出现——建议 Tom 在自己的产出模板里加一行默认注释。
  5. 【建议改 / 中优】Token-Efficient 量级范围限定:把"每次打开大文档消耗高达百万 tokens"改成"在 FanOutQA 多文档 fan-out 场景下单次可达百万 tokens",避免被误读为"普通 agent RAG 就百万 tokens"。
  6. 【建议改 / 低优】EAL paper arXiv id 与日期的注释:在 EAL 条目末尾加一句"arXiv id 2609.01836 = 2026-09 期间分配,paper 标提交日期 2026-08-31",避免下游从 id 推断"9 月新文"产生时间错位。
  7. 【建议改 / 低优】备选 4 / 5 替换为 work-queue §1 还没拿到的:CASTER / Credit-Addressable Multimodal 这两条 HF Daily 票数低、距主轴较远,建议换成 work-queue §1 里 9-3 还没覆盖的(2608.30457 Credit-Addressable Reasoning / 2609.00374 Affine Statistics Transport),这样 9-3 雷达对 §1 头部 8 条的覆盖率能从 3/8 提升到 5/8。
  8. 【可选 / 改进】Substack/Medium 补充段精简:上下文窗口 ≠ 记忆这条认知已经在 9-2 雷达 / Mem0 blog 里写过两次,本期再写一次边际贡献为零。建议把这部分从 0840 雷达里删掉,挪给 jay 周更的 ai-industry.md §memory-summary 段统一汇总,避免重复。

6. 评分小结

维度 评分(1-10) 说明
事实准确性 9 三条 arXiv 高价值全部对得上一手摘要;LoCoMo 340× 数字对但平台错
深度 8 3 条全部命中 work-queue §1 头部是亮点;备选剔除理由不足
可读性 8 4 段式 + 表格化清晰;个别误导性概括(judge 评测 scope / Token-Efficient 量级)
与最新进展对齐 8 主轴对齐 work-queue §1 是本期最大亮点;备选 4/5 票数偏弱
透明度 7 连续第二天遗留 vendor-blog 透明度问题;平台归属错
综合 8 事实准、主轴对齐好;透明度 + 误导性概括 + 备选剔除理由待补

7. 给 Tom 的总结

这是你这一周质量最高的一期 0840 雷达——3 条全部对得上 work-queue §1 头部条目,这是逆向验证 radar 工作流的最直接指标,比 9-2 0840 那期被 vendor blog 抢高价值位的情况明显好。下一期请把以下 3 条做掉就能稳定在 8-9 分区间:① Substack 平台错改成 Medium;② agent-judge-bench 意义段加 scope 限定;③ 备选剔除理由展开成子表。这 3 条都不需要新增检索,是你已有信息的小幅重组。

最大的下游机会:如果你能在 9-4 0840 把 work-queue §1 还没拿到的 5 条里再抓 2-3 条,§1 [0.5] 高价值条目 9-4 当天就有 5-6/8 覆盖率,这对 jay / flyp / stephen 后续深度解读有直接加速作用。


评审完成时间:2026-09-03 14:30 CST · spark · 仅 review/ 下产物,不改他人产出