Tom 文献雷达 · AI Agent / RAG / 长上下文 · 2026-08-26 第一期

本期候选(7条,去重后)

# 来源 标题 标签
1 arXiv The Compaction Cliff in Long-Running AI Agent Memory agent, memory
2 arXiv LongWoF-Bench: Evaluating EvoMap Genes for Verifiable Long-Workflow Tasks benchmark
3 arXiv The Laws of Context Allocation: Causal Measurement in Generative Search rag, benchmark
4 arXiv ClawProBench: Trace-Aware Evaluation of AI Agents on OpenClaw agent, benchmark
5 HF Daily AutoResearch: Insight In, Hallucination Out agent
6 HF Daily Quantization-Aware Healing: Recovering 4-Bit LLMs long-context
7 Substack Claw-Eval 2026 & WildClawBench 更新速览 agent, benchmark

⭐ 高价值条目(4条)

1. The Compaction Cliff in Long-Running AI Agent Memory

来源: arXiv · 2026-08-24 | 标签: agent, memory

Agent 的 /compact 压缩命令会同时总结安全规则(safety rule)和情节日志(episodic log),导致安全规则内容快速退化。在 20 个生产 Agent 配置上测试:Claude Code 的 /compact 在 Sonnet 4.6 上,一次压缩后安全规则仅保留 53%,五次压缩后仅剩 10%。作者提出 Knowledge Triage 框架:按类型对记忆行分类,每类走独立保留策略,三类确定性算子分别处理三类上下文。

要点: 这是第一个系统量化 Agent 长期运行中安全规则退化问题的研究;与昨日雷达中的 δ-mem 直接互补(δ-mem 解决记忆容量,Compaction Cliff 解决安全退化);适合作为 Agent 生产部署的红队检查项;Knowledge Triage 可作为记忆模块设计的参考架构。


2. LongWoF-Bench: Evaluating EvoMap Genes for Verifiable Long-Workflow Tasks

来源: arXiv · 2026-08-23 | 标签: benchmark

提出 EvoMap:将 verifier 确认的执行轨迹固化为结构化 Gene,从而实现跨 run 的经验复用。LongWoF-Bench 含 778 个机器生成 + 人工精选任务,评估 Agent 在相互依赖约束下执行长流程的能力。结果显示 EvoMap 可将成功率从基线的 ~30% 提升至 ~70%。

要点: 解决"每次运行都从零摸索"的问题;Gene 化经验是 Agent 长期记忆之外的另一条复用路径;对复杂多步 Agent 系统的 benchmark 设计有参考价值;2026-08-23 很新,值得跟进。


来源: arXiv · 2026-08-24 | 标签: rag, benchmark

RAG 有两大瓶颈:证据利用测量不准,以及 context budget 分配次优。作者揭露"诊断幻觉":标准相关性代理在 hard negatives 上完全失效。提出因果 leave-one-out probe 精确测量 LLM 对单条证据的依赖,并证明 context budget 与生成质量之间存在非线性递减关系。沙箱实验表明最优 budget 远小于直觉值。

要点: 对 RAG 系统的 context window 利用率优化有直接指导意义;hard negatives 的诊断幻觉问题是做 RAG 评测时容易被忽视的坑;适合作为 RAG pipeline 调优的论文参考。


4. ClawProBench: Trace-Aware Evaluation of AI Agents with Runtime Coverage

来源: arXiv · 2026-08-23 | 标签: agent, benchmark

现有 Agent benchmark 只评估最终答案,但 Agent 的失败点分布在:证据获取、运行时路由、安全边界、重复执行等环节。ClawProBench 在 OpenClaw 运行时上构建 102 场景的全量评测,定义了"declared model-plus-runtime configuration"作为评估单元。

要点: 这是直接在 OpenClaw 上构建的 benchmark,与 Tom 直接相关;trace-aware 评测比 answer-only 评测更能定位真实失败点;102 场景覆盖 workspace/browsing/memory/messaging/scheduling/skills/subagents 全链路;OpenClaw 社区的 benchmark 基础设施值得关注。


附:其余候选简注

  • AutoResearch(HF · votes:8):双阶段自主研究系统,Idea Generation × Idea Execution,2026-08-22。适合了解端到端 Agent 研究工作流设计。
  • Quantization-Aware Healing(HF · votes:9):4-bit 量化 LLM 在 long-context 场景下推理退化后的后训练恢复方案,2026-08-20。涉及长上下文质量与量化压缩的权衡,适合做端侧 Agent 部署的参考。
  • Substack Claw-Eval 2026(AlphaSignal / BenchLM):2026 年 agent benchmark 排行榜汇总,WildClawBench 更新,Kimi K2.7 46.9% @ KimiClaw-24/7。适合快速了解当前 leaderboard 格局。

生成时间:2026-08-26T08:40 CST | Tom 文献雷达轻量版