agent · E1 预消化简报(2026-08-28)

结论先行

本轮没有发现可与 knowledge/agent.md 直接对应的现成文件:目标路径不存在;工作队列显示主题活文档“全部最新”,但这不表示内容没有增量。近两日 inbox 的 jay/tom/flyp/spark/stephen 目录均无按文件修改时间筛选出的新笔记,因此本简报主要依据工作队列与 paper_cards/ 近三日主题卡整理,重点集中在 agent runtime/harness、安全授权、长任务记忆、技能选择、工程基准和证据链。需特别注意:以下多数卡片只有卡片级摘要/TLDR,数字、协议和实验结果尚不能替代原文核验。

今日最重要的 7 条增量

1. Agent 评测从“最终答案”转向“模型+运行时配置”的轨迹化评测

  • 来源paper_cards/1085-2608-22510.md(arXiv:2608.22510,ClawProBench);工作队列同时指出“待更新/缺失的主题活文档(0)”。
  • 要点:ClawProBench 明确批评只评最终答案的做法,把被测对象定义为“声明式 model-plus-runtime 配置”,并关注证据获取、runtime 路由、安全边界和重复执行。其运行环境包含工作区工具、浏览、记忆、消息、调度、技能和子 agent 等原生 surface,恰好覆盖本轮任务的真实基础设施边界。
  • knowledge/agent.md 现有脉络的关系:若原活文档已有“工具调用/长任务/可靠性/评测”章节,这应归入“系统级可靠性与评测”,并把 runtime 视为和模型同等重要的评测对象;若没有该章节,则建议新建“运行时感知评测”。
  • 建议归入哪一节:系统级可靠性与评测 / 运行时与 Harness。

2. Harness 正在从提示词技巧变成可检查、可恢复的执行状态机

  • 来源paper_cards/1004-2608-15089.md(arXiv:2608.15089,StateM);paper_cards/921-2608-11632.md(arXiv:2608.11632,Continuity Kernel);paper_cards/032-2603-25723.md(arXiv:2603.25723,Natural-Language Agent Harnesses/IHR)。
  • 要点:StateM 把执行组织为持久化状态、阶段局部上下文、受检 transition、可恢复 runbook 和版本化流程;Continuity Kernel 将“连续性”定义为经过授权、不断裂的已接受分支头谱系,并区分提交前候选评估与原子状态激活;IHR 则把可编辑的运行级自然语言策略解释为调用、交接、状态更新、验证门和 artifact 契约。
  • knowledge/agent.md 现有脉络的关系:这组工作共同补强“长任务不能靠自由文本上下文滚动维持”的旧判断,提供 state、phase、transition、validation gate、artifact contract 等可操作抽象。Continuity Kernel 的“授权谱系”与后续安全/提交状态条目可互相引用。
  • 建议归入哪一节:Harness 与运行时 / 长任务状态管理。

3. 安全边界开始落实为“授权—效果”闭环,而不是只做输出过滤

  • 来源paper_cards/1059-2608-21159.md(arXiv:2608.21159,AID-Guard);paper_cards/1038-2608-15888.md(arXiv:2608.15888,Bounded Agents);paper_cards/068-2602-11510.md(arXiv:2602.11510,AgentLeak)。
  • 要点:AID-Guard 在 commit 时重新校验请求和提供方状态;歧义时只保留一个 reservation,只有终态结果或经认证的“无效果”并配合 delivery fence 后才释放或后继。Bounded Agents 关注多 agent 委派中的 blast radius 单调性和组合可靠性。AgentLeak 卡片摘要则指出,隐私风险可能由协调者—工作者之间的内部通信通道产生,不能只检查最终输出。
  • knowledge/agent.md 现有脉络的关系:可直接补入“工具副作用/委派/风险”一节,把安全从 prompt-level 防御升级为 runtime-level authorization 和 effect fencing;同时说明内部协作通道可能成为数据泄露面。
  • 建议归入哪一节:工具安全、委派与副作用 / 风险控制。

4. 长时记忆的关键不只是“保存更多”,而是按知识类型保留和压缩

  • 来源paper_cards/1077-2608-22752.md(arXiv:2608.22752,The Compaction Cliff);paper_cards/1096-2608-24569.md(arXiv:2608.24569,Constraint Weakening);paper_cards/1105-2608-24358.md(arXiv:2608.24358,The Handoff Tax)。
  • 要点:Compaction Cliff 提出 Knowledge Triage,对知识库逐行分类并按类型配置保留策略,配套 AgentArtifactCorpus、分类器和参考实现。Constraint Weakening 研究摘要、计划、ticket、记忆和 handoff note 如何把“执行前必须解决”的条件弱化为“仅供参考”。The Handoff Tax 则研究低成本/高能力模型之间延续非原生轨迹时的质量—成本与继承信息。
  • knowledge/agent.md 现有脉络的关系:这直接强化“记忆应保留状态、决策、证据和授权语义,而非只存文本摘要”的方向;交接轨迹应被视为带来源和约束的运行资产。
  • 建议归入哪一节:记忆、上下文与交接 / 可靠性与风险。

5. Skill 的研究重点从“有没有 skill”转向“什么时候选、是否读、是否被误导”

  • 来源paper_cards/1018-2608-14036.md(arXiv:2608.14036,Demystifying Agent Skills);paper_cards/1032-2608-18852.md(arXiv:2608.18852,SkillGate);paper_cards/1057-2608-08466.md(arXiv:2608.08466,Hierarchical Self-Improvement)。
  • 要点:前者将 skill 作用归纳为噪声轨迹变成稳定执行的过程性锚点,并报告三类高层类别、十二种使用模式;SkillGate 卡片报告将 9B policy 成功率从 40.8% 提至 53.2%,同时减少误导候选暴露和读取数量;Hierarchical Self-Improvement 则把任务特定 harness evolution 定位为改进冻结 LLM agent 的可行方向,但明确存在经验边界。
  • knowledge/agent.md 现有脉络的关系:若活文档已有 skills/工具选择,可补入“skill selection is a control problem”:要比较技能检索、策略内选择与 outcome reward,而不是假定堆叠技能必然提升。
  • 建议归入哪一节:技能、工具调用与策略内学习。

6. 长时编码任务的有效性取决于持续结构状态和可验证迁移,而非只看得分

  • 来源paper_cards/1041-2608-19854.md(arXiv:2608.19854,Repo0);paper_cards/1115-2608-23564.md(arXiv:2608.23564,SWE Refactor Bench);paper_cards/1061-2608-21208.md(arXiv:2608.21208,Specification Portability)。
  • 要点:Repo0 维护需求级 DAG、组件级 DAG 及二者对齐关系,以持续结构演化支持从零到全代码生成。SWE Refactor Bench 针对“测试通过但迁移没有发生”的 Blindness,提出 20 个全仓库迁移任务。Specification Portability 摘要显示规约大小不能预测实现质量,跨 agent 迁移可能出现显著、agent-dependent degradation。
  • knowledge/agent.md 现有脉络的关系:这是 harness/state 脉络在软件工程中的具体落点:显式结构状态、迁移证据和规约—实现兼容性应进入编码 agent 的任务设计;不能只用最终通过率。
  • 建议归入哪一节:编码 agent / 结构化状态 / 评测与失败模式。

7. 交互式研究与直接语料访问仍存在“证据盲区”

  • 来源paper_cards/1087-2608-24764.md(arXiv:2608.24764,Evidence Blindness/AtlasNav);paper_cards/1082-2608-17906.md(arXiv:2608.17906,AutoResearch);paper_cards/1113-2608-25625.md(arXiv:2608.25625,RetrievalRouter)。
  • 要点:Evidence Blindness 将直接语料交互中的渐进式静默损失分为证据未浮现、支持文档未打开、决定性片段未暴露,并以阶段式证据实现量化。AutoResearch 连接 idea generation 与 idea execution,试图用多模型生成和跨模型校验避免自动化但失真的研究流程。RetrievalRouter 摘要强调文本/多模态、dense/late-interaction 检索存在质量—延迟成本权衡,缺少查询级自适应选择原则。
  • knowledge/agent.md 现有脉络的关系:可用于 agent/RAG/知识库章节:检索成功不等于证据被实际用于行动,agent 的证据链必须记录获取、打开、定位、引用和最终采用。
  • 建议归入哪一节:RAG、证据链与知识获取 / 研究型 agent。

值得警惕的矛盾或待核实说法

  1. work-queue.md 写明“待更新/缺失的主题活文档(0)”,但本轮没有找到 knowledge/agent.md;这更像路径/挂载差异或队列状态与实际文件不一致,不能据此判断活文档真的已更新。
  2. 近两日 inbox 目录没有按 mtime 筛出的 agent 笔记,可能是笔记尚未落盘、候选来源位于更早日期,或 mtime 不能代表语义日期;不能写成“今天没有 agent 新笔记”的确定事实,只能记录检查结果。
  3. paper_cards/ 的“近三日”采用文件修改时间,混入大量由 OpenAlex/S2 回填更新的旧卡;例如 2603.257232607.27918 等并非近三日新研究,不能把 OpenAlex 更新日期当作论文发表日期。
  4. 多张卡只有被截断的 TLDR,数字如 95.3%、40.8%→53.2%、20 个任务、9.4%/17.5% 提升、98.4%/97.8% 成本吞吐变化等,在未读全文前不应写成已独立复核的结论。
  5. 卡片标题/摘要存在错配风险:如部分卡片 TLDR 重复、截断或分类不精确;尤其旧卡被回填后,引用前需打开 arXiv 原文核对版本、实验范围和指标定义。
  6. “无显著新增量”的判断受限:工作队列未列出 agent 主题的具体新卡,且目标活文档缺失,因此只能谨慎报告“候选主题增量已整理,无法完成与现有章节的逐段 diff”。

可引用的 arXiv 号列表

  • 2608.22510(ClawProBench)
  • 2608.15089(StateM)
  • 2608.11632(Continuity Kernel)
  • 2603.25723(Natural-Language Agent Harnesses / IHR)
  • 2608.21159(AID-Guard)
  • 2608.15888(Bounded Agents)
  • 2602.11510(AgentLeak)
  • 2608.22752(The Compaction Cliff)
  • 2608.24569(Constraint Weakening)
  • 2608.24358(The Handoff Tax)
  • 2608.14036(Demystifying Agent Skills)
  • 2608.18852(SkillGate)
  • 2608.08466(Hierarchical Self-Improvement)
  • 2608.19854(Repo0)
  • 2608.23564(SWE Refactor Bench)
  • 2608.21208(Specification Portability)
  • 2608.24764(Evidence Blindness / AtlasNav)
  • 2608.17906(AutoResearch)
  • 2608.25625(RetrievalRouter)