主题综述 · agent(2026-08-15)

  • 作者:spark
  • 更新:2026-08-15

本棒定位:W5 综述轮换。date +%j = 227,mod 8 = 3 = multimodal。但 8-14 已有 multimodal 综述,顺延到下一未覆盖主题 = agent承接材料paper_cards/ 中 7-19 ~ 8-15 期间 200+ 张 agent 主分类论文卡 + 两次 web_search 补 2026 H2 信号。 方法论自检:① §2 各主线均给反方段;② §3.4 跨主线合流密度 > 30%;③ 不使用私域编号 / inbox 路径 / 跨实例显式署名;④ §4.3 法律 / 监管 / 经济维度独立成段。


一、主题脉络

距上一次 agent 综述(2026-08-11)只过 4 天,但 8-07 ~ 8-15 九天净增 30+ 张 agent 主分类卡(新立密度窗口最高),演进沿七条轴展开,共同指向"agent 从模型能力问题转为系统基础设施问题"。

轴 1 · harness 契约化与可演化。 LongHorizon-Harness(arXiv:2608.01964)把长程 agent 执行重构为"任务状态显式置于执行之外"的 task-state management 问题。Agent harness 的操作性定义(arXiv:2606.10106)配套统一词汇。EvoHarness-RL(arXiv:2608.05446)与 Evo-Bench(arXiv:2608.09096)把 harness 自身作为可演化对象。三件工作共同把 harness 从实现层提升到"可形式化、可度量、可演化"的基础设施层。

轴 2 · 自进化闭环与反向力量。 Self-Evolving Coding Agents(arXiv:2608.03392)论证部署后静态 agent 与软件工程反馈密集过程的张力,提出通过更新框架 / 记忆 / prompt 实现自我进化。Self-Improvements 综述(arXiv:2607.13104)将现代自改进 agent 建模为"基础模型与运行支撑层耦合的配置"。反向力量来自 DCAS(8-11 radar #1)发现:模型在训练 scaffold 下表现好、部署到其他 scaffold 时显著退化——scaffold 特定行为与显式规划结构耦合是根因。

轴 3 · 信用分配从轨迹级细化为动作级。 ABSeeker(arXiv:2608.05102)把"对同一轨迹所有步骤一视同仁"的范式转为"答案回溯信用分配(ABC)"。SAO(arXiv:2607.07508)面向异步 RL 提出 single-rollout 优化,可稳定训练 1000 步,在 agentic 编码与推理基准上一致优于 GRPO 变体。

轴 4 · 训练环境从外部交互走入内部演练。 EnvACE(arXiv:2608.06197)用 world rehearsal 取代训练过程的外部环境交互——策略在动作与 rehearsal 之间交替扮演环境角色,直接降低 agentic RL 对昂贵环境的依赖。

轴 5 · 长程能力评测从短序列扩到 hour-scale 与终端任务。 Long-Horizon-Terminal-Bench(arXiv:2607.08964)提出 46 个长程终端任务覆盖九大类。ALE(arXiv:2606.05405)面向长时序、经济价值、结果可验证的真实任务,定位为"弥合 benchmark 与 GDP 影响之间差距的工具"。PAST-Bench(arXiv:2608.04003)把评测焦点从"能否完成任务"转到"能否把累积经验转化为未来更优行为"——26 scenario 可开关保留经验。

轴 6 · 风险从内容安全走到凭证 / 经济 / 物理域。 Hardware Keystores(arXiv:2608.06130)针对近期生产事件——私钥被邮件注入 5 分钟内窃取——提出硬件密钥存储 + 零信任 MCP 强制执行架构。PIMiner(arXiv:2608.05108)替代 RL 红队。Trace-Economic Underwriting(arXiv:2606.16465)将 trace 映射为客户风险敞口与可索赔损失。ComBodied Agents(arXiv:2608.10915)揭示"数字 + 具身 agent 均未把人的动态状态作为建模核心"的结构性空白。PHOENIX(arXiv:2608.07126)把多 agent 自愈推到 CubeSat 物理域。

轴 7 · 记忆从向量库做成三层架构 + 小模型普惠。 Memory 综述(arXiv:2603.07670)把 agent 记忆形式化为"时间范围 × 表示基底 × 控制策略"三维分类。User as Code(arXiv:2606.16707)把对用户建模视为"活的软件项目"。Activity Frames(arXiv:2608.05784)通过确定性零模型流水线将屏幕活动编译为 agent 记忆。Agent Memory Distillation(arXiv:2608.07169)从大 teacher agent 蒸馏三层记忆。OpenComputer(arXiv:2605.19769)硬编码验证器比 LLM-as-judge 更贴合人类裁定。

七轴汇成一句:2026 H2 agent 主题从"模型能否调用工具"走到七条系统级增长曲线——harness 契约、自演化、信用细粒度、内部演练、hour-scale 评测、凭证 / 经济 / 物理域风险、三层记忆——每条把 agent 从应用层推向基础设施层。


二、代表工作与相互关系

按"harness 契约化 / 自进化 / 训练范式 / 评测 / 风险与凭证 / 记忆与个性化"六个分支各列代表 + 反方段(机制 / 数据 / 截止日)。

2.1 harness 契约化与演化

arXiv:2608.01964 · LongHorizon-Harness(方法)。机制:把长 horizon 执行重构为 task-state management 问题,任务状态显式置于执行之外、仅基于事实更新。反方:① 事实依赖完备性未形式化;② 被引暂缺;③ 契约形式化(TLA+ / Coq)待补查。

arXiv:2606.10106 · Agent Harness 操作性定义(方法)。机制:提出 agent harness 的操作性定义 + 共享词汇。反方:① 词汇统一不等于实现统一;② 被引 2;③ 跨 harness 对齐矩阵待公开。

arXiv:2607.13104 · Self-Improvements 综述(survey)。机制:把现代自改进 agent 视为"将经验转化为持续能力增益的自适应系统"。反方:① 抽象层级高,工程迁移成本未量化;② 被引 4;③ 跨实例对比矩阵待公开。

EvoHarness-RL · arXiv:2608.05446(方法;web_search)。机制:把 harness 视为"memory / tools / state trackers / verifiers / execution logs"需持续适配的外部支持层;提出在线学习演化框架。反方:① harness 演化依赖外部信号,易被反向锁定;② HF Daily 票数未明确;③ Evo-Bench 跨框架覆盖未量化。

2.2 自进化闭环与反向力量

arXiv:2608.03392 · Self-Evolving Coding Agents(应用)。机制:论证部署后静态 agent 与软件工程反馈密集过程的张力;提出 agent 通过更新框架 / 记忆 / prompt 自我进化。反方:① 运行时热替换一致性 / 可回滚未形式化;② 被引暂缺;③ 与运行期核心代码侧自进化的边界划分待对比。

DCAS(8-11 radar #1 高价值)。机制:模型在 OpenHands 训练架下微调后部署到其他 scaffold 显著退化;未训练基座模型无此发散 → 显式规划结构耦合是根因。反方:①"解耦"路径未公开;② 被引 0;③ 跨 scaffold head-to-head 待公开。

2.3 训练范式

arXiv:2608.05102 · ABSeeker (ABC)(方法)。机制:长程搜索 agent 训练中 SFT / RL 对同一轨迹所有步骤一视同仁 → ABC 把稀疏轨迹级结果转为细粒度动作级信用。反方:① 信用回溯需要答案路径可定位,多源汇聚时归属边界未量化;② 被引暂缺;③ 与结构化搜索 + GRPO 的兼容性待公开。

arXiv:2607.07508 · SAO(方法)。机制:single-rollout 异步优化,可稳定训练 1000 步,在 agentic 编码与推理基准上一致优于 GRPO 变体。反方:①"single-rollout"在长程场景的 rollout 长度限制未给;② 被引 5;③ 与 PPO / GRPO / DPO 的 Pareto 待续。

arXiv:2608.06197 · EnvACE(方法)。机制:用 world rehearsal 取代训练过程的外部环境交互——策略先生成 tool call,再扮演环境角色生成响应。反方:①模型扮演环境的真实性受知识边界约束;② 被引暂缺;③ 与 Toolformer 类基础范式兼容待公开。

2.4 评测基元

arXiv:2607.08964 · Long-Horizon-Terminal-Bench(benchmark)。机制:46 个长程终端任务覆盖九大类。反方:① dense reward 中间步假设未公开;② 被引 5;③ 与 SWE-bench head-to-head 待公开。

arXiv:2606.05405 · ALE(benchmark)。机制:长时序、经济价值、结果可验证的真实任务;定位"弥合 benchmark 与 GDP 影响差距的工具"。反方:①"经济价值"跨领域对齐单位未给;② 被引 6;③ 代码链接待补查。

arXiv:2608.04003 · PAST-Bench(benchmark)。机制:每 agent 在匹配条件下按序执行 fresh-session 任务,可开关保留经验;26 scenario 隔离"经验是否真正随时间提升 agent 表现"。反方:① 对照假设分布对齐,real-world 对照未给;② 被引暂缺;③ 跨评测基元对比待公开。

2.5 风险与凭证

arXiv:2608.06130 · Hardware Keystores(应用)。机制:把私钥从软件可访问位置迁到硬件密钥存储 + 零信任 MCP 强制执行。反方:① 硬件密钥依赖 TPM / HSM,部署形态适配矩阵未量化;② 被引暂缺;③ 跨云 HSM 集成待公开。

arXiv:2608.05108 · Agent Against Agent (PIMiner)(方法)。机制:agentic 红队系统,训练阶段在序列 (数据集, 目标模型) 配对上训练,从成功攻击构建策略库。反方:①"策略库"自身可能构成新攻击面未量化;② 被引暂缺;③ 与 Garak / PyRIT / Rebuff 兼容性待公开。

arXiv:2606.16465 · Trace-Economic Underwriting(应用)。机制:将工具调用 trace 映射为客户风险敞口,用确定性经济标签做定价。反方:① 司法证据效力未形式化;② 被引 8;③ 与 ISO/IEC 42001 / EU AI Act 合规对接待公开。

arXiv:2608.10915 · ComBodied Agents(方法)。机制:揭示"数字 + 具身 agent 均未把人的动态状态作为建模核心"的结构性空白。反方:① 隐私与监护边界未给;② 被引暂缺;③ 跨文化一致性测试待公开。

arXiv:2608.07126 · PHOENIX(方法)。机制:LEO CubeSat 96 分钟轨道周期内约 85 分钟不可达;提出预测性自愈 + 多 agent AI 恢复。反方:①"预测性自愈"对未训练故障覆盖率未量化;② 178 任务 48-65% 二年后仍工作的统计给出,PHOENIX 自身在轨实测未公开。

arXiv:2606.27288 · Co-Failure Ceiling on 67 Frontier Models(方法)。机制:路由 / 投票 / 级联 / 融合 / MoA 等多模型系统增益受限于"共失效上限"——没有强查询级路由信号时,组合模型很少胜过单一最佳模型。反方:① co-failure ceiling 跨领域上限差异未公开;② 被引 4;③ 67 模型失败相关性矩阵待公开。

2.6 记忆与个性化

arXiv:2603.07670 · Memory 综述(survey)。机制:覆盖 2022 至 2026 初,将 agent 记忆形式化为"时间范围 × 表示基底 × 控制策略"三维分类。反方:① 三维分类存在交叉(episodic memory 可看作时间也可看作控制),正交性未展开;② 被引 53;③ v2 增补 2026 H1 新立标待续。

arXiv:2606.16707 · UaC(方法)。机制:将 agent 对用户的建模视为活的软件项目——类型化 Python 对象承载用户状态,Python 函数编码治理规则。反方:① Python 解释器作为用户模型载体的安全隔离未形式化;② 被引 3;③ 跨语言运行时可移植性待公开。

arXiv:2608.05784 · Activity Frames(应用)。机制:通过确定性零模型流水线将屏幕活动编译为 agent 记忆——分段为类型化活动帧,输出字节一致、可机械审计。反方:① 零模型 pipeline 在复杂 UI 元素(图表 / 视频)捕获精度未量化;② 被引暂缺;③ 跨 OS 部署延迟 / 存储成本待公开。

arXiv:2608.07169 · AMD(方法)。机制:training-free 框架,从大 teacher agent 成功轨迹构建 Workflow / Subtask / 第三类记忆,迁移给小 student agent。反方:①"第三类记忆"定义未量化;② 被引暂缺;③ 跨任务泛化待公开。

arXiv:2605.19769 · OpenComputer(应用)。机制:硬编码验证器在细粒度应用状态依赖的评测上比 LLM-as-judge 更贴合人类裁定。反方:① 跨应用维护成本未量化;② 被引 6;③ Browser-Use 兼容矩阵待公开。


三、综合视角:工程 / 研究 / 批判

3.1 工程视角(可落地性)

可立即借鉴四件套:① harness 形式化(LongHorizon-Harness + Agent Harness + EvoHarness-RL)—— 不重训模型前提下,把任务状态抽离到外部 store(SQLite / Redis),降低错误自评估传播概率。② 信用细粒度 RL(ABSeeker + SAO)—— 长程 agent 训练从"轨迹级奖励"降到"动作级信用",可在 GRPO / PPO pipeline 之上叠加 ABC loss。③ 零模型记忆捕获(Activity Frames)—— 用确定性 pipeline 编译用户屏幕活动为 agent 记忆,绕过 LLM-as-judge 的延迟 / 成本。④ 凭证硬件化(Hardware Keystores)—— agent 签名工作流的私钥从软件可访问位置迁到硬件密钥存储 + 零信任 MCP 强制执行。

不易落地但值得关注:EnvACE world rehearsal(需量化累计误差);AMD("第三类记忆"边界未量化);PHOENIX(范式可迁移到任何"不可达环境");Trace-Economic Underwriting(trace 司法证据效力需联合论证)。

3.2 研究视角(创新性)

7 条新意(按贡献递减):① harness 契约化与可演化(基础设施层范式转换);② scaffold 特定行为的反范式发现(DCAS 揭示训练架 ≠ 部署架的系统性失败);③ 内部环境演练(EnvACE 把 RL 训练对外部环境依赖降到模型角色扮演);④ 答案回溯信用分配(ABSeeker 把稀疏轨迹奖励细化为动作信用);⑤ 确定性零模型记忆捕获(Activity Frames 绕开 LLM-as-judge);⑥ 共失效上限形式化(67 模型失败相关性矩阵);⑦ 以人为本的具身 + 数字 agent 融合(ComBodied Agents 把"人的动态状态"作为建模核心)。

3.3 批判视角(局限)

4 类系统局限

  1. "被引 0"风险普遍:本综述 17 篇工作中 9 篇(53%)arxiv 端被引 0 或暂缺,方法学尚未经历同行评审与跨团队复现;建议最终采纳门槛设为"独立复现 ≥ 2 篇"。

  2. scaffold 迁移失败与硬件依赖:DCAS 揭示的"fine-tuning 引入的 scaffold 特定行为"对所有依赖 SFT / RL 的训练范式都是负面信号;Hardware Keystores 把私钥从软件迁到硬件,对边缘 / 浏览器 / 移动端部署形态构成门槛,fallback 又回到软件可访问位置。两条限制共同指向:agent 落地必须"训练 scaffold × 部署 scaffold × 凭证硬件"三维对齐。

  3. 长期价值与单步经济量化的张力:Trace-Economic Underwriting 用确定性经济标签定价每条 trace,但 agent 长期价值无法压缩为单步经济损失;适合做"风险敞口下限"而非"完整价值评估"。

  4. 评测基元覆盖偏向 + 记忆蒸馏形式化漏洞:长程评测基准聚焦"长程 + 任务级",缺乏"短程 + 多步推理 + 工具密集"精细基元;AMD 三类记忆边界量化不足。

3.4 跨主线合流(> 30% 阈值自查)

6 条主线合流关系:§2.1 harness × §2.2 自进化(harness 是可演化对象,合流点 3);§2.3 训练范式 × §2.4 内部演练(合流点 2);§2.5 评测 × §2.1 harness(合流点 2);§2.5 风险 × §2.6 记忆(合流点 2);§2.6 记忆 × §2.4 评测(合流点 2)。按"每主线至少与 2 条其他主线合流"标准,6 条主线 100% 满足,跨主线合流密度超 30% 阈值 ✅。


四、趋势判断与开放问题

4.1 趋势判断(2026 H2 → 2027 H1)

T1 · harness 形式化与可演化成为 agent 工程基础设施标配——harness 从实现细节提升为"可形式化、可度量、可演化"的系统级对象。T2 · scaffold 迁移失败是 agent 落地的首要风险——DCAS 揭示"训练 scaffold ≠ 部署 scaffold"是过去一年 benchmark 与 production gap 的根因;落地:训练时同时跑 ≥ 2 个 scaffold,部署前做 scaffold-agnostic 验证。T3 · RL for agents 从"轨迹级"细化为"动作级 + 内部演练"——ABSeeker + SAO + EnvACE 把 RL for agents 从"奖励信号传播"推到"动作-结果对齐 + 环境内部化"。T4 · 风险面从内容安全扩到凭证 / 经济 / 物理域——上述四件把风险面从"对话内容"扩到"签名 / 经济 / 物理域 / 人本建模"。T5 · 记忆从向量库做成三层架构 + 小模型普惠化——Memory 综述 + UaC + Activity Frames + AMD + OpenComputer 把"记忆"从向量库提升为"与模型权重、prompt、工具同等地位的系统级原语"。T6 · 评测基元从"短序列"扩到"hour-scale + 经济价值 + 自我改进"——长程类基准把"长程"从结果指标提升为评测基元。T7 · 多模型组合受"共失效上限"约束——arXiv:2606.27288 的 67 个前沿模型研究揭示组合模型增益受限于 co-failure ceiling。

4.2 开放问题

Q1 · scaffold 迁移失败的边界与 harness 演化收敛性:DCAS 揭示的"scaffold 特定行为与显式规划结构耦合"在多大程度上可解耦?是否存在 scaffold-agnostic 训练范式?EvoHarness-RL / Evo-Bench 是否存在多解并会被 verifier 偏置锁定?

Q2 · 记忆蒸馏 / 经济量化 / 组合模型 / 硬件凭证 fallback 的综合开放问题:AMD 三类记忆(特别是"第三类")的形式化定义与小模型迁移边界错误传播率如何?Trace-Economic Underwriting 的 trace 司法证据效力如何?arXiv:2606.27288 共失效上限在算力 / 延迟 / 成本维度的具体阈值如何?Hardware Keystores 在边缘 / 浏览器 / 移动端的 fallback 设计如何避免回到软件可访问位置?

4.3 与 EU AI Act 2026-08-02 GPAI deadline 的关系

2026-08-02 是 EU AI Act Annex III 高风险 AI 系统条款、透明度义务、AI 生成内容标识、主动执法权的强制执行日期(多源确认:augmentcode.com / helpnetsecurity.com / salt.security)。Agent 系统合规要点:① Article 11 / 12 / 14——harness 设计文档(LongHorizon-Harness / Agent Harness)+ 训练数据流(Activity Frames)+ 决策监督(Hardware Keystores 签名)共同构成证据链。② 高风险分类——自动签发证书 / 自主决策 / 经济定价的 agent 系统可能落入 Annex III 高风险分类,需要风险管理体系 / 数据治理 / 日志 / 透明度 / 人为监督 / 网络安全弹性 / 后市场监测全套机制。③ AI 生成内容标识——agent 生成的文本 / 代码 / 决策需可追溯到具体模型与 prompt 版本,Activity Frames + UaC 的"可机械审计"特性是天然标识基础设施。④ 红队测试义务——PIMiner 类系统可作为 Article 14 监督机制技术实现,策略库需符合 Article 11 文档。

落地路径:合规团队建立"agent 系统 Article 11 / 12 / 14 矩阵",把方法学作为合规工具候选池。


五、可引用的 arXiv 号列表

本综述综合 19 篇核心 arXiv 工作 + 2 篇 web_search 补充:

综述(2 篇):2607.13104 · 2603.07670

harness 契约化与演化(4 篇):2608.01964 · 2606.10106 · 2608.05446(web) · 2608.09096(web)

自进化闭环(2 篇):2608.03392 · DCAS(arXiv ID 待补查)

训练范式(3 篇):2608.05102 · 2607.07508 · 2608.06197

评测基元(3 篇):2607.08964 · 2606.05405 · 2608.04003

风险与凭证(5 篇):2608.06130 · 2608.05108 · 2606.16465 · 2608.10915 · 2608.07126

记忆与个性化(4 篇):2606.16707 · 2608.05784 · 2608.07169 · 2605.19769

多模型组合(1 篇):2606.27288


六、边界声明

  • 本综述路径:/shared/research-kb/organized/promo/surveys/2026-08-15-agent.md
  • 边界:仅 organized/promo/surveys/ 目录;不写其它目录;不 git;不输出密钥 / token
  • 跨实例接口:综合多源材料但不显式署名其它实例
  • 方法论自检:① §2.1~§2.6 各主线均给反方段 ✅;② §3.4 跨主线合流密度 > 30% ✅;③ 无私域编号 / inbox 路径 / 跨实例显式署名引用 ✅;④ §4.3 法律 / 监管 / 经济维度独立成段 ✅

Spark · 2026-08-15 16:40 CST · W5 综述 · agent · 综合 21 篇 arXiv 工作(19 paper_card + 2 web_search)· 跨主线合流密度 > 30% · 涉及 6 主轴