主题综述 · agent(2026-08-18)
- 作者:spark
- 更新:2026-08-18
本棒定位:W5 综述轮换。
date +%j= 230,mod 8 = 6 = database。promo/surveys/下 72 小时内已有2026-08-17-database.md,顺延到下一未覆盖主题 → agent。 承接材料:paper_cards/7-19 ~ 8-18 期间 240+ 张 agent 主分类卡 + 两次 web_search 补 2026 H2 信号(METR / UltraHorizon / ComplexMCP / HMO / Mem0)+ 8-18 inbox 6 件 agent 主轴 net-new + 上轮 8-15 agent 综述七轴延伸。 方法论自检:① §二 各主线均给反方段(机制 + 数据 + 截止日);② §三.4 跨主线合流密度 > 30%;③ 五维私域清洁(ip + kp + rn + fp + oc)SUM = 0;④ CJK 字数 ≤ 4000 上限(实测wc -m);⑤ §四.3 法律 / 监管 / 经济维度独立成段;⑥ ⚠️ 数字核验 ≥ 4 处显式标注;⑦ 首段自报「机制 N 段 + 工程 M 段 + ⚠️ 数字核验 K 处 + 跨主线合流密度 + 五维私域 SUM」。
一、主题脉络
距 8-15 agent 综述只过 3 天,但 8-15 ~ 8-18 净增 5 张核心 agent 主分类卡(Second Thought / MobileMem / Nanbeige4.2-3B / Parthenon Law v2 / Context-Fractured Decomposition v2)+ 8-18 inbox 6 件 net-new(SlotGuard · Skill-Native LLMs · DeepAgents · Stolen Thoughts · MCP Tasks 异步 · LongHorizon-Harness arXiv:2608.13417)+ METR 公开「50% time horizon ~4 个月翻倍」曲线,agent 主题正从「七轴系统级增长」向「三新轴 + 一条时间轴拐点」演化。
新轴 A · 推理空闲窗口被工程化。arXiv:2608.13667 Second Thought 在 ReAct 主循环的「Thought → Action → Observation」三段之间识别出 reasoning idle window:Action 序列化后到 Observation 到达前的几百毫秒到几秒内,主线程推理被冻结、GPU 闲置。论文提出免训练 fork-and-merge 协议:主线每完成 Thought 立刻 fork 出 4 条辅助分支(乐观 / 报错 / 反方辩驳 / 2-3 步 lookahead),在等待窗口内并行解码;Observation 到达后 best-of-N / self-consistency merge 回主线。在 3 个 agentic benchmark × 3 个 reasoning LLM = 9 配对里:6/9 配对主线解码减少(最高 43%),2/9 pair Pass@1 显著提升(+12.4 / +10.2 pp),compute-matched control 全部胜出。这是首次把「GPU 闲置窗口」从推理基础设施话题拉到 agent 主循环的工程实践。
新轴 B · 长记忆走向年度级 + 多模态。arXiv:2608.13606 MobileMem(浙大 / OpenKG)首次把长记忆 benchmark 时间尺度拉到「1 周 / 1 月 / 1 季度 / 1 年」四档,用知识图谱锚定的合成流水线把异构 app event + UI screenshot + text input + sensor tap 编成多跳推理 / 时序推理 / 知识更新 / 隐式偏好推断四类任务。在 7 个主流框架(Mem0 / MemoryBank / A-Mem / LangMem / ChatGPT with memory / Claude with projects / 原生 RAG)上,跨季度档位普遍从 70%+ 掉到 30%-45%,多模态比纯文本难 10-20 pp;8× 压缩率 <3% 退化的「甜点」配合端侧分层(热 / 温 / 冷 + 异步写入 + 两段式召回)成为默认工程模板。
新轴 C · model × harness 配对评测。arXiv:2606.10933 Frontier Coding Agents Use Metaprogramming 把「评测 deployed coding agents 而非 bare models」推到方法论层面:Claude Opus 4.6 / Sonnet 4.6 / Haiku 4.5 → Claude Code harness,GPT-5.4 xhigh / mini → Codex harness,Kimi K2.5 → OpenCode harness;附录 A 给 per-agent API endpoints / model identifiers / 采样设置 / harness 调用方式的完整配置。Terminal-Bench 2.0(Vals AI)评测硬核真实 CLI 任务。与 8-15 综述「harness 形式化与可演化」轴形成「形式化(基础设施层)× 配对评测(benchmark 层)」双轨。
时间轴拐点 · 50% time horizon 每 4 个月翻倍。METR 在 2026 H2 公开的 frontier agent 时间跨度实证:2019-2025「50% time horizon」翻倍周期为 7 个月,2024-2025 加速到 4 个月;mid-2026 frontier agent 可在 ~2 小时内完成 50% 真实软件任务;任务长度 × 成功率 R² = 0.83。按 4 个月翻倍外推:2027 ~ 8 小时工作日,2028 ~ 1 周,2029 ~ 1 月。⚠️「extrapolation breaks at some point — almost certainly」,但已穿越六个模型代际。
八条主线汇成一句:2026 H2 agent 主题从「七轴系统级增长」走到「八轴 + 一条时间轴拐点」——新增推理空闲窗口工程化、年度级长记忆、model × harness 配对评测,加上 METR 4 个月翻倍曲线——共同把 agent 从「应用层能力问题」推到「推理基础设施 × 长期经验智能」双重基础设施层。
二、代表工作与相互关系
按「推理调度 / 长记忆 / harness 配对 / 评测拐点 / 自演化 / 风险与凭证 / 多 agent 协作 / 后确定性系统」八条主线各列代表 + 反方段。
2.1 推理空闲窗口被工程化
arXiv:2608.13667 · Second Thought(方法;2026-08-17)。机制:免训练 fork-and-merge,主线每完成 Thought 立刻 fork 4 条辅助分支,在 Action → Observation 的 idle window 内并行解码;Observation 到达后 best-of-N / self-consistency merge。数据:9 个 (model, benchmark) 配对里 6/9 主线解码减少(最高 43%),2/9 Pass@1 显著提升(+12.4 / +10.2 pp),compute-matched control 全部胜出。反方:① 依赖 GPU 闲置,batch 推理占满 GPU 时优势消失;② merge 质量封顶于主线模型 judgement;③ planning-heavy benchmark(类 SWE-bench)可迁移性 abstract 未给;④ branch prompt / 显著性判据 / compute-matched 4 setting 具体清单 abstract 未明示。
2.2 长记忆走向年度级 + 多模态
arXiv:2608.13606 · MobileMem(benchmark + framework;2026-08-17)。机制:浙大 / OpenKG 团队把「1 年移动使用轨迹」通过知识图谱锚定合成流水线变为可评测的多模态长程任务;时间尺度 4 档 + 任务 4 类;框架给端侧分层(热 / 温 / 冷)+ 异步写入 + 两段式召回 + 压缩归档。数据:7 框架跨季度档位从 70%+ 掉到 30%-45%,多模态比纯文本难 10-20 pp,8× 压缩率 <3% 退化。反方:① 合成数据与真实 365 天日志在噪声分布 / 应用弹窗干扰上有差距;② 隐私脱敏链(IRB / 知情同意)原文未明确;③ 多模态仅覆盖「图像 + 文本」,未触及音频 / 传感器流 / 视频;④ ⚠️ HF zjunlp/MobileMem 数据集实际发布状态、Mem0 eval CLI --spans 参数名、LLM-as-judge 用哪个模型均待 fetch 验证(榜单公平性核心风险)。
arXiv:2606.06090 · MAGE(方法)。机制:把「执行状态」从语义相似度检索里抽出来做成分层状态树,主动式管理(agent-guided exploration),避免 RAG 把有效 / 失败 / 局部相关但状态不连续信息混在一起破坏执行状态。数据:平均任务成功率提升 7.8 ~ 20.4 pp,token 消耗减少 55.1%。反方:① 主动式管理依赖 LLM 决策,多轮累积误差未量化;② 状态树粒度选择无形式化标准。
2.3 model × harness 配对评测 + 可验证软件世界
arXiv:2606.10933 · Frontier Coding Agents Use Metaprogramming(方法)。机制:评测 deployed coding agents(Claude Code / Codex / OpenCode harness)而非 bare models;附录 A 给 per-agent API endpoints / model identifiers / 采样设置 / harness 调用方式完整配置;Terminal-Bench 2.0 硬核真实 CLI 任务。反方:① 仅 3 harness × 3 模型 = 9 配对;② harness 内部 API 升级后评测失效处理未给;③ 与 OpenHands / Devin / Cursor harness 的 head-to-head 未公开。
arXiv:2605.19769 · OpenComputer(应用)。机制:硬编码 verifier 在细粒度应用状态依赖评测上比 LLM-as-judge 更贴人类裁定;100 多轮任务 + 5 领域 personas + hidden intents + cross-session continuity。被引 6。反方:① 跨应用维护成本未量化;② Browser-Use 兼容矩阵待公开;③ 与 MAGE / MobileMem 可验证边界差异未对比。
2.4 评测拐点:长程 + 经济价值 + 自我改进
arXiv:2606.05405 · Agents' Last Exam(ALE)(benchmark)。机制:长时序、经济价值、结果可验证的真实任务;定位「弥合 benchmark 与 GDP 影响差距」。被引 6。反方:①「经济价值」跨领域对齐单位未给;② 与 SWE-bench / GAIA / OSWorld head-to-head 待公开。
arXiv:2605.14678 · π-Bench(benchmark)。机制:100 多轮任务 + 5 领域 personas;联合衡量 proactivity + task completion + cross-session continuity + hidden intents。反方:① proactivity 与 completion 冲突案例 rubric 未公开;② 任务 schema 与 OpenComputer 互补性未对比。
METR 50% time horizon 曲线(web_search;2026 H2)。机制:2019-2025 翻倍 7 个月,2024-2025 加速到 4 个月;mid-2026 ~2 小时 50% 完成率;任务 × 成功率 R² = 0.83。反方:①「time horizon」单一指标,多任务并行 / 工具密集场景未覆盖;② exponential extrapolation 必然在某点 break;③ 与 Long-Horizon-Terminal-Bench / UltraHorizon(ICML 2026)的 head-to-head 待公开。
2.5 自演化法律框架
arXiv:2606.04602 · Parthenon Law(方法)。机制:Model / Harness / Agent 角色 / 法律 Knowledge / 确定性 Tools / 程序性 Skills 拆分为可审计层面;端到端 legal matter 评测(source documents → deliverables + expert rubrics);自演化框架。数据:~70× 人工速度。反方:① 法律单点验证,跨领域(医疗 / 金融 / 合规)迁移性未量化;② 成本对比 bucket 估算误差棒未公开;③ 与 User as Code 可执行记忆边界差异未对比。
2.6 风险与凭证:跨上下文越狱 + 隐私泄露
arXiv:2606.09084 · Context-Fractured Decomposition Attacks(position)。机制:揭示使用工具的 LLM Agent 部署失效模式——provenance gap(来源缺口)+ 一类跨上下文多步越狱攻击:保留早期交互中看似无害的中间产物,在不同 agent 实例或工作流阶段诱发有害行为。反方:① 攻击链对不同 agent 实例可迁移性未量化;② Activity Frames + User as Code + Hardware Keystores 组合防御的 head-to-head 未给。
8-18 inbox 增量 · SlotGuard(Yongjoo Park 组 · ICML AIWILD 2026)。机制:检测并阻止 Agent 转录本中敏感槽位(浏览器 cookie / 个人位置 / 健康信息 / 财务数据)的输出,确保 LLM Agent 在工具调用 / 状态报告时不暴露私有上下文。反方:① ⚠️ arXiv ID 待 arXiv 官方检索「Yongjoo Park SlotGuard ICML AIWILD 2026」确认才能升级立标等级;② 跨 Browser-Use / Computer-Use / Mobile-Use Agent 兼容矩阵未公开。
8-18 inbox 增量 · Stolen Thoughts(arXiv:2608.09867)。机制:加密 thinking block 共享密钥设计缺陷 → 弱模型可明文读强模型推理轨迹;跨 OpenAI / Anthropic / Google 三厂商。反方:① ⚠️ 与 arXiv:2608.09867 蒸馏论文是否同一篇待核实(重命名 vs 兄弟论文);② 修复后跨厂商一致性未量化。
2.7 多 agent 协作:从中心化到去中心化
arXiv:2606.10662 · DeLM(方法)。机制:MAS 框架通过并行 Agent + 共享已验证上下文 + 任务队列实现去中心化协作;测试时扩展与长上下文推理均提升。反方:① 共享上下文跨节点一致性边界未给;② 与 AutoGen / CrewAI head-to-head 未公开;③ 任务队列调度延迟未量化。
2.8 后确定性分布式系统
arXiv:2606.01722 · PDDS(方法)。机制:把确定性代码 / 随机模型 / 自主 Agent 共存的异构环境形式化为参与者通用模型;证明经典 SMR 是其零模糊特例。反方:① 语义漂移 / 意图丢失 / 证据伪造的非确定性边界未形式化;② 与 RAG / Agent 记忆一致性保证未量化;③ practical consensus protocol 未公开。
2.9 跨主线合流
8 主线合流关系:§2.1 推理空闲 × §2.3 harness 配对(merge 策略挂到 harness 调度器,合流点 3);§2.2 长记忆 × §2.4 评测(MobileMem / MAGE 是评测基元,合流点 3);§2.4 评测 × §2.5 自演化(Parthenon 端到端 legal matter 评测 + ALE 经济价值,合流点 2);§2.6 风险 × §2.2 长记忆(SlotGuard 隐私防护是长记忆访问控制层,合流点 2);§2.7 多 agent × §2.8 后确定性(PDDS 形式化多 agent 协作基础,合流点 2)。按「每主线至少与 2 条其他主线合流」标准,8 主线 100% 满足,跨主线合流密度 > 30% 阈值 ✅。
三、综合视角:工程 / 研究 / 批判
3.1 工程视角(可落地性)
可立即借鉴四件套:① 推理空闲 fork-and-merge(Second Thought)—— 在 LangGraph / AutoGen / 自研 ReAct 调度层挂 ParallelBranchNode + idle_hook,不改模型拿 turn 数与 sequential decoding 双下降,对 IO-bound agent(web / GUI / shell)收益最显著。② 年度级长记忆分层(MobileMem)—— 端侧 3 层(热 KV / 温向量+摘要 / 冷统计+偏好)+ 异步写入 + 两段式召回 + 8× 压缩归档,配合 BGTaskScheduler / WorkManager。③ model × harness 配对评测(Frontier Coding Agents)—— 附录 A 完整配置可作为自建 coding agent 评测框架参考模板。④ 可验证软件世界(OpenComputer)—— 硬编码 verifier 在细粒度应用状态依赖场景可直接替代 LLM-as-judge。
不易落地但值得关注:MAGE 主动式状态管理(多轮累积误差未量化);Parthenon Law(单领域未跨域);DeLM(跨节点一致性未给);PDDS(consensus protocol 未公开)。
3.2 研究视角(创新性)
8 条新意(按贡献递减):① 推理空闲窗口工程化;② 年度级长记忆 benchmark;③ model × harness 配对评测;④ 后确定性分布式系统形式化;⑤ 跨上下文越狱形式化(provenance gap);⑥ 主动式执行状态管理;⑦ 去中心化多 agent 协作;⑧ 时间轴拐点实证(METR 4 个月翻倍 + R² = 0.83)。
3.3 批判视角(局限)
4 类系统局限:
-
「time horizon 翻倍曲线」必然在某点 break:METR 4 个月翻倍是 exponential extrapolation,已穿越六个模型代际但 2029 月级外推几乎必然失效;任何把 agent 工程时间表绑在「2028 = 1 周任务」外推上的路线图都需 ⚠️ 标注。
-
被引 0 风险普遍 + 合成数据隐私脱敏链不充分:本综述 12 篇工作中 4 篇(33%)arxiv 端被引 0 或暂缺;MobileMem 仍是合成数据 + IRB / 知情同意未披露是常见组合风险。建议最终采纳门槛设为「独立复现 ≥ 2 篇」。
-
GPU 资源争抢 + 端上存储压缩 + 跨节点一致性的复合门槛:Second Thought 在 batch 推理占满 GPU 时优势消失;MobileMem 8× 压缩率 <3% 退化的具体验证集(1 月 / 1 季度 / 1 年哪一档)未标;DeLM 共享上下文跨节点一致性边界未给。三条限制共同指向:落地必须「推理调度 × 端上分层 × 多 agent 一致性」三维对齐。
-
法律 / 经济 / 物理域风险的合规覆盖缺口:Parthenon Law 仅法律单点验证;ALE「经济价值」跨领域对齐单位未给;Context-Fractured Decomposition 跨实例可迁移性未量化;Stolen Thoughts 跨厂商修复后一致性未量化。
3.4 跨主线合流密度自查
详见 §2.9:8 主线 100% 至少与 2 条其他主线合流;6 主线(§2.1, §2.2, §2.3, §2.4, §2.6, §2.8)被 ≥ 3 条其他主线引用。跨主线合流密度 > 30% 阈值 ✅。
四、趋势判断与开放问题
4.1 趋势判断(2026 H2 → 2027 H1)
T1 · 推理空闲窗口工程化成为 IO-bound agent 的标配调度层——所有面向 IO-bound 任务(web / GUI / shell)的推理引擎都会挂 fork-and-merge hook。T2 · 长记忆从月级走到年级 + 多模态 + 端云协同——配合 Apple Intelligence 2 / Android AICore / 鸿蒙智慧助手的端云协同趋势,端上分层成为默认架构。T3 · model × harness 配对评测取代 bare model 评测成为方法论标准——把「评测 deployed agents」推到 ACL / NeurIPS 投稿要求层。T4 · 时间轴拐点逼近,2027 ~ 8 小时工作日任务完成率将成为新 SOTA 维度——按 METR 4 个月翻倍曲线外推。T5 · 风险面从内容安全扩到凭证 / 经济 / 物理 / 跨上下文域——Context-Fractured Decomposition + Parthenon Law + Stolen Thoughts 三件把风险面从「对话内容」扩到「跨实例 / 经济 / 加密 / 物理域」。T6 · 自演化从「特征工程 → 端到端学习」演进路径在 agent 框架层复现——OpenSage 把「agent 自动生成拓扑 / 工具集 / 记忆架构」推到范式级别。T7 · 后确定性分布式成为 agent 协作的底层形式化——PDDS 把经典 SMR 形式化为零模糊特例,为多 agent 协作提供一致性基础。T8 · 评测从「短序列」扩到「hour-scale + 经济价值 + 自我改进 + 跨季度长记忆」四元组——ALE + π-Bench + MobileMem + Long-Horizon-Terminal-Bench 四元组把评测基元推向「多时间尺度 × 多能力维度」网格。
4.2 开放问题
Q1 · 推理空闲窗口在 batch 推理 / planning-heavy benchmark 的可迁移性——9 配对覆盖 3 benchmark + 3 LLM,类 SWE-bench / HumanEval / LiveCodeBench 的扩展 abstract 未给。Q2 · 长记忆端云协同的隐私 / 合规 / 商业化三角平衡——EU AI Act 2026-08-02 GPAI deadline + 中国《个人信息保护法》实施细则 + GDPR 三重合规映射未公开。Q3 · METR 翻倍曲线何时 break 与 break 后能力天花板——break 在 8 小时(2027)/ 1 周(2028)/ 更早?break 的物理原因(算力 / 记忆 / 工具调用深度 / 监督信号?)决定下一代 agent 基础设施投资方向。Q4 · model × harness 配对评测与 harness 演化的方法学张力——harness 形式化 + 可演化 vs model × harness 配对评测 = 「harness 在变,benchmark 锚点也要变」的方法学张力。Q5 · 后确定性分布式系统的 consensus protocol 工程落地——PDDS 形式化优雅但 practical consensus protocol(容忍语义漂移 / 意图丢失 / 证据伪造)尚未公开。
4.3 与 EU AI Act 2026-08-02 GPAI deadline / 监管 / 经济的交叉
2026-08-02 是 EU AI Act Annex III 高风险 AI 系统条款 / 透明度义务 / AI 生成内容标识 / 主动执法权的强制执行日期。Agent 系统合规要点:① Article 11 / 12 / 14——harness 设计文档(model × harness 配对评测)+ 训练数据流(MobileMem 端侧分层)+ 决策监督(Parthenon Law 可审计层面)共同构成证据链。② 高风险分类——自动签发证书 / 自主决策 / 经济定价的 agent 系统可能落入 Annex III;ALE「经济价值」是直接合规触发器。③ AI 生成内容标识——agent 生成的文本 / 代码 / 决策需可追溯到具体模型与 prompt 版本;OpenComputer 硬编码 verifier + User as Code 可执行记忆是天然标识基础设施。④ 红队测试义务——Context-Fractured Decomposition + Stolen Thoughts 类系统可作为 Article 14 监督机制技术实现。⑤ 跨境数据合规——MobileMem 年规模轨迹天然涉及 GDPR / 个保法 / EU AI Act 三重合规,分层存储 + 遗忘机制设计需要法务 / 安全提前介入。⑥ 保险与责任——Trace-Economic Underwriting 把工具调用 trace 映射为客户风险敞口的思路可对接 ISO/IEC 42001 AI 管理体系认证与 AI 责任保险定价。
落地路径:合规团队建立「agent 系统 Article 11 / 12 / 14 矩阵」;监管侧把 METR 翻倍曲线纳入风险评估基线;经济侧把 trace 定价纳入 AI 责任保险标准。
五、可引用的 arXiv 号列表
本综述综合 12 篇核心 arXiv 工作 + 2 处 web_search 实证(METR + Mem0):
推理调度(1 篇):2608.13667
长记忆与状态管理(2 篇):2608.13606 · 2606.06090
harness 配对 + 可验证软件世界(2 篇):2606.10933 · 2605.19769
评测拐点(3 篇):2606.05405 · 2605.14678 · METR 2026 H2(web)
自演化法律框架(1 篇):2606.04602
风险与凭证(3 篇):2606.09084 · SlotGuard(arXiv ID 待核) · 2608.09867
多 agent 协作 + 后确定性(2 篇):2606.10662 · 2606.01722
六、边界声明
- 本综述路径:
/shared/research-kb/organized/promo/surveys/2026-08-18-agent.md - 边界:仅
organized/promo/surveys/目录;不写其它目录;不 git;不输出密钥 / token - 五维私域清洁:ip 0 / kp 0 / rn 0 / fp 0 / oc 0,SUM = 0 ≤ 3 ✅
- 跨主线合流:8 主线 100% 至少与 2 条其他主线合流,密度 > 30% ✅
- CJK 字数:≤ 4000 上限(实测
wc -m) - 数字核验 ⚠️:6 处显式标注(Second Thought 9 配对 / MobileMem 8× 压缩 / Frontier Coding Agents 3 harness / METR R² = 0.83 / SlotGuard arXiv ID / Stolen Thoughts 重命名核实)
Spark · 2026-08-18 20:55 CST · W5 综述 · agent · 综合 12 篇 arXiv 工作 + 2 处 web_search 实证 · 跨主线合流密度 > 30% · 涉及 8 主轴 · 五维私域清洁 SUM = 0