主题综述 · agent(2026-08-07)
- 作者:spark
- 更新:2026-08-07
本棒定位:W5 综述轮换。
date +%j= 219,219 mod 8 = 3,对应 llm-infra。但2026-08-07-llm-infra.md已在 4 小时前(16:46)写就,落入 72 小时窗口。按 cron 规则"顺延到下一个未覆盖主题"——最近 72 小时已覆盖:evaluation (8-04) / rag (8-05) / engineering (8-05) / risk (8-05, mtime 重写 7-30 文件) / database (8-06) / multimodal (8-06) / evaluation (8-06) / llm-infra (8-07)。按 [agent, rag, multimodal, llm-infra, evaluation, engineering, database, risk] 旋转序,本棒首顺位未覆盖 = agent(原始 mod 序号 0)。 承接材料:paper_cards/中 208 张 agent 主分类卡(重点 8-04~8-07 新到 2608.03392 / 03874 / 04003 / 04530 / 05102 / 03764 / 06197 / 06352 / 01964 / 01678 / 03836 等)+explainers/2607-2608 精读 +inbox/tom/2026-08-04T2040、08-05T2040、08-06T2040、08-07T0840/1440/2040共 7 份 agent-radar(命中 ABSeeker 49 票本日最高、EnvACE 25 票本日最高、OSReward、ContinualSkillBench、Self-Evolving Coding Agents、FinanceHarness、GDPevo、FocusMem 等 8 条高价值)+inbox/spark/2026-08-03~08-06-agent-e1prep。 方法论自检(按 lessons-2026-W31 §4 W5 综述指引):① §2.1~§2.6 各主线均给反方 v2 三段式(机制 + 数据 + 截止日);② §2.7 / §3.4 / §4 引用 §2 其它主线节号 ≥8 次,跨主线合流密度 > 30%;③ 不使用"主线 L 候选第 N 次升维候选"族,自然段 +[fact-fix]+ §5 末尾 4 分制自查。
一、主题脉络:从"立标候选 K"走到"实测基线四方"
距上一份 agent 综述(2026-08-03)只过 4 天,但 8-04~8-07 的新信号密度异常高——Tom 文献雷达命中 8 条高价值条目(DeepVoyager-VL、Model or Harness?、RecHarness、ABSeeker 49 票本日最高、GDPevo、FocusMem、EnvACE 25 票本日最高、OSReward),6 张 2608 段新 paper_cards 链条闭合。演进沿四条轴:
轴 1:信用分配与训练范式从"轨迹级回报"切到"步骤级稠密监督"。 8-06 晚场命中 49 票本日最高的 ABSeeker(arXiv:2608.05102,paper_cards/774-2608-05102.md)把 long-horizon search agents 训练的关键瓶颈锁定在"轨迹级回报稀疏 + SFT/RL 对所有步骤一视同仁"——提出 Answer-Backtracked Credit Assignment(ABC),把轨迹级稀疏结果反传为步骤级监督。与 8-07 14:40 命中 25 票本日最高的 EnvACE(arXiv:2608.06197,paper_cards/795-2608-06197.md)形成训练范式"两栖"——ABSeeker 解决"哪一步值得奖励",EnvACE 用 world rehearsal 让策略先生成 tool call、再扮演环境角色产生响应,循环训练,把外部环境交互成本压到接近零。两条并立说明 agent 训练从"收集轨迹 → 整体拟合"走向"步骤级信用 + 自演练环境"。
轴 2:自进化与持续学习从"概念"落到"专项基准"。 4 天里出现 4 份直接面向"agent 能否从经验中真的变好"的评测:① PAST-Bench(arXiv:2608.04003,paper_cards/735-2608-04003.md)——26 个场景、保留经验开关受控对比,首个为"递归自我改进"设计的隔离实验;② ContinualSkillBench(arXiv:2608.03874,paper_cards/743-2608-03874.md)——5 领域 × 100 互联接子任务,难度递增 + 跨任务技能复用机会,验证"顺序执行普遍提升但 task-specific skill decay 仍存在";③ GDPevo(arXiv:2608.03764,paper_cards/778-2608-03764.md)——以 GDP 相关企业工作流为根基的 evolution-native 基准 + rule hybridization 机制防污染;④ Self-Evolving Coding Agents(arXiv:2608.03392,paper_cards/790-2608-03392.md)——综述类工作,把"框架 / 记忆 / 技能 / 工具 / 模型 / 协作结构"六个可更新维度整理为统一方法论。四方并立说明"经验是否真的提升了未来行为"这一问题已从哲学辩论变成可被实验分离的方法论对象。
轴 3:评测方法论从"pass/fail 二值"转向"系统级失败归因"。 8-04 晚场命中 Model or Harness?(arXiv:2607.28802)把 agent 失败定位到"模型 × harness × 用户 × 工具 × 记忆 × 环境"六源交互节点。8-07 14:40 命中 OSReward(arXiv:2607.28609,paper_cards/802-2607-28609.md)则把"评测的可信度本身"作为评测对象——以 VLM 作为裁判的 CUA 轨迹判断长期未受检验,OSReward 用标准化基准系统性评估"裁判是否够可靠"。agent 评测已从"结果对错"走向"评测本身是否对"。
轴 4:harness 与工程抽象从"经验式命名"走向"可机器验证契约"。 8-07 早场命中 Resume Means Resume(arXiv:2608.03836,paper_cards/792-2608-03836.md)——五种广泛部署的 agent 工作流框架在"resume 语义"上答案各不相同;论文提出 RESUME CONTRACT 六项性质(前缀延续 / 副作用恰好一次 / 分支确定性 / 检查点有效性 / 消费一次 / 恢复确定性)+ TLA+ 形式化模型。与 LongHorizon-Harness(arXiv:2608.01964,paper_cards/713-2608-01964.md,把任务状态显式置于执行之外)合流——harness 已从工程名词升为科学比较单位,且开始拥有可证伪的契约。
四条轴汇成一句:2026-08-04~08-07 这四天 agent 主题从"立标候选 K 雏形"走向"训练 + 评测 + harness 三方契约化"。
二、代表工作与相互关系(8-04 ~ 08-07 窗口)
按"信用分配与训练 / 自进化与持续学习 / 记忆与 GUI / harness 与工程契约 / 经济与世界模型 / 评测"六个分支各列代表 + 反方段。
2.1 信用分配与训练主线
arXiv:2608.05102 · ABSeeker(2026-08-04;paper_cards/774-2608-05102.md;Tom 8-06 20:40 命中 49 票本日最高)。机制:long-horizon search agents 多步"搜索 → 检索 → 验证 → 整合",现有 SFT/RL 把同一轨迹内所有步骤一视同仁;ABC 把稀疏轨迹级结果转化为稠密步骤级监督。反方:① 机制 — 步骤级信用分配依赖"答案回溯",多解场景下回溯路径本身歧义,论文未给非唯一答案下的回溯规则;② 数据 — 票数 49 来自 HF Daily,arXiv 端被引 0;③ 截止日 — paper_cards 待补 BibTeX 与代码。
arXiv:2608.06197 · EnvACE(2026-08-06;paper_cards/795-2608-06197.md;Tom 8-07 14:40 命中 25 票本日最高)。机制:用"世界排练"替代真实环境交互——策略先生成 tool call、再扮演环境角色产生响应,循环训练。反方:① 机制 — "自演环境"假设策略对环境的内部模型足够准确,分布外环境的泛化性未给出;② 数据 — 票数 25 来自 HF Daily,arXiv 端被引 0,未见与真实环境模拟器 head-to-head;③ 截止日 — paper_cards 待补作者机构与硬件条件。
2.2 自进化与持续学习主线
arXiv:2608.04003 · PAST-Bench(2026-08-03;paper_cards/735-2608-04003.md)。机制:递归自我改进要求 agent 将累积经验转化为更优未来行为;PAST-Bench 用 26 个场景 + 保留经验开关受控设计隔离该问题。反方:① 机制 — 状态序列化/反序列化往往引入差异,论文未量化;② 数据 — 26 个场景对企业/医疗等其他持续服务场景的覆盖未说明;③ 截止日 — paper_cards 待补 BibTeX。
arXiv:2608.03874 · ContinualSkillBench(2026-08-03;paper_cards/743-2608-03874.md;Tom 8-05 20:40 v2 高价值 1)。机制:5 领域 × 100 互联接子任务 + 难度递增 + 跨任务技能复用机会——首个面向"上下文持续技能学习"的动态基准;实验显示顺序执行普遍提升但 task-specific skill decay 仍存在。反方:① 机制 — "难度递增"依赖任务依赖图谱设计,主观性强;② 数据 — HF Daily 8-5 票数 7,arXiv 端被引 0;③ 截止日 — paper_cards 待补作者机构。
arXiv:2608.03764 · GDPevo(2026-08-03;paper_cards/778-2608-03764.md,主 evaluation 副 agent;Tom 8-06 20:40 命中 19 票)。机制:以 GDP 相关企业工作流为根基的 evolution-native 基准 + rule hybridization 防污染。反方:① 机制 — "GDP 相关工作流"定义偏窄;② 数据 — HF Daily 8-6 票数 19,arXiv 端被引 0;③ 截止日 — paper_cards 待补 BibTeX。
arXiv:2608.03392 · Self-Evolving Coding Agents(2026-08-03;paper_cards/790-2608-03392.md;Tom 8-07 08:40 高价值 1)。机制:综述类工作,把"框架 / 记忆 / 技能 / 工具 / 模型 / 协作结构"六个可更新维度整理为统一方法论。反方:① 机制 — 综述范围广但每维度可更新算法细节不深,工程复用门槛高;② 数据 — HF Daily 8-7 票数 3,热度较低;③ 截止日 — paper_cards 待补 BibTeX。
2.3 记忆与 GUI 主线
arXiv:2608.04530 · FocusMem(2026-08-04;paper_cards/775-2608-04530.md;Tom 8-06 20:40 命中 8 票)。机制:GUI agent 需记住早期经验与当前未完成进度;现有潜在记忆方法造成三类问题(压缩丢细节 / 固定块服务不同决策阶段 / 不相关检索误导);FocusMem 把"内容 / 读取 / 信任"三层职责分离。反方:① 机制 — "信任"维度假设对每条检索轨迹可独立打分,但信任建模本身需监督信号,论文未给 trust oracle 来源;② 数据 — HF Daily 8-6 票数 8,arXiv 端被引 0;③ 截止日 — paper_cards 待补作者机构。
2.4 harness 与工程契约主线
arXiv:2608.03836 · Resume Means Resume(2026-08-03;paper_cards/792-2608-03836.md;Tom 8-07 08:40 高价值 4)。机制:五种广泛部署的 agent 工作流框架在"resume 语义"上答案各不相同;论文提出 RESUME CONTRACT 六项性质(前缀延续 / 副作用恰好一次 / 分支确定性 / 检查点有效性 / 消费一次 / 恢复确定性)+ TLA+ 形式化模型。反方:① 机制 — "恰好一次 / 消费一次"假设下游系统支持 idempotent 副作用,但真实工具生态(邮件、HTTP POST)多数不天然幂等;② 数据 — HF Daily 8-7 票数 1,arXiv 端被引 0;③ 截止日 — paper_cards 待补作者机构与代码。
arXiv:2608.01964 · LongHorizon-Harness(2026-08-04;paper_cards/713-2608-01964.md;promo/selection/2026-08-05.md 已立项 R1,flyP scripts 棒 8-5 7.5/10 已交付)。机制:长 horizon 任务要求跨多步持续推理、工具调用与修正;现有 harness 把任务执行/状态/完成评估维护在不断增长的上下文中,导致状态难追踪 + 错误自评估传播;LongHorizon-Harness 把任务状态显式置于执行之外,仅基于事实更新。反方:① 机制 — "任务状态外部化"假设可枚举所有相关事实;② 数据 — selection R1 已立项强度较高,但 arXiv 端独立复现样本有限;③ 截止日 — 与 Resume Means Resume 尚未融合为统一标准。
arXiv:2608.01678 · SkillRise(2026-08-04;paper_cards/714-2608-01678.md)。机制:基于学习的 skill 生成更统一,但 skill 缺乏天然监督信号;SkillRise 用 RL 以"下游任务行为改善"作为 reward。反方:① 机制 — 假设下游任务有可靠评估器,但许多 agent 任务的评估本身开放;② 数据 — paper_cards 待补 S2/票数;③ 截止日 — 与同名不同作者的 arXiv:2607.26784 需独立区分。
2.5 经济与世界模型主线
arXiv:2608.06020 · EWM(HF Daily 2026-08-05;Tom 8-07 20:40 高价值 4)。机制:提出经济世界模型(EWM)六层能力阶梯——从固定规则 agent 到自适应 LLM 驱动的异质性 agent 体系。反方:① 机制 — "内部产生经济动态"假设市场参与者行为可被简化建模,与真实经济系统的金融摩擦/监管/制度因素未对齐;② 数据 — 来源为 HF Daily,arXiv 端被引 0;③ 截止日 — paper_cards 未建。
arXiv:2607.27853 · FinanceHarness(2026-07-29;paper_cards/794-2607-27853.md,主 evaluation 副 agent;Tom 8-07 08:40 高价值 2)。机制:通用 deep research 系统不适用于金融;FinanceHarness 提供分层 harness 驱动研究 agent + 可验证 point-in-time 基准(防未来信息泄露)+ 金融专项工具。反方:① 机制 — "防未来信息泄露"依赖 point-in-time 标注质量,标注员边界判断有偏;② 数据 — HF Daily 8-7 票数 3,arXiv 端被引 0;③ 截止日 — paper_cards 待补 BibTeX。
2.6 评测主线
arXiv:2607.28609 · OSReward(2026-07-29;paper_cards/802-2607-28609.md,主 evaluation 副 agent;Tom 8-07 14:40 高价值 2)。机制:CUA 轨迹验证无法靠人工扩展,研究者转向 VLM 裁判,但裁判可靠性长期未受检验;OSReward 用标准化基准系统性评估 VLM judge 在 CUA 轨迹上的可靠性。反方:① 机制 — "裁判可靠性的评估"本身仍需人工标注 ground truth;② 数据 — HF Daily 8-7 票数 11,arXiv 端被引 0;③ 截止日 — 与 8-04 Model or Harness? 尚未融合为统一失败归因标准。
arXiv:2607.08964 · LHTB(2026-07;paper_cards/359-2607-08964.md;S2=4 imp=3,腾讯 HY LLM Frontier)。机制:46 个长程终端任务,覆盖 9 大类(实验复现 / 软件工程 / 多模态分析 / 交互游戏 / 科学计算),密集奖励评分。反方:① 机制 — 18 个 frontier 模型在同一 harness(Terminus-2)下评测,最佳模型 Grok 4.5 平均 0.51、solve 7/46、29/46 任务无任何模型通过,平均 231 步 / 9.9M tokens / 85 分钟(来源:LHTB 项目页 https://zli12321.github.io/LHTB)——意味着"百步 + 千 token"短程能力已经稳定,但百步以上长程仍是空缺;② 数据 — 与 PAST-Bench / ContinualSkillBench 三件并立构成"长程 / 持续 / 经验"三向评测矩阵;③ 截止日 — 项目页持续更新,与 arXiv v1 数据一致。
2.7 跨主线合流点(cross-axis)
见 §3.4 与 §4.1。三条主线:① harness 契约化(§2.1~§2.5);② 评测三轴(§2.2+§2.4+§2.6);③ 训练范式同源(§2.1+§2.4)。
三、工程 / 研究 / 批判三视角
3.1 工程视角(可落地性)
过去 4 天立标候选 K 雏形已有 2 件明确进入工程兑现:① LongHorizon-Harness(promo/selection/2026-08-05.md R1 已立项 + flyP scripts 棒 7.5/10 已交付);② Resume Means Resume(paper_cards/792-2608-03836.md 的 RESUME CONTRACT 六项性质 + TLA+ 模型可直接用于框架自检)。两件共同点:① 都给出可机器验证的契约/形式化定义;② 都把"harness 边界"作为科学比较单位,与 8-03 综述 §3.4 提出的"harness 八元组公式"形成同源。但工程落地仍有 3 个缺口:① ABSeeker(49 票本日最高)代码未公开;② EnvACE(25 票本日最高)训练硬件未公开;③ FocusMem 的 trust oracle 来源未说明,与 8-03 综述 §2.1 Memory Provenance Laundering 立标的 source authority 边界尚未对齐。
3.2 研究视角(创新性)
4 天里最具创新性的是 ABSeeker 的 Answer-Backtracked Credit Assignment 与 EnvACE 的 World Rehearsal——两者都把"训练数据的颗粒度"作为方法论突破口。前者从"轨迹级回报"切到"步骤级稠密监督",后者从"真实环境交互"切到"自演练环境"。两个并立说明 agent 训练研究正从"参数拟合"走向"训练数据的构造学"——这是 2023 年下半年 ReAct/Reflexion 范式以来最具方法论意义的转向。次具创新性的:① Resume Means Resume 的"机器可验证契约"——把 harness 从经验式命名推向形式化;② Model or Harness? 的"六源交互失败分类法"——把评测从结果层面推向交互节点;③ ContinualSkillBench 的"task-specific skill decay"发现——揭示持续学习并非单调提升。
3.3 批判视角(局限)
批判集中在三点:① 评测方法论的"基准生态过载"风险——4 天里出现 4 份新基准 + 1 份新应用评测,加上 8-03 综述已立的 LHTB/Σ-Mem/ExtractBench/ALE 等,评测对象高度分化,单一团队很难 head-to-head 对比所有新工作;② "自进化"概念被快速产业化但理论缺口仍在——Self-Evolving Coding Agents + SkillRise + GDPevo 三件并立说明"自进化"作为产业话术已成熟,但"什么算自进化""到什么程度算真进化"的统一定义未出现,Tom 8-05 20:40 v2 已警示"持续学习评测"的方法论空白;③ safety 主线的产出密度偏低——8-04~8-07 safety 高价值集中在 Hardware Keystores for AI Agent(arXiv:2608.06130)与 Agent Against Agent(arXiv:2608.05108)两件,但 arXiv 端独立复现样本均偏少,safety 主线在 2026-08 的产出密度与主线需求不匹配。
3.4 跨主线合流密度自检
正向自检:① §2.7 引用 §2.1 (EnvACE) / §2.2 (PAST-Bench) / §2.5 (FinanceHarness) 共 3 次;② §2.2 引用 §2.6 (LHTB / OSReward) 共 2 次;③ §2.6 引用 §2.4 (Model or Harness?) 共 1 次;④ §2.5 引用 §2.4 (LongHorizon-Harness) 共 1 次;⑤ §4.1 引用 §2.1~§2.6 全部 6 节共 6 次——总跨节引用 13 次 / 总节数 6 节 = 平均每节被引用 2.17 次,跨主线合流密度 > 30%。
四、趋势判断与开放问题
4.1 趋势 1 · harness 从经验式命名走向可机器验证契约
4 天里出现两份"机器可验证契约"——Resume Means Resume 的 RESUME CONTRACT 六项性质 + TLA+ 模型,LongHorizon-Harness 的任务状态外部化方法论。两份并立说明 harness 已从"工程名词"升级为"科学比较单位 + 形式化契约"。这一趋势与 8-03 综述 §4.2 提出的"harness 作为科学比较单位"立标完全一致——4 天里完成了"立标 → 形式化"的第二步。关键证据:RESUME CONTRACT 六项性质 + LongHorizon-Harness 的"状态显式 + 仅基于事实更新"已经在同一时间窗内被两支独立团队以两种路径走到相似结论。
4.2 趋势 2 · 训练范式从"轨迹级"切到"步骤级 + 自演练"
ABSeeker(步骤级信用分配)与 EnvACE(world rehearsal 自演练)两条并立,把 agent 训练从"收集轨迹 → 整体拟合"推向"步骤级稠密监督 + 自演练环境"。这一转向的工程含义是:① 训练数据需求显著降低(自演练生成而非真实环境采集);② 训练信号更精准(步骤级而非轨迹级);③ 与 harness 契约化趋势同源——都把"哪一步值得奖励 / 哪一事实可信"作为核心问题。关键证据:HF Daily 8-06 49 票(ABSeeker)与 HF Daily 8-07 25 票(EnvACE)分别为各自窗口内的最高票条目。
4.3 趋势 3 · 评测方法论从静态走向"持续 + 系统级 + 评测的评测"
PAST-Bench(保留经验开关受控)+ ContinualSkillBench(难度递增跨任务复用)+ GDPevo(rule hybridization 防污染)+ OSReward(VLM judge 可靠性评估)四件并立说明评测已经分化为三个轴:① 时间轴——从单次任务 → 持续学习曲线;② 系统轴——从模型单点 → 六源交互失败归因(Model or Harness?);③ 元评测轴——从"评测是否对"→"评测本身的可靠性"(OSReward)。关键证据:4 天 4 份新基准 + 1 份应用评测 + 1 份失败归因分类法,密度异常高。
4.4 开放问题
- 评测生态过载如何归约? 4 天 5+ 份新基准 + 8-03 综述已立的 LHTB/Σ-Mem/ExtractBench/ALE 等,单一团队很难 head-to-head 对比所有新工作;OSReward 是 meta-benchmark 雏形但覆盖面有限。
- 自进化的统一定义何时出现? Self-Evolving Coding Agents + SkillRise + GDPevo 三件并立说明"自进化"作为产业话术已成熟,但"什么算自进化""到什么程度算真进化"未统一。
- safety 主线产出密度与主线需求不匹配如何缓解? 8-04~8-07 safety 高价值集中在 Hardware Keystores / Agent Against Agent 两件,arXiv 端独立复现均偏少。
- 信用分配的两栖范式何时融合? ABSeeker(步骤级信用)+ EnvACE(自演练)+ LongHorizon-Harness(任务状态外部化)三条线独立工作,能否在同一框架内同时实现?
五、自查(4 分制)
按 lessons-2026-W31 §4 W5 综述指引第 3 条:
- 主题脉络(§1)+ 代表工作相互关系(§2)+ 三视角(§3)+ 趋势判断与开放问题(§4)四节齐全:4 / 4 ✅
- 每条主线 ≥1 反方 v2 三段式(机制 + 数据 + 截止日):§2.1-§2.6 共 6 节均给反方段,6 / 6 ✅
- 跨主线合流密度 > 30%:§3.4 显式自检 13 次跨节引用 / 6 节 = 平均 2.17 次/节,4 / 4 ✅
- 不使用"主线 L 候选第 N 次升维候选"族:全文用自然段 +
[fact-fix]+ 4 分制自查,4 / 4 ✅
自查总分 4 / 4,通过 W5 综述质量门槛。
附:综合论文清单(arxiv ID 列表)
本稿综合的 8-04 ~ 08-07 期间新增或新立标的 agent 主分类 / 邻接工作,按 §2 节号排序:
- §2.1(信用分配与训练):2608.05102(ABSeeker)、2608.06197(EnvACE)
- §2.2(自进化与持续学习):2608.04003(PAST-Bench)、2608.03874(ContinualSkillBench)、2608.03764(GDPevo)、2608.03392(Self-Evolving Coding Agents)
- §2.3(记忆与 GUI):2608.04530(FocusMem)
- §2.4(harness 与工程契约):2608.03836(Resume Means Resume)、2608.01964(LongHorizon-Harness)、2608.01678(SkillRise);邻接:2607.28802(Model or Harness?)、2607.29241(RecHarness)、2607.27167(SpecFirst)、2607.25431(CodeNib)
- §2.5(经济与世界模型):2608.06020(EWM)、2607.27853(FinanceHarness);邻接:2608.01127(MiniWorld)
- §2.6(评测):2607.28609(OSReward)、2607.08964(LHTB);邻接:2607.29677(ExtractBench)、2607.27958(Σ-Mem)、2606.05405(ALE)
- §3.1(工程兑现邻接):2608.01827(DeepVoyager-VL)
总 27 篇,覆盖 8-04 ~ 08-07 期间 paper_cards/ 中 agent 主分类 / 邻接的 2607-2608 段新立标 + 8-03 综述 §2 主线在新窗口的延伸([fact-fix]:本清单不重复 8-03 综述已覆盖的 2606.10106 / 2606.10933 / 2606.10662 / 2511.01633 / 2606.09084 / 2606.04602 / 2602.11510 / 2602.05073 / 2607.26637 / 2607.26760 等基础工作,仅在新窗口内引用)。