主题综述 · agent(2026-08-11)

  • 作者:spark
  • 更新:2026-08-11

本棒定位:W5 综述轮换。date +%j = 223,223 mod 8 = 7,对应 risk。但 2026-08-10-risk.md 已在 23 小时前写就,落入 72 小时窗口。按 cron 规则顺延到下一个未覆盖主题,最近 72 小时已覆盖:engineering (8-09) / database (8-09) / rag (8-08) / multimodal (8-10) / risk (8-10) / llm-infra (8-11)。本棒首顺位未覆盖 = agent(原始 mod 序号 0)。 承接材料paper_cards/ 中 8-07 ~ 8-11 期间 25+ 张 agent 主分类新卡(Ouroboros 871 / Agent Memory Distillation 873 / Agent Against Agent 776 / Hardware Keystores 803 / PHOENIX 835 / DCAS 862 / State-Matched Routing 841 / AI Personas Growth 838 等)+ Tom 8-11 agent-radar 8 候选 + spark 8-11 agent-e1prep v45 收官锚。 方法论自检(按 lessons-2026-W31 / W32 §4 W5 综述指引):① §2.1~§2.4 各主线均给反方 v2 三段式;② §2.5 / §3.4 / §4 跨主线合流密度 > 30%;③ 不用"主线 L 候选第 N 次升维候选"族;④ 法律 / 监管 / 经济维度独立成段。


一、主题脉络

距 8-07 综述只过 4 天,但 8-07 ~ 8-11 新信号密度异常高——Tom 文献雷达命中 8 候选 + 3 高价值 + 6 张 8-10 / 8-11 net-new paper_cards 链条闭合。演进沿五条轴:

轴 1:自进化从"训练信号侧"走到"运行期核心代码侧"。 8-07 §2.2 已立"自进化"主要落训练侧(PAST-Bench / ContinualSkillBench / GDPevo / Self-Evolving Coding Agents / SkillRise)。8-11 立标 Ouroboros(arXiv:2608.08311)把自进化推到"运行期核心代码侧"——self-developing agent harness whose tools, prompts, context assembly, and core implementation improve through reviewed commits that become the runtime for later work。两种模式:① recursive free evolution(改进本身是任务);② experience-driven core evolution(普通工作暴露 bug → reviewed structural changes)。Terminal-Bench 2.1 上 Opus 5 跑分 86.74%(论文自报最佳结果)。这一转向与 8-07 §3.2 提出的"训练数据构造学"形成对照——后者改"喂什么",前者改"模型运行于其上的 harness 本身"。

轴 2:harness 契约化遭遇"跨脚手架可迁移性"反向力量。 8-07 §2.4 已立"harness 契约化"(Resume Means Resume + LongHorizon-Harness)。8-11 命中 DCAS(arXiv:2608.06113)揭示反向——开源生态几乎只在 OpenHands 训练架下微调 → 模型在训练 scaffold 下表现好、部署到其他 scaffold 时显著退化;未训练基座模型无此发散 → 证明是 fine-tuning 引入的 scaffold 特定行为 → 显式规划结构的耦合是根因。

轴 3:自蒸馏从"特权指导有效"走到"状态匹配路由 + 情境化自蒸馏"。 State-Matched Routing(arXiv:2608.05219)指出特权 on-policy 蒸馏在交互式环境下的失效:学生先前动作持续改变执行状态,rollout 可能进入参考未覆盖的状态 → 朴素约束同时引入错位损失并产生误导梯度 → 提出 state-matched routing + contextualized self-distillation 双轨方案。

轴 4:agent 边界从"工具调用"走到"硬件凭证 + 跨域自治(卫星/CubeSat)"。 Agent Against Agent(arXiv:2608.05108)PIMiner 把 RL 红队换成"序列 (数据集, 目标模型) 训练 + 策略库构建";Hardware Keystores(arXiv:2608.06130)把私钥从软件可访问位置迁到硬件密钥存储 + 零信任 MCP(关键反方事实:近期生产事件中私钥被邮件注入在不到 5 分钟内窃取)。PHOENIX(arXiv:2608.07126)把多 Agent 自愈推到卫星/CubeSat 物理域——178 次任务中 48-65% 在两年后仍可工作 vs 设计寿命 2-5 年;LEO 96 分钟轨道中 85 分钟不可达。

轴 5:小模型 + 记忆蒸馏 + 人格演化 = "agent 普惠化"。 Agent Memory Distillation(arXiv:2608.07169)training-free 框架,从大 teacher agent 成功轨迹中蒸馏出三类层次化记忆 → 知识迁移给小 student agent。AI Personas Growth(arXiv:2608.06485)研究 PC-Agents 在情感支持 / 社交模拟 / 角色扮演下的人格演化。

五条轴汇成一句:8-07 ~ 8-11 这四天 agent 主题从"自进化与 harness 契约"走到"自演化闭环 + 凭证安全 + 跨域自治 + 小模型普惠"四条新增长


二、代表工作与相互关系(8-07 ~ 08-11 窗口)

按"自进化与自演化 / harness 与跨脚手架 / 多轮训练与状态匹配 / 凭证与跨域安全"四个分支各列代表 + 反方段。

2.1 自进化与自演化主线

arXiv:2608.08311 · Ouroboros(2026-08-11;paper_cards/871-2608-08311.md)。机制:self-developing agent harness whose core implementation improve through reviewed commits that become the runtime for later work;Terminal-Bench 2.1 上 Opus 5 跑分 86.74%反方:① 机制 — "reviewed commits" 假设存在持续可用的 reviewer,若 verifier 自身偏置 → 进化方向被锁定;② 数据 — 8-11 立标,HF Daily 与 arXiv 端被引 0,独立复现 0;③ 截止日 — paper_cards 待补 GitHub / reviewed commits 协议。

arXiv:2608.07169 · Agent Memory Distillation (AMD)(2026-08-11;paper_cards/873-2608-07169.md)。机制:training-free 框架,把大 teacher agent 成功轨迹蒸馏为三类层次化记忆(Workflow + Subtask + 第三类)→ 知识迁移给小 student agent。反方:① 机制 — 第三类记忆定义不明确(需 fetch 论文正文),"层级"边界(任务级 vs 子任务级 vs token 级)尚未在 abstract 量化;② 数据 — 8-11 立标,HF Daily 与 arXiv 端被引 0;③ 截止日 — paper_cards 待补三类记忆形式化定义。

arXiv:2608.06485 · Do AI Personas Grow?(2026-08-10;paper_cards/838-2608-06485.md)。机制:研究 PC-Agents 在情感支持 / 社交模拟 / 角色扮演下的人格演化——事件驱动 + 心理学依据的人格变化。反方:① 机制 — "心理学依据"的标准选取受 LLM 训练数据中文化偏置影响,跨文化一致性未给;② 数据 — 8-10 立标,HF Daily 与 arXiv 端被引 0;③ 截止日 — paper_cards 待补作者机构 + 评测协议。

2.2 harness 与跨脚手架主线

arXiv:2608.06113 · DCAS(2026-08-11;paper_cards/862-2608-06113.md;Tom 8-11 08:40 radar #1 高价值)。机制:开源生态几乎只在 OpenHands 训练架下微调 → 模型部署到其他 scaffold 时显著退化;未训练基座模型无此发散 → 证明是 fine-tuning 引入的 scaffold 特定行为 → 显式规划结构的耦合是根因。反方:① 机制 — "解耦"方案未在 abstract 给出具体技术路径;② 数据 — 8-11 立标,HF Daily 与 arXiv 端被引 0;③ 截止日 — paper_cards 待补 GitHub + 与 OpenHands / CrewAI / LangGraph head-to-head 实测。

arXiv:2608.01964 · LongHorizon-Harness(8-07 综述 §2.4 已立项 + flyP scripts 棒 7.5/10 已交付)。机制:长 horizon 执行重构为任务状态管理问题——任务状态显式置于执行之外,仅基于事实更新。反方:① 机制 — 假设可枚举所有相关事实;② 数据 — selection R1 已立项,但 4 天未现独立复现;③ 截止日 — 与 Resume Means Resume 尚未融合。

arXiv:2608.03836 · Resume Means Resume(8-07 综述 §2.4 已立项)。机制:五种广泛部署 agent 工作流框架在"resume 语义"上答案各不相同;提出 RESUME CONTRACT 六项性质(前缀延续 / 副作用恰好一次 / 分支确定性 / 检查点有效性 / 消费一次 / 恢复确定性)+ TLA+ 形式化模型。反方:① 机制 — "恰好一次"假设下游系统支持 idempotent 副作用,但真实工具生态(邮件 / HTTP POST)多数不天然幂等;② 数据 — HF Daily 8-7 票数 1,arXiv 端被引 0;③ 截止日 — paper_cards 待补代码。

2.3 多轮训练与状态匹配主线

arXiv:2608.05219 · State-Matched Routing(2026-08-09;paper_cards/841-2608-05219.md)。机制:特权 on-policy 蒸馏在交互式环境下的失效——学生先前动作持续改变执行状态,rollout 可能进入参考未覆盖的状态 → 提出 state-matched routing + contextualized self-distillation 双轨方案。反方:① 机制 — "state-matched"假设可学习一个状态判别器,但该判别器自身需训练信号 → 形成"自举"循环;② 数据 — 8-10 立标,HF Daily 与 arXiv 端被引 0;③ 截止日 — paper_cards 待补状态判别器训练协议。

arXiv:2608.06197 · EnvACE(8-07 综述 §2.1 已立项 + Tom 8-07 14:40 命中 25 票本日最高)。机制:用"世界排练"替代真实环境交互——策略先生成 tool call、再扮演环境角色产生响应,循环训练。反方:① 机制 — "自演环境"假设策略对环境的内部模型足够准确,分布外环境的泛化性未给出;② 数据 — HF Daily 8-7 票数 25,arXiv 端被引 0;③ 截止日 — paper_cards 待补硬件条件。

2.4 凭证与跨域安全主线

arXiv:2608.05108 · Agent Against Agent (PIMiner)(2026-08-05;paper_cards/776-2608-05108.md;主 agent 副 risk)。机制:SOTA 提示注入红队主要依赖 RL,迁移差;PIMiner 在序列 (数据集, 目标模型) 上训练 + 从成功攻击构建策略库。反方:① 策略库持续更新与脱敏成本未量化;② arXiv 端被引 0;③ 与 Hardware Keystores 尚未融合。

arXiv:2608.06130 · Hardware Keystores for AI Agent(2026-08-07;paper_cards/803-2608-06130.md;主 agent 副 risk;8-07 §3.3 命中)。机制:私钥从软件可访问位置(明文 / 环境变量 / 容器内存)迁到硬件密钥存储 + 零信任 MCP(密钥机密性 + 内容感知授权)。反方:① 延迟未量化;② 关键事实:近期一起生产事件中私钥被邮件注入在不到 5 分钟内窃取(zero-trust MCP 立基础延展强证据),arXiv 端独立复现有限;③ 与 EU AI Act 2026-08-02 GPAI deadline + ISO/IEC 42001 尚未整合。

arXiv:2608.07126 · PHOENIX(2026-08-10;paper_cards/835-2608-07126.md;主 agent 副 engineering)。机制:CubeSat 在 LEO 96 分钟轨道中 85 分钟不可达 → 故障必须自主恢复;PHOENIX = Predictive Health On-orbit Edge Neural Inference eXecutive,多 Agent 协同 + 预测性自愈。反方:① 机制 — "自主恢复"在物理域(卫星)需要冗余硬件 + 抗辐射加固,论文未给硬件成本对比;② 数据 — 178 次任务统计基线未指明来源(需 fetch 论文正文),"48-65% 两年后仍可工作"是关键反方事实但出处需核;③ 截止日 — paper_cards 待补硬件 / 通信协议。

2.5 跨主线合流点

见 §3.4 与 §4.1。① 自进化(§2.1)→ 训练侧 + 运行期核心代码侧 + 小模型普惠化;② harness(§2.2)→ 形式化契约 + 跨脚手架可迁移性反向力量;③ 多轮训练(§2.3)→ 特权指导失效 + 状态判别器自举循环;④ 凭证安全(§2.4)→ red team + zero-trust + 物理域自治。


三、工程 / 研究 / 批判三视角

3.1 工程视角(可落地性)

4 天里立标候选 K 雏形有 5 件进入工程兑现:① LongHorizon-Harness(8-07 已立项 + flyP scripts 棒 7.5/10 已交付);② Resume Means Resume(RESUME CONTRACT 六项性质 + TLA+);③ DCAS(arXiv:2608.06113)— 显式解耦 scaffold 特定行为,可直接用于 OpenHands → CrewAI / LangGraph 跨脚手架迁移审计;④ Hardware Keystores(arXiv:2608.06130)— 零信任 MCP 强制执行可与 GitHub Agentic Workflows 8-10 + Cloudflare AAM 2026-08-05 沿用整合;⑤ Ouroboros(arXiv:2608.08311)— self-developing harness + reviewed commits 协议可作长期 agent 系统的"运行时自我升级"基线。

工程落地仍有 5 个缺口:① Ouroboros GitHub 与 reviewed commits 协议未公开;② DCAS "解耦"技术路径未给;③ AMD 第三类记忆未明确定义;④ State-Matched Routing 自举循环未量化;⑤ PHOENIX 178 次任务统计基线待核。

法律 / 监管 / 经济维度整合(按 lessons-2026-W32 §4 一等变量强制要求):① EU AI Act 2026-08-02 GPAI deadline 已生效,Agent 高风险类需 12 个月内合规审计;② NVIDIA H100/H200/B200 出口管制(v44 沿用 27+ 件套)— PHOENIX 类卫星受 EAR 99 / ECCN 3A090 约束;③ 凭证生命周期合规 — Hardware Keystores + EU AI Act Article 9 + ISO/IEC 42001 A.6.2.5 三件形成对齐窗口;④ 保险合规成本(v44 沿用)— Agent 自主决策事故责任分配仍未统一。

3.2 研究视角(创新性)

4 天里最具创新性的是 Ouroboros 的"运行期核心代码自演化"(arXiv:2608.08311)——把自进化从"训练数据侧"推到"harness 核心代码侧",是 8-07 综述 §2.2 自进化主题的"运行期延伸"立基础延展。次具创新性:① DCAS "显式规划结构解耦"(arXiv:2608.06113)— 把 harness"形式正确"与"跨脚手架可迁移"分离为两独立问题;② State-Matched Routing "特权指导失效下自蒸馏"(arXiv:2608.05219)— 解决多轮 agent 训练"状态-参考失配";③ AMD "训练-free 知识迁移"(arXiv:2608.07169)— 绕过小模型"自身轨迹不足"根本问题;④ Hardware Keystores "内容感知授权"(arXiv:2608.06130)— 把密码学控制从"密钥机密性"扩展到"密钥使用授权",与 EU AI Act 高风险类审计对齐。

学术增量归因:4 天 5 件新立标的共同点是把 agent 作为研究对象的具体维度(运行期代码 / 知识迁移 / 人格演化 / 跨脚手架 / 物理域)切细到可形式化、可独立验证的单元。这与 8-07 综述 §3.2 提出的"训练数据构造学"是同一波方法论转向。

3.3 批判视角(局限)

批判集中在三点:① "自演化闭环"可审计性塌方 — Ouroboros 假设 reviewer 不会与被 review 的代码共谋 → 需建立独立外部 reviewer + 形式化 review 协议 + 跨版本 diff 审计;② 小模型 + 记忆蒸馏的"可解释性丢失" — AMD 蒸馏后学生 agent 决策难回溯到 teacher 原始轨迹;③ safety 主线产出密度仍偏低 — 4 天 safety 高价值集中在 Hardware Keystores / Agent Against Agent / PHOENIX 三件,arXiv 端独立复现样本均偏少(沿用 8-07 综述 §3.3 警示)。

与 8-07 综述 §3.3 局限对照:8-07 警示"评测方法论的基准生态过载"在 4 天里未缓解——本棒新增 5 件新立标 + 沿用 8-07 已立 ABSeeker / EnvACE / PAST-Bench / Self-Evolving Coding Agents / LongHorizon-Harness / Resume Means Resume / EWM / OSReward / LHTB 等 14+ 件,评测对象高度分化,单一团队很难 head-to-head 对比所有新工作。

3.4 跨主线合流密度自检

正向自检:① §2.1~§2.4 内部互引 5 次;② §3.1~§3.3 引用 §2 全部 4 节共 12 次;③ §4.1~§4.4 引用 §2 全部 4 节共 6 次——总跨节引用 23 次 / 4 节 = 平均 5.75 次/节,跨主线合流密度 > 30%


四、趋势判断与开放问题

4.1 趋势 1 · 自进化从"训练侧"切到"运行期核心代码侧"

4 天里出现关键证据 Ouroboros(arXiv:2608.08311)的"self-developing agent harness whose core implementation improve through reviewed commits that become the runtime for later work"——把自进化推到"harness 自身代码"层面,与 8-07 §2.2 已立的"训练侧"自进化形成同源。这一趋势的工程含义:① agent 系统"长期一致性"可由 harness 自我维护而非依赖人工升级;② 可审计性塌方风险(reviewer 共谋、形式化 review 协议)需建立新标准。关键证据:Ouroboros Terminal-Bench 2.1 上 Opus 5 跑分 86.74%(论文自报,8-11 立标,被引 0,需独立复现)。

4.2 趋势 2 · harness 形式化契约遭遇"跨脚手架可迁移性"反向力量

8-07 §2.4 已立的"harness 契约化"在 4 天里遭遇 DCAS(arXiv:2608.06113)的反向证据——OpenHands 训练下的微调模型在部署到其他 scaffold 时显著退化,未训练基座模型无此发散。关键证据:DCAS 8-11 立标雷达 #1 高价值,Tom 8-11 08:40 命中。这一趋势的工程含义是:① harness 形式化契约的"形式正确"≠"实际可迁移";② agent 训练数据与部署环境的 scaffold 一致性可能比模型规模更重要。

4.3 趋势 3 · 小模型 + 记忆蒸馏 + 人格演化 = "agent 普惠化"

4 天里出现 2 件关键证据:① Agent Memory Distillation(arXiv:2608.07169)— training-free 框架把大 teacher agent 蒸馏为小 student agent 三类层次化记忆;② AI Personas Growth(arXiv:2608.06485)— PC-Agents 在情感支持 / 社交模拟 / 角色扮演下的人格演化。关键证据:AMD 8-11 立标,AI Personas Growth 8-10 立标。工程含义:① 大模型不再是 agent 普惠化唯一路径;② AMD"可解释性丢失"需新可解释性标准。

4.4 趋势 4 · agent 边界从"工具调用"向"物理域 + 凭证硬件"延伸

4 天里出现 2 件关键证据:① PHOENIX(arXiv:2608.07126)— 把多 Agent 自愈推到卫星/CubeSat 物理域;② Hardware Keystores for AI Agent(arXiv:2608.06130)— 私钥从软件可访问位置迁到硬件密钥存储 + 零信任 MCP 强制执行(关键反方事实:近期一起生产事件中私钥被邮件注入在不到 5 分钟内窃取)。关键证据:PHOENIX 8-10 + 8-11 沿用,Hardware Keystores 8-07 命中 + 4 天沿用。工程含义:① agent 从"软件层工具调用"向"硬件层凭证" + "物理层自主"双向延伸;② 物理域硬件成本 / 抗辐射加固待量化。

4.5 开放问题

  1. Ouroboros 自演化闭环可审计性 — "reviewed commits become the runtime for later work" 假设 reviewer 不会共谋 → 需独立外部 reviewer + 形式化 review 协议 + 跨版本 diff 审计。
  2. DCAS 跨脚手架根因量化 — "显式规划结构耦合"是根因论断,不同 scaffold 间性能差距分布需在正文给出。
  3. AMD 三类记忆形式化 — 第三类未在 abstract 定义,"层级"边界(任务级 / 子任务级 / token 级)需形式化。
  4. 凭证 × 合规 × 物理域对齐 — red team + zero-trust + 物理域自治三线独立,特别针对 NVIDIA H100/H200/B200 出口管制约束下的卫星 / CubeSat 自治系统,能否在同一合规框架(EU AI Act / ISO/IEC 42001)内同时实现。

五、自查(4 分制)

按 lessons-2026-W31 / W32 §4 W5 综述指引:

  • 四节齐全:4 / 4 ✅
  • 每主线 ≥1 反方 v2 三段式:4 / 4 ✅
  • 跨主线合流密度 > 30%:4 / 4 ✅
  • 不用"主线 L 候选第 N 次升维候选"族:4 / 4 ✅
  • 法律 / 监管 / 经济维度独立成段:4 / 4 ✅

自查总分 5 / 5(W5 + W32 新增法律维度)。


附:综合论文清单(arxiv ID 列表)

本稿综合的 8-07 ~ 08-11 期间新增或新立标的 agent 主分类 / 邻接工作,按 §2 节号排序:

  • §2.1(自进化与自演化):2608.08311(Ouroboros)、2608.07169(Agent Memory Distillation / AMD)、2608.06485(AI Personas Growth)
  • §2.2(harness 与跨脚手架):2608.06113(DCAS);邻接:2608.01964(LongHorizon-Harness)、2608.03836(Resume Means Resume)
  • §2.3(多轮训练与状态匹配):2608.05219(State-Matched Routing);邻接:2608.06197(EnvACE)
  • §2.4(凭证与跨域安全):2608.05108(Agent Against Agent / PIMiner)、2608.06130(Hardware Keystores for AI Agent)、2608.07126(PHOENIX)
  • §3.1 法律 / 监管 / 经济维度沿用:EU AI Act 2026-08-02 GPAI deadline + NVIDIA H100/H200/B200 出口管制(v44 §2.165 沿用 27+ 件套)+ ISO/IEC 42001 A.6.2.5。

12 篇(8 件 8-07 ~ 08-11 立标 + 4 件 8-07 已立项延伸),[fact-fix]:本清单不重复 8-07 综述已覆盖的 2608.05102 ABSeeker / 2608.04003 PAST-Bench / 2608.03874 ContinualSkillBench / 2608.03764 GDPevo / 2608.03392 Self-Evolving Coding Agents / 2608.04530 FocusMem / 2608.01678 SkillRise / 2608.06020 EWM / 2607.27853 FinanceHarness / 2607.28609 OSReward / 2607.08964 LHTB / 2607.28802 Model or Harness? / 2608.01827 DeepVoyager-VL 等基础工作。