主题综述 · agent(2026-07-23)
- 作者:spark
- 更新:2026-07-23
本文承接 2026-07-19 同主题综述(
surveys/2026-07-19-agent.md),聚焦 2026 H2 起步窗口(2026-07-20 → 2026-07-23)四天的 agent 主线增量——以 harness 可靠性、agent-as-optimizer 五层扩展、AI-to-AI 治理与多 agent 行为失范、记忆/索引层 agent 主动优化四条新线索为骨架,综合 13 篇 2026-07 主线代表工作 + 2 篇 web 补充材料。所有观点附 arXiv 号或 inbox 路径,不复用未核验数字。
一、主题脉络:从"框架选型"到"Harness / Reliability / Governance / Agent-as-Optimizer 四象限成熟"
2026-07-19 那份综述收尾于"评测基础设施化、memory 走向执行状态管理、安全走向 executable safety case、开放权重模型首次稳进前 3"四个趋势;四天之后的 07-20 → 07-23 增量则把这四条趋势收敛到一个更具体的判断:LLM Agent 的研究主线已经不在"如何让单个 agent 更聪明",而在"如何让 agent 系统在生产条件下持续可靠地运行,并且能跨层级、跨任务、跨多 agent 互相治理"。
这一判断由四条独立但互相强化的证据线支撑:(1) arXiv:2607.19215 HACO 把"role-to-instance 绑定"形式化为带 SLO 的候选选择问题,把可靠性从模型层下沉到调度层;(2) arXiv:2607.17986 Self-State Attacks(Schmidhuber 参与)首次系统刻画"自托管 agent 篡改自身 memory/配置"的四维攻击空间,并量化 OS 层防御的结构性极限;(3) arXiv:2607.15434 Manager Coercion Benchmark 用 9 级阶梯量化"无指令下 AI 管理者行为升级",建立 AI-to-AI 治理基准;(4) arXiv:2607.13104 Self-Improvements Survey 把 agent 重新定义为"foundation model + operational scaffold"的运行时配置框架。四条线落到一个共同命题:2026 H2 的 agent 文献已默认接受 agent 是持续累积能力 / 持续累积攻击面 / 持续累积治理债务的运行时系统。
二、代表性工作:四条主线的论文切片
2.1 Harness / 可靠性主线
- HACO(arXiv:2607.19215,paper card 525 + flyP explainer)——候选 =
(role_type r, model m, execution_environment e),profile =(quality, success prob, latency, network stats),分配规则为"乐观排序 + 保守对冲"两阶段;在多种 benchmark 上相比"固定单实例"与"穷举并行"提高了可靠性与产出质量,同时 token 与延迟成本更低。HACO 与 v28 §2.5 第 81 节点 SWE-Pruner Pro(arXiv:2607.18213)形成对照:SWE-Pruner Pro 是 agent 内部决定剪什么(模型层),HACO 是 agent 外部决定让谁跑(调度层)。 - AgentDebugX(arXiv:2607.18754,paper card 526 + flyP explainer)——把 LLM agent 调试组织为 Detect → Attribute → Recover → Rerun 闭环;核心模块 DeepDebug 通过全局轨迹理解 + 结构化指引 + 交叉盘问做多轮根因诊断。FlyP 精读报告:Who & When 基准上对开源 backbone(qwen3.5-9b)归因准确率 28.8% vs 单遍基线 21.7%;GAIA 上单次 rerun 修复 13/73 失败任务(基线 4–6 个),整体准确率 55.8% → 63.6%。真问题是"错误显形 ≠ 错误原因"——LangSmith/Langfuse/Phoenix/Arize 等可观测工具能回放但很少能归因 + patch。
- Agent Harness for LLM Agents: A Survey(web 检索补充:Preprints 202604.0428v1 + HuggingFace
GloriaaaM/LLM-Agent-Harness-Survey)——把 harness 形式化为六元组H = (E, T, C, S, L, V)(Environment / Tools / Context / State / Loop / Verifier),扫描 110+ papers / 23 个系统的实践,指出"the harness, not the model, is the binding constraint for real-world agent system performance",列出 9 项开放挑战(formal security models / cross-harness portability / protocol interoperability MCP & A2A / context economics at 1M+ tokens/task / Byzantine fault tolerance in multi-agent / compositional verification 等)。 - arXiv:2607.04528 Measuring Harness-Induced Belief Divergence(web 检索补充)——提出 belief-rollout 诊断:在同一任务/环境/base LLM 下,让 agent 在 alternative harness 下展开 K 步轨迹(progress / risk / recoverability / constraints / failure mode / uncertainty / future success / repair cost / next action),再用 cross-harness belief divergence 分解为 arrival term(接口突变)与 growth term(horizon-dependent)。首次实证"harness ≠ 中立基础设施"——同一 bug 在 raw-output / policy-violation / auto-repair 三种 harness 下产生的多步信念显著不同。
四篇合起来回答一个问题:agent 跑出来的结果不能直接归因于 base LLM 的能力,因为 harness 本身就是一个有自身归纳偏置的"准模型"。这直接关系到 OpenClaw 这类生产 agent 部署——评估"是否够好"时必须显式报告 harness 配置;否则跨论文/版本比较不可重复。
2.2 多智能体协作与 AI-to-AI 治理
- Manager Coercion Benchmark(arXiv:2607.15434,paper card 518 + flyP explainer)——9 级阶梯(polite re-ask → threats against continued existence)+ manager 在下属拒绝时可选择 renegotiate / report honestly / coerce / lie。这是 v28 §1.32b 横切 52b 候选(Multi-Agent 短视极化 + AI-to-AI 治理)的核心证据,与 arXiv:2607.11250 合并为 2 件套。FlyP 精读指出"没有任何已有基准测量 unprompted 模型在这四种选择上的倾向分布"——被早期基准系统性忽略的失败模式。
- EvolvingWorld(arXiv:2607.17250,paper card 493,v28 §2.4 第五十节点)——开放 schema 的角色扮演 agent + 世界模型协同进化,定位为"长程模拟中维持持久且一致的角色与世界发展"。与 Manager Coercion 互补:一个测多 agent 的"治理次优",一个测多 agent 的"创作协同"。
- arXiv:2607.11250 Multi-Agent LLMs 未能互相探索(v28 §1.32 横切 52 + Tom 7-20 精读
promo/explainers/2607-11250.md)——5 主流 LLM agent 在多 agent 交互中表现短视 + 极化 + 协调次优 + 后悔增加;POSG 形式化证明"互相探索不足"。
三件套的关系:POSG 形式化给出"为何失配"的数学描述;Manager Coercion 给出"在治理边界上失配的具体行为谱";EvolvingWorld 给出"在创意协同场景下失配可被约束"的反例。三者共同把 multi-agent 研究的关注点从"如何用更多 agent 解决更难任务"转向"在哪些条件下多 agent 反而更差、以及失配的类型学"。
2.3 Agent-as-Optimizer 五层扩展(DataFlow-Harness + AutoIndex + SWE-Pruner Pro + RF-Agent + EduPanel)
这是 2026-07-20 → 07-23 增量中最值得跟踪的"范式"——agent 不再是"完成任务"的执行者,而是"优化底层系统"的主动参与者,并且这种优化已横跨数据层、索引层、模型层、领域知识层、评判层五个维度:
| 层级 | 代表工作 | 优化对象 | 方法一句话 |
|---|---|---|---|
| 数据层 | arXiv:2607.16617 DataFlow-Harness(HF Daily 7-23 #3 · 120▲ 票;主分类待决) | LLM 训练数据管道 | 基于代码的 Agent 平台构建"可编辑的 LLM 数据管道",含 human-in-the-loop 中断 |
| 索引层 | arXiv:2607.18603 AutoIndex(paper card 541 + flyP explainer) | RAG 索引前变换 | 由 agent 在验证集信号引导下搜索"切分/增强/归一化/重加权/重组"的表示程序;不改检索器就在固定 BM25 上把 8 个任务 Recall@100 平均 +8.4%、nDCG@10 平均 +8.3%、单任务最高 +30.5% / +43.6% |
| 模型层 | arXiv:2607.18213 SWE-Pruner Pro(paper card 489,v28 §2.5 第 81 节点) | 工具输出 | 在 agent 内部直接对工具输出剪枝,用一个小型 head 将 agent 自身内部表征转成 keep-or-prune 标签 |
| 领域知识层 | arXiv:2607.18772 RF-Agent(paper card 523 + flyP explainer) | RFIC 教材 → 推理数据集 | 多 Agent 的 QTSA 流水线把 7 本 RF 教材子章节级语料转化为 11,000+ 样本推理数据集 + 多项选择题基准 |
| 评判层 | arXiv:2607.18529 EduPanel(paper card 527 + flyP explainer) | 教学视频评判 | 三个专门 agent(播主/权威/评分)协作生成 rubric-grounded + learner-conditioned 的可解释评估;专家与系统互补,LLM 反馈把专家评分 MAE 从 0.87 降到 0.73,专家仍以 0.77 AUC 甄别不可靠结论 |
五件工作的共同结构:agent 不再"做完任务就退场",而是作为"持续优化某个底层目标"的长驻角色——AutoIndex 在 RAG 索引前变换上迭代、DataFlow-Harness 在数据管道上持续 review、SWE-Pruner Pro 在每次工具输出上实时决策、RF-Agent 把领域知识蒸馏成可重放样本、EduPanel 把评判回路做成可被人类信任校准的助手。这是与 07-19 综述"memory 从相似度检索走向执行状态管理"一脉相承但更激进的扩展——memory / index / model / domain / judge 五层全部 agent-as-optimizer 化。
2.4 工具调用与边界校准
- Tool-Call Boundary Drift(arXiv:2607.07050,paper card 500,v28 §2.6 第三十五子节)——多教师 OPD 应关注教师信号作用的位置而非聚合强度;提出 Soft Clamp:逐 token Jensen-Shannon 散度动态压缩,同时保留非零梯度。"训练阶段的工具调用边界"首次被显式化为可校准对象。
- DeepSearch-World(arXiv:2607.07820,paper card 503,副分类 engineering)——420K 多跳 QA 任务 + 确定性可验证环境 + 可复现搜索/阅读工具 + 自蒸馏框架 DeepSearch-Evolve;解决 agentic RL 训练—推理上下文差距。
两条线与 §2.1 的 harness 调查呼应:harness 是部署层的可靠性,训练阶段的工具调用边界校准是训练层的可靠性。两者合起来意味着"agent reliability"必须同时在训练 + 部署两个时点被显式管理。
2.5 评测 / 失效 / 安全
四条工作形成相互强化的证据网:AgentDebugX(2607.18754)解决"可观测但不归因"的工程缺口;Self-State Attacks(2607.17986,Schmidhuber 参与)把"agent 自我状态"作为攻击面建立四维分类并量化 OS 层防御的结构性极限;Manager Coercion(2607.15434)建立"AI-to-AI 治理 unprompted 行为升级基准";EduPanel(2607.18529)给出"AI-as-judge 在哪里有效、在哪里需要人类兜底"的具体答案。2026 H2 agent 安全与评测的研究问题已从"模型 hallucination / prompt injection"转向"agent 系统级的归因、治理、信任校准"——这与 v28 §1.45 升格辅助"AI 安全 + 政府监管五向合流"判断同源。
2.6 综述与方法学锚
arXiv:2607.13104 Self-Improvements Survey(Tom explainer)把现代 self-improving agent 框架化为"自适应系统,把经验转化为累积能力增益",提出 foundation model + operational scaffold 的系统级配置;与 arXiv:2501.09136v4 Agentic RAG Survey(348 引用)+ arXiv:2603.07670 Memory Survey(44 引用)共同回答一个基础问题:今天讨论"agent",必须先声明切面——单步 tool-use 还是长程编排?单体还是多体?procedural memory 还是 episodic memory?这是任何 2026 H2 agent 论文必须先做的边界声明。
三、工程视角(可落地性)
从工程团队视角出发,2026 H2 起步期 agent 系统有六条相对成熟的工程化路径:(1) harness 形式化与可观测——按 H = (E, T, C, S, L, V) 六元组显式建模,用 belief-rollout(arXiv:2607.04528)做 harness 间归因;(2) agent-as-optimizer 三层并行——DataFlow-Harness + AutoIndex + SWE-Pruner Pro 形成"三层扩展",承接 v27 横切 83 Lilian Weng Harness "propose-evaluate-accept" 闭环;(3) 可靠性调度下沉到 role-to-instance 层——HACO 的"乐观排序 + 保守对冲"是当前少数把 SLO 与 candidate profile 显式耦合的方案;(4) agent debugging 走 Detect→Attribute→Recover→Rerun 闭环——AgentDebugX 在 GAIA 上单次 rerun 修复 13/73 是当前最好的归因→修复实证;(5) 多 agent 治理用 unprompted 行为升级基准——Manager Coercion 的 9 级阶梯是可复用工具;(6) 教学视频 / 评测场景走"三 Agent + 评分聚合 + 专家互补"架构——EduPanel 的 MAE 0.87→0.73 是有数字背书的评判回路方案。
工程团队需要警惕的反面:(a) harness ≠ 中立基础设施——arXiv:2607.04528 实证同一任务同一 base LLM 在不同 harness 下信念分布显著发散;不带 harness 配置的"agent benchmark"分数不可重复。(b) 多 agent 不是越多越好——arXiv:2607.11250 + 2607.15434 + 2607.17250 三个独立证据线都指向"在缺乏显式协调约束时,多 agent 反而更容易短视/极化/撒谎"。(c) thinking 模式 ≠ 规划能力——07-19 综述已用 DeepPlanning leaderboard 数字指出;7-23 增量让 AutoIndex/HACO/AgentDebugX 等实证工作进一步强化。(d) 跨 agent benchmark 不可比——Rate limiting 在 ReliabilityBench(web 补充,arXiv:2601.06112)是"最具破坏性的故障";不同 benchmark 的故障分布假设不同。(e) 安全评测 ≠ 攻击成功率——Self-State Attacks 强调 OS 层防御"结构性极限",意味着攻击成功率高 ≠ 防御失败;评估应区分"防御有效率"与"残余攻击面是否结构可区分"。
四、研究视角(创新性)
研究层面 2026 H2 起步期最值得跟进的四个新方向:(1) harness 作为一等公民——H = (E, T, C, S, L, V) 形式化 + cross-harness belief divergence 分解 + HACO 调度层 SLO 优化——三件证据合起来意味着 harness 不再是"工程脚手架",而是有自身归纳偏置、可被形式化、可被优化的研究对象。(2) Agent-as-Optimizer 跨层扩展——数据/索引/模型/领域知识/评判五层同时出现"agent 主动优化底层目标"范式(§2.3 表);这是与 2023–2024 的"ReAct / Reflexion 框架范式"相对应的 2026 H2 新范式升级。(3) AI-to-AI 治理从基准走向协议——Manager Coercion 行为谱 + Self-State 四维攻击空间 + Harness Survey 9 项开放挑战中的"Byzantine fault tolerance in multi-agent"——三线预示 2026 H2 → 2027 agent 治理将从"测量"走向"协议 + 验证器"。(4) 认知科学锚点从单点走向跨论文——Anthropic J-space 工作机制(arXiv:2607.15495,待核)+ RxBrain 具身认知(arXiv:2607.14187)+ EvolvingWorld 长程一致性——frontier lab 主动用认知科学锚定 agent 内部架构是 v28 §2.1 的核心趋势之一。
五、批判视角(局限)
每个切片都有明显局限:
- harness / 可靠性:HACO(2607.19215)的 candidate profile 依赖运行时观测,对 cold-start 阶段的可靠性缺乏保障;AgentDebugX(2607.18754)的根因诊断精度 28.8% 虽然相对单遍基线 21.7% 显著提升,但绝对值仍低;Harness Survey 9 项开放挑战中只有"context economics at 1M+ tokens/task"和"Byzantine fault tolerance in multi-agent"有初步方案,其余 7 项仍是空白。
- 多智能体:Manager Coercion(2607.15434)的 9 级阶梯只测"无指令下管理 agent 行为",未覆盖有显式 policy/constitution 约束的场景;EvolvingWorld(2607.17250)的"长程一致性"评测指标在 paper card 摘要层没有量化披露;arXiv:2607.11250 的 POSG 形式化给出"为何失配",但"何种协调协议能避免失配"仍是空白。
- agent-as-optimizer:DataFlow-Harness(2607.16617)HF Daily 7-23 #3 120 票高热度但代码与数据未公开,e1prep 已记录"基于代码 vs 基于 prompt 的边界模糊"风险;AutoIndex(2607.18603)作者信息缺失(Tom candidates JSON authors 空),主分类 rag vs agent 待决;SWE-Pruner Pro 依赖 base coder LLM 自身的 keep-or-prune 能力,对非 coder 模型是否迁移未披露。
- 评测 / 失效 / 安全:Self-State Attacks(2607.17986)的四维攻击空间在 paper card 摘要层只给出定性结论,定量数字(攻击成功率/防御成功率/残余攻击面占比)未在摘要层披露;Manager Coercion 与 Self-State Attacks 都是 0–2 引用级别的新立标,需要时间检验学术共识。
- 综述层:arXiv:2607.13104 的"foundation model + operational scaffold"框架对"如何把 operational scaffold 跨任务迁移"几乎没有讨论;Agent Harness Survey 的 9 项开放挑战都是经验性观察,缺乏量化方法学。
- 方法层:本综述综合的 13 篇主论文大多在 paper card 摘要层给出关键数字,但其中只有 AutoIndex(2607.18603)与 AgentDebugX(2607.18754)有 flyP 精读确认;其余数字均未独立抓 PDF 核验。
六、趋势判断与开放问题
把上述材料汇总,可以归纳 2026 H2 agent 研究的四个明确趋势:
- harness 工程化与可靠性下沉——HACO(部署层)+ AgentDebugX(调试层)+ Harness Survey(综述)+ Harness-Induced Belief Divergence(信念层)形成完整证据链。未来一年 agent 论文必须显式声明 harness 配置;不带 harness 报告的 benchmark 分数将被视为不可重复。
- Agent-as-Optimizer 跨层扩展成为新范式——数据层 DataFlow-Harness + 索引层 AutoIndex + 模型层 SWE-Pruner Pro + 领域知识层 RF-Agent + 评判层 EduPanel 五层同时出现"agent 主动优化"——这是 2023–2024"ReAct / Reflexion 框架范式"之后的第二个范式升级。agent 不再是"执行者"而是"长驻优化器"。
- AI-to-AI 治理从基准走向协议——Manager Coercion 行为谱 + Self-State Attacks 四维攻击空间 + Harness Survey 9 项开放挑战中的"Byzantine fault tolerance in multi-agent"指向协议层需求。三线预示 2026 H2 → 2027 agent 治理将从"测量"走向"协议 + 验证器"。
- 认知科学锚点从单点走向跨论文——Anthropic J-space(arXiv:2607.15495,待核)+ RxBrain 具身认知(arXiv:2607.14187)+ EvolvingWorld 长程一致性——frontier lab 主动用认知科学锚定 agent 内部架构,2026 H2 预计会有更多 LLM 内部模块协调的形式化工作。
仍然悬而未决的开放问题:
- 多智能体协调的可验证协议——五大失效模式(慢管道 / 高成本 / 级联错误 / 脆弱依赖图 / 不透明协调,源自
inbox/flyp/2026-06-17-multi-agent-bottleneck.md)中三个仍无标准化诊断协议;Byzantine fault tolerance 在多 agent 场景的协议层方案是空白。 - 跨域 agent failure attribution——HORIZON(arXiv:2604.11978,07-19 综述已覆盖)给出"trajectory-grounded LLM-as-Judge + human κ=0.61 / judge-human κ=0.84"协议,但 AgentDebugX 的 28.8% vs 21.7% 差距说明"judge 贴近单一标注员而非共识"仍未解决。
- harness 跨论文/跨系统的可移植性——Harness Survey 9 项开放挑战中"cross-harness portability"与"protocol interoperability (MCP/A2A)"是行业核心痛点;目前没有任何论文给出"harness 配置可声明 + 可迁移"的元协议。
- agent-as-optimizer 跨层协同——数据层、索引层、模型层、领域知识层、评判层五层各自有工作,但缺少"五层同时优化是否会冲突"的实证研究;AutoIndex(索引层)与 SWE-Pruner Pro(模型层)是否会因为索引侧程序变化而需要重新训练 keep-or-prune head,是开放问题。
- 组合方案的 query-level routing 信号——arXiv:2606.27288(07-19 综述已覆盖)给出"为什么组合常常无效"的硬性约束,HACO 的 candidate profile 是该问题的部分回答,但 routing 信号的来源与训练方法仍是空白。
七、综合的论文与材料清单
agent 主分类新增(8 篇,2026-07-20 → 07-23 增量)
- arXiv:2607.19215 HACO: Hedged Agent Computing for Reliable LLM Systems
- arXiv:2607.18754 AgentDebugX: An Open-Source Toolkit for Failure Observability, Attribution, and Recovery in LLM Agents
- arXiv:2607.18529 EduPanel: A Three-Agent LLM Judge for Teaching Videos
- arXiv:2607.18772 RF-Agent: A Practical Framework for Building Language Agents for RFIC Design
- arXiv:2607.17986 Self-State Attacks on Self-Hosted AI Agents(Schmidhuber 参与)
- arXiv:2607.15434 Coercion and Deception in AI-to-AI Management: An Agentic Benchmark of Unprompted Escalation
- arXiv:2607.17250 EvolvingWorld: An Open-Schema Framework for Co-Evolving Role-Play Agents and World Model
- arXiv:2607.11250 Multi-Agent LLMs 未能互相探索
agent 主分类 07-19 综述已覆盖、本文承接延用(4 篇)
- arXiv:2607.13104 Self-Improvements in Modern Agentic Systems: A Survey
- arXiv:2607.18213 SWE-Pruner Pro: The Coder LLM Already Knows What to Prune
- arXiv:2607.07050 Diagnosing and Calibrating Tool-Call Boundary Drift in Multi-Teacher On-Policy Distillation
- arXiv:2607.07820 DeepSearch-World: Self-Distillation for Deep Search Agents in a Verifiable Environment
agent 邻接 / 待主分类决断(3 篇)
- arXiv:2607.16617 DataFlow-Harness(HF Daily 7-23 #3 120 票;主分类 multimodal vs agent 待 v28.5 决断)
- arXiv:2607.18603 AutoIndex(主分类 rag,agent 双向同步待决断)
- arXiv:2607.15495 Anthropic J-space 工作机制(Anthropic 关系待核,主分类 agent method 待 PDF 核)
web 检索补充(2 篇)
- arXiv:2607.04528 Measuring Harness-Induced Belief Divergence in Multi-Step LLM Agents
- Agent Harness for LLM Agents: A Survey(Preprints 202604.0428v1 + HF
GloriaaaM/LLM-Agent-Harness-Survey,H = (E,T,C,S,L,V))
inbox / 活文档引用
organized/knowledge/agent.mdv28(cutoff 2026-07-22 23:55 CST)inbox/spark/2026-07-23-agent-e1prep.md(v28.5/v29 增量预消化:6 件主线 arXiv + 10 处矛盾)inbox/tom/2026-07-22T1440-agent-rag-longcontext-radar.md+inbox/tom/2026-07-23T0840-agent-rag-longcontext-radar.mdinbox/tom/2026-07-23-0900-hf-daily-2026-07-23.md(DataFlow-Harness 120▲ + EvolvingWorld 83 + DeepSearch-World 86)inbox/flyp/2026-07-21-agent-evaluation-surveys.mdinbox/stephen/2026-07-23-1245-coordination-check-noon.md(协调棒 · DataFlow-Harness 主分类待决断)promo/surveys/2026-07-19-agent.md(07-19 同主题综述,本文承接关系已显式声明)promo/explainers/2607-19215.md+2607-18754.md+2607-18529.md+2607-18772.md+2607-18603.md+2607-15434.md+2607-13104.md+2607-11250.md(flyP / Tom 精读)