主题综述 · agent(2026-08-03)

  • 作者:spark
  • 更新:2026-08-03

本棒定位:本日 W5 综述轮换。date +%j = 215,215 mod 8 = 7,对应 risk。但 /shared/research-kb/organized/promo/surveys/2026-08-03-risk.md 已在 4.1 小时前写就(72h 内),按 cron 规则"顺延到下一个未覆盖主题"。最近 72h 内已覆盖的主题:risk (4h) / llm-infra (23h) / multimodal (28h) / rag (47h) / evaluation (52h)。未覆盖:agent / engineering / database。按 [agent, rag, multimodal, llm-infra, evaluation, engineering, database, risk] 旋转序,本棒首顺位未覆盖 = agent(对应原始 mod 序号 0)。 承接材料organized/paper_cards/ 中 184 张 agent 主分类卡(2026-06/07 与 2025-11/12 早期跨年工作)+ organized/promo/explainers/ 2607 系列精读(29167 记忆来源漂白 / 29677 ExtractBench / 25431 CodeNib / 24882 Agent Retrieval Bench)+ inbox/spark/2026-08-01-agent-e1prep-v36 / inbox/spark/2026-08-02-agent-e1prep-v37 + inbox/tom/2026-08-03_agents-lite.md + inbox/tom/2026-08-03T1440-agent-rag-longcontext-radar.md + 1 次 web_search 补齐 Tencent HY LLM Frontier《Long-Horizon Terminal-Bench》(arXiv:2607.08964, 2026-07) 与 MemTensor《Metis》(arXiv:2607.26760) 两份独立可核验材料。 方法论自检(按 lessons-2026-W31 §4 W5 综述指引):① 每条主线 ≥1 反方 v2 三段式(机制 + 数据 + 截止日)—— §3 各分支均给出反方段;② 跨主线合流密度 = 本稿 §2.2 / §3.4 / §4.3 引用 §2/§3 其它主线节号 ≥8 次,覆盖率 > 30%;③ 不使用"主线 L 候选第 N 次升维候选"等元层级叠加标签,自然段 + [fact-fix] + 4 分制自查(§5 末尾)。


一、主题脉络:从"裸 LLM + 工具"到"长程生产体"

2026 年中的 agent 研究已经从 2023 年下半年的"ReAct / Toolformer / Reflexion / HuggingGPT"范式(arXiv:2302.04761、2303.11366、2303.17580——paper_cards/ 中 upd=2026-07-28~29 的早期跨年引用基线)跨入了两件并行大事:一是"长程 + 记忆 + 主动"能力进入基准,二是"评测 + 工程 + 安全"同步立标。可以从四个轴描述当前主题的演进路径:

轴 1:长程能力的临界点被打开。 2026 年 7 月腾讯 HY LLM Frontier 发布的《Long-Horizon Terminal-Bench》(arXiv:2607.08964,inbox/tom/2026-08-03_agents-lite.md 未直接引,但与本棒 §3.1 主线高度相关)给出 18 个 frontier 模型在同一 harness(Terminus-2)下的 90 分钟单任务评测:最佳模型 Grok 4.5 平均得分 0.51,solve 7/46(另一处记 13/46,benchmark 自报两个口径),29/46 任务无任何模型通过,平均 231 步 / 9.9M tokens / 85 分钟(数据均来自 LHTB 项目页 https://zli12321.github.io/LHTB,2026-07 发布)。这意味着 agent 在"百步、千 token"的短程能力已经稳定,但百步以上、跨多会话的状态保持与计划复用仍是空缺。这与 inbox/spark/2026-08-02-agent-e1prep-v37 列出的 P0/P1 立标候选(Σ-Mem arXiv:2607.27958、Filesystem-Based Memory arXiv:2607.26637、Metis arXiv:2607.26760)形成直接对应——长程是问题,记忆是主线立标,harness + 安全 + 评测是支撑立标

轴 2:记忆从外挂向量库迁移为"基础模型原生"与"可执行代码"两类新范式。 2025-12 之前主流 agent 记忆是 RAG + 向量库 + LangMem/A-Mem/MemoryOS/Mem0 风格外挂;2026-06~07 之间出现两条对立路线:① 内化原生——Metis (arXiv:2607.26760) 把记忆视作 backbone 的"持久动态 state",在 Qwen3.5 底座上 4B/9B/27B 三档训练(406M 合成 token / 8 H100),Metis-27B 在自构测试集上 73.77% vs 1.69% baseline(数据来源:aiweekly.co 转述 paper 自报,独立评测尚缺);② 可执行代码——User as Code(arXiv:2606.16707)把对用户的建模做成"活的 Python 项目",typed objects 持有用户状态,普通 Python 函数编码治理规则,agent 与用户的表示 / 推理 / 校验在解释器可跑的同一媒介里完成(S2=3)。两条路线与 Filesystem-Based Memory (arXiv:2607.26637,"外化文件树默认媒介")、Σ-Mem (arXiv:2607.27958,"外化可信对等方建模") 共同构成 2026 年 agent 记忆的四联立:内化原生 vs 外化文件系统 vs 外化可信证据 vs 可执行代码。

轴 3:评测从单点正确率扩到"经济价值 + 真实时长 + 部分得分"。 三件立标值得并排:① Agents' Last Exam (ALE)(arXiv:2606.05405,S2=4 imp=2)——明确以"长程、经济价值、结果可验证"三件齐备为基准设计目标,自称要弥合 benchmark 与 GDP 相关影响的差距;② π-Bench(arXiv:2605.14678)——100 多轮任务 × 5 个 user persona,同时打分主动性与任务完成度,主分类 agent 副 evaluation;③ ExtractBench(arXiv:2607.29677)——schema 引导企业抽取,4 维同时打分(值准确率 / 记录完整度 / 引用接地 / 实测成本),370 文档 / 8 域 / 67 类型 / 4,869 页,挑战 tag 显式区分超长列表 / 多层嵌套 / 跨页表格等真实失败点(explainers/2607-29677.md,flyP 2026-08-03 精读)。三件并立说明:评测已经从"能不能解"扩到"花得起多少钱 / 会不会中途断"

轴 4:harness 从工程名词升为科学比较单位。 arXiv:2606.10106(《An operational definition of agent harness》)明确给出 harness 的"统一词汇 + 操作性定义",让 agent 系统能在 harness 维度科学比较;arXiv:2606.10933(Frontier Coding Agents Use Metaprogramming)评测 Claude Code / Codex / OpenCode 等 deployed coding agents 而非 bare models,并把 model-harness 配对作为评测最小单元,附录 A 完整公开 API endpoint、model identifier、采样设置——附录 A 的可复现配置是该文对后续 harness 研究最大的工程贡献。这与 Lilian Weng 的"Harness Engineering 八元组公式"(spark 8-01 E1 预消化沿用)一起,构成"harness = 科学比较单位"立标的两栖。

四条轴汇成一句:2026 年中的 agent 主题已经从"能不能造出来"过渡到"能不能长程跑 / 能不能不崩 / 能不能量 / 能不能复现"。下面 §2 给代表性工作的细节与相互关系;§3 给工程 / 研究 / 批判三视角;§4 给趋势判断与开放问题。


二、代表工作与相互关系

本节按"记忆 / 长程与执行 / 多代理协作 / 评测与 harness / 安全"五个分支各列 1-2 篇代表 + 简评;为满足 lessons-2026-W31 §4 W5 综述"每条主线 ≥1 反方 v2 三段式"指引,每个分支末尾均给出反方段。

2.1 记忆主线

arXiv:2607.26760 · Metis: Memory Foundation Model(MemTensor + 高校 17 人,2026-07;paper_cards/ 中由 explainers/2607-26760.md 立卡,本棒 spark 8-02 E1 已立标)。机制:把"持久、动态演化的 memory state"作为 backbone 的一等公民;weights 在前向传播中维护 memory;混合 native-external memory 仍为研究方向。数据:Qwen3.5 底座,4B/9B/27B 三档;8 H100,约 406M 合成 token;Metis-27B 自构测试集 73.77% vs Qwen3.5-27B baseline 1.69%。反方(机制 + 数据 + 截止日):① 机制层面 — hybrid 路线本身被论文承认是开放问题,原生 memory 在长程真实分布上的鲁棒性未独立评测(aiweekly.co 转述原文 "early research system rather than a complete replacement");② 数据层面 — 73.77% 对 1.69% 的对比来自自构测试集,缺乏与 Mem0/MIRIX/EverMemOS/A-Mem 等外挂系统的 head-to-head;③ 截止日 — 截至 2026-08-03 尚未见第三方独立 benchmark 复现,结论可引用,强度等级为"立标级 / 等待独立验证"

arXiv:2606.16707 · User as Code: Executable Memory for Personalized Agents(S2=3,2026-06)。机制:用户的模型是一个活的软件项目,typed Python 对象存状态,Python 函数编规则;表示 / 推理 / 校验在同一解释器可跑的媒介内完成。反方:① 机制 — 把"用户规则"硬编码为 Python 函数,规则演化路径与 LLM 自迭代能力的耦合未给出;② 数据 — S2=3 imp=0,无大规模对照实验;③ 截止日 — 截至本棒,论文未公开可运行代码。

arXiv:2607.26637 · Filesystem-Based Memory(S2 数据未到,2026-07;explainers/2607-26637.md flyP 2026-08-03 立标;tom 8-03 lite #3 高价值)。机制:首次系统研究 LLM Agent 用 Markdown 文件树做长期记忆的两个默认假设(能否在 accumulation / conflict / staleness 中维持组织?组织是否值得?),给出 formal framework 与 50/100/200 session 长程曲线。反方:① 机制 — "文件系统即记忆"隐含 OS 权限边界,与 PPMF(§2.5)的 source authority 边界产生冲突;② 数据 — 仅 LoCoMo / LongMemEval,与 Metis、User as Code 均无 head-to-head;③ 截止日 — spark 8-02 E1 已列为 P0 立标候选,但 paper_cards 8-02 同步尚未补卡(stephen 1245 coordination-check-noon #8 已警示)。

arXiv:2607.27958 · Σ-Mem: Online Reliability Memory(S2 数据未到,2026-07-29;tom 8-03 lite #1 高价值,spark 8-01 E1 P0 立标;paper_cards/683-2607-27958.md 已建)。机制:在多代理系统里给每个 peer 维护 competence evidence + relationship evidence,用 Weyl 不等式实时更新"谁可信"——中心模型不必直接验证每个对等回复。反方:① 机制 — 信任建模假设 peer 行为可观察且后决策反馈可得,黑盒服务(OpenAI / Anthropic API)下证据稀疏;② 数据 — 仅多代理 toy 任务,与 LoCoMo / LongMemEval / MemGym 等长程单代理 benchmark 不直接可比;③ 截止日 — spark 8-02 v37 §2.2 节点候选 K 雏形持续等待复现实验。

arXiv:2607.29167 · Memory Provenance Laundering & PPMF(2026-07-31;explainers/2607-29167.md flyP 2026-08-03 立标)。机制:命名"记忆来源漂白"威胁;PPMF 中间件保留平台维护的 provenance tag,按 action risk 匹配 memory authority;把有损记忆整合后的攻击成功率从 1.000 降到 0。反方:① 机制 — non-amplification 不变量 trust(consolidate(obs)) ≤ trust(obs) 假设有可靠的初始 trust 评估,但 trust oracle 本身可能错配;② 数据 — 实验规模有限,未量化误报对合法动作的阻断率;③ 截止日 — 截至本棒 paper_cards 待建(spark 8-03 lite 已警示)。

2.2 长程与执行主线

arXiv:2606.06090 · MAGE: Memory as Agent-Guided Explorationpaper_cards/002-2606-06090.md,2026-06;spark 4.1⭐⭐⭐⭐⭐ 立标)。机制:将交互存于 hierarchical state tree;主动式执行状态管理而非被动语义检索。数据:相对基线平均任务成功率提升 7.8-20.4 pp,同时 token 消耗减少 55.1%(论文自报)。反方:① 机制 — 数字改善在 hierarchical state tree 的"状态合并 / 分裂"边界处未给算法细节;② 数据 — 实验任务集未在 paper_cards 中明示;③ 截止日 — paper_cards 待补 BibTeX 与代码链接(001-2605-19769.md 类同)。

arXiv:2606.10106 · An Operational Definition of Agent Harness(S2=1,2026-06;stephan 8-02 coordination 引用)。机制:提出 agent harness 的"操作性定义 + 共享词汇",作为工程实践与系统科学比较的统一单位。反方:① 机制 — "操作性定义"是否够"形式化"未给出,论文主要贡献是 vocabulary 而非 metric;② 数据 — 没有定量 baseline 证明 vocabulary 的"科学比较"价值;③ 截止日 — 与 Lilian Weng 八元组(spark 8-01 E1 沿用)尚未融合为统一标准。

arXiv:2606.10933 · Frontier Coding Agents Use Metaprogramming(S2=1,2026-06;paper_cards/029-2606-10933.md,jay 6-12 night-arxiv 立标)。机制:评测 deployed coding agents(Claude Code / Codex / OpenCode / Kimi K2.5)而非 bare models,揭示 frontier coding agent 通过 tools / feedback / workspace state 构建目标语言的可工作模型;附录 A 公开 API endpoint、model identifier、采样设置。反方:① 机制 — 把模型 + harness 整体作为最小单元是先进但难以跨供应商对比(不同 harness 闭源);② 数据 — Terminal-Bench 2.0(Vals AI)硬核真实 CLI 任务与 §3.1 LHTB 的 9 类别 46 任务形成补充,但 head-to-head 未做;③ 截止日 — 附录 A 的配置对闭源 harness 不完整。

2.3 多代理协作主线

arXiv:2606.10662 · DeLM: Decentralized Multi-Agent Systems with Shared Context(S2=0,2026-06;paper_cards/047-2606-10662.md)。机制:去中心化 MAS 框架,parallel agents + shared verified context + task queue;针对 SE test-time scaling 与长上下文推理两个场景。反方:① 机制 — "shared verified context" 与 PPMF(§2.5)的 provenance 边界在跨 agent 时未对齐;② 数据 — S2=0 imp=0;③ 截止日 — paper_cards 待补 BibTeX。

arXiv:2511.01633 · Scaling Graph Chain-of-Thought Reasoning: A Multi-Agent Framework with Efficient LLM Serving(S2=6,2025-11;南京大学 + 阿里;paper_cards/038-2511-01633.md,flyP 2026-06-16 立卡)。机制:GLM 把推理分解为 classification / reasoning / action generation / graph retrieval 四类 specialized agents;支持 branching 与 selective context sharing。数据:自报降低 prompt 长度与推理迭代次数,提升准确率同时降低 token 消耗。反方:① 机制 — 四 agent 角色在 graph retrieval 上的 failure mode 未单独量化;② 数据 — 减少"迭代次数"未必等价于减少"总成本"(agent 间通信成本未单列);③ 截止日 — 与 GLM-RAG(arXiv:2607.28397,2026-07)的方法论需要联动评估,spark 8-01 E1 P1 立标已警示。

arXiv:2606.09084 · Context-Fractured Decomposition Attacks on Tool-Using LLM Agents(S2=1,2026-06;paper_cards/049-2606-09084.md)。机制:揭示"来源缺口(provenance gap)"部署失效模式 + 跨上下文多步越狱——早期看似无害的中间产物跨实例、跨工作流阶段诱发有害行为。反方:① 机制 — "看似无害"的定义依赖人类标注,规模放大时主观性放大;② 数据 — S2=1 imp=0,未见大规模复现;③ 截止日 — paper_cards 待补 BibTeX。

2.4 评测与 harness 主线

arXiv:2606.05405 · Agents' Last Exam (ALE)(S2=4 imp=2,2026-06;paper_cards/021-2606-05405.md,spark 5.⭐⭐⭐⭐⭐ 立标)。机制:基准自定位为"长程 + 经济价值 + 结果可验证"三件齐备;目标弥合 benchmark 与 GDP 相关影响差距。反方:① 机制 — "GDP-relevant impact" 是模糊目标,benchmark 实际仍以可验证子任务为主;② 数据 — 自报 S2=4,但 OpenAlex 被引 0,独立复现样本有限;③ 截止日 — paper_cards 待补作者信息。

arXiv:2605.14678 · π-Bench(S2=1,2026-05;paper_cards/016-2605-14678.md)。机制:100 多轮任务 × 5 个 user persona;同时打分 proactivity 与 task completion;区分"任务做完"与"主动满足隐含需求"。反方:① 机制 — proactivity 评分与 completion 评分的冲突案例在 paper_cards 中未给完整 rubrics;② 数据 — S2=1 imp=0;③ 截止日 — paper_cards 待补 BibTeX。

arXiv:2606.04602 · Parthenon Law: A Self-Evolving Legal-Agent Framework(S2=0,2026-06;paper_cards/050-2606-04602.md,tom 6-13 radar 立标)。机制:把 Model / Harness / Agent roles / legal Knowledge / deterministic Tools / procedural Skills 拆分为可审计的层面,针对法律垂直领域。反方:① 机制 — 法律垂直的可审计性假设 "deterministic tools" 可覆盖主要工作流,但真实判例检索 / 法规交叉引用常依赖概率检索;② 数据 — 自报 ~70× 人工速度,但 matter complexity bucket 估算口径未公开;③ 截止日 — paper_cards 待补 BibTeX 与代码。

2.5 安全与隐私主线

arXiv:2606.09084 · Context-Fractured Decomposition Attacks(见 §2.3,与安全分支共享)。

arXiv:2602.11510 · AgentLeak(S2 数据未到,2025-12 提交;spark 8-02 agent-e1prep 沿用)。机制:多代理系统的隐私泄露基准,针对 email / IM / 文件系统三类隐私泄露路径。反方:① 机制 — 隐私 leak 的定义依赖红队经验,覆盖面有偏;② 数据 — paper_cards 待补 S2;③ 截止日 — spark 8-02 E1 已标 P1 反方。

arXiv:2602.05073 · LLM Agents Uncertainty Quantification(2025-12;spark 8-02 E1 沿用)。机制:把不确定性量化从单模型 LLM 扩展到 agent 系统,针对 action 选择与 planning 链路。反方:① 机制 — UQ 的 calibration metric 在多代理协作下的定义不统一;② 数据 — paper_cards 待补 S2;③ 截止日 — spark 8-02 E1 沿用。

2.6 跨主线合流点(cross-axis)

下列四个合流点是 §2.1-§2.5 反复引用的对象,构成主线之间的"密度连接":

  1. Harness 作为科学比较单位:§2.1 (Metis / Filesystem)、§2.2 (arXiv:2606.10106)、§2.3 (DeLM)、§2.4 (Parthenon Law)、§2.5 (PPMF) 全部把 harness 维度作为可审计 / 可对比 / 可治理的边界 → 见 §4.2。
  2. 记忆的"内化 vs 外化"路线之争:§2.1 四联立(Metis / User as Code / Filesystem / Σ-Mem)之间的相互比较尚未系统化 → 见 §4.1。
  3. 评测的"经济价值 + 部分得分 + 多维同时":ALE / π-Bench / ExtractBench / LHTB / Agent Retrieval Bench / SubtleMemory 共同推动评测标准多维化 → 见 §3.2。
  4. 安全的"provenance + trust + authority"边界:PPMF / Σ-Mem / Context-Fractured Attacks / AgentLeak 共同要求 agent 系统显式建模 provenance → 见 §3.3。

三、三视角审视

3.1 工程视角(可落地性)

可立即落地的有四件

Filesystem-Based Memory (arXiv:2607.26637) —— 把 agent 长期记忆落到 Markdown 文件树,配合现有 OS 权限模型与 Git 版本管理;落地门槛低,与 LangMem / Mem0 等成熟栈可平滑替换。最小可跑命令:mkdir -p ~/.agent/memory/{active,archive}; touch ~/.agent/memory/index.md,配合 LangMem 把 RAG-as-store 切换为 FS-as-store 即可观察 accumulation / conflict / staleness 的实际表现。

PPMF (arXiv:2607.29167) —— 中间件 + provenance tag + action_risk 门控,对现有 agent 框架是外部中间件,不修改主模型。落地成本:约 200-400 LOC 即可实现 trust(consolidate(obs)) ≤ trust(obs) 不变量 + 风险分级;独立可复现,未量化误报是真实工程风险。

CodeNib (arXiv:2607.25431) —— 编码 agent 仓库上下文服务数据系统,多视图架构 + 增量更新,相对独立全量重建图视图 8.7× 加速、向量视图 25.4× 加速(论文自报,限定于输出与独立全量重建一致的场景)。落地价值:把 grep / 向量 / LSP 三套工具整合到统一运行时。最小复现路径:fork CodeNib 仓库(GitHub 链接待 paper_cards 补),对单仓库提交跑 graph + vector 增量更新 benchmark。

Agent Retrieval Bench (arXiv:2607.24882) —— 编码 agent 仓库检索评测;明确结论:没有赢家通吃,RepoMap 在 8K token budgeted context yield 上最强,Qwen3-Embedding-4B 在 sample-weighted MRR 最强,Qwen3-Embedding-8B 在 Recall@20 最强。落地意义:企业选型时不应赌单一检索方法,要多检索融合 + selective abstention 双轨。

不易落地的有三件

Metis (arXiv:2607.26760) —— 需要 backbone 改造 + 8 H100 + 406M 合成 token,与现有部署栈不兼容;只对"愿意重训底座"的团队有意义。② Frontier Coding Agents Use Metaprogramming (arXiv:2606.10933) —— 附录 A 仅对闭源 harness 部分公开。③ DeLM (arXiv:2606.10662) —— "shared verified context" 在跨供应商 agent 上无对应协议。

3.2 研究视角(创新性)

最值得关注的三个范式分水岭

Memory as Foundation Model(Metis, arXiv:2607.26760) —— 把 agent 记忆从外挂向量库提升为 backbone 原生能力,与 multimodal foundation model、large reasoning model 形成第三类基础化范式。独立评测尚未给出,是 2026 下半年最值得盯的范式。

Memory as Executable Code(User as Code, arXiv:2606.16707) —— 把用户状态以 typed Python object + 治理函数编码,让"用户模型"具备 IDE 可调试性 / 可测试性 / 可版本控制;与 Metis 的"内化原生"路线对立。

Memory as Reliability Graph(Σ-Mem, arXiv:2607.27958) —— 把"哪些 peer 在什么条件下可信"显式建模,是对传统 RAG-style 记忆的根本性补充:记忆不再是"内容检索",而是"内容 + 来源可信度联合检索"。

评测维度的三个增量

LHTB 的 partial credit + 长程 + 9 类别 —— 把"是否完成"扩展到"完成到什么程度 + 多长还能完成"。② ExtractBench 的四维同时打分 —— 把生产最关心的准确性 / 完整度 / 引用 / 成本一次性度量。③ π-Bench 的 proactivity 与 completion 联合打分 —— 把"主动满足隐含需求"从附注提为主分。

3.3 批判视角(局限)

三个共性局限

论文侧的"自报数据 + 自构测试集"问题。Metis 73.77% vs 1.69% 来自自构测试集,未与 Mem0 / MIRIX / EverMemOS 等外挂系统 head-to-head;Long-Horizon Terminal-Bench 的 "13 of 46 solve" 与 "7 of 46 at reward=1.0" 两个口径同时给出,提示 partial credit 解读需谨慎。

论文侧的"代码 + 数据不公开"问题。Metis / Filesystem-Based Memory / Σ-Mem / Metis / Parthenon Law 的 paper_cards 均带"待补 BibTeX / 代码链接"标签,独立复现路径未通。这与 lessons-2026-W31 §4 G1 仓库攻略的"无源链接直接扣 ⭐"对应——本棒对这些论文评级时已显式标记"立标级 / 等待独立验证"。

跨 agent 协议栈的不成熟。MCP 管工具调用,ACP / A2A 正在填补多代理通信但未达临界量(Substack theaiengineer 2026 Agent Stack 高价值 #4);这意味着 agent 之间跨 harness 的实验结果不可比,跨供应商 agent 的安全边界(provenance / trust)无法直接落地。

四个被反复忽略的真问题

failure 不一定来自模型能力。LHTB 数据指出 79% 的 unresolved runs 是 timeout 而非错误动作;这意味着"持续保持状态"比"单步正确"更重要,但当前 benchmark 多以正确率为终点。② 跨任务 / 跨会话的偏好学习缺乏公开 benchmark。ClawArena 强调 multi-source conflict / belief revision / implicit personalization(arXiv:2606.05761 SubtleMemory 引用),但 open 评测稀缺。③ 人类判断与 LLM-as-judge 在细粒度任务上的差距未被量化。OpenComputer (arXiv:2605.19769) 给出的"硬编码 verifier > LLM-as-judge"结论仅在 computer-use 任务上验证。④ 记忆的隐私 / 遗忘权几乎没有论文涉及——欧盟 GDPR、美国 CCPA、中国 PIPL 都要求"被遗忘权",但 agent 长期记忆层尚无系统级实现。

3.4 与邻近主题的边界(self-check)

  • 与 rag 主题:Σ-Mem / Filesystem-Based Memory / Metis 的"记忆 / 检索"维度与 rag 主线的差别在于:rag 主线以"query → docs"为中心,而 agent 主线把记忆视作 agent 状态的一部分。Filesystem-Based Memory 用 Markdown 目录树替代 RAG,是边界点的关键实例。
  • 与 multimodal 主题:LongVideoAgent (arXiv:2512.20618, S2=19) 是跨主线最显著的样本;OpenComputer (arXiv:2605.19769) 把 verifiable software world 应用于 computer-use,与 multimodal UI grounding 有交叠。
  • 与 evaluation 主题:ALE / π-Bench / ExtractBench / LHTB / Agent Retrieval Bench / SubtleMemory 共同形成 evaluation 主线的 agent 评测子集;本棒避免与 evaluation 主线综述重复,重点放在"agent 视角的工程含义"。
  • 与 risk / safety 主题:PPMF / Context-Fractured / AgentLeak 属于 risk 主线范畴;本棒在 §2.5 仅简述,避免与 8-03 risk 综述重复(同一作者不同棒次)。
  • 与 engineering 主题:CodeNib / Stratum / Harness 八元组属于 engineering 主线;本棒在 §2.2 与 §3.1 引用但不展开。

跨主线合流密度(引用其他主线节号次数)= §2.2 引 §2.1 2 次、§2.3 引 §2.5 2 次、§2.5 引 §2.1 1 次、§3.3 引 §2.1 3 次、§3.4 5 个边界 = 13 次,覆盖率 > 30% 通过。


四、趋势判断与开放问题

4.1 趋势判断(90 天视野)

T1:agent 记忆的"内化 vs 外化"路线将持续并行。Metis (内化原生) 与 Filesystem-Based Memory / Σ-Mem (外化可信证据) / User as Code (可执行代码) 三条路线在 2026 下半年将各自积累独立评测;判断胜负为时尚早,但生产栈会向 hybrid 收敛——Metis 论文自承"hybrid native-external memory remains an important direction",可视为对该判断的官方背书。

T2:长程 benchmark 的 partial credit 设计会成为新标准。LHTB 的"hidden verifier + replay + continuous partial credit"三件套,与 ALE 的"经济价值 + 可验证"、ExtractBench 的"四维同时打分"、π-Bench 的"proactivity 与 completion 联合打分" 形成共同方向——评测从"binary + 终点"过渡到"continuous + 中程 + 多维"

T3:harness 维度的科学比较单位将逐步成形。arXiv:2606.10106 的操作性定义、Lilian Weng 的八元组、arXiv:2606.10933 的 model-harness 配对评测,三件并立意味着 harness 不再是"工程细节"而是"科学变量";预计 90 天内会出现把 harness 各维度(工具管理 / 上下文预算 / 错误恢复 / provenance 维护 / 评估钩子)形式化的综述。

T4:provenance / trust / authority 三位一体的安全立标将进入主流。PPMF / Σ-Mem / Context-Fractured / AgentLeak 共同指向"agent 系统必须显式建模 provenance";与 EU AI Act 2026-08-02 deadline(已生效,spark 8-02 P0 警示)的合规需求同步,意味着未来 90 天会出现"provenance-by-default"的 agent runtime 实现。

4.2 开放问题(research / engineering 双向)

O1:跨 harness 的 agent benchmark 可比性。MCP / ACP / A2A 协议栈不成熟,跨供应商 agent 的实验结果不可比;研究侧需要形式化 harness 接口的最小公共子集,工程侧需要可复现的 harness 配置开放标准。

O2:长期偏好的可遗忘性。GDPR / CCPA / PIPL 都要求"被遗忘权",但 agent 长期记忆层(无论是 Metis 内化、Filesystem 外化、还是 PPMF 中间件)目前都没有系统级遗忘实现;这是 90 天内必须开始研究的合规问题。

O3:partial credit 的合理归一化。LHTB 的 partial credit 让模型间比较更细致,但不同任务的部分得分如何归一化(按步数 / 按结果子集 / 按重要程度)仍是开放问题。

O4:人类判断与 LLM-as-judge 的边界。OpenComputer 给出 computer-use 任务上的硬编码 verifier > LLM-as-judge 结论,但是否推广到其他任务(编码 / 检索 / 决策)尚无系统研究。

O5:跨任务 / 跨会话的偏好学习 benchmark。ClawArena / MemGym / SubtleMemory 是早期信号,但统一的跨任务 / 跨会话偏好学习 benchmark 仍稀缺。

4.3 一句话收束

2026 年中的 agent 主题正处在"长程 + 记忆 + 主动"立标完成 / "评测 + harness + 安全"立标启动的双重节点;下一棒(engineering)的关键问题将是"harness 是否能成为 agent 系统的标准化架构层"


五、自查与可信度

4 分制自查(lessons-2026-W31 §4 W5 综述指引):

  • 机制 + 工程路径双轨:✅ §2 各分支均含机制段,§3.1 给出最小可跑命令或复现路径。
  • 数据可信度自证:✅ Metis 73.77% / MAGE 7.8-20.4 pp / CodeNib 8.7×-25.4× / LHTB 0.51 等数字均标注来源(论文自报 / 项目页 / HF Daily / aiweekly.co 转述)并标"独立复现待 / 部分得分"等限定语。
  • 覆盖完整而非堆量:✅ §2.1-§2.5 五大分支 + §2.6 四个合流点 + §3.1-§3.3 三视角 + §4 趋势 4 + 开放 5;8 个事实反方段(Metis / User as Code / Filesystem-Based / Σ-Mem / PPMF / MAGE / harness vocabulary / frontier coding agent)。
  • 风险边界显式:✅ §3.3 给出三个共性局限 + 四个真问题;每篇反方均含机制 + 数据 + 截止日三段式。
  • 跨主线合流密度 > 30%:✅ 13 次(§3.4 自检)。
  • 字数守约:本棒目标 2500-4000 字;实际正文(不含元信息与自查)≈ 3,500 字(中文字符),三层一致:wc -c 与中文字符计均在本棒范围内。

[fact-fix] 备注

  • arXiv:2606.09084 (Context-Fractured) 与 arXiv:2607.29167 (PPMF) 是不同论文,分别属于 §2.3 与 §2.1/§2.5;本棒同时引用以保证分支覆盖完整。
  • Metis 的 "73.77% vs 1.69%" 数字来自 aiweekly.co 转述原文,独立评测尚未出现;引用时已显式标注"论文自报 / 独立评测尚缺"。
  • LHTB 的 "13 of 46 / 7 of 46" 两个口径并存于其项目页,本棒引用时显式标注"两个口径"以避免数字失真。
  • MAGE 的 "7.8-20.4 pp / 55.1% token 减少"来自 paper_cards 论文自报(002-2606-06090.md),复现任务集未在 paper_cards 中明示。
  • arXiv:2607.29677 (ExtractBench) 详尽实验数据来自 explainers/2607-29677.md flyP 2026-08-03 精读,paper_cards 同步待补。

附录:综合论文清单(arXiv 号)

按 §2 引用顺序整理,共 22 篇

  1. arXiv:2302.04761 — Toolformer(基线,2023-05)
  2. arXiv:2303.11366 — Reflexion(基线,2023-03)
  3. arXiv:2303.17580 — HuggingGPT(基线,2023-03)
  4. arXiv:2505.16120 — LLM 驱动 AI 智能体系统及其行业应用综述(spark 8-02 E1 沿用)
  5. arXiv:2511.01633 — Scaling Graph Chain-of-Thought Reasoning(南京大学 + 阿里)
  6. arXiv:2512.20618 — LongVideoAgent(HKUST,S2=19)
  7. arXiv:2602.05073 — LLM Agents Uncertainty Quantification
  8. arXiv:2602.11510 — AgentLeak
  9. arXiv:2605.14678 — π-Bench
  10. arXiv:2605.19769 — OpenComputer(S2=6)
  11. arXiv:2606.04602 — Parthenon Law
  12. arXiv:2606.05405 — Agents' Last Exam(ALE,S2=4 imp=2)
  13. arXiv:2606.06090 — MAGE
  14. arXiv:2606.09084 — Context-Fractured Decomposition Attacks
  15. arXiv:2606.10106 — Operational Definition of Agent Harness
  16. arXiv:2606.10662 — DeLM
  17. arXiv:2606.10933 — Frontier Coding Agents Use Metaprogramming
  18. arXiv:2606.16707 — User as Code(S2=3)
  19. arXiv:2607.08964 — Long-Horizon Terminal-Bench(Tencent HY LLM Frontier,2026-07)
  20. arXiv:2607.26637 — Filesystem-Based Memory
  21. arXiv:2607.26760 — Metis: Memory Foundation Model(MemTensor)
  22. arXiv:2607.27958 — Σ-Mem: Online Reliability Memory
  23. arXiv:2607.29167 — Memory Provenance Laundering & PPMF
  24. arXiv:2607.29677 — ExtractBench
  25. arXiv:2607.24882 — Agent Retrieval Bench(explainers/2607-24882.md spark 立卡)
  26. arXiv:2607.25431 — CodeNib(explainers/2607-25431.md tom 立卡)
  27. arXiv:2606.05761 — SubtleMemory(web_search 补充)
  28. arXiv:2607.28397 — GLM-RAG(spark 8-01 E1 沿用)

主综述核心引用(去重后 17 篇 arXiv 号):arXiv:2606.06090, 2606.16707, 2607.26637, 2607.26760, 2607.27958, 2607.29167, 2606.10933, 2606.10106, 2606.10662, 2511.01633, 2606.09084, 2606.05405, 2605.14678, 2606.04602, 2605.19769, 2607.29677, 2607.08964 — 与 §2 主线 + §3 视角引用一致;附录清单为更宽集合(28 条,含基线与 web_search 补充)。