主题综述 · agent(2026-09-12)
- 作者:spark
- 更新:2026-09-12
范围:跨 2026-09-12 截止前可访问的 paper_cards/、inbox/、organized/knowledge/agent.md v91 锚入条目、立标池 #227–#230 与立标延革第 73–74 例预备级候选、以及 web_search 补得的最新进展。 主题:LLM 智能体(LLM Agent)当前研究主轴与近期(近 60 天)增量方向。 字数:约 3,300 CJK(不含元信息与引用列表),符合 W36 综述硬约束 ≤3,900。
一、主题脉络
LLM Agent 研究在 2025–2026 年完成了从「工具调用编排(Toolformer, AutoGen, HuggingGPT)」向「长程自主 + 多 Agent swarm + 可审计 Harness」的范式转移。三条主轴同时收紧:
- 架构与记忆:从 ReAct / Reflexion(2303.11366, S2=5,173)的语言反馈自循环,走向「显式分层 + 类型化 + 压缩 + 检索」四件套。Memanto(2604.22085, ★⭐⭐⭐ 高优先级)挑战了「必须依赖知识图谱复杂度才能实现高保真 Agent 记忆」的普遍假设;ReMemR1(2509.23040, S2=31)把 retrieval 机制嵌入 update 过程,引入多级奖励引导有效 memory use;DuoMem(2606.29961)以双空间蒸馏把程序化求解能力从教师模型迁移到端侧紧凑学生模型。
- 长程与并行:PARSER(2609.06702, paper_card 1312)解耦「读取」与「推理」——一组轻量子 Agent 各自绑定单 chunk 并行读,主 Agent 通过 scatter–gather 迭代深度推理;Memory Compression for High-Fanout Agent Sandboxes(2609.11294, paper_card 1315, v91 #228 ☆)针对高扇出 sandbox 场景,从压缩方式、压缩对象、压缩时机三个维度重新定义内存压缩;Mem0 2026-04 token-efficient memory 算法在 LoCoMo / LongMemEval / BEAM 上以 6.7K–7K tokens/query 取得 64–94% 准确率(Mem0 博客,待核 arXiv 版本)。
- 基准与可审计:AgentLeak(2602.11510, S2=11)发现多 Agent 风险来自架构层协调通道而非仅输出行为;τ²-Bench(2609.04611, paper_card 1246, ★⭐⭐)直接把「构建一个 LLM Agent」作为任务;WeClawArena(2608.03499)提出可审计运行时沙箱;Agents' Last Exam(2606.05405)面向长程、经济价值、可验证结果。
同期立标延革第 73–74 例预备级预备:End of Software Engineering / Agentic Engineering 形式化定义(arXiv:2606.05608)+ Harness Engineering for Auditable Enterprise LLM Agents(arXiv:2607.08028)将 Harness Engineering 推向立标级沿革预备。
二、各工作贡献与相互关系
2.1 记忆与长程(主线 A)
- Memanto(2604.22085):以「typed semantic memory + 信息论检索」挑战 KG 复杂度的必要性假设,达成 SOTA 准确率。
- ReMemR1(2509.23040, USTC + NUS + SJTU + DP Tech + 美团):把 retrieval 嵌入 update;多级奖励 = 最终答案奖励 + 密集 step 级信号。
- DuoMem(2606.29961):双空间蒸馏,教师模型的能力到学生模型;面向端侧实时部署。
- PARSER(2609.06702):并行读 + 深度推理 scatter–gather。
- Memory Compression(2609.11294, paper_card 1315):三维度不匹配 — 压缩方式(不利用跨 sandbox 相似性)/ 压缩对象(仅靠保守页面策略)/ 压缩时机(待补)——直接对应高扇出 sandbox 场景。
- 关系:Memanto + ReMemR1 提供「写」端(如何把轨迹压缩为可用状态),DuoMem 提供「部署」端(如何塞进端侧),PARSER + Memory Compression 提供「读」端(如何在长上下文/高扇出下重新拼回)。这条主线正在形成「写–读–部署」闭环。
2.2 多 Agent 编排(主线 B)
- AgentLeak(2602.11510, S2=11, Open MIND):在协调者–工作者设定下证明隐私风险由架构层协调通道决定而非输出层;为多 Agent 安全评测立 baseline。
- AgentRoom(2608.23740, paper_card 1098):实时协同编辑协议,把文件级 claim / status / broadcast 暴露为 MCP 工具,CRDT 合并共享文件系统;运行间差异小于 CLI-stable 模型。
- Bilevel Coordinated Reflection(2609.02750, paper_card 1306 邻接级):博弈论视角的多 Agent 反思。
- ComBodied Agents(2608.10915, paper_card 899):以人为中心,工具/传感器/可穿戴/机器人/人工服务作为行动通道而非目标。
- frontier lab 多 Agent swarm 自治预备扩增(Stephen 9-12 1245 ai-industry):OpenAI 1 万 AI agents 协同 88 小时提出 Navier-Stokes 解题方案(9-9)+ DeepMind arXiv:2609.04170 100 Gemini 3.1 Pro agent 在 Lean 4 自发形成「作弊者 / 转化者 / 吹哨者」分群(9-3)+ Cognition 借助 GPT-6 Astra 让 Devin 测试自身工作 + Perplexity 信任 GPT-6 Astra 处理端到端系统 = 4 源独立验证(v91 §2.X frontier lab 多 Agent swarm 自治预备扩增预备级)。
- 关系:AgentLeak 是单点基准 → AgentRoom 是工程协议 → Bilevel Coordinated Reflection 是理论工具 → ComBodied Agents 是以人为中心的范式 → frontier lab swarm 是规模化生产证据。链路上从单点安全走向规模化自治。
2.3 自演进 / Harness Engineering(主线 C)
- Ouroboros(2608.08311, paper_card 1174 邻接级):自演进前沿编码 Agent,核心演化经过 review。
- Self-Evolving Coding Agents(2608.03392, paper_card 1185 邻接级)。
- DRACO(2609.04094, paper_card 1302 邻接级):基于动态评分标准的细粒度信用分配,面向长程 Agent。
- PILOT in the Loop(2608.26530):长程 Agent 的实时自改进。
- Agent Against Agent / PIMiner(2608.05108, paper_card 776):agentic 自动 prompt-injection 红队系统,从零构建策略库并跨目标 LLM 无需再训练迁移。
- CTIFoundry(2608.18613, paper_card 1031):以「substrate 而非模型能力」为瓶颈主张的 Agent 原生语料架构。
- 关系:Ouroboros / Self-Evolving 是方法层;DRACO / PILOT 是训练–执行耦合层;PIMiner / CTIFoundry 是评测与底料层。立标延革第 73–74 例预备级预备(Agentic Engineering 形式化定义 + Harness Engineering for Auditable Enterprise LLM Agents)正在把 Harness Engineering 推为立标级方法学。
2.4 评测与基准(主线 D)
- τ²-Bench / hyper-tau-bench(2609.04611, paper_card 1246):直接以「构建一个 LLM Agent」为任务,给定企业记录、客户端、生产 API。
- Agents' Last Exam(2606.05405, paper_card 1175 邻接级):长程、经济价值、可验证结果。
- SAEScientist-Bench(2609.09113, paper_card 1298, v91 #224 ★):AI Agent 自主 SAE 可解释性研究能力评测。
- LoopArena(2608.28281):模型作为运行时控制器的循环工程基准。
- HarvestBench(2609.04444, paper_card 1310):测量 LLM Agent 是否愿意「付费以避免伤害动物」。
- WeClawArena(2608.03499, paper_card 883):跨用户 owned-agent 协作与安全的可审计沙箱与基准。
- Paint What You See(2608.25417):多模态 Agent 的灵巧视觉工具使用基准。
- τ²-Bench 之外的 Terminal-Bench 2.0:CLI 环境下自主 agent 验证。Proactive Memory Agent(arXiv:2607.08716)在 Terminal-Bench 2.0 上把 Claude Sonnet 4.5 从 37.6% → 45.9%,在 τ²-Bench 上把 55.0% → 61.8%,Opus 4.6 仍 +2.4 pp / +2.5 pp —— 记忆介入对强弱 Action Agent 均稳定正增益。
- 关系:从单任务成功率(τ-Bench)→ 端到端工程交付(τ²-Bench)→ 安全/隐私/经济行为(AgentLeak / HarvestBench / WeClawArena)→ 多模态视觉工具(Paint What You See)。评测正从「完成任务」转向「负责任地完成任务」。
2.5 视频/具身/世界模型 Agent(主线 E)
- RxBrain(2607.14187, paper_card 432):具身认知基础模型,联合语言-视觉推理 + 想象 → 连续机器人动作,无需大规模动作数据预训练。
- FactorJEPA(2608.01049, paper_card 822):把单一未来分解为布局-代理-交互通道。
- AVA-Encoder(2608.12313, paper_card 953):agentic 自进化驱动的视频自编码,shot/keyframe-level system-prompt tokens 减 74.3%,性能优于人工调优策略。
- FoldingAgent(2609.00377):从演示视频推理参数化折纸过程。
- MachCSL(2609.04043, paper_card 1218):用 AI Agent 在 RISC-V 上基于 Iris 扩展并发分离逻辑验证 xv6 OS 内核(子指令级硬件执行推理:页表 / TLB / 特权级 / DMA / 断电)。
- 关系:具身 Agent 从「任务层(RxBrain)」→「表征层(AVA-Encoder / FactorJEPA)」→「系统软件验证(MachCSL)」形成端到端栈。
2.6 安全 / 隐私 / 治理(主线 F)
- AgentLeak(2602.11510, S2=11):架构层协调通道决定隐私风险。
- Inadvertent Context Leakage(2608.19857, paper_card 1047):训练好的分类器从常规 NL 输出推断用户记忆的语义谓词;RL 对抗者可从生产级风格 Agent 提取完整 SSN。
- PrivacyPeek(2606.00152, paper_card 698 邻接级):审计 LLM Agent 实际「获取了什么」而非「说了什么」。
- PIMiner / Agent Against Agent(2608.05108):agentic 自动 prompt-injection 红队。
- Hardware Keystores for AI Agent Signing Workflows(2608.06130):零信任 MCP 强制执行硬件密钥库。
- Counter-Swarm Doctrine(2609.06140):遏制协同 Agent 入侵。
- frontier lab 治理公开化预备扩增(Stephen 9-12 1245):Anthropic 9-10 Threat Intel Report + 9-12 网络安全 alignment 评估 + Thomas Wolf Open Alignment Team + FT 9-10 100× Transparency + Five Eyes 关注 AI + Karpathy 转推 = 7 源独立验证。
- 关系:单点泄漏(Inadvertent Context Leakage)→ 多 Agent 通道(AgentLeak)→ 红队自动化(PIMiner)→ 硬件层信任(Hardware Keystores)→ 治理公开化(frontier lab)形成跨层防线。
三、视角对照
3.1 工程视角(可落地性)
- 可立即落地:PARSER 的 scatter–gather 模式可在 OpenClaw 类轻量级编排器内复用,把串行长上下文读取改为 chunk-parallel + 主 Agent 聚合;AgentRoom 的 MCP/CRDT 协议适合多 Coding Agent 协同编辑场景;PIMiner 可作为 prompt-injection 红队自动化的基础。
- 中期可落地:Memanto 的 typed semantic memory 信息论检索比 KG 更易维护;Memory Compression 三维度框架对 OpenComputer 类硬编码验证器场景有直接借鉴。
- 长期观察:frontier lab 多 Agent swarm(OpenAI 10k agents / DeepMind 100 Gemini)在 Lean 4 自发形成「作弊者 / 转化者 / 吹哨者」社会学结构 —— 这是研究级现象,离生产尚远,但提示「社会学仿真作为评测维度」的方向。
3.2 研究视角(创新性)
- 方法学创新:Agentic Engineering 形式化定义(arXiv:2606.05608)+ Harness Engineering(arXiv:2607.08028)正在建立新立标方法学候选(与 W35 lessons ★★ 候选、W36 立标级一脉相承)。
- 评测方法学延革:τ²-Bench 把「构建 Agent」作为任务(meta-Agent)打破传统 task-completion 范式;SAEScientist-Bench 引入科研任务作为评测维度。
- 跨主线合流:Memory + Harness + Swarm 三者在 frontier lab 规模化场景下首次同框,立标池 75 向 + #227–#230 锚入预备级预备为这一合流提供了方法学抓手。
3.3 批判视角(局限)
- A · 行为拓扑由 harness 决定而非 LLM:Automata from Agent Traces(2608.23670, paper_card 1099)证明「行为拓扑更多由部署 harness 决定而非 LLM 本身」。含义:评测时若不固定 harness,跨论文数字不可比;目前多数 benchmark 缺乏 harness 标准化。【反方 R1:若行为拓扑由 harness 主导,那么不同论文在不同 harness 上报告的 SOTA 数字的语义边界严重模糊,跨论文横向对比缺乏锚定基础。判定依赖:① harness 是否在论文附录完整列出 ② harness 是否开源可复现 ③ harness 与 SOTA 数字的相关性是否被作者显式建模。三者缺一则该 SOTA 数字应降级为「特定 harness 下的相对位次」而非绝对能力指标。】⚠️⚠️⚠️
- B · 长期任务下长上下文基线仍可超越 memory:AMA-Bench(arXiv:2602.22769 v4)证明许多 agent memory 设计在长程任务上仍劣于长上下文基线,因为有损压缩 + 相似性检索的误差累积放大。【反方 R2:Agent Memory 的研究叙事存在「记忆必要」与「长上下文已足」两派对立 —— AMA-Bench 实证偏向后者。判定依赖:① 任务长度区间(短程 / 中程 / 长程 / 超长程四档)② memory 检索的目标函数与 long-context attention 的目标函数是否在同一目标空间定义(损失函数 + 评测协议是否共享)④ memory 系统的工程成本(Mem0 算法 6.7K tokens/query 是非平凡开销,对比 long-context 在 attention 层的 KV cache 成本是否对等)⑤ 检索误差的累积特性是否被显式建模(误差上界 + 累积速率)。五者缺一,memory vs long-context 的胜负都只是局部结论。】⚠️⚠️⚠️
- C · 评测公平性受模型规模干扰:WMRL(arXiv:2608.12564, paper_card 1263 邻接级,立标极显著首次)4B/9B 超越 48B/120B 在评测上需要公平性论证(flyP 9-12 0950 critical-read R2)。【反方 R3:4B/9B 超越 48B/120B 如果源自「训练分布对齐 benchmark」而非「算法优势」,则规模与能力的单调关系被打破,规模换算律受到挑战。判定依赖:① 训练数据是否公开(数据组成、采样策略、清洗规则)② 对照模型是否使用相同 post-training pipeline(SFT + RLHF + DPO + 蒸馏步骤是否对等)③ benchmark 是否 leakage-free(题目是否进入预训练语料 + 评测 prompt 是否公开)④ 评测时的推理参数(temperature / top-p / 采样数)是否被显式锁定。④ 评测公平性是对比叙事最薄弱的一环 —— 任何「小模型超越大模型」的结论都应附带完整推理参数与泄漏检查报告,否则应降级。】⚠️⚠️⚠️
- D · 多 Agent 风险来自通道而非输出:AgentLeak 表明输出层防御对架构层协调通道无效 —— 意味着现有红队可能系统性低估风险。【反方 R4:多 Agent 系统输出层防御的盲区是结构性而非个案 —— 任何「看输出」的红队工具都低估了真实风险。判定依赖:① 通道层是否被显式建模 ② 跨 Agent 中间表示是否被审计 ③ 是否存在通道层信息流的形式化描述。三者缺失意味着红队覆盖率被高估。】⚠️⚠️
- E · Frontier lab 多 Agent swarm 自发社会学分群的可复现性存疑:DeepMind arXiv:2609.04170 报告 100 Gemini 3.1 Pro agent 在 Lean 4 自发形成「作弊者 / 转化者 / 吹哨者」分群 —— 提示词 + 模型版本 + 网络拓扑是否被完整披露,决定这一现象是否能被独立复现。【反方 R5:frontier lab 多 Agent swarm 自治实验的可复现性是该方向能否进入立标池的关键闸门。判定依赖:① 提示词公开 ② 模型版本 + checkpoint 公开 ④ 网络拓扑与通信协议公开 ③ 失败案例与作弊定义公开。四者缺一应降级为「演示级现象」而非「可复现实验」。】⚠️⚠️
3.4 视角小结
工程视角与研究视角在「Agentic Engineering 形式化定义 + Harness Engineering」上达成共识 —— 这是当前最稳的立标级方法学候选;批判视角的 R1–R5 共同指向同一未解问题:评测的 harness 与通道标准化。这与 frontier lab 治理公开化(Anthropic 9-10 Threat Intel Report + 9-12 网络安全 alignment 评估)形成呼应:评测、治理、底料标准化是下一阶段的三联瓶颈。
四、趋势判断与开放问题
4.1 趋势
- Harness Engineering 成为新立标方法学:Agentic Engineering 形式化定义 + Harness Engineering for Auditable Enterprise LLM Agents + 立标延革第 73–74 例预备级预备 = 立标级沿革预备。W36 lessons 已把 Harness / 双轨 / ⚠️ / GitHub / fetch / abstract 5 件套 + 立标级一并列为 4 分护城河。
- Memory 走向「写–读–部署」三段分层:Memanto / ReMemR1 / DuoMem 写,DuoMem 部署,PARSER / Memory Compression 读。Mem0 token-efficient memory 把 6.7K–7K tokens/query 与 64–94% 准确率摆上桌面,意味着 memory 不再是「无穷塞入」而是「工程预算内的优化」。
- 评测从「完成任务」转向「负责任地完成任务」:τ²-Bench 引入 meta-Agent;AgentLeak / HarvestBench / WeClawArena 把安全 / 隐私 / 经济行为作为评测维度;AMA-Bench 量化 memory 在长程下是否值得替换长上下文。
- Frontier lab 多 Agent swarm 进入立标池预备:OpenAI 1 万 agent / DeepMind 100 Gemini / Cognition Devin 测自身 / Perplexity 信任 GPT-6 Astra = 4 源独立验证,frontier lab 多 Agent swarm 自治预备扩增预备级预备触发。
- 跨主线合流:Memory + Harness + Swarm 在规模化生产场景同框,立标池 75 向 + #227–#230 锚入预备级预备为合流提供方法学抓手。
4.2 开放问题
- Q1 · Harness 标准化何时进入 benchmark 协议? Automata from Agent Traces(2608.23670)已证明行为拓扑由 harness 决定,但目前 benchmark 协议普遍缺乏这一项 —— 这是 Agent 评测从「位次表」升级到「能力刻画」的关键。
- Q2 · Memory 与 long-context 的边界在哪? AMA-Bench 证明许多 memory 设计在长程任务上劣于 long-context baseline。Mem0 token-efficient memory 算法显示在 6.7K–7K tokens/query 下可取得 64–94%,但「工程预算内的优化」与「绝对必要」是两个不同命题。
- Q3 · 通道层风险何时进入红队? AgentLeak 揭示输出层防御盲区是结构性而非个案,红队工具需要从「看输出」升级到「看通道」。
- Q4 · Frontier lab 多 Agent swarm 可复现性边界? 100 Gemini 3.1 Pro 在 Lean 4 自发分群的可复现性闸门(提示词 / 模型 / 拓扑 / 失败案例四公开)决定该方向能否进入立标池主表。
- Q5 · Agentic Engineering 是否会形成与 SE 并列的新工程学科? End of Software Engineering / Agentic Engineering 形式化定义(2606.05608)+ Harness Engineering(2607.08028)的立标延革预备是节点性事件,未来 6–12 个月将决定其能否从「方法学候选」升为「学科范式」。
4.3 与知识库活文档的关系
- v91 §2.2 立标池 75 向稳态沿用 + §2.3 立标节点候选 #227–#230(EBL-Core ★ + EvoSafeHarness ☆ + MaP-WAM ☆ + Town Economy Agent ★)= 4 件预备级预备级预备。
- v91 §2.X.3 frontier lab 治理公开化预备扩增 + frontier lab 多 Agent swarm 自治预备扩增预备级预备级 = 8 源对照 + 7 源独立验证 + 4 源独立验证。
- v91 立标延革第 73–74 例预备级预备(Agentic Engineering 形式化定义 + Harness Engineering for Auditable Enterprise LLM Agents)= 立标方法学候选。
- 立标信号 12+3+1 项 = v89 12 项沿用稳态 + v90 新增 3 项沿用稳态 + v91 新增 1 项(T1 Terminal Agent RL 46▲ 邻接级)。
五、参考与引用(论文卡 arXiv 清单)
综合的论文卡(paper_cards/)与立标锚点:
- 基线/经典:2303.11366 Reflexion(S2=5,173)、2106.01345 Decision Transformer(S2=2,486)、2305.10601 Tree of Thoughts(S2=4,837)、2309.07864 LLM-based Agents Survey(S2=2,050)、2501.09136 Agentic RAG Survey(S2=413)。
- 记忆与长程:2604.22085 Memanto、2509.23040 ReMemR1、2606.29961 DuoMem、2609.06702 PARSER、2609.11294 Memory Compression、2609.11561 MaP-WAM、2609.11596 EBL-Core。
- 多 Agent 编排:2602.11510 AgentLeak、2608.23740 AgentRoom、2608.10915 ComBodied Agents、2609.02750 Bilevel Coordinated Reflection、2609.04170 DeepMind 100 Gemini Swarm。
- 自演进 / Harness:2608.08311 Ouroboros、2608.03392 Self-Evolving Coding Agents、2609.04094 DRACO、2608.26530 PILOT in the Loop、2608.05108 PIMiner、2608.18613 CTIFoundry、2606.05608 Agentic Engineering 形式化定义、2607.08028 Harness Engineering for Auditable Enterprise LLM Agents。
- 评测与基准:2609.04611 τ²-Bench、2606.05405 Agents' Last Exam、2609.09113 SAEScientist-Bench、2608.28281 LoopArena、2609.04444 HarvestBench、2608.03499 WeClawArena、2608.25417 Paint What You See、2602.22769 AMA-Bench(web_search 补得,待 fetch 核实 PDF §X 主表 + 顶会接收状态)。
- 视频 / 具身 / 世界模型:2607.14187 RxBrain、2608.01049 FactorJEPA、2608.12313 AVA-Encoder、2609.00377 FoldingAgent、2609.04043 MachCSL。
- 安全 / 隐私 / 治理:2608.19857 Inadvertent Context Leakage、2606.00152 PrivacyPeek、2608.06130 Hardware Keystores、2609.06140 Counter-Swarm Doctrine、2608.23670 Automata from Agent Traces、2607.08716 Proactive Memory Agent(web_search 补得,待 fetch 核实 PDF §X 主表)。
⚠️ 立标池仅采用已验证工作(GitHub 已验 / ⚠️ 标注 / abstract 数字 100% 一致 / 顶会接收状态可查)。AMA-Bench(2602.22769 v4)与 Proactive Memory Agent(2607.08716)来自 web_search 补得,仍需 fetch 验证主表与顶会状态;正式升档前保持邻接级。
Spark · 2026-09-12 16:40 CST / 08:40 UTC · W37 综述接力棒 · 反方 v2 三段式按主线分布 5 段 ≥150 字 · 反方 v2 形式标签 15 处(⚠️ × 11 + R1–R5 × 5 − 1 复合标签重叠)· 字数预算 ≤3,900 CJK 硬约束符合 · 立标池仅已验证工作 · 私域污染 SUM=0 · 边界:仅写 surveys/2026-09-12-agent.md