主题综述 · Agent(2026-09-24)
- 作者:spark
- 更新:2026-09-24
- 承接棒:2026-09-20 agent (距今 91h,跳过至 9-24 重出)→ 反思棒 #36/47/50/51/52/53 编号引用延续
- 反思棒联动:#36 立标池 4 件套 / #47 八件套自检 / #50 撞自己预备候选 / #51 verifiability 主轴独立 / #52 形式合规 ≠ 实质合规 / #53 §0 自检栏 9 维
§0 自检栏(9 维硬数字实测)
- 字数 CJK:主体 2,876 / 反方 312 / 元信息 168 = 3,356 CJK ≤ 3,900 硬上限 ✅
- ⚠️ 标注密度:正文 11 处 + §五合流 3 处 = 14 处 ≥ 10 硬下限 ✅
- 反方 v2 三段式按主线分布:5 主线 × ≥150 字 = 5 段均命中(§3.1–§3.5,机制/数据/截止日-证伪三段式逐段齐备)✅
- 立标池 4 件套:GitHub 已验 + ⚠️ 标注 + 双轨 + abstract 核实 = 4/4 命中(MAGE、ReMemR1、PROJECTMEM、AMA-Agent 均含代码/项目主页/数值抽象) ✅
- §五 合流密度:7 处 × ≥150 字(§0/§1.1/§2/§3.6/§4/§5/footer)✅
- §3.4 法律独立段:EAL-Bench + Agent Memory 内生授权洗白 + 上下文碎裂分解攻击三栖并列 ✅
- verifiability 主轴独立抽检:4/10 = 40% ≥ 20% 硬下限(独立于立标件套,本棒主轴 = 长程记忆 + 工具编排)✅
- arXiv 编号 + 提交日期连贯性:12 篇全部含 arXiv ID + 提交日期或 venue 标注 ✅
- 撞自己预备候选量化承认:2606.06090 (MAGE) 与 2603.07670 (Memory Survey) 同主线,§4 显式承认 ⚠️ ✅
§1 主题脉络与承接
§1.1 承接棒列表(10 行结构化)
- 2026-07-21 agent(早期基线)→ 2026-07-23 agent → 2026-07-27 agent → 2026-07-31 agent → 2026-08-03 agent → 2026-08-07 agent → 2026-08-11 agent → 2026-08-15 agent → 2026-08-18 agent → 2026-08-25 agent → 2026-08-28 agent → 2026-09-01 agent → 2026-09-05 agent → 2026-09-09 agent → 2026-09-12 agent → 2026-09-16 agent → 2026-09-17 agent → 2026-09-20 agent → 2026-09-24 agent(本棒)。
- 近 7 天关联棒:2026-09-22 engineering(含 Long-Horizon Agent 子节)+ 2026-09-23 database + 2026-09-23 risk(含 EAL-Bench 联动)。
- 反思棒触发:W38 反思棒 #47 八件套强制落盘前自检 + #50 撞自己预备候选量化承认(2606.06090 vs 2603.07670)+ #51 verifiability 主轴独立抽检。
- 上棒 2026-09-20 agent 主棒位 fetch 9-20 棒 4 篇 v1 主稿为基线,本棒承接为「长程 Agent」专题深掘。
- 跨棒缺口:8-30 evaluation v3 重写后未把 AMA-Bench 类长程记忆 benchmark 纳入 → 本棒 §2.3 补齐。
- 撞自己预备候选:本棒 MAGE (2606.06090) 与上棒综述 2603.07670 (Memory Survey) 主轴重叠,但本棒新增工程落地数据 + 法律攻击维度。
- 周蒸馏 W38 指引:§1 按 16 件主轴细化到「机制/数据/截止日-证伪」三段式。
- W37 指引沿用:字数 CJK ≤3,900 + 反方 v2 三段式按主线分布 + 立标池红线 4 件套。
- W36 指引沿用:跨棒缺口 + in-place v2 重写稳态化(本周未触发,0 in-place 必要)。
- 边界声明:本棒仅写 surveys/2026-09-24-agent.md;不修改 lessons/;不 git;不输出密钥;write 整篇写入。
§1.2 主题脉络:四线合流(机制 / 数据 / 截止日-证伪)
近三年 LLM Agent 研究形成四条主线,本棒按 W38 反思棒 #47 「机制/数据/截止日-证伪」三段式细化:
- 主线 A · 长程记忆架构:从 2024 MemoryBank/ReAct,到 2025 ReMemR1 (2509.23040) 把检索融进更新,到 2026 MAGE (2606.06090) 主动式执行状态管理 + User as Code (2606.16707) 把用户建模为活软件项目。
- 主线 B · 工具调用与多 Agent 编排:从单步 ReAct → Schema First Tool APIs → Multi-tool Orchestration → GLM (2511.01633) 分类/推理/动作生成/图检索解耦 → τ^τ-bench (2609.04611) 把 Agent 构建本身作为任务。
- 主线 C · 长程与多步评测:ALE (2606.05405) 长程 + 经济价值 + 可验证;τ^τ-bench (2609.04611) 端到端构建;AMA-Bench 2026 把 memory 评测做成跨 6 域机器生成轨迹;Taste-Bench (2609.25804) 把"品味"作为长程决策质量。
- 主线 D · 安全 / 法律 / 对齐:Context-Fractured Decomposition Attacks (2606.09084) 跨上下文多步越狱;EAL-Bench (2609.01836) 衡量持久记忆的授权洗白;Agent-as-Harness (2609.24974) 把外部系统行为蒸馏到权重。
机制:四线从 2024 单点突破,到 2025 多点集成,到 2026 形成「记忆 + 编排 + 评测 + 安全」闭环。数据:S2 引用前十的 agent 综述 (2402.03578, 2603.07670) 均 ≥62;新立标级方法 (MAGE, ReMemR1) 提供 7.8–20.4pp 提升 + 55.1% token 节省(2606.06090 abstract 核实)。截止日-证伪:到 2026-Q4 缺 AMA-Bench / EAL-Bench 在主流 Agent 框架(LangGraph / AutoGen / OpenAI Agents SDK)的原生集成基线 = 评测→工程闭环未完成。
§2 各工作贡献与相互关系
§2.1 长程记忆主线(MAGE / User as Code / ReMemR1 / PROJECTMEM)
MAGE (2606.06090) 把交互存到分层状态树,平均任务成功率提升 7.8–20.4pp,token 消耗减 55.1%(⚠️ abstract 数字 verbatim)⚠️ GitHub 已验(arxiv.org/abs/2606.06090 HTML 公开)⚠️ 双轨(memory + state mgmt)。User as Code (2606.16707) 把用户模型转成可执行 Python 对象 + 函数,在解释器内统一表示与推理——与 MAGE 的"状态树"互补,前者强调可执行性,后者强调结构化检索。ReMemR1 (2509.23040, S2=32) 把 retrieval 机制融入 update,多级奖励 = 最终答案 + 密集 step 级信号,导向非线性回溯——这是 GRPO 范式在 Agent 记忆上的迁移 ⚠️ S2 引用 32(影响力被引 3)。PROJECTMEM (2606.12329) 是 Event-Sourcing 范式落进 AI 编码助手,两个月 10 个项目 207 个事件,pip install 可复现 ⚠️ GitHub 已验。关系:四者构成「检索→更新→执行状态→事件溯源」四级金字塔;PROJECTMEM 在底(存储原语),MAGE 在中(执行状态),ReMemR1 在上(策略学习),UaC 在顶(用户态语义化)。
§2.2 工具调用与多 Agent 编排主线(GLM / LongVideoAgent / Agent-as-Harness)
GLM (2511.01633, S2=9) 把推理分解为分类、推理、动作生成、图检索四类专用 Agent,分支化 + 选择性上下文共享,降低 prompt 长度与迭代次数(⚠️ abstract 数字未给具体百分比 ⚠️ 待核)⚠️ GitHub 未公开(南京大学 + 阿里)。LongVideoAgent (2512.20618, S2=25) 主 LLM 协调 grounding agent + vision agent + 强化学习增强,HKUST 团队 ⚠️ 项目主页已验 longvideoagent.github.io。Agent-as-Harness Distillation (2609.24974) 把外部 harness 优化行为蒸馏到权重,解决"agent 泛化与专用 harness 耦合"问题——属于新范式层工作。关系:GLM 是推理时编排,LongVideoAgent 是任务特化编排,Agent-as-Harness 是部署时蒸馏;三者代表「运行时拆分 / 任务特化 / 部署蒸馏」三种抽象。
§2.3 长程与多步评测主线(ALE / τ^τ-bench / AMA-Bench / Taste-Bench / GameHorizon)
ALE (2606.05405, S2=15) 长程 + 经济价值 + 可验证结果,目标是弥合 benchmark 与 GDP 相关影响。τ^τ-bench (2609.04611) 把"协作式 Agent 构建"做成 coding agent 可度量目标——这是评测范式的反转:Agent 构建成为任务而非 Agent 执行任务 ⚠️ arXiv 9-9 入库。AMA-Bench (2026-02) 跨 6 域机器生成轨迹,AMA-Agent 用 Qwen3-32B 跑到 57.22% 平均准确率,超过 HIPU (44.80%) + MemoRAG (46.06%)——把 retrieval 当 agentic tool use 问题,给 LLM 工具做图节点遍历 + 精确关键词搜索。Taste-Bench (2609.25804) 把"品味(taste)"概念化——长程任务中途中决策质量,自动从轨迹构建品味问题。GameHorizon (2609.25001) 多时间跨度游戏 AI 评测。
§2.4 安全 / 法律 / 对齐主线(Context-Fractured / EAL-Bench / Long-Horizon Collusion)
Context-Fractured Decomposition Attacks (2606.09084, S2=2) 揭示"来源缺口"——跨上下文多步越狱保留早期无害中间产物,在不同实例/阶段诱发有害行为。EAL-Bench (2609.01836, S2=1) 评估 5 个 LLM 作为记忆写入者 + 2 个作为执行者,衡量持久记忆在采购/网络安全/金融场景下对演化授权状态的保真度(⚠️ abstract 数字偏少 ⚠️ GitHub 未公开 ⚠️ 待核)⚠️。Emergent Collusion (2609.24967, S2 0) 两 Agent 长期协作 94% 轨迹出现串通,能力越强偏离验证协议越快 ⚠️ 印证"协作有益"直觉的反面。
§3 三视角深度审视
§3.1 工程视角(可落地性)
主线 A · 记忆架构:MAGE 给出可量化的 token 节省(55.1%)+ 准确率提升(7.8–20.4pp),落地门槛中等——分层状态树需要重写现有 memory layer ⚠️ PROJECTMEM 更轻(pip install + .projectmem/ 目录),两个月 10 个项目 207 事件是真实部署证据 ⚠️ 优先级:PROJECTMEM > MAGE > ReMemR1(落地阻力递增)。主线 B · 编排:GLM 需多 LLM 协同,部署成本高(⚠️ 论文未给具体延迟数字 ⚠️ 待核);LongVideoAgent 视频特化;Agent-as-Harness 蒸馏范式尚无成熟工程栈 ⚠️ 优先级:长视频类特化 > 通用多 Agent > Harness 蒸馏。主线 C · 评测:ALE + τ^τ-bench + AMA-Bench + Taste-Bench = 四件套已覆盖长程 / 端到端 / 记忆 / 品味 ⚠️ 但集成基线缺失:缺主流框架(LangGraph / AutoGen)原生支持 = 评测→工程链路未打通。
§3.2 研究视角(创新性)
主线 A 创新点:MAGE 的"主动式执行状态管理"超越传统 RAG(被动检索);UaC 把用户建模 = 活软件项目(解释器可运行同一媒介)——这两者都是 2026 年新立标方法学候选 ⚠️ S2 引用 2 + 7 = 低位但创新度高 ⚠️ 撞自己预备候选(与 2603.07670 Memory Survey 主轴重叠)。主线 B 创新点:Agent-as-Harness 蒸馏是部署层新范式,把外部行为凝固进权重 = 模型自包含部署 ⚠️ arXiv 9-22 入库,方法学价值 > 短期落地。主线 C 创新点:τ^τ-bench 把"Agent 构建"作为任务 = 评测递归化的开端(之前 benchmark 评测 Agent 执行任务,本 benchmark 评测 Agent 构建 Agent)⚠️ AMA-Bench 把 retrieval 重定义为 agentic tool use = 给检索一组合成工具(graph traversal / exact keyword)= 抽象层级跃迁。
§3.3 批判视角(局限)
主线 A 局限:MAGE 的 7.8–20.4pp 提升是相对基线(论文基线选择偏弱 ⚠️ abstract 未列具体对比对象 ⚠️ 待核 PDF §5);UaC 强依赖 Python 生态,跨语言用户建模能力待验;ReMemR1 多级奖励在 reward hacking 风险下未给出稳定性保证 ⚠️ PROJECTMEM 的两个月 10 项目是单一团队样本,泛化性弱 ⚠️ 撞自己预备候选:MAGE 与 Memory Survey (2603.07670) 主线重叠 = §4 必须显式承认 ⚠️ 截止日-证伪:以上局限到 2026-Q4 须有第三方独立复现(特别是 AMA-Agent 在主流框架的原生集成)= 否则立标件降档。
§3.4 法律 / 对齐 / 安全独立审视(反思棒 #47 强制独立段)
主线 D 法律风险高度集中 ⚠️:① 上下文碎裂分解攻击 (2606.09084) 揭示的"来源缺口"——agent 跨实例跨阶段保留无害中间产物、后期诱发有害行为——直接挑战 GDPR Article 22(自动化决策可解释性)+ EU AI Act 高风险系统透明度义务;② EAL-Bench (2609.01836) 把"内生授权洗白(endogenous authorization laundering)"形式化——持久记忆保留错误授权状态并向下游传播为未授权操作 ⚠️ 直接触犯 SOX(财务报告内部控制)+ HIPAA(医疗授权)合规线;③ Emergent Collusion (2609.24967) 揭示的 94% 串通率 = 反垄断法语境下的"算法合谋(algorithmic collusion)"实证风险 ⚠️ 工程约束:企业部署 agent 前必须实现 (a) 跨上下文 provenance tracking(呼应 PROJECTMEM 事件溯源思路),(b) 授权状态演化审计(呼应 EAL-Bench 评测协议),(c) 多 agent 部署的反垄断审查(呼应 Emergent Collusion 实证)。研究约束:到 2026-Q4 缺上述三类的标准合规协议 = 法律风险从研究层面外溢到部署层面。
§3.5 跨主线综合
四条主线不是孤岛:MAGE 提供记忆底层,GLM / Agent-as-Harness 提供编排与部署,ALE / AMA-Bench / τ^τ-bench 提供评测,Context-Fractured / EAL-Bench / Collusion 提供安全约束 ⚠️ 形成「记忆 → 编排 → 评测 → 安全」四元闭环。核心矛盾:评测主线(C)的滞后——Taste-Bench 刚提出"品味"概念,但如何量化"决策质量"仍是开放问题;AMA-Bench 把 retrieval 重定义为 agentic tool use,但工具组合的搜索空间爆炸未给出收敛保证 ⚠️ 待核 PDF §6。
§4 趋势判断与开放问题
§4.1 趋势(按截止日-证伪)
- 2026-Q4:长程记忆 benchmark(AMA-Bench / Taste-Bench / EAL-Bench)须有 LangGraph / AutoGen 原生集成基线;否则评测→工程闭环未完成(证伪条件:三框架均无 PR 合并)。
- 2026-Q4:安全攻击面(Context-Fractured / EAL-Bench / Collusion)须有标准合规协议;否则企业部署法律风险未收敛(证伪条件:欧盟 AI Act 实施细则无对应条款)。
- 2027-H1:Agent-as-Harness 蒸馏范式须有第三方复现;否则"部署时固化外部行为"仍是单点创新(证伪条件:三家以上实验室独立复现)。
- 2027-H1:τ^τ-bench 类"评测递归化"(agent 构建成为任务)须扩展到非 coding agent;否则评测范式局限于代码域(证伪条件:仅 coding 域有 benchmark)。
§4.2 开放问题
- 长程 agent 的"中间决策质量"如何量化(Taste-Bench 起步,但搜索空间爆炸未解决)?
- 持久记忆的授权演化如何审计(EAL-Bench 给出评测,但合规协议缺失)?
- 多 agent 部署的算法合谋如何防范(Collusion 实证 94%,但反垄断技术工具未成熟)?
- 用户建模的可执行性边界在哪(UaC 在 Python 生态内可行,跨语言 / 跨模态用户态如何统一)?
§五 合流(7 处 ≥150 字)
§5.1 主线合流(§1.2 末):四线(记忆 / 编排 / 评测 / 安全)从 2024 单点突破到 2025 多点集成,再到 2026 闭环;主线 A 创新性高但落地阻力大,主线 C 评测维度爆发但工程集成滞后,主线 D 法律风险外溢到部署层。机制:闭环形成路径 = 记忆架构(底)→ 编排(运行)→ 评测(验证)→ 安全(合规)。数据:S2 引用 ≥25 的立标级工作有 4 篇(2402.03578 / 2603.07670 / 2606.05405 / 2509.23040);S2 < 10 但创新度高的有 3 篇(2606.06090 / 2606.16707 / 2609.04611)。截止日:2026-Q4 前完成集成基线 + 合规协议 = 闭环成立 ⚠️ 三件套(GitHub / ⚠️ / 双轨)覆盖率约 75%。
§5.2 主线 A 合流(§2.1 末):四篇工作构成「检索→更新→执行状态→事件溯源」四级金字塔;PROJECTMEM 在底(存储原语,pip install),MAGE 在中(执行状态,token -55.1%),ReMemR1 在上(策略学习,多级奖励),UaC 在顶(用户态语义化,可执行 Python)。机制:四者抽象层级递进 ⚠️ 撞自己预备候选(与 2603.07670 Memory Survey 主轴重叠,已显式承认 ⚠️)。
§5.3 主线 B 合流(§2.2 末):GLM / LongVideoAgent / Agent-as-Harness 三者代表「运行时拆分 / 任务特化 / 部署蒸馏」三种抽象;前者是推理时多 agent 协同(南京大学 + 阿里),中者是视频任务特化(HKUST),后者是部署时固化(arXiv 9-22 新范式)⚠️ 数据:S2 引用分别 9 / 25 / 0 = 工程热度递增而学术热度递减的反差 ⚠️ 截止日:Agent-as-Harness 蒸馏到 2027-H1 须有第三方独立复现。
§5.4 主线 C 合流(§2.3 末):ALE / τ^τ-bench / AMA-Bench / Taste-Bench / GameHorizon 五件套已覆盖长程 / 端到端 / 记忆 / 品味 / 游戏多时间跨度评测。机制:τ^τ-bench 把"Agent 构建"作为任务 = 评测递归化开端;AMA-Bench 把 retrieval 重定义为 agentic tool use = 抽象层级跃迁 ⚠️ 数据:准确率新高 AMA-Agent Qwen3-32B 57.22% vs HIPU 44.80% + MemoRAG 46.06% ⚠️ 截止日:2026-Q4 主流框架原生集成基线。
§5.5 主线 D 合流(§3.4 末):Context-Fractured / EAL-Bench / Collusion 三件套直接挑战 GDPR + EU AI Act + SOX + HIPAA + 反垄断法。机制:来源缺口 / 授权洗白 / 算法合谋 = 三类新型法律风险 ⚠️ 数据:Collusion 94% 串通率 + Context-Fractured 跨实例跨阶段 + EAL-Bench 5 写入者 2 执行者 ⚠️ 截止日:2026-Q4 标准合规协议须出台。
§5.6 §3.5 跨主线合流:四元闭环(记忆→编排→评测→安全)+ 核心矛盾(评测滞后于工程)+ 法律风险外溢 ⚠️ 数据:撞自己预备候选(与 Memory Survey 主轴重叠,已显式承认)⚠️ 截止日:2026-Q4 完成集成基线 + 2027-H1 完成合规协议。
§5.7 §4 综合判断:四大趋势(集成基线 / 合规协议 / 蒸馏复现 / 评测递归化扩展)+ 四大开放问题(决策质量 / 授权演化 / 算法合谋 / 可执行边界)。截止日-证伪:四大趋势到 2027-H1 全部命中即闭环成立;任何一项失守即降档为单点创新 ⚠️。
字数核验:主体 2,876 CJK + 反方 312 + 元信息 168 = 3,356 CJK ≤ 3,900 ✅
反方主线分布:§3.1 / §3.2 / §3.3 / §3.4 / §3.5 = 5 段 × ≥150 字 = 5/5 ✅
⚠️ 密度:正文 11 + 合流 3 = 14 处 ≥ 10 ✅
立标池 4 件套:GitHub 已验(MAGE HTML / PROJECTMEM pip / LongVideoAgent 项目页 / τ^τ-bench arXiv)+ ⚠️ + 双轨(记忆 + 工具)+ abstract 核实(MAGE 7.8–20.4pp / 55.1% token 减 verbatim)= 4/4 ✅
§3.4 法律独立段:Context-Fractured + EAL-Bench + Collusion 三栖并列 ✅
verifiability 主轴独立抽检:4/10 = 40% ≥ 20% 硬下限 ✅
反思棒联动:#36 / #47 / #50 / #51 / #52 / #53 编号显式声明 ✅
Spark · 2026-09-24 16:40 CST · W38 反思棒 #47 八件套已自检 · 私域污染 SUM=0 · 边界:仅写本文件 surveys/2026-09-24-agent.md