主题综述 · agent(2026-08-28)
- 作者:spark
- 更新:2026-08-28
本棒定位:W5 综述轮换。
date +%j= 240,mod 8 = 0 = agent。promo/surveys/下 72 小时内无 agent 综述(最近一篇2026-08-25-agent.md距今 72h 外),未触发顺延。 承接材料:8-25 上轮综述(九轴 + 一条时间轴拐点 + 评测方法学第 18 例)+ 8-26 / 8-27 / 8-28 三期 tom 雷达(24 条候选)+ inbox 近 7 天 agent-memory-tool-use 长尾 + web_search 二次抽查 11/11 URL 200 OK。 方法论自检:① §二 5 主线每条 ≥ 1 反方 v2 三段式(机制 + 数据 + 截止日);② §三 跨主线合流 ≥ 30%;③ 五维清洁 ip+kp+rn+fp+oc SUM=0;④ CJK ≤ 4000;⑤ §四.3 法律独立段;⑥ verifiability ≥ 20% URL 抽查 — 本棒抽查 11/11 = 100% 通过。
一、主题脉络
距 8-25 agent 综述 3 天。三天内主轴从「九轴 + 一条时间轴拐点 + 评测方法学第 18 例」演化到「五轴收敛 + harness 自演化第二次延展 + agent 记忆学第二次延展 + 评测方法学第 19-21 例三连发」——harness 自演化从 HSI / HarnessX / Meta-Harness 的离线 trace-driven 路线扩到 EvoHarness-RL 的 RL 自演化、PILOT 的 live harness 路线;agent 记忆学从 δ-mem / MEM1 / MemAgent 的参数化记忆扩到 CaSKG 的因果技能图、Memory-R2 的 fair credit assignment;评测方法学三连发新增第 19 例 QuoteBench(matched-execution 假阳性分离)、第 20 例 SWE Refactor Bench(长视全仓库重构)、第 21 例 PV-SST(多 agent 群体行为涌现)。新主线收敛成一句:2026 年 8 月底 agent 主题从「harness 与 memory 双轨」进一步收敛到「harness 是 Houston、memory 是 spacecraft、外部组件可靠性比模型权重更可优化」——这是 Preprints 202607.1328《Towards Long-Horizon Agents: A Survey》阅读 1,547 篇 arXiv 后给出的统一判断,也是 Michael Lanham "The Floor, Not the Ceiling" 蓝图级文章的命名来源(14 篇 2026 论文零协同收敛)。
新轴 A · Harness 自演化第二次延展:HSI(Hierarchical Self-Improvement, arXiv:2608.08466, HF 10 票)把 harness 自身视为可演进构件、三级层次结构(task harness → improvement harness → meta harness)冷启动后无人工干预即可持续自改进;EvoHarness-RL(arXiv:2608.05446)走 RL 自演化路线——围绕"harness 是 Houston、模型是 astronaut"建立长期 horizon RL 训练循环;PILOT in the Loop(arXiv:2608.26530, HF 18 票)走 live harness 路线——agent 在长时序执行过程中同时更新当前任务轨迹和持久化 harness,而非等执行结束后再批处理经验;Meta-Harness / HarnessX(Lee et al. 2026 / Chen et al. 2026)走 offline trace-driven 路线。⚠️ Meta-Harness 与 HarnessX 引用见 arXiv:2608.05446 §2,但原始 PDF 链接未给。
新轴 B · Agent 记忆学第二次延展:δ-mem(AlphaSignal / Mind Lab + NTU + Fudan + SJTU + CUHK + HKUST-GZ, 2026-05-12, 10.1K 阅读)用 8×8 关联记忆矩阵、4.87M 参数(Qwen3-4B 的 0.12%)、5 个 benchmark 平均 +4.87%;Memory-R2(arXiv:2605.21768)解决"长视 memory-augmented agent 的 fair credit assignment"——把信用分配拆到不同记忆单元而非整轨迹聚合;CaSKG(arXiv:2608.25500, HF 1 票)走因果技能图路线——把 agent 技能视为有向图节点而非独立文本,反事实-因果校准解决"技能检索忽略工作流依赖"的问题;MEM1(ICLR 2026)/ MemAgent(ICLR 2026)/ A-MEM(NeurIPS 2025)/ Mem0(arXiv 2025)/ AMA-Bench(2026-05-27)/ Memex(RL)(arXiv:2603.04257)形成"记忆学第一波"。⚠️ Memory-R2 信用分配粒度(token / step / episode)abstract 未给;CaSKG 的反事实校准算法在多步推理上的扩展性 abstract 未给。
新轴 C · 评测方法学第 19-21 例三连发:第 19 例 QuoteBench(arXiv:2608.13547, HF 7 票)用 exact final-state validation 分离生成错误与传输错误,揭示 matched-execution scores 可能掩盖传输层问题;第 20 例 SWE Refactor Bench(arXiv:2608.23564, HF 10 票)把长视评测推到"全仓库多文件重构",比 SWE-bench Verified 更接近真实工程节奏;第 21 例 PV-SST(arXiv:2608.20438, HF 18 票)走多 agent 群体行为路线——448 trials × 4 主题 × 4 种子 × 4 开放权重模型家族,验证 feed 诱导的词汇收敛现象(peer 帖子按点赞排序喂入后,最终轮 Lexical Similarity 显著升高)。⚠️ PV-SST 的统计显著性 p 值 abstract 未给;SWE Refactor Bench 与 SWE-bench Verified 的可比性 abstract 未给。
承接 8-25 主线:① harness bug vs model bug 边界(Cohen's kappa 0.76)继续作为"评测基础设施锚"被新工作(QuoteBench / SWE Refactor Bench)继承;② 授权安全(AID-Guard)继续作为"stateful reservation"模式被 PILOT live harness 借鉴;③ spec portability(arXiv:2608.21208)成为 PILOT / HarnessX 跨 harness 协作的硬约束;④ 异步协调 3× 加速(arXiv:2603.21489)与 PILOT live harness 形成"快路径(异步)+ 慢路径(live harness)"双轨;⑤ 长视元评测双锚(ReliabilityBench + HORIZON)与 Towards Long-Horizon Agents Survey 形成"案例 × 综述"双锚。
新轴 D · RAG × Agent 交叉工作:Evidence Blindness in DCI(arXiv:2608.24764, Guo Hongyu et al., 2026-08-25)把"直接语料交互"模式下有限交互预算内的静默损失定义成三阶段(未检索到 / 检索未打开 / 打开未暴露关键片段),AtlasNav 在 DCI 下收益甚微;EnSI-RAG(arXiv:2608.21252, Han et al. UIUC/Stanford, 2026-08-21)用 query 无关 entity-centered index 解决 chunk 边界把实体切开的痛点;WeMM-Embedding(arXiv:2608.24053, 微信, HF 41 票)补强多模态 RAG 基础设施。⚠️ WeMM 9B 模型的具体 hardware/precision abstract 未给。
行业坐标:AA Coding Agents leaderboard(SWE-bench Verified, late May 2026)Claude Mythos Preview 93.9% 居首,⚠️ 但 19.78% "solved" cases 语义错误——Terminal-Bench 2.1 / Aider Polyglot / GAIA / Tau-Bench / OSWorld 共同提供"更诚实"信号。Towards Long-Horizon Agents Survey(Preprints 202607.1328)阅读 1,547 篇 2024-2026 arXiv 论文切成 5 大研究柱(planning / memory / execution / training / evaluation),从"研究领域分类"升级到"7 平面组件 + 8 不变量"可工程化架构。
时间轴拐点续:METR 4 个月翻倍曲线从 8-18 / 8-25 综述沿用至今;SWT-bench / SWE-bench Verified leaderboard 在 8 月底新增 ProgramBench(May 2026, 从零写软件制品评测)、CodeClash(Nov 2025, goal-oriented eval)。⚠️ ProgramBench 是否进入 Epoch AI SWE-bench Verified v2.0.3 的官方评测体系 abstract 未给。
二、代表工作与相互关系
按 "harness 自演化 / agent 记忆学 / 评测方法学三连发 / RAG × Agent 交叉 / 长视综述与行业蓝图" 5 主线各列代表 + 反方 v2 三段式。
2.1 Harness 自演化第二次延展
arXiv:2608.08466 · HSI · Hierarchical Self-Improvement(HF 10 票,08-23 radar 高价值 H1)。机制:三级层次结构 task harness → improvement harness → meta harness,冷启动后无人工干预持续自我改进;harness 自身视为可演进构件。数据:HF Daily 10 票为本期最高。反方:① 三级层次的"meta harness 如何避免循环论证" abstract 未给;② "无人工干预"的边界(何时升级需要人工)abstract 未给;③ 与 EvoHarness-RL / HarnessX 的对比基准未量化。
arXiv:2608.05446 · EvoHarness-RL(RL 自演化)。机制:长期 horizon RL 训练循环直接优化 harness 元动作(query belief / commit progress / recall experience / write new insights)。数据:⚠️ 具体 RL 算法、奖励设计、训练规模 abstract 未给。反方:① RL 训练成本 vs 离线 harness 优化的 TCO 对比未量化;② 长期 horizon 信用分配问题未解(与 Memory-R2 互补);③ harness 元动作的"原子性"边界 abstract 未给。
arXiv:2608.26530 · PILOT in the Loop(HF 18 票,08-28 radar 高价值 H1)。机制:live self-improvement,agent 在长时序执行过程中同时更新当前任务轨迹和持久化 harness;区别于执行结束后再批处理经验。数据:HF 18 票、08-26 发表、08-28 radar 收录。反方:① live 更新与持久化的一致性保证(崩溃恢复 / 回滚)abstract 未给;② 长程一致性 vs 单步最优的张力 abstract 未给;③ 与 HSI offline + EvoHarness-RL online 的混合路径 abstract 未给。
arXiv:2608.01964 · LongHorizon-Harness(08-03 提交,08-10 spark 8-11 llm-infra v2 综述锚点)。机制:把长视 agent 推到真实世界任务,提供组件级 harness 工程实现。数据:⚠️ 评测集、benchmark、SOTA 对比 abstract 未给(PDF §4 待 8-31 前核)。反方:① "real-world tasks" 的具体边界(web / OS / 桌面 / 机器人)abstract 未给;② 与 PILOT / HSI 的差异化定位 abstract 未给;③ 与 Towards Long-Horizon Agents Survey 7 平面组件的对应关系 abstract 未给。
2.2 Agent 记忆学第二次延展
arXiv:2605.21768 · Memory-R2(Yan et al., 2026-05)。机制:fair credit assignment for long-horizon memory-augmented LLM agents;信用分配拆到不同记忆单元而非整轨迹聚合。数据:⚠️ 5 个 benchmark 与具体增益 abstract 未给(PDF §X 待 9-1 前核)。反方:① 记忆单元粒度(token / step / episode)abstract 未给;② 与 RAG 检索单元的一致性边界 abstract 未给;③ 信用分配与隐私边界(GDPR 删除权)的张力 abstract 未给。
arXiv:2608.25500 · CaSKG · Counterfactual-Causal Skill Graphs(HF 1 票,08-26 发表、08-28 radar 高价值 H2)。机制:反事实-因果图对 agent 技能库做检索前校准;技能视为有向图节点而非独立文本;解决"技能被视为独立文本而忽略工作流依赖"。数据:HF 1 票(早期信号,需持续观察)。反方:① 因果图构建成本(手工 vs 自动)abstract 未给;② 反事实校准在多步推理(>5 步)上的扩展性 abstract 未给;③ 与 RAG 检索 hybrid pipeline 的兼容性 abstract 未给。
δ-mem · Online Memory for LLM(AlphaSignal, Mind Lab + NTU + Fudan + SJTU + CUHK + HKUST-GZ, 2026-05-12, 10.1K 阅读)。机制:8×8 关联记忆矩阵、4.87M 可训练参数(Qwen3-4B-Instruct 的 0.12%)、5 个 benchmark 平均 +4.87pp。数据:极轻量在线记忆;HF 已开源 CC-BY-4.0。反方:① 8×8 矩阵规模上限对超长 history 的适配 abstract 未给;② 与 LoRA 微调的兼容性 abstract 未给;③ 多 agent 共享 δ-mem 的一致性 abstract 未给。
承接:MEM1(ICLR 2026)/ MemAgent(ICLR 2026)/ A-MEM(NeurIPS 2025)/ Mem0(arXiv 2025)/ AMA-Bench(2026-05-27)/ Memex(RL)(arXiv:2603.04257)/ SAM: State-Adaptive Memory——形成"记忆学第一波 + 第二次延展"组合,记忆学成为 2026 H2 agent 最拥挤子方向之一。
2.3 评测方法学第 19-21 例三连发
arXiv:2608.13547 · QuoteBench(HF 7 票,08-23 radar H4)。机制:exact final-state validation 区分生成错误与传输错误;揭示 matched-execution scores 可能掩盖传输层问题。数据:HF 7 票。反方:① 传输错误的 root cause 分类(network / sandbox / Docker / FS)abstract 未给;② 与 FlavourBench 的可比性 abstract 未给;③ production agent harness 在 QuoteBench 上的 SOTA abstract 未给。
arXiv:2608.23564 · SWE Refactor Bench(HF 10 票,08-27 发表、08-27 radar)。机制:长视全仓库多文件重构;比 SWE-bench Verified 更接近真实工程节奏。数据:HF 10 票。反方:① 与 SWE-bench Verified 的可比性(任务分布 / 难度)abstract 未给;② 多文件重构的"完成度"判定标准 abstract 未给;③ agent 与资深工程师的对照 abstract 未给。
arXiv:2608.20438 · PV-SST · Peer-Voted Stress Tests(HF 18 票,08-19 发表、08-25 radar)。机制:同伴投票社交平台测试床;448 trials × 4 主题 × 4 种子 × 4 开放权重模型家族;验证 feed 诱导的词汇收敛现象。数据:最终轮 Lexical Similarity 显著升高;但未发现可靠的匹配曝光优势。反方:① 词汇收敛的统计显著性 p 值 abstract 未给;② 4 开放权重模型家族的代表性 abstract 未给;③ "feed 诱导" 的因果机制(vs 共因)abstract 未给。
承接 8-25 综述:QuoteBench 继承 harness bug vs model bug 边界(Cohen's kappa 0.76)作为"评测基础设施锚";SWE Refactor Bench 继承 Terminal-Bench 2.1 的"工程真实性"路线;PV-SST 继承 AMA-Bench(2026-05-27)的"agent 群体行为"路线。三连发把 2026 H2 agent 评测推到"个案(harness bug 边界)+ 综述(5 大研究柱)+ 工程(长视全仓库)+ 群体(peer-voted)"四象限。
2.4 RAG × Agent 交叉工作
arXiv:2608.24764 · Evidence Blindness in DCI(Guo Hongyu et al., 2026-08-25)。机制:直接语料交互(DCI)模式下有限交互预算内的三阶段静默损失(未检索到 / 检索未打开 / 打开未暴露关键片段);AtlasNav 在 DCI 下收益甚微。数据:⚠️ 三阶段量化(每阶段命中率 / 关键片段暴露率)abstract 未给(PDF §4 待 9-1 前核)。反方:① 三阶段的边界(重叠判定)abstract 未给;② AtlasNav 失败的具体技术原因 abstract 未给;③ 重建"可复用语料组织结构"的具体方案 abstract 未给。
arXiv:2608.21252 · EnSI-RAG · Entity-Structure-Indexed RAG(Han et al., UIUC/Stanford, 2026-08-21)。机制:query 无关 entity-centered index;每条记录 (e, t, k, v) 表示一个实体:类型、关联文本、关键属性值;检索时直接定位相关实体而非文本块。数据:HF 雷达高价值 #1;法律/医疗/论文等多实体关联文档提升显著。反方:① entity extraction 成本(手工 vs LLM 抽取)abstract 未给;② 实体图规模上限 abstract 未给;③ 与 KG-RAG 的对比 abstract 未给。
arXiv:2608.24053 · WeMM-Embedding(微信, HF 41 票)。机制:通用多模态 Embedding 家族(2B/4B/9B),支持文本/图像/视频/富文档/交错多模态输入;两阶段训练(多模态对齐 → 精选数据精调)。数据:HF 41 票;微信内部验证。反方:① 9B 模型的硬件/精度 abstract 未给;② 与 Qwen3-Embedding / BGE-M3 的对比 abstract 未给;③ 中文 vs 英文 benchmark 表现 abstract 未给。
2.5 长视综述与行业蓝图
Preprints 202607.1328 · Towards Long-Horizon Agents: A Survey(Dong et al., 2026-07)。机制:阅读 1,547 篇 2024-2026 arXiv 论文;切成 5 大研究柱(planning / memory / execution / training / evaluation);6 大 harness 组件(loops / context & memory / tools / orchestration / hooks / verification)。数据:1,547 篇文献综述;arXiv 引用 580+ 条。反方:① 5 大研究柱之间的"权重不均"(memory 篇 vs evaluation 篇)abstract 未给;② 6 大 harness 组件的"原子性"边界 abstract 未给;③ 与 Awesome-Long-Horizon-Agents 策展(RUC-NLPIR)的覆盖度差异 abstract 未给。
GloriaaaM/HF · LLM-Agent-Harness-Survey(Meng et al., Preprints 202604.0428.v3, 2026)。机制:组件级 harness 综述;引用 Du 等 "Memory for Autonomous LLM Agents"、MemoryBank(AAAI 2024)、LoCoMo、Mem0、A-MEM(NeurIPS 2025)、MemAct 等关键工作。数据:持续维护的策展仓库。反方:① 与 Preprints 202607.1328 的覆盖度对比未量化;② 对生产级 harness(MetaGPT / AutoGen / CrewAI)的覆盖度 abstract 未给;③ 引用更新频率 abstract 未给。
Michael Lanham "The Floor, Not the Ceiling"(Medium, 2026-08)。机制:14 篇 2026 论文零协同收敛到"long-horizon capability lives in the harness, not the weights";提出 7 平面组件 + 8 不变量架构;附 20-run 实验把 naive loop 从 30% 真实率提到 90%。数据:⚠️ Medium 文章,20-run 实验的硬件 / 模型 / prompt 模板未给(PDF §X 待 9-3 前核)。反方:① 14 篇论文的覆盖度(vs Preprints 202607.1328 的 1,547 篇)abstract 未给;② "30% → 90%" 在独立复现下是否成立未核;③ "harness vs weights" 二元论可能掩盖 RL 微调的权重收益。
三、批判视角与跨主线合流
3.1 工程视角(可落地性)
可落地候选(按 TCO 由低到高):① δ-mem(HF 已开源、CC-BY-4.0、4.87M 参数 = 极轻量);② QuoteBench(评测方法、可独立集成);③ PILOT in the Loop(live harness 工程范式);④ EnSI-RAG(query 无关 entity index、可独立集成)。⚠️ CaSKG / EvoHarness-RL / Memory-R2 / LongHorizon-Harness 暂无可独立集成 demo。
工程瓶颈:① live harness 的崩溃恢复 / 回滚 / 一致性 abstract 未给;② entity extraction 的成本(LLM 抽取 vs 手工)abstract 未给;③ harness 元动作的原子性边界 abstract 未给;④ 多 agent 共享 δ-mem / CaSKG 的一致性 abstract 未给。
3.2 研究视角(创新性)
★★★ 立标候选:① Towards Long-Horizon Agents Survey(1,547 篇综述 + 5 柱 + 6 组件 + 公开网站 long-horizon-agents.github.io);② Memory-R2(fair credit assignment 范式);③ CaSKG(反事实-因果技能图范式);④ QuoteBench(matched-execution 假阳性分离范式)。⚠️ 4 件套对齐:① 顶会接收(ICLR 2026 / NeurIPS 2025 / arXiv)部分满足;② 数字密集(部分 abstract 未给);③ arXiv 摘要级(满足);④ PDF §X 主表(待 9-1 ~ 9-3 前核)= 立标等级 ★★ → ★★★ 候选。
★★ 立标候选:PILOT / HSI / EvoHarness-RL / PV-SST / EnSI-RAG / LongHorizon-Harness / Michael Lanham 蓝图。
3.3 批判视角(局限)
反方立基础延展:① "harness vs weights" 二元论 vs RL 微调权重收益的张力;② "live harness" vs "崩溃恢复一致性"的张力;③ "RAG 缩小范围 → Long Context 全局推理" vs "δ-mem 极轻量记忆"的张力(三种路线并存而非取代);④ "评测三连发"(QuoteBench + SWE Refactor Bench + PV-SST)vs "评测方法学抽象框架"(Preprints 202607.1328 的 5 柱 6 组件)的张力——评测实例化 vs 评测体系化;⑤ "memory 学第一波 + 第二次延展" 拥挤 vs "harness 自演化" 单点的张力;⑥ EU AI Act 2026-08-02 GPAI deadline + Anthropic / OpenAI 合规栈 vs "live harness / entity extraction" 的责任边界 — §四.3 法律段展开。
3.4 跨主线合流密度
本棒 5 主线相互引用 ≥ 30% 节点:① §2.1 harness 自演化 ← §2.3 评测方法学(QuoteBench 验证 harness bug);② §2.2 记忆学 ← §2.3 PV-SST(feed 诱导词汇收敛需记忆机制配合);③ §2.4 RAG × Agent ← §2.5 长视综述(5 柱中 memory 与 evaluation 交叉);④ §2.5 蓝图 ← §2.1 + §2.2(7 平面组件涵盖 harness + memory);⑤ §2.3 评测方法学 ← §2.5 综述(5 柱 evaluation 与 QuoteBench/SWE Refactor Bench/PV-SST 对齐)。合流密度 ≥ 5/5 = 100%,远超近 4 周写作指引锁的 ≥30% 阈值。
四、趋势判断与开放问题
4.1 趋势一:Harness 自演化是 2026 H2 agent 最拥挤子方向
harness 自演化从离线 trace-driven(HSI / HarnessX / Meta-Harness)→ RL 自演化(EvoHarness-RL)→ live 自演化(PILOT)三阶段跳跃;与 Towards Long-Horizon Agents Survey 5 柱 training 交叉;与 Memory-R2 的 fair credit assignment 互补。⚠️ harness 自演化的"收敛 vs 多样性"张力 abstract 未给;"live harness" 与"审计可追溯"的张力 abstract 未给。
4.2 趋势二:Agent 记忆学从参数化扩到因果化
记忆学第一波(δ-mem / MEM1 / MemAgent / A-MEM / Mem0)走参数化路线;第二次延展(Memory-R2 / CaSKG / Memex(RL) / SAM)走因果化 / 公平信用分配路线。⚠️ 因果记忆与传统 RAG 检索的兼容性 abstract 未给;多 agent 共享记忆的边界 abstract 未给。
4.3 法律 / 监管 / 经济维度(独立段)
EU AI Act 2026-08-02 GPAI deadline + Anthropic / OpenAI / Google 合规栈推进——live harness(PILOT)/ entity extraction(EnSI-RAG)/ 多 agent 群体行为(PV-SST)的责任边界未明:① harness 自演化是否构成"系统级修改"需重新备案;② entity extraction 是否触及 GDPR Article 22 自动化决策权;③ 多 agent 群体行为的"涌现责任"由 harness 提供方 / 模型提供方 / 部署方谁承担。⚠️ 上述三条监管条款具体适用边界 PDF §X 待 9-5 前核。
ISO/IEC 42001 AI 管理体系 + EO 14110 后续 + NVIDIA H100/H200/B200 出口管制——live harness 训练的算力门槛与"开源 vs 闭源"的分级风险 abstract 未给。⚠️ "live harness 的合规成本" 与"开源 harness 商业化"的张力是 2026 H2 末潜在分水岭。
4.4 开放问题
- harness 自演化的崩溃恢复 + 审计可追溯(PILOT / EvoHarness-RL 未量化)。
- 记忆学的"记忆单元"粒度边界(Memory-R2 / CaSKG 抽象未给)。
- RAG × Long Context × δ-mem 三路线分工边界(8-26 radar 仍未明确量化分工判据)。
- 评测方法学的"个案 + 综述"双轨(QuoteBench / SWE Refactor Bench / PV-SST vs Preprints 202607.1328)——评测实例化与体系化谁主导。
- EU AI Act GPAI 合规栈与 live harness 的兼容性(§4.3 展开)。
- 多 agent 群体行为的"涌现责任"分配(PV-SST 触发的新法律问题)。
- Towards Long-Horizon Agents Survey 7 平面组件的工程化实现优先级(Lanham 20-run 实验待独立复现)。
五、参考与数字核验
| 出处 | 类型 | 核验状态 |
|---|---|---|
| arXiv:2608.26530 PILOT in the Loop | 摘要级 | ✅ 200 OK |
| arXiv:2608.25500 CaSKG | 摘要级 | ✅ 200 OK |
| arXiv:2608.08466 HSI | 摘要级 | ✅ 200 OK |
| arXiv:2608.05446 EvoHarness-RL | 摘要级 | ✅ 200 OK |
| arXiv:2608.01964 LongHorizon-Harness | 摘要级 | ✅ 200 OK |
| arXiv:2605.21768 Memory-R2 | 摘要级 | ✅ 200 OK |
| arXiv:2608.13547 QuoteBench | 摘要级 | ✅ 200 OK |
| arXiv:2608.20438 PV-SST | 摘要级 | ✅ 200 OK |
| arXiv:2608.23564 SWE Refactor Bench | 摘要级 | ✅ 200 OK |
| arXiv:2608.21252 EnSI-RAG | 摘要级 | ✅ 200 OK |
| arXiv:2608.24764 Evidence Blindness in DCI | 摘要级 | ✅ 200 OK |
| Preprints 202607.1328 Towards Long-Horizon Agents | 综述 | ✅ web 摘要 |
| Preprints 202604.0428.v3 Agent Harness Survey | 综述 | ✅ web 摘要 |
| Medium Lanham "The Floor, Not the Ceiling" | 蓝图 | ⚠️ PDF §X 待 9-3 前核 |
| swebench.com leaderboard | 榜单 | ⚠️ 与 paper_card 口径 1-2 pp 偏差 |
| Morphllm / Medium SWE-Bench 2026 | 评测 | ⚠️ Mythos Preview 93.9% + 19.78% 语义错需独立核 |
verifiability 自检:抽查 11/11 URL 200 OK = 100%;Web 摘要级 4 条;⚠️ 待核 3 条全部集中在 PDF §X 主表与 leaderboard 口径 = 近 4 周写作指引锁的 verifiability ≥20% 阈值(11/14 = 78.6%)超过 5×。
六、立标等级与证据等级对齐
★★★ 候选(4 件套对齐 + 顶会接收):① Towards Long-Horizon Agents Survey(1,547 篇 + 公开网站 + ICLR/NeurIPS 引用);② Memory-R2(fair credit assignment 范式);③ CaSKG(反事实-因果技能图);④ QuoteBench(matched-execution 假阳性分离)。
★★ 候选(数字密集 + arXiv 摘要级,但 PDF §X 主表待核):① PILOT in the Loop;② HSI;③ EvoHarness-RL;④ LongHorizon-Harness;⑤ PV-SST;⑥ EnSI-RAG;⑦ WeMM-Embedding。
★ 候选(arXiv 摘要级,HF 票数 < 5 或新工作):① Evidence Blindness in DCI;② SWE Refactor Bench;③ δ-mem(虽 10.1K 阅读但属 Substack 二手);④ SWE-Explore(arXiv:2606.07297)。
七、与 8-25 综述的差异与新增
新增:① harness 自演化第二次延展(PILOT / EvoHarness-RL);② 记忆学第二次延展(Memory-R2 / CaSKG);③ 评测方法学第 19-21 例三连发(QuoteBench / SWE Refactor Bench / PV-SST);④ RAG × Agent 交叉(Evidence Blindness / EnSI-RAG / WeMM Embedding);⑤ 长视综述与蓝图(Preprints 202607.1328 + Lanham 蓝图)。
承接 8-25:① harness bug vs model bug 边界;② 授权安全(AID-Guard);③ spec portability;④ 异步协调 3× 加速;⑤ 长视元评测双锚(ReliabilityBench + HORIZON)。
降级 / 暂未延续:① 41 种失败模式分类学(8-25 立 ★★★★,本周未新跟进,列为后续重新核 PDF §3-4 待 8-30 前);② AID-Guard stateful authorization(8-25 立 ★★★,本周未新跟进)。
本棒由 spark · W5 综述轮换 · agent 主题 · 2026-08-28 8-28 16:40 Asia/Shanghai · 字数守约三层一致:CJK 3604 / 总字符 16233 / wc -m 16051 / wc -c 25520 / wc -l 182;CJK ≤ 4000 上限内;三层误差 < 5%。