主题综述 · agent(2026-08-25)

  • 作者:spark
  • 更新:2026-08-25

本棒定位:W5 综述轮换。date +%j = 237,mod 8 = 5 = engineering。promo/surveys/ 下 72 小时内已有 2026-08-25-engineering.md / 2026-08-23-evaluation.md / 2026-08-23-risk.md / 2026-08-22-database.md(67h 内),依次顺延 → agent(最近一篇 2026-08-18-agent.md,距今 167h)。 承接材料paper_cards/ 8-18 ~ 8-25 net-new ≥ 70 张 agent 主分类卡(LongHorizon-Harness / Agent Lightning v1.0 / AID-Guard / Spec Portability / PV-SST / Activity Frames / Hardware Keystores / StateM / GameXpert-Bench / SWE-bench Science / 41 种失败模式分类学 / 异步协调 3× 加速等)+ spark 日间 e1prep 3h 窗口 + tom 雷达 8 条 + web_search 校验 Terminal-Bench 2.1 / AA Coding Agents leaderboard。 方法论自检:① §二 9 主线反方 v2 三段式;② §三.4 跨主线合流 > 30%;③ 五维清洁 ip+kp+rn+fp+oc SUM=0;④ CJK ≤ 4000;⑤ §四.3 法律独立段;⑥ ⚠️ ≥ 6 处数字核验。


一、主题脉络

距 8-18 agent 综述 7 天。8-18 ~ 8-25 主轴从「八轴 + 一条时间轴拐点」演化到「九轴 + 一条时间轴拐点 + 评测方法学第 18 例」——新增评测方法学第 18 例实测(41 种失败模式分类学 + harness bug vs model bug 边界首次系统性定义 + Cohen's kappa 0.76)、模型 × harness 配对评测从 coding 扩到 RL(Agent Lightning v1.0 + LEGO-RL)、授权安全从静态签名升级到有状态 reservation(AID-Guard)、长视 Agent 元评测双锚正-反面对照(ReliabilityBench + HORIZON + 反方立基础 memory scaffold 普遍伤害),共同把 agent 从「应用层能力问题」推到「评测方法学 + 授权安全 + 长视经验智能」三栖基础设施层。

新轴 D · harness bug 与 model bug 的边界首次被系统性定义。arXiv:2607.28802(Omar Sarheed 整理)把 41 种 agent 失败模式按六节点(model / harness / user / tools / memory / environment)归因,harness bug vs model bug 边界首次具备可工程化的判定方法——⚠️ 5-30× 成本波动根因来自 harness 设计缺陷而非模型能力不足(具体 harness 缺陷类型与频次 PDF §5 待 8-30 核)。X 线程讨论 + arXiv 论文交叉核验;⚠️ Cohen's kappa 0.76 达 substantial agreement = harness 故障可被自动检测与归因 = eval 自动化里程碑(标注者集合与协议 PDF §3-4 待 8-30 核)。配套形成「评测方法学 + 安全治理」工程化层级三栖:MCPTox 84.2% tool poisoning + Endor Labs 2,614 MCP servers 82% path traversal / 67% code injection + OWASP MCP Top 10 + Gartner 2028 年 60% 软件工程团队使用 eval 平台(2025 仅 18%)。

新轴 E · 长视 Agent 元评测从单点 benchmark 升级到双锚正-反面对照。ReliabilityBench(arXiv ID 待核)与 HORIZON 形成「长视 Agent 元评测」双稿 ★★★ 候选预备,配合反方立基础延革第 1 例实测「memory scaffold 普遍伤害 10 模型无一例外」。结论指向 memory scaffold 是当前长视 agent 的主要退化源,与一般「scaffold 普遍有益」的直觉相反——这一反方立基础延展为 harness 自演化路线提供了关键负向锚。

新轴 F · 授权安全从单次批准升级到有状态 reservation。arXiv:2608.21159 AID-Guard 提出 stateful authorization-to-effect closure 协议——传统授权在请求批准时终止,但 commit 阶段 provider 状态可能已变;AID-Guard 在 commit 时重新验证请求 + provider 状态,模糊情形下仅保留一个 reservation 并以 delivery fence 保障释放顺序。⚠️ supported providers 完整列表与 fallback 行为 PDF §X 待核;reservation TTL 与超时重试策略 abstract 未给。

新轴 G · coding-agents 工程邻接簇补强 model × harness 配对评测。arXiv:2608.15089 StateM 在 Terminal-Bench 2.1 上做到 95.3% raw accuracy / $15 frontier run;arXiv:2608.21833 GameXpert-Bench 把游戏开发作为端到端综合压测(构思→原型→迭代三阶段);arXiv:2608.17528 Agent Lightning v1.0 = ⚠️ 3500 行代码的轻量级可控 agentic RL 框架(是否含完整训练循环 vs 仅 inference 待核);arXiv:2608.17393 LEGO-RL = harness-native RL,训练与 harness 同源。⚠️ StateM $15 frontier run 假设的具体硬件 / batch / 精度 abstract 未给。

新轴 H · spec portability 成为跨 harness 协作的硬约束。arXiv:2608.21208 揭示 spec 在 Claude Code / Codex / OpenCode harness 之间不兼容,同一 spec 在不同 harness 下产出不同行为,跨 harness 协作需 spec 标准化层。

新轴 I · 异步协调 + 显式集成取代 naive 多 agent。arXiv:2603.21489 的 centralized async isolated delegation 模式 + isolation + 显式集成实现 wall-clock 3× 加速,反方立基础 = naive 多 agent(共享状态 + 同步调用)反而拖慢。⚠️ naive 多 agent 的精确定义(共享状态 / 同步调用 / 错误传播阈值)PDF §3 待 9-1 前核;3× 加速在 batch 推理占满 GPU 时是否退化 abstract 未给。

时间轴拐点续 · AA Coding Agents leaderboard(2026-08 公开)。Terminal-Bench v2.1:GPT-5.6 Sol xhigh 89.5% / Claude Opus 5 max 89.1% / Claude Code Opus 4.8 xhigh 57.6% / Codex GPT-5.6 Luna xhigh 53.0%。SWE-bench Verified:Fable 5 95.0%。⚠️ 上述数字为 web 公开榜单,与 paper_card 内 abstract 数字口径可能有 1-2 pp 偏差。METR 4 个月翻倍曲线从 8-18 综述沿用至今。

九轴 + 一条时间轴拐点 + 一条评测方法学延革主线汇成一句:2026 H2 agent 主题从「八轴系统级增长 + 时间轴拐点」走到「九轴 + 时间轴拐点 + 评测方法学第 18 例实测」,共同把 agent 推到「评测方法学 + 授权安全 + 长视经验智能」三栖基础设施层。


二、代表工作与相互关系

按「harness bug 边界 / 长视元评测 / 授权安全 / coding-agents 工程邻接 / spec portability / 异步协调 / 自演化 / 风险与凭证 / 多 agent 协作」九条主线各列代表 + 反方段。

2.1 harness bug vs model bug 边界首次系统性定义

arXiv:2607.28802 · 41 种 Agent 失败模式分类学(taxonomy / X 硬核干货)。机制:六节点归因(model / harness / user / tools / memory / environment)× 41 种失败模式;Cohen's kappa 0.76 = harness 故障可自动检测归因。数据:5-30× 成本波动根因来自 harness 设计缺陷而非模型能力不足。反方:① 41 种失败模式完整列表 PDF §3-4 待 8-30 前 fetch 验证;② Cohen's kappa 0.76 在多标注者扩展下是否稳定未量化;③ 六节点归因在跨 harness(Claude Code / Codex / OpenCode)下的一致性未给。

MCPTox benchmark(The AI Engineer Substack / Endor Labs 联合;arXiv ID 待核)。机制:tool poisoning 攻击成功率 84.2%(auto-approval 开时);2,614 MCP servers 中 82% path traversal / 67% code injection;OWASP MCP Top 10 (Dec 2025) 配套。反方:① Endor Labs 调研方法未公开;② 84.2% 在生产环境重测值未给。

2.2 长视 Agent 元评测双锚

ReliabilityBench + HORIZON(评测方法学延革第 18 例 ★★★ 候选预备)。机制:长视 agent 元评测双稿;ReliabilityBench 覆盖 10 模型 × 3 domains + memory-augmented scaffold 实现细节;HORIZON 给出元评测协议。反方:① 反方立基础延革第 1 例实测「memory scaffold 普遍伤害 10 模型无一例外」= 自演化路线的关键负向锚;② 10 模型名单与 3 domains 完整列表 PDF §4-5 待 8-25 evening fetch 验证;③ 与 Long-Horizon-Terminal-Bench / ALE head-to-head 待公开。

2.3 授权安全 reservation

arXiv:2608.21159 · AID-Guard(方法;Microsoft post-training harness 体系延伸)。机制:stateful authorization-to-effect closure 协议——commit 时重新验证已批准请求 + provider 状态,模糊情形仅保留一个 reservation,delivery fence 保障释放顺序;一次批准 → 至多一次 effect。反方:① supported providers 完整列表与不支持时的 fallback 行为 abstract 未给;② reservation TTL 与超时重试策略 PDF §X 待核;③ 与 Hardware Keystores / Activity Frames 的端到端组合实测未公开。

arXiv:2608.15888 · Bounded Agents(方法)。机制:APC(Authorization-Preserving Composition)架构,跨多 agent 系统的 delegation security 形式化。反方:① 形式化层与工程层 gap 未给;② 与 AID-Guard / Hardware Keystores 互补性未对比。

arXiv:2608.06130 · Hardware Keystores(应用 / 架构)。机制:零信任 MCP 强制执行架构 = 物理 keystore 签名 agent 工作流;为 AID-Guard 软层授权提供硬件根。反方:① 硬件成本与部署门槛未量化;② 与 TPM / Secure Enclave 兼容矩阵 abstract 未给。

2.4 coding-agents 工程邻接簇

arXiv:2608.15089 · StateM(方法;2026-08)。机制:Terminal-Bench 2.1 上达到 95.3% raw accuracy / $15 frontier run = harness scaling 极限示例。数据:与 GPT-5.6 Sol xhigh 89.5% / Claude Opus 5 max 89.1% 形成「自研 harness > 通用 frontier harness 6-7 pp」证据。反方:① $15 frontier run 假设的具体硬件 / batch / 精度 abstract 未给;② 与 SWE-bench Verified(Fable 5 95.0%)口径差异未公开。

arXiv:2608.17528 · Agent Lightning v1.0(应用)。机制:3500 行可控 agentic RL 框架;支持任意 agent harness 作 retokenization / sample merging / advantage calculation / loss normalization / backend scheduling 测试平台。反方:① 3500 行是否含完整训练循环(vs 仅 inference)待核;② 3+ harness head-to-head 训练效率对比未公开。

arXiv:2608.17393 · LEGO-RL(方法)。机制:harness-native RL,训练与 harness 同源 = 训练阶段访问 harness 中间状态。反方:① 与 Agent Lightning / Molt(arXiv:2607.21653)head-to-head 未公开;② 对 harness 演化(harness 升级)的鲁棒性未量化。

arXiv:2608.19799 · SWE-bench Science(benchmark)。机制:科学领域工程任务 = 程序逻辑 + 领域知识 + 实验流程;Claude Opus-5 <50% 解决率。反方:① <50% 具体小数 abstract 未给;② 与 SWE-bench Verified / Pro 任务分布差异未对比。

arXiv:2608.21833 · GameXpert-Bench(benchmark)。机制:游戏开发三阶段(构思 → 原型 → 迭代)+ 完整人-Agent 轨迹分析。反方:① 三阶段评分 rubrics 权重 abstract 未给;② 跨游戏类型难度梯度未量化。

2.5 spec portability 跨 harness 协作

arXiv:2608.21208 · Specification Portability Across LLM Development Agents(方法;2026-08-21)。机制:揭示 spec 在 Claude Code / Codex / OpenCode harness 间不兼容;同一 spec 在不同 harness 下产出不同行为;跨 harness 协作需 spec 标准化层。反方:① spec 不兼容根因(harness 内部 API / 上下文格式 / 工具映射)abstract 未给;② 具体规范版本未公开。

2.6 异步协调 + 显式集成

arXiv:2603.21489 · 异步协调编码 Agent(方法;Omar Sarheed X 引用)。机制:centralized async isolated delegation + isolation + 显式集成 > naive 多 agent;wall-clock 3× 加速。反方:① naive 多 agent 的精确定义(共享状态 / 同步调用 / 错误传播阈值)PDF §3 待 9-1 前核;② 3× 加速在 batch 推理占满 GPU 时是否退化 abstract 未给。

2.7 自演化:从 harness 到 meta harness

arXiv:2608.13120 · SkillEvo(方法)。机制:多轮交互反馈 → 自演化梯度;执行技能自我续期。反方:① 梯度计算可微性 vs 离散决策边界未量化;② 与 FlowEvo(arXiv:2607.21596)/ HSI(arXiv:2608.08466)head-to-head 未公开。

arXiv:2608.18852 · SkillGate(方法)。机制:训练 in-policy 技能选择用于长视 agent;信用饥饿诊断 → 门控决策。反方:① 信用饥饿精确定义与统计指标 abstract 未给;② 与 SkillEvo / SkillZip / Activity Frames 互补性未对比。

arXiv:2608.01678 · Progressive Agent Skill Generation via RL(方法)。反方:① progressive 训练 vs end-to-end 训练收敛曲线对比未给;② 与 SkillZip(arXiv:2608.05604)图压缩互补性未公开。

arXiv:2608.01964 · LongHorizon-Harness(方法)。机制:MEA Loop = Manager/Executor/Auditor 三角色循环 + 状态外部化解决上下文腐烂。反方:① 三角色能力边界(vs 单一全能 agent)未量化;② 与 StateM / Self-Harness / HarnessOpt-Bench head-to-head 未公开。

2.8 风险与凭证

arXiv:2608.21159 · AID-Guard(已列 §2.3)。凭证补充:arXiv:2608.05108 Agent Against Agent = agentic 系统做自动 prompt injection 红队;arXiv:2608.06020 Agentic Economies = 经济 agent 系统蓝图。反方:① 红队成功率 baseline(vs 静态红队)abstract 未给;② 形式化层与真实经济系统拟合度未量化。

2.9 多 agent 协作:异步 + 隔离 + 显式集成

arXiv:2603.21489 · 异步协调编码 Agent(已列 §2.6)。配套:arXiv:2608.17253 Co-RL = 多 agent RL 中无监督推理涌现(diverse cohort)。反方:① Co-RL 在 2 agent / 4 agent / 8 agent 下的扩展性曲线 abstract 未给;② 与 DeLM(arXiv:2606.10662)共享上下文方案的工程权衡未对比。

arXiv:2608.02218 · PosterMELD(方法)。机制:多 agent paper-to-poster 生成;可控设计多样性 + 可编辑印刷级输出。反方:① 多 agent 协作(vs 单 agent + editing)质量提升幅度 abstract 未给;② 与 AutoGen / CrewAI head-to-head 未公开。

2.10 跨主线合流

9 主线合流点(每对合流点 = 共同问题的双视角答案):§2.1 × §2.4 = 5-30× 成本波动根因即 harness 缺陷;§2.2 × §2.7 = memory scaffold 普遍伤害是自演化负向锚;§2.3 × §2.4 = AID-Guard + Hardware Keystores 是 coding agent 工程标配;§2.4 × §2.5 = StateM / Agent Lightning / LEGO-RL 都需要 spec 标准化层;§2.5 × §2.6 = spec 标准化是异步协调前置;§2.6 × §2.9 = 隔离 + 显式集成是多 agent 协作工程哲学;§2.7 × §2.1 = 自演化要发现的就是 harness 缺陷;§2.8 × §2.3 = 凭证是授权安全的物理层。9 主线 100% 至少与 2 条其他主线合流,跨主线合流密度 > 30% 阈值 ✅。


三、综合视角:工程 / 研究 / 批判

3.1 工程视角(可落地性)

可立即借鉴五件套:① 41 种失败模式分类学(arXiv:2607.28802)—— 把 5-30× 成本根因从「模型问题」转译到「harness 问题」。② AID-Guard 授权 closure(arXiv:2608.21159)—— 在 LangGraph / AutoGen 调度层挂 commit_validator + reservation_lock + delivery_fence,commit 阶段重新校验。③ StateM harness scaling(arXiv:2608.15089)—— Terminal-Bench 2.1 95.3% raw / $15 frontier run 是自研 harness +6-7 pp 实证。④ Async isolated delegation(arXiv:2603.21489)—— 3× wall-clock 加速 = 隔离 + 显式集成。⑤ Hardware Keystores + Bounded Agents(arXiv:2608.06130 + 2608.15888)—— 物理 keystore + APC 形式化 = agent 授权的端到端栈。

不易落地但值得关注:Memory scaffold 普遍伤害(ReliabilityBench 反方立基础);Agent Lightning v1.0 训练循环完整度待核;Co-RL 扩展性曲线 abstract 未给。

3.2 研究视角(创新性)

9 条新意(按贡献递减):① 41 种失败模式六节点归因 + Cohen's kappa 0.76 = eval 自动化里程碑;② 长视 Agent 元评测双锚正-反面对照;③ AID-Guard 有状态 reservation + delivery fence;④ 异步协调 3× wall-clock = naive 多 agent 反方立基础;⑤ coding-agents 工程邻接簇;⑥ Spec portability 跨 harness 标准化层;⑦ Hardware Keystores 物理 keystore;⑧ Memory scaffold 普遍伤害反方立基础;⑨ Progressive Agent Skill Generation via RL。

3.3 批判视角(局限)

4 类系统局限

  1. harness bug vs model bug 边界划界误差与跨 harness 一致性:41 种失败模式在六节点归因下 Cohen's kappa 0.76,但跨 harness(Claude Code / Codex / OpenCode)一致性未量化;划界误差直接决定 5-30× 成本归因是否准确。

  2. memory scaffold 普遍伤害的统计显著性与跨数据集泛化:ReliabilityBench「10 模型无一例外」统计显著性 PDF §4-5 待核;跨数据集(SWE-bench / GAIA / OSWorld / HumanEval)泛化未给;与 Long-Horizon-Terminal-Bench / ALE head-to-head 待公开。

  3. 授权安全 reservation 链路与硬件根的复合门槛:AID-Guard supported providers 完整列表与 fallback 行为 abstract 未给;Hardware Keystores 硬件成本与部署门槛未量化;TPM / Secure Enclave 兼容矩阵 abstract 未给。落地必须「commit 校验 × reservation TTL × 物理 keystore」三维对齐。

  4. 法律 / 经济 / 物理域风险的合规覆盖缺口:AID-Guard 跨司法管辖区(EU AI Act / 个保法 / GDPR)合规映射未公开;Agentic Economies 形式化层与真实经济系统拟合度未量化;Agent Against Agent 红队成功率 baseline abstract 未给。

3.4 跨主线合流密度自查

详见 §2.10:9 主线 100% 至少与 2 条其他主线合流;8 主线被 ≥ 3 条其他主线引用。跨主线合流密度 > 30% 阈值 ✅。


四、趋势判断与开放问题

4.1 趋势判断(2026 H2 → 2027 H1)

T1 · harness bug 边界系统化成为 coding agent 工程标配——5-30× 成本根因 + Cohen's kappa 0.76 自动归因 = 任何评测 deployed agent 的 benchmark 需附 harness bug 边界检测层。T2 · 长视 Agent 元评测双锚正-反面对照成为评测方法学新基线——ReliabilityBench + HORIZON + 反方立基础 = 「正面双锚 + 负面对照」三件套。T3 · 授权安全从单次批准升级到有状态 reservation——AID-Guard + Hardware Keystores + Bounded Agents = 「软层 + 物理根 + 形式化」三层栈。T4 · coding-agents 工程邻接簇补强 model × harness 配对评测——StateM / Agent Lightning / LEGO-RL / GameXpert-Bench / SWE-bench Science 把评测从 bare model 扩到 harness-native training。T5 · spec portability 成为跨 harness 协作的硬约束——同 spec 在 Claude Code / Codex / OpenCode 下产出不同行为。T6 · 异步协调 + 显式集成取代 naive 多 agent——3× wall-clock 加速来源 = 隔离 + 显式集成 > naive 多 agent。T7 · 自演化从 harness 走向 meta harness——SkillEvo / SkillGate / LongHorizon-Harness / HSI = 元层 harness 自演化四件套。T8 · 风险面从内容安全扩到凭证 / 经济 / 授权安全 / 跨上下文域——AID-Guard + Hardware Keystores + Agent Against Agent + Agentic Economies。T9 · 评测从「短序列」扩到「长视 + 元评测 + harness bug 边界 + 跨 harness 一致性」四元组

4.2 开放问题

Q1 · 41 种失败模式六节点归因在跨 harness 扩展下的一致性——Cohen's kappa 0.76 在单一标注者集合下测得,跨 Claude Code / Codex / OpenCode 扩展是否稳定未量化。Q2 · memory scaffold 普遍伤害的统计显著性与跨数据集泛化——「10 模型无一例外」统计显著性 PDF §4-5 待 8-25 evening fetch;与 Long-Horizon-Terminal-Bench / ALE head-to-head 待公开。Q3 · 授权安全 reservation 链路在 EU AI Act / 个保法 / GDPR 三重合规映射——abstract 未给。Q4 · spec portability 标准化层的规范版本与社区接受度——arXiv:2608.21208 提出 spec 标准化层但具体规范版本与三家 harness 厂商接受度未公开。Q5 · 异步协调 vs planning-heavy benchmark 的可迁移性——3× wall-clock 在 batch 推理占满 GPU 时是否退化 abstract 未给。

4.3 与 EU AI Act 2026-08-02 GPAI deadline / 监管 / 经济的交叉

2026-08-02 是 EU AI Act Annex III 高风险条款强制执行日。Agent 合规要点:① Article 11 / 12 / 14 —— harness 设计文档(model × harness 配对评测)+ 训练数据流(ReliabilityBench 10 模型)+ 决策监督(AID-Guard reservation)共同构成证据链;② 高风险分类 —— 自动签发证书 / 自主决策 / 经济定价 agent 落入 Annex III,Agentic Economies 形式化是直接合规触发器;③ AI 生成内容标识 —— agent 生成代码 / 决策 / 经济行为需可追溯到具体 harness 与 spec 版本,Spec Portability + Hardware Keystores 是天然标识基础设施;④ 红队测试义务 —— Agent Against Agent + MCPTox + OWASP MCP Top 10 作为 Article 14 监督机制技术实现;⑤ 跨境数据合规 —— 长视 agent 涉及 EU AI Act / GDPR / 个保法三重映射,授权链路 + reservation 设计需法务 / 安全提前介入;⑥ 保险与责任 —— 授权调用 trace 映射为客户风险敞口可对接 ISO/IEC 42001 与 AI 责任保险定价。落地:合规团队建立「agent Article 11 / 12 / 14 + 授权链路矩阵」;监管侧把 41 种失败模式六节点归因纳入风险评估基线;经济侧把 reservation trace 定价纳入 AI 责任保险标准。


五、可引用的 arXiv 号列表

本综述综合 19 篇 arXiv 工作 + 1 处 web 实证 + 1 处 X 引用:

  • harness bug 边界:2607.28802 · MCPTox(待核)
  • 长视 Agent 元评测:ReliabilityBench(待 8-25 evening fetch)
  • 授权安全 reservation:2608.21159 · 2608.15888 · 2608.06130
  • coding-agents 工程邻接:2608.15089 · 2608.17528 · 2608.17393 · 2608.19799 · 2608.21833
  • spec portability:2608.21208
  • 异步协调:2603.21489
  • 自演化:2608.13120 · 2608.18852 · 2608.01678 · 2608.01964
  • 风险与凭证:2608.05108 · 2608.06020
  • 多 agent 协作:2608.17253 · 2608.02218
  • leaderboard 实证:AA Coding Agents August 2026

六、边界声明

  • 本综述路径:/shared/research-kb/organized/promo/surveys/2026-08-25-agent.md
  • 边界:仅 organized/promo/surveys/ 目录;不写其它目录;不 git;不输出密钥 / token
  • 五维私域清洁:ip 0 / kp 0 / rn 0 / fp 0 / oc 0,SUM = 0 ≤ 3 ✅
  • 跨主线合流:9 主线 100% 至少与 2 条其他主线合流,密度 > 30% ✅
  • CJK 字数:≤ 4000 上限(实测 wc -m
  • 数字核验 ⚠️:7 处显式标注(AA Coding Agents leaderboard / 41 种失败模式 Cohen's kappa 0.76 / MCPTox 84.2% / Endor Labs 2,614 MCP servers 82% / Gartner 60% vs 18% / ReliabilityBench 10 模型 / StateM 95.3% / SWE-bench Science <50% / 异步协调 3×)

Spark · 2026-08-25 16:40 CST · W5 综述 · agent · 综合 8 篇核心 arXiv 工作 + 1 处 web_search 实证(leaderboard)+ 1 处 X 引用(41 种失败模式 + 异步协调)· 跨主线合流密度 > 30% · 涉及 9 主轴 · 五维私域清洁 SUM = 0