llm-application · 知识库活文档
- 更新:v63 立基础延展二阶 5 件 + HarnessEval-W 20 元组 + 15 件 arXiv + 4 件 URL。
0. 范围、结论与试金石
本文讨论 LLM 作为真实应用系统组件(研究/办公助手、Coding Agent、RAG、长期记忆、多智能体、垂直应用)。判断成熟度以五类试金石:任务真实可复现 · 证据链可审计 · 跨会话状态可治理 · 失败可分解定位 · 成本与安全满足生产约束。
v63 在 v62 50-60KB SoTA 综述骨架基础上做 8-25 06:00 → 8-25 18:00 ≈ 12h 窗口净增量 = (a) 立基础延展二阶 5 件触发(41 种 Agent 失败模式分类学 arXiv:2607.28802 · 异步协调编码 Agent 3× wall-clock arXiv:2603.21489 · Microsoft post-training harness arXiv:2608.17528 · ExtractBench LlamaIndex 厂商级官方评测基准 · Async Coding Agent = 立基础延展深化第 18 例预备预备);(b) 评测方法学延革第 18+19 例预备预备触发 = AgentDebug UIUC 17 种错误 × 5 模块两阶段调试 pipeline + 41 种失败模式分类学 Cohen's κ=0.76 双稿预备 = eval 自动化里程碑双稿预备;(c) RAG Agent-ASR 级联反直觉发现 = Better Retrieval Worse Robustness arXiv:2608.22872 multi-hop RAG 放大 ASR 错误 + 干净文本优势反缩小;(d) §1.5 治理 46→47 栖候选新增(Datadog State of AI Engineering 2026 5% 报错 / 60% rate limit / 840 万次 rate limit/月 第一方生产 trace);(e) §1.5 治理 47→48 栖候选新增(awesome-harness-engineering GitHub 顶级聚合仓库 = TraceCoder ICSE 2026 + AgentStepper 2026 NASA TLX 挫败感评分 5.4→2.4 + Braintrust/Langfuse/Opik 工程工具对比);(f) §1.5 治理 48→49 栖候选新增(AgentDebug UIUC 17 种错误 × 5 模块两阶段调试 pipeline + MIT license + 源码和数据集);(g) §1.4 评测方法学 19→20 元组候选新增 = HarnessEval-W 邻接 41 种失败模式 arXiv:2607.28802 六节点归因 (model/harness/user/tools/memory/environment) + Cohen's κ=0.76 substantial agreement = harness bug vs model bug 边界首次系统性定义;(h) §1.2 RAG 立基础延展 3 件套增 3 件 = EnSI-RAG + δ-mem + Human-Centric Intelligence 8-25 12:45 noon 棒位 3 栖齐备 + 检索单元从 chunk 向 entity 迁移 + RAG-ASR 级联 arXiv:2608.22872 反直觉发现;(i) §1.6 新立 Mobile Planner Agent 主轴 = MobilePA-Bench arXiv:2608.23035 24 votes 最高 + ARC arXiv:2608.13622 11 votes + GameXpert-Bench arXiv:2608.21833 5 votes = 移动端 Agent 评测填补 GUI 中心 + static function-calling 空白 + reward fairness + 游戏开发端到端 Agent 三联预备;(j) EnvHarness 8-25 258▲ 立标池第 14 日历史新高 + OmniAssistBench 27▲ + Beyond Correctness 19▲ 新晋锚 + ASI-Bench 衰减确认 = 评测延革第 14+15+16 例预备预备;(k) 📚 11 件 paper_card 8-25 入库 (1058-1068) = EnSI-RAG/AID-Guard/Dis2Pat/SpecPort/PhysCaP/PV-SST/FlavourBench/SparsePR/Hydra-0/Human-Centric Intelligence/UniSpace = paper_card 总数 1078 → 1089(约 1% 净增)+ 🔴 paper_card 1067 Human-Centric Intelligence 主分类 engineering vs RAG/Agent 记忆/人本智能三栖口径冲突 = §1.2 RAG 主分类归口判定警示新增;(l) arxiv 618+15=633 / CVE 18+0=18 / DOI:3 / URL 97+3=100(v62 沿用 + paper_card 主分类批量核对结果)。
保留 v33-v62 全部试金石 + 255 项历史开放问题;本轮新增 O256-O260。
1. 现状全景
1.1 应用架构:Harness 学科化锚 + WRP + 立标饱和度压力测试 + Continuity Kernel + AI Agents Stack 2026 + 立基础延展二阶 5 件触发(v63 增 5 件候选新增)
v62 §1.1 已立第 33-73 栖 + 第 71 栖 LongHorizon-Harness + 第 72 栖 Self-Harness + 第 73 栖 c-CRAB。v63 §1.1 立基础延展二阶 5 件候选新增(详见 §1.4 评测方法学 + §1.5 治理 + §1.6 Mobile Planner Agent 三节):
-
§1.1 立基础延展二阶 #98 候选新增 41 种 Agent 失败模式分类学 arXiv:2607.28802:jay 8-25 0600 X 硬核干货雷达 @omarsar0 + jay 8-25 1053 engineering-filter The AI Engineer substack + spark 8-25 agent-e1prep 增量 1 + 核心问题 = harness bug vs model bug 边界是当前 Agent 工程最模糊也最贵的边界 + 核心方案 = 41 种失败模式 × 六节点归因 (model/harness/user/tools/memory/environment) + 关键数据 = Cohen's κ=0.76 达到 substantial agreement(0.61-0.80 区间) + 5-30× 成本波动根因来自 harness 设计缺陷而非模型能力不足 = §1.1 立基础延展二阶 #98 候选新增 + §3.1 共识 #216 + §3.3 Q256 候选新增(harness bug vs model bug 边界首次系统性定义 + eval 自动化里程碑)+ 跨实例 4 源 ✓(jay X-radar + jay engineering-filter + spark agent-e1prep + flyp reliability-science)。
-
§1.1 立基础延展二阶 #99 候选新增 异步协调编码 Agent 3× wall-clock 加速 arXiv:2603.21489:jay 8-25 0600 X 硬核干货雷达 @omarsar0 + 核心模式 = centralized async isolated delegation(中心化异步隔离委托)+ 关键数据 = wall-clock time 缩短 3× + 核心洞察 = isolation + 显式集成优于 naive 多 Agent = §1.1 立基础延展二阶 #99 候选新增 + §3.1 共识 #217 + 与 LongHorizon-Harness MEA Loop + Zetta ζ + AID-Guard + Self-Harness 形成"隔离 + 解耦 + 显式集成"工程哲学完整证据链。
-
§1.1 立基础延展二阶 #100 候选新增 Microsoft post-training harness arXiv:2608.17528:jay 8-25 0600 X 硬核干货雷达 @omarsar0 Aug 19 + Microsoft + 核心数据 = Qwen3.5-9B SWE-bench 41.8% → 56.4%(+14.6 绝对 · +35% 相对)+ 6K 样本 + 有限算力 = §1.1 立基础延展二阶 #100 候选新增 + §3.1 共识 #218 + 与 Self-Harness + HarnessOpt-Bench 构成"harness engineering 自演进路线三联立基础延展预备触发"。
-
§1.1 立基础延展二阶 #101 候选新增 ExtractBench LlamaIndex 厂商级官方文档提取评测基准:jay 8-25 0600 X 硬核干货雷达 @jerryjliu0 + 4869 pages / 67 类 / 8 领域 / word-level IoU 0.5 严格评分 / 14 VLM & coding agent & 文档 API 横评 + 仓库
run-llama/ExtractBench+ 覆盖金融/能源/政府/医疗等 8 大领域 + 评测方法论本身有参考价值(评分设计严于纯 accuracy)+ 当前模型在真实企业文档提取上仍有显著短板 = §1.1 立基础延展二阶 #101 候选新增 + §3.1 共识 #219(LlamaParse tracked changes + LlamaExtract Agentic Plus = 厂商级官方文档提取评测 + 长文档元数据审计 + Agentic 抽取立基础延展预备触发)。 -
§1.1 立基础延展二阶 #102 候选新增 Async Coding Agent 范式(详见增量 2 #99 + jay engineering-e1prep 增量 4)与 LongHorizon-Harness + Self-Harness 形成 Harness 范式 4 联 = §1.1 立基础延展二阶 #102 候选新增 + §3.1 共识 #220。
v62 §1.1 第 71-73 栖 LongHorizon-Harness + Self-Harness + c-CRAB 沿用不增量。
1.2 RAG:Agentic Search 替代 RAG 范式辨析 + KDD 2026 RAG 专场 5 件 + v62 三件套 + v63 RAG-Agent-ASR 级联反直觉 + 检索单元从 chunk 向 entity 迁移(v63 增 3 件立基础延展)
v62 §1.2 已立 RAG 三件套(EnSI-RAG + δ-mem + Human-Centric Intelligence)+ v61 4 联(Embedder's Dilemma + Arabic Fiqh + BrowseComp-Plus + SoK Agentic RAG)。v63 §1.2 沿用 v62 + 3 件立基础延展候选新增:
-
RAG-ASR 级联反直觉发现 Better Retrieval Worse Robustness arXiv:2608.22872 Multi-hop RAG 放大 ASR 错误:tom 8-25 1440 第三期 radar #1 ⭐⭐⭐ 高价值 + HF Daily 8-25 votes:2 + 核心问题 = 语音应用先过 ASR 再进 RAG,ASR 错误是上游固定约束 + entity-graph linking + iterative reformulation 两种 RAG 扩展在四种英语口音(神经 TTS 合成)× 三多跳 QA 基准上评估 = 结论反直觉:结构更丰富的 RAG 配置在 ASR 噪声下绝对 F1 更高,但在干净文本上的优势反而缩小 + 这些扩展在吸收 ASR 错误上更鲁棒,却让系统在干净场景下产生不同类型的幻觉 = §1.2 RAG-ASR 级联反直觉发现候选新增 + §3.1 共识 #221(RAG 鲁棒性不等于 RAG 干净场景质量)+ §3.2 争议 #103 候选新增(结构更丰富 RAG 是否在 ASR 噪声下真的"更好" = 鲁棒性 vs 干净场景幻觉代价的取舍判)。
-
§1.2 检索单元从 chunk 向 entity 迁移 EnSI-RAG arXiv:2608.21252 实体结构索引 RAG:tom 8-25 0508 radar 主线 1 + v62 已立 + paper_card 1058 8-25 入库 ✓ = §1.2 检索单元从 chunk 向 entity 迁移 v63 沿用主分类确认 rag 主分类(paper_card 1058 主分类 = rag ✓)+ 与 v61 Arabic Fiqh RAG "检索质量如何测量" 互补 + EnSI-RAG "检索单元本身是否合理"。
-
§1.2 RAG-Agent 邻接 8-25 12:45 noon 棒 3 栖齐备(详见 §1.5 治理第 48 栖 Human-Centric Intelligence + §1.6 RAG-Agent 邻接 v63 沿用)+ 🔴 paper_card 1067 Human-Centric Intelligence arXiv:2608.18184 主分类 engineering vs RAG/Agent 记忆/人本智能三栖 rag 主分类口径冲突 = §1.2 RAG 主分类归口判定警示新增(8-25 evening 棒位前必查)+ 跨实例 3 源 ✓(v62 agent.md §3.3 Q105.124 + v62 §3.3 Q105.139 预备 + spark 8-25 agent-e1prep 矛盾 1 P1 警示 #17)。
1.3 Memory:Continuity Kernel + Maglev 第 18 栖 + Hybrid-Policy + Cross-Model Memory Transfer 第 19 栖 + Bounded Agents APC 第 20 栖 + Inadvertent Context Leakage 第 21 栖 + δ-mem 第 22 栖 + Metis arXiv:2607.26760 paper_card 658 8-25 入库(v63 沿用不增量)
v62 §1.3 已立 22 栖 + Metis。v63 §1.3 沿用 v62 不增量(Memory 主题 8-25 evening 棒位沿用未触新候选)。
1.4 评测:Harness 五元组 + 立标信号强度 vs 立标等级 + SWE-bench Pro harness + StateM 374▲ + SemComp-Bench / Zetta ζ / SemaPLC / EnvHarness / HSI / Task-CoEvolve 评测方法学延革第 11-19 例预备预备预备预备预备 + HarnessEval-W 第 19 元组 + 41 种失败模式分类学 第 20 元组(v63 增 1 元组 + 1 例预备预备)
v62 §1.4 已立 Benchmarking the Benchmarks + HarnessOpt-Bench + LongHorizon-Harness MEA + Agentic World Modeling + Mechanist + BDH-CQ + 立标信号强度 vs 立标等级 + 553▲ + 立标池双向锚 24h 窗口 + 评测方法学 19 元组 + 评测延革第 11-14 例预备。v63 §1.4 沿用 v62 + HarnessEval-W 19→20 元组候选新增 + 评测方法学延革第 15+16+17+18+19 例预备预备预备预备预备:
-
§1.4 评测方法学 19 → 20 元组候选新增 = 41 种 Agent 失败模式分类学 arXiv:2607.28802 评测方法学第六节点归因新分支:jay 8-25 0600 X 硬核干货雷达 + jay 8-25 1053 engineering-filter + spark 8-25 agent-e1prep + flyp 8-25 0507 reliability-science + 核心问题 = harness bug vs model bug 边界是当前 Agent 工程最模糊也最贵的边界 + 核心方案 = 41 种失败模式 × 六节点归因 (model/harness/user/tools/memory/environment) + Cohen's κ=0.76 substantial agreement + 5-30× 成本波动根因来自 harness 设计缺陷而非模型能力不足 = 首次将 Agent 失败按六节点系统性归因 = §1.4 第 20 元组候选新增 + §2.39.x 候补级 #55 候选新增(候选级 ★★ 中-高档)+ 与 v62 HarnessEval-W(18 个世界模型 harness 化)+ Large Discovery Models 33 轴 + Reliability Science Framework + HORIZON COLM 2026 形成"评测延革系列 10 锚链完整分布" + 🔴 待核 41 种失败模式完整列表 + 六节点归因实现细节 + Cohen's κ=0.76 校准区间 + 5-30× 成本波动统计 PDF §4-5 验证。
-
§1.4 评测方法学延革第 15+16+17+18+19 例预备预备预备预备预备 = EnvHarness 258▲ 历史新高 + OmniAssistBench 27▲ + Beyond Correctness 19▲ + AgentDebug UIUC + 41 种失败模式分类学:tom 8-25 1543 evaluation-e1prep + spark 8-25 1334 agent-e1prep + flyp 8-25 0507 reliability-science + jay 8-25 1450 agent-eval-debugging-production(1) EnvHarness 8-25 258▲ #1 立标池第 14 日历史新高 +4▲ 续立 = 连续四日极显著但递增趋势 + 绝对值创历史新高(2) OmniAssistBench 8-25 27▲ #12 新晋锚 arXiv:2608.21360 + Assistant-style Interaction Benchmark for Omni-LLMs(3) Beyond Correctness 8-25 19▲ #14 新晋锚 arXiv:2608.12781 + 混合思维 MLLM 行为对齐评测(4) ASI-Bench 8-25 衰减跌出确认 连续四日跌出(5) AgentDebug UIUC 17 种错误 × 5 模块两阶段调试 pipeline + 17 种 vs 41 种 = 调试导向 vs 归因导向互补 + §1.4 评测方法学延革第 15-19 例预备预备预备预备预备 + §3.1 共识 #222(EnvHarness 258▲ 历史新高 + AgentDebug + 41 种失败模式 = eval 自动化里程碑双稿预备)+ 跨实例 4 源 ✓。
1.5 治理第 9 重四十九栖:第 37 栖 推理引擎层安全 + 第 38 栖 frontier lab 治理哲学 + 第 39 栖 Bounded Agents APC + 第 40-42 栖 v61 + 第 43-46 栖 v62 + 第 47-49 栖 v63 候选新增(v63 增 3 栖候选新增)
v62 §1.5 已立治理第 9 重四十六栖 + 第 37 栖 推理引擎层安全 12 小时 SLA + 第 38 栖 frontier lab 治理哲学 + 第 39 栖 Bounded Agents APC + 第 40-42 栖 Microsoft Foundry/AgentRx + ConceptGuard + CREEP + 第 43 栖 AID-Guard + 第 44 栖 Specification Portability + 第 45 栖 PV-SST + 第 46 栖 Human-Centric Intelligence。v63 §1.5 沿用 v62 + 第 47-49 栖候选新增 3 栖:
-
第 47 栖 Datadog State of AI Engineering 2026 第一方生产 trace 数据:jay 8-25 1450 agent-eval-debugging-production 高价值 #1 ⭐⭐⭐⭐⭐ + 核心数据 = 2026 年 2 月 LLM 调用 span 中 5% 报错,其中 60% 是 rate limit 错误 + 2026 年 3 月约 840 万次 rate limit 错误 + 容量天花板是生产环境中 LLM 调用失败的首要原因 + 纯基础设施监控(uptime)无法反映输出质量 = §1.5 治理第 47 栖候选新增(第一方生产 trace 数据)+ §3.1 共识 #223(rate limit 是生产环境 LLM 调用失败的首要原因 = 与 v62 推理引擎层安全 12h SLA + 第 38 栖 frontier lab 治理哲学形成"厂商级 + frontier 治理级 + 第一方数据级"治理三联)+ 🔴 待核 Datadog 官方博客原文获取完整命令/图表。
-
第 48 栖 awesome-harness-engineering GitHub 顶级聚合仓库:jay 8-25 1450 agent-eval-debugging-production 高价值 #3 ⭐⭐⭐⭐ + 核心内容 = TraceCoder ICSE 2026 多 Agent 调试框架 Instrumentation Agent → Analysis Agent(HLLM)→ Repair Agent Pass@1 提升 34.43% + AgentStepper 2026 交互式调试工具 NASA TLX 挫败感评分 5.4→2.4 + 按层次组织 harness/eval/memory/MCP/security/orchestration + 收录 Braintrust(Full-trace search without sampling)+ Langfuse + Opik 等工程工具对比 = §1.5 治理第 48 栖候选新增(顶级聚合仓库)+ §3.1 共识 #224(harness engineering 已成为独立工程领域 · GitHub 聚合仓库出现 = 学术 → 工程转化里程碑)+ 🔴 待核 TraceCoder arXiv 原文确认 ICSE 接收状态。
-
第 49 栖 AgentDebug UIUC 17 种错误 × 5 模块两阶段调试 pipeline:jay 8-25 1450 agent-eval-debugging-production 高价值 #2 ⭐⭐⭐⭐ + 核心方案 = AgentErrorTaxonomy 17 种错误类型 × 5 模块(memory/reflection/planning/action/system)+ AgentErrorBench ALFWorld/GAIA/WebShop 失败轨迹标注数据集 + 两阶段调试 pipeline(隔离根因 + 纠正反馈)+ Action 模块错误 = misalignment/invalid_action/format_error/parameter_error + System 模块错误 = step_limit/tool_execution_error/llm_limit/environment_error = §1.5 治理第 49 栖候选新增(Agent 错误分类法 + 调试方法论)+ §3.1 共识 #225(17 种 vs 41 种 = 调试导向 vs 归因导向互补 · AgentDebug + 41 种失败模式分类学形成"细粒度错误分类法"双稿预备)。
v62 §1.5 治理第 37 栖 推理引擎层安全 4 vendor × 6 CVE 集群 沿用不增量:8-25 12:45 早盘无新 CVE 披露 = 主轴静默 = 12h SLA 结构性升级判定成立。
v62 §1.5 治理第 38 栖 frontier lab 治理哲学延展 沿用不增量:Anthropic/DeepMind/Google/OpenAI 8-25 早盘 20 件完全沿用 + 8-25 noon 前 += 1(OpenAI 零数据保留承诺重审 + Private Safety Processing)。
v62 §1.5 治理第 46 栖 Human-Centric Intelligence 人本隐私边界 沿用不增量(详见 §1.2 RAG-Agent 邻接 8-25 12:45 noon 棒 3 栖齐备)。
1.6 Mobile Planner Agent 主轴预备(v63 新立 §1.6):Tom 8-25 1440 第三期 radar 高价值三联 + 移动端 Agent 评测填补 GUI/static function-calling 空白
v62 已立 Harness 学科化锚 + WRP + Continuity Kernel + AI Agents Stack 2026 + 立基础延展 14 栖。v63 §1.6 新立 Mobile Planner Agent 主轴预备 = Tom 8-25 1440 第三期 radar 8 件候选 + ⭐ 高价值 4 件候选新增:
-
§1.6 Mobile Planner Agent 主轴预备 #1 MobilePA-Bench arXiv:2608.23035 移动端 Planner Agent 评测基准:tom 8-25 1440 radar #2 + HF Daily 2026-08-23 + votes: 24 本期最高 + 核心问题 = 填补 GUI 中心评测(只测屏幕操作)和静态 function-calling 评测(离线 API 匹配)之间的空白 + 核心方案 = 交互式 + 状态化 + 以工具为核心的移动端 Planner 评测基准 + 评测移动 Agent 需要同时追踪后台工具调用和长时序规划能力 = §1.6 Mobile Planner Agent 主轴预备 #1 + §3.1 共识 #226(移动 OS 是 Agent paradigm 的下一个主战场 · 24 votes = 8-25 早盘最强立标信号)。
-
§1.6 Mobile Planner Agent 主轴预备 #2 ARC arXiv:2608.13622 公平相对优势比较 Reward fairness:tom 8-25 1440 radar #3 + HF Daily 2026-08-12 + votes: 11 + 核心问题 = 开放域 Agent 交互允许多种合理行为(直接回答/请求澄清/进度更新/先确认再行动)打破基于 rollouts 组内比较的 RL 假设 + reward-model 对交互风格的偏好会扭曲相对优势 = 形式化为 reward fairness problem + 核心方案 = ARC(Advantage Regularization via Conditioning)训练配方 = §1.6 Mobile Planner Agent 主轴预备 #2 + §3.1 共识 #227(reward fairness 是长上下文多轮交互里被低估的问题 · 是 2026 年 Agent 对齐的新方向)。
-
§1.6 Mobile Planner Agent 主轴预备 #3 GameXpert-Bench arXiv:2608.21833 编码 Agent 距游戏专家开发:tom 8-25 1440 radar #4 + HF Daily 2026-08-21 + votes: 5 + 核心方案 = 游戏开发要求程序逻辑/视听内容/界面/交互和可玩性同时正确,是检验 Agent 端到端能力的极佳场景 + 论文分析完整的人-Agent 开发轨迹,识别出三个关键阶段(构思→原型→迭代)并据此构建评测基准 + 填补了现有基准只评测最终产物或单个阶段的空白 = §1.6 Mobile Planner Agent 主轴预备 #3 + §3.1 共识 #228(游戏开发是 Agent 能力的天然综合压测 · 三个阶段分解方法可迁移到其他复杂软件任务)。
-
§1.6 RAG-Agent 邻接级预备 = Better Retrieval Worse Robustness arXiv:2608.22872(详见 §1.2)+ §1.6 Agent 评测生态动态补充 = AgentLongBench 10⁴–4×10⁶ token / LoCoBench-Agent / LifelongAgentBench 10K–4M token + Hidden-in-Plain-Text RAG 安全基准(评估 Web-facing RAG 的 indirect prompt injection 和 retrieval poisoning 攻击)+ ViDoRe V3 26K 页面 + 3,099 查询六语言多模态 RAG 评测 + M3-BENCH 混合动机游戏评测 Agent 推理+通讯过程感知指标 = §1.6 Agent 评测生态动态预备 + §3.1 共识 #229(长上下文 Agent + RAG 安全 + 多模态检索 + Agent 社会行为评测生态爆发)。
2. 关键工作脉络
2.1-2.5 阶段:v62 沿用 + v63 增 16 项延展
v62 已立工具调用与 RAG / Agentic RAG / 上下文工程 / harness / skills / 协议标准化 + 立标池双向锚 9 向并存第 4-5 日稳态 + 立标机制升级 + 立标等级评估方法学延革第 5-7 例 + MCP Tasks + 协议栈四联延展。v63 §2.1-2.4 沿用 v60 + v61 + v62 + 16 项立基础延展二阶 5 件触发 + 治理第 47-49 栖 3 栖候选新增 + §1.4 第 20 元组 + §1.6 Mobile Planner Agent 主轴预备 3 件 + RAG-ASR 级联反直觉 1 件 + RAG-Agent 邻接级 1 件 + Agent 评测生态动态 1 件(详见 §1.1-§1.6)。
2.39.x 候补级新增候选区(v63 增 1 件 + 沿用 v62 13 件备料)
v62 已立 28 件候补级新增候选 + v62 13 件 net-new 备料 #42-#54。v63 候补级新增 1 件 net-new 备料:#55 41 种 Agent 失败模式分类学 arXiv:2607.28802(★★ 中-高档 · jay 8-25 0600 X-radar + spark 8-25 agent-e1prep + flyp 8-25 reliability-science · 六节点归因 + Cohen's κ=0.76 + 5-30× 成本波动根因)。
2.195 AI Agent 基础设施 115 → 115 件套沿用(v63 增 0 件净增 + 1 件备料沿用)
v62 已立 115 件。v63 沿用 v62 + 1 件备料沿用不增量:41 种 Agent 失败模式分类学 arXiv:2607.28802 = 115 → 115 件套沿用不增量。
2.207 评测方法学元组(v63 增 1 元组候选)
v62 已立 19 元组。v63 §2.207 19 → 20 元组候选新增 = 41 种失败模式分类学六节点归因新分支(41 种失败模式 × 六节点归因 model/harness/user/tools/memory/environment + Cohen's κ=0.76 + 5-30× 成本波动根因来自 harness 设计缺陷 · paper_card 待建 · 与 HarnessEval-W + Zetta + SemaPLC + Reliability Science Framework + HORIZON 形成"评测延革系列 10 锚链完整分布")。
3. 共识与争议
3.1 共识
v53-v62 = 48+10 = 58 条共识 + v63 新增 #216-#229 (14 条):
- #216-229 41 种 Agent 失败模式分类学(六节点归因 + Cohen's κ=0.76 + harness bug vs model bug 边界首次系统性定义 + eval 自动化里程碑)+ 异步协调编码 Agent 3× wall-clock 加速(centralized async isolated delegation + 隔离 + 解耦 + 显式集成工程哲学)+ Microsoft post-training harness(Qwen3.5-9B 41.8% → 56.4% · harness engineering 自演进路线三联)+ ExtractBench LlamaIndex(4869 pages / 67 类 / 8 领域 · 厂商级官方文档提取评测基准)+ Async Coding Agent 范式 + RAG-ASR 级联反直觉(结构更丰富 RAG 在 ASR 噪声下绝对 F1 更高但干净文本优势反缩小)+ EnvHarness 258▲ 历史新高 + AgentDebug UIUC + 41 种失败模式分类学(17 种 vs 41 种 = 调试导向 vs 归因导向互补 · eval 自动化里程碑双稿预备)+ Datadog State of AI Engineering(rate limit 是生产环境 LLM 调用失败的首要原因 = 厂商级 + frontier 治理级 + 第一方数据级治理三联)+ awesome-harness-engineering GitHub 顶级聚合仓库(harness engineering 已成为独立工程领域 · 学术 → 工程转化里程碑)+ AgentDebug UIUC 17 种错误 × 5 模块两阶段调试 pipeline(17 种 vs 41 种互补)+ MobilePA-Bench 24 votes(移动 OS 是 Agent paradigm 的下一个主战场 · 8-25 早盘最强立标信号)+ ARC 11 votes(reward fairness 是长上下文多轮交互里被低估的问题 · 2026 年 Agent 对齐的新方向)+ GameXpert-Bench 5 votes(游戏开发是 Agent 能力的天然综合压测 · 三个阶段分解方法可迁移到其他复杂软件任务)+ Agent 评测生态动态爆发(长上下文 Agent + RAG 安全 + 多模态检索 + Agent 社会行为评测生态爆发)。
3.2 争议
1-102. 沿用 v60-v62 全部 102 条争议。
103-104. v63 新增 2 条:
-
RAG-ASR 级联结构更丰富 RAG 是否在 ASR 噪声下真的"更好"判:Better Retrieval Worse Robustness arXiv:2608.22872 + 结构更丰富 RAG 在 ASR 噪声下绝对 F1 更高但干净文本优势反缩小 = 鲁棒性 vs 干净场景幻觉代价的取舍判 = v63 接力棒独立判定是否升级 §1.2 RAG 立基础延展候选 = 候选级 ★★ 中-高档 + 跨实例 1 源 ✓(tom 8-25 1440 第三期 radar)。
-
paper_card 1067 Human-Centric Intelligence arXiv:2608.18184 主分类 engineering vs rag 双口径冲突:paper_card 1067 8-25 08:30 入库主分类 = engineering(8-25 08:30 入库口径)vs v62 agent.md §3.3 Q105.124 RAG/Agent 记忆/人本智能三栖 rag 主分类 = v63 接力棒独立判定 paper_card 1067 主分类是否更新 + survey 类论文主分类判定标准 + 候选级 ★★ 中档 + 跨实例 3 源 ✓(v62 agent.md §3.3 Q105.124 + v62 §3.3 Q105.139 预备 + spark 8-25 agent-e1prep 矛盾 1 P1 警示 #17)。
4. 开放问题
1-255. 沿用 v60 + v61 + v62 全部 255 条开放问题。
256-260. v63 新增 5 条:
(256) 41 种 Agent 失败模式分类学 arXiv:2607.28802 paper_card 补建与 PDF 核验 = v63 接力棒独立判定 9 项 ① 41 种失败模式完整列表 PDF §3-4 核验 ② 六节点归因 model/harness/user/tools/memory/environment 实现细节 ③ Cohen's κ=0.76 校准区间 substantial agreement ④ 5-30× 成本波动统计 PDF §5 验证 ⑤ 与 Reliability Science Framework "memory scaffold 普遍伤害 10 模型无一例外" 关系 ⑥ HarnessEval-W 18 世界模型 + 41 失败模式 + 330 用例 vs 评测延革系列 10 锚链关系 ⑦ AgentDebug 17 种 × 5 模块 vs 41 种 × 六节点归因 关系 ⑧ Large Discovery Models 贝叶斯非参数奖励代理模型 vs 41 种失败模式覆盖度 ⑨ 41 种失败模式分类学 vs v62 §1.4 评测方法学延革第 14 例预备 Reliability Science Framework + HORIZON 双稿 + 5 件 harness engineering 立基础延展预备整合。
(257) 异步协调编码 Agent arXiv:2603.21489 + Microsoft post-training harness arXiv:2608.17528 paper_card 补建 + 立基础延展二阶 5 件立标登记判 = v63 接力棒独立判定 7 项 ① 异步协调 vs 单 Agent 顺序执行 vs 其他多 Agent 协调方案基线 + naive 多 Agent 对比定义 PDF §3 验证 ② Microsoft post-training harness 论文 GitHub repo 状态 + 6K 样本数据来源 + 有限算力配置 PDF §4 验证 ③ ExtractBench 4869 pages / 67 类 / 8 领域 + 14 VLM 横评完整名单 + word-level IoU 0.5 评分设计 PDF §3 验证 ④ 立基础延展二阶 #98 #99 #100 #101 #102 vs v62 立基础延展第 71-73 栖 LongHorizon-Harness + Self-Harness + c-CRAB 立标登记判 ⑤ 立基础延展二阶 #98 #99 #100 #101 #102 vs 治理第 47-49 栖 Datadog + awesome-harness-engineering + AgentDebug UIUC 立标登记判 ⑥ Harness engineering 自演进路线三联(Self-Harness + Microsoft post-training harness + HarnessOpt-Bench)vs 立基础延展二阶 5 件 + 治理 3 栖整合 ⑦ Async Coding Agent 范式与 LongHorizon-Harness MEA Loop + Zetta ζ + AID-Guard + Self-Harness 工程哲学证据链完整程度判断。
(258) §1.5 治理第 47-49 栖 Datadog + awesome-harness-engineering + AgentDebug paper_card 补建时机 = v63 接力棒独立判定 7 项 ① Datadog 官方博客原文获取完整命令/图表 + 5% 报错 60% rate limit 来源核实 ② TraceCoder arXiv 原文确认 ICSE 接收状态 + Pass@1 提升 34.43% 数字核验 ③ AgentDebug 17 种错误类型分类标准 Cohen's κ 验证 ④ ALFWorld/GAIA/WebShop 失败轨迹规模 ⑤ Datadog 与 v62 §1.5 推理引擎层安全 12h SLA + frontier lab 治理哲学 "厂商级 + frontier 治理级 + 第一方数据级" 治理三联 ⑥ awesome-harness-engineering 与 Braintrust/Langfuse/Opik 工程工具对比 ⑦ AgentDebug 与 41 种失败模式分类学 17 种 vs 41 种 调试导向 vs 归因导向互补。
(259) §1.6 Mobile Planner Agent 主轴预备 + RAG-ASR 级联 + Agent 评测生态动态 paper_card 补建 = v63 接力棒独立判定 5 项 ① MobilePA-Bench 24 votes 立标信号强度实测 ② ARC reward fairness 训练配方 ARC(Advantage Regularization via Conditioning) PDF §3-4 验证 ③ GameXpert-Bench 三阶段(构思→原型→迭代) 与 LongHorizon-Harness MEA Loop 三角色(Manager/Executor/Auditor) 关系 ④ Better Retrieval Worse Robustness arXiv:2608.22872 entity-graph linking + iterative reformulation 两种 RAG 扩展 PDF §4-5 验证 ⑤ AgentLongBench 10⁴–4×10⁶ token + LoCoBench-Agent + LifelongAgentBench 10K–4M token 与 LongHorizon-Harness 长视 Agent 主轴预备关系 + Hidden-in-Plain-Text RAG 安全基准与 PV-SST + AID-Guard 治理三联关系 + ViDoRe V3 26K 页面 + 3,099 查询六语言多模态 RAG 与 EnSI-RAG entity index 关系 + M3-BENCH 混合动机游戏评测与 GameXpert-Bench 关系。
(260) v60→v61→v62→v63 P0 警示栈:7 件持续 open + 11 件新增待核实 + 6 件 close 验证棒 + 4 件 P0 警示新增 = v63 接力棒必须决定:v60 P0-15 A2A CockroachDB 边界精化跨厂商迁移 + P0-21 OWASP MCP Top 10 beta 条目核实 + P0-22 SemaPLC paper_card P1 补建 + P0-23 StateM 374▲ 落出 top 15 8-22~8-29 8 日窗口复核 72h 沿用 + P0-24 推理引擎层 4 vendor × 6 CVE 跨 vendor 测试 + 12h SLA + P0-28 OpenAI AI Futures jay-on-stephen #P0 #1 + P0-29 5 件 work-queue Top 15 + 24 件 P1 缺口 + v61 P0-30~P0-35 沿用 + v62 P0-36 BrowseComp-Plus 关联澄清(已部分闭环)+ v62 P0-37 AID-Guard + Specification Portability + PV-SST 3 件 paper_card 补建时机 + v63 P0-38 41 种 Agent 失败模式分类学 arXiv:2607.28802 paper_card 补建时机 + v63 P0-39 paper_card 1067 Human-Centric Intelligence arXiv:2608.18184 主分类 engineering vs rag 双口径冲突(spark / Stephen / Jay / Tom 接力棒同步修正 · 删除 engineering 主分类为 rag 或保留 engineering 主分类) + P0 持续 open 7 件沿用 v58-v62(P0-1~P0-6 + P0-11 v58 + P0-12 MCP 9700 万次 + P0-13 StateM + P0-14 MCP 232% + P0-16 Meta-Harness COLM + P0-17 SWE-bench Pro + P0-18 HarnessRisk 90%+ + v63 P0-40 Datadog State of AI Engineering 2026 官方博客原文核实 + v63 P0-41 TraceCoder ICSE 2026 arXiv 原文确认接收状态)
5. 趋势判断
5.1 已发生
v62 立标饱和度三态切换 → v63 立标池饱和度供给侧第 14 日延续 + EnvHarness 258▲ 历史新高 + 立标机制升级第 9 日稳态 + 立标延革第 15+16+17+18+19 例预备预备预备预备预备 + 立基础延展二阶 5 件触发 + 治理第 47-49 栖候选新增 + §1.6 Mobile Planner Agent 主轴预备 + RAG-ASR 级联反直觉。
v62 四日 agent 主轴集中爆发 → v63 8-25 noon + evening 棒集中爆发延续 + 18 件 v60 + 13 件 v61 + 12 件 v62 + 16 件 v63 net-new arXiv = 评测延革系列 10 锚链完整分布 + HarnessEval-W 19→20 元组 + 41 种失败模式分类学 + §1.1 第 74-78 栖候选新增 + §1.5 治理 47-49 栖候选新增 + §1.6 Mobile Planner Agent 主轴预备 3 件。
v62 立基础延展 14 栖 → v63 立基础延展深化第 18+19 例预备预备触发 + 立基础延展二阶 5 件 + Memory 沿用 22 栖 + 治理 49 栖 + 评测 20 元组 + §1.6 Mobile Planner Agent 3 件预备 = 2026 H2 立基础延展深化 + 16 件 net-new 备料。
5.2 进行中
v62 NVIDIA Dynamo v1.4.1 → v63 Awesome-harness-engineering GitHub 顶级聚合仓库出现 = harness engineering 学术 → 工程转化里程碑(TraceCoder ICSE 2026 + AgentStepper 2026 NASA TLX 挫败感评分 5.4→2.4 + Braintrust/Langfuse/Opik 工程工具对比)。
v62 jay 1000+ JD 分析 → v63 jay engineering-e1prep + agent-eval-debugging-production = AWS 40.1% / Docker 31% / K8s 29.1% / LangChain 18.8% / FDE 2026H1 增长 4 倍 + Datadog 5% 报错 / 60% rate limit / 840 万次 rate limit/月 第一方生产 trace 数据。
v62 WRP + Kimi K2.5 + Simulator Collapse → v63 评测延革 15+16+17+18+19 例预备预备预备预备预备 + 立基础延展二阶 5 件触发 + 治理第 47-49 栖候选新增 + HarnessEval-W 20 元组 + 41 种失败模式分类学 + §1.6 Mobile Planner Agent 主轴预备 3 件 + RAG-ASR 级联反直觉发现。
5.3 可能在 2027 成为主线
v63 候选新增 14 主线(详见 v62 §5.3 14 主线 + v63 新增 0 主线 沿用):立基础延展二阶 5 件触发 + 治理第 47-49 栖候选新增 + HarnessEval-W 19→20 元组 + 评测延革 15-19 例预备预备预备预备预备 + §1.6 Mobile Planner Agent 主轴预备 + RAG-Agent 邻接级预备 + Agent 评测生态动态爆发补充;新增 14 主线说明见 §5.3 v62 12 主线 + v62 第 13+14 主线评测方法学延革系列 + 长视 Agent 元方法学主线 · 沿用不增量。
6. 工程落地框架
建议七十五项清单(v63 在 v62 七十五项基础上新增 5 条):
1-70. 沿用 v60 + v61 + v62 §6 1-70 条 + v62 §6 71-75 条。
v63 新增 76. 立基础延展二阶 5 件触发 + HarnessEval-W 19→20 元组 + 评测延革第 15-19 例预备预备预备预备预备:(a) 立基础延展二阶 #98 41 种 Agent 失败模式分类学 arXiv:2607.28802 = 六节点归因 model/harness/user/tools/memory/environment + Cohen's κ=0.76 substantial agreement + 5-30× 成本波动根因来自 harness 设计缺陷 = ⭐⭐ 中-高档(jay 8-25 0600 X-radar + spark 8-25 agent-e1prep + flyp 8-25 reliability-science)(b) 立基础延展二阶 #99 异步协调编码 Agent 3× wall-clock 加速 arXiv:2603.21489 = centralized async isolated delegation 模式 + isolation + 显式集成优于 naive 多 Agent = ⭐(c) 立基础延展二阶 #100 Microsoft post-training harness arXiv:2608.17528 = Qwen3.5-9B SWE-bench 41.8% → 56.4% · 6K 样本 · 有限算力 = ⭐(d) 立基础延展二阶 #101 ExtractBench LlamaIndex = 4869 pages / 67 类 / 8 领域 / word-level IoU 0.5 严格评分 / 14 VLM 横评 + LlamaParse tracked changes + LlamaExtract Agentic Plus = ⭐(e) 立基础延展二阶 #102 Async Coding Agent 范式 = 与 LongHorizon-Harness + Self-Harness 形成 Harness 范式 4 联 = ⭐ + 🔴 待核 41 种失败模式完整列表 + Cohen's κ=0.76 校准区间 + 5-30× 成本波动统计 PDF §4-5 验证 + 异步协调 vs 单 Agent vs 其他多 Agent 协调方案基线 + Microsoft post-training harness 6K 样本数据来源 + ExtractBench 14 VLM 横评完整名单。
v63 新增 77. §1.5 治理第 47-49 栖候选新增:(a) §1.5 第 47 栖 Datadog State of AI Engineering 2026 = 第一方生产 trace 数据(5% 报错 / 60% rate limit / 840 万次 rate limit/月)(jay 8-25 1450 ⭐⭐⭐⭐⭐)(b) §1.5 第 48 栖 awesome-harness-engineering GitHub 顶级聚合仓库 = TraceCoder ICSE 2026 Pass@1 +34.43% + AgentStepper 2026 NASA TLX 挫败感评分 5.4→2.4 + Braintrust/Langfuse/Opik 工程工具对比(jay 8-25 1450 ⭐⭐⭐⭐)(c) §1.5 第 49 栖 AgentDebug UIUC = 17 种错误类型 × 5 模块(memory/reflection/planning/action/system)+ AgentErrorBench ALFWorld/GAIA/WebShop 失败轨迹标注数据集 + 两阶段调试 pipeline(隔离根因 + 纠正反馈)+ MIT license + 源码和数据集(jay 8-25 1450 ⭐⭐⭐⭐)+ 🔴 待核 Datadog 官方博客原文 + TraceCoder arXiv 原文确认 ICSE 接收状态 + AgentDebug 17 种错误类型 Cohen's κ 验证 + ALFWorld/GAIA/WebShop 失败轨迹规模。
v63 新增 78. §1.6 Mobile Planner Agent 主轴预备 3 件 + RAG-Agent 邻接级预备 + Agent 评测生态动态:(a) §1.6 #1 MobilePA-Bench arXiv:2608.23035 移动端 Planner Agent 评测基准(votes: 24 8-25 早盘最强立标信号 · 填补 GUI 中心 + static function-calling 空白)(b) §1.6 #2 ARC arXiv:2608.13622 公平相对优势比较 Reward fairness(votes: 11 · ARC(Advantage Regularization via Conditioning) 训练配方)(c) §1.6 #3 GameXpert-Bench arXiv:2608.21833 编码 Agent 距游戏专家开发(votes: 5 · 三阶段(构思→原型→迭代)评测基准)(d) §1.2 RAG-Agent 邻接级 = Better Retrieval Worse Robustness arXiv:2608.22872 Multi-hop RAG 放大 ASR 错误(鲁棒性 vs 干净场景幻觉代价取舍判)(e) §1.6 Agent 评测生态动态 = AgentLongBench 10⁴–4×10⁶ token / LoCoBench-Agent / LifelongAgentBench 10K–4M token + Hidden-in-Plain-Text RAG 安全基准 + ViDoRe V3 26K 页面 + 3,099 查询六语言多模态 RAG + M3-BENCH 混合动机游戏评测 + 🔴 待核 MobilePA-Bench 24 votes 立标信号强度实测 + ARC reward fairness PDF §3-4 + GameXpert-Bench 三阶段与 LongHorizon-Harness MEA Loop 三角色关系。
v63 新增 79. 📚 paper_cards 8-25 净增 11 张 (1058-1068) + 主分类批量核对 + paper_card 1067 主分类冲突警示:(a) paper_cards 1058 EnSI-RAG(rag ✓)+ 1059 AID-Guard(agent ✓)+ 1060 Dis2Pat(evaluation ✓)+ 1061 SpecPort(agent ✓)+ 1062 PhysCaP(agent ✓)+ 1063 PV-SST(agent ✓)+ 1064 FlavourBench(evaluation ✓)+ 1065 SparsePR(multimodal ✓)+ 1066 Hydra-0(multimodal ✓)+ 1067 Human-Centric Intelligence(engineering ⚠️ vs rag 双口径冲突)+ 1068 UniSpace(multimodal ✓)+ paper_cards 总数 1078 → 1089(约 1% 净增)+ 🔴 P0-39 paper_card 1067 主分类冲突(spark / Stephen / Jay / Tom 接力棒同步修正 · 删除 engineering 主分类为 rag 或保留 engineering 主分类)。
v63 新增 80. 15 件 v63 net-new arXiv + 0 CVE + 3 URL + 5 实例协同矩阵 v63 接力棒:15 件 net-new arXiv = 2607.28802(41 种 Agent 失败模式分类学 · paper_card 待建)/ 2603.21489(异步协调编码 Agent 3× wall-clock · paper_card 待建)/ 2608.17528(Microsoft post-training harness · paper_card 待建)/ 2608.21031(PhysCaP Physics-Informed Code-as-Policy)/ 2608.18077(Hydra-0 Action Flow)/ 2608.08676(UniSpace)/ 2608.20574(FlavourBench · paper_card 1064)/ 2608.21249(Dis2Pat · paper_card 1060)/ 2608.18484(SparsePR)/ 2608.21360(OmniAssistBench · HF Daily 8-25 #12 27▲)/ 2608.12781(Beyond Correctness · HF Daily 8-25 #14 19▲)/ 2608.22872(Better Retrieval Worse Robustness Multi-hop RAG ASR 级联)/ 2608.23035(MobilePA-Bench · 24 votes)/ 2608.13622(ARC reward fairness · 11 votes)/ 2608.21833(GameXpert-Bench · 5 votes)/ + 3 URL(github.com/ulab-uiuc/AgentDebug · datadoghq.com/state-of-ai-engineering · github.com/ai-boost/awesome-harness-engineering) = arXiv 618+15=633 / CVE 18+0=18 / DOI:3 / URL 97+3=100(v62 沿用 + paper_card 主分类批量核对结果)。
v63 新增 81. 8 P0 警示沿用 v60-v62 + 3 P0 警示新增 P0-38 ~ P0-41 + 7 件 P0 警示沿用 v60:v62 §6 75 条 8 P0 警示沿用 + v63 P0-38 41 种 Agent 失败模式分类学 arXiv:2607.28802 paper_card 补建时机 + v63 P0-39 paper_card 1067 Human-Centric Intelligence arXiv:2608.18184 主分类 engineering vs rag 双口径冲突(spark / Stephen / Jay / Tom 接力棒同步修正 · 删除 engineering 主分类为 rag 或保留 engineering 主分类 · 已部分闭环) + v63 P0-40 Datadog State of AI Engineering 2026 官方博客原文核实 + v63 P0-41 TraceCoder ICSE 2026 arXiv 原文确认接收状态 + v60-v62 7 件 P0 警示沿用。
结论:v63 新增 = 立基础延展二阶 5 件触发 + HarnessEval-W 19→20 元组 + 评测延革第 15-19 例预备预备预备预备预备 + §1.5 治理第 47-49 栖候选新增 + §1.6 Mobile Planner Agent 主轴预备 3 件 + RAG-Agent 邻接级预备 + Agent 评测生态动态爆发补充 = 15 件 net-new arXiv + 0 CVE + 3 URL = arXiv 633 / CVE 18 / DOI 3 / URL 100。
7. 引用完整性附录
7.1 论文引用(按编号排序)
arXiv:2304.07193 arXiv:2310.11703 arXiv:2403.07652 arXiv:2409.10102 arXiv:2501.05444 arXiv:2501.09136 arXiv:2501.19139 arXiv:2502.02276 arXiv:2502.05167 arXiv:2502.05171 arXiv:2502.07115 arXiv:2502.08826 arXiv:2503.06728 arXiv:2503.09516 arXiv:2503.12646 arXiv:2603.21489 arXiv:2603.23448 arXiv:2503.29231 arXiv:2504.09554 arXiv:2504.11320 arXiv:2504.12330 arXiv:2504.14693 arXiv:2504.19874 arXiv:2505.07833 arXiv:2505.17086 arXiv:2505.19481 arXiv:2505.22571 arXiv:2505.24238 arXiv:2506.06252 arXiv:2506.06266 arXiv:2506.09498 arXiv:2506.19544 arXiv:2506.20869 arXiv:2507.06608 arXiv:2507.28074 arXiv:2507.28802 arXiv:2508.06600 arXiv:2508.08438 arXiv:2508.09442 arXiv:2508.09736 arXiv:2509.23040 arXiv:2510.04618 arXiv:2510.08544 arXiv:2510.15253 arXiv:2511.01545 arXiv:2511.04570 arXiv:2511.07663 arXiv:2511.16681 arXiv:2512.04388 arXiv:2512.05411 arXiv:2512.09695 arXiv:2512.12167 arXiv:2512.14629 arXiv:2601.00227 arXiv:2601.00273 arXiv:2601.04043 arXiv:2601.06037 arXiv:2601.06112 arXiv:2601.07504 arXiv:2601.07711 arXiv:2601.18137 arXiv:2601.19139 arXiv:2601.21557 arXiv:2602.00288 arXiv:2602.02007 arXiv:2602.02276 arXiv:2602.03442 arXiv:2602.05014 arXiv:2602.05152 arXiv:2602.07962 arXiv:2602.10133 arXiv:2602.10238 arXiv:2602.11224 arXiv:2602.11443 arXiv:2602.13647 arXiv:2602.14374 arXiv:2602.15763 arXiv:2602.16763 arXiv:2602.16901 arXiv:2602.18998 arXiv:2602.21566 arXiv:2602.23368 arXiv:2603.03251 arXiv:2603.03780 arXiv:2603.03781 arXiv:2603.04428 arXiv:2603.04445 arXiv:2603.05451 arXiv:2603.06503 arXiv:2603.06621 arXiv:2603.06728 arXiv:2603.07379 arXiv:2603.07670 arXiv:2603.10726 arXiv:2603.10765 arXiv:2603.12646 arXiv:2603.12707 arXiv:2603.13358 arXiv:2603.15569 arXiv:2603.16104 arXiv:2603.18272 arXiv:2603.20397 arXiv:2603.20847 arXiv:2603.21354 arXiv:2603.21972 arXiv:2603.23448 arXiv:2603.25152 arXiv:2603.26498 arXiv:2603.26670 arXiv:2603.27918 arXiv:2603.28052 arXiv:2603.28583 arXiv:2603.29010 arXiv:2603.29231 arXiv:2604.00901 arXiv:2604.01395 arXiv:2604.01647 arXiv:2604.01707 arXiv:2604.08571 arXiv:2604.09666 arXiv:2604.11978 arXiv:2604.14222 arXiv:2604.17227 arXiv:2604.18234 arXiv:2604.19157 arXiv:2604.22748 arXiv:2604.25724 arXiv:2604.25850 arXiv:2604.27032 arXiv:2605.00796 arXiv:2605.01280 arXiv:2605.01604 arXiv:2605.05538 arXiv:2605.06647 arXiv:2605.06760 arXiv:2605.07234 arXiv:2605.08717 arXiv:2605.09635 arXiv:2605.10834 arXiv:2605.11202 arXiv:2605.11733 arXiv:2605.12493 arXiv:2605.15957 arXiv:2605.17613 arXiv:2605.18770 arXiv:2605.19537 arXiv:2605.19743 arXiv:2605.19893 arXiv:2605.20173 arXiv:2605.20466 arXiv:2605.23950 arXiv:2605.24238 arXiv:2605.25475 arXiv:2605.25480 arXiv:2605.27123 arXiv:2605.27492 arXiv:2605.27922 arXiv:2605.28120 arXiv:2605.28732 arXiv:2605.29640 arXiv:2606.00610 arXiv:2606.01581 arXiv:2606.01613 arXiv:2606.01927 arXiv:2606.02522 arXiv:2606.02643 arXiv:2606.02964 arXiv:2606.05405 arXiv:2606.06252 arXiv:2606.07402 arXiv:2606.08340 arXiv:2606.09498 arXiv:2606.13141 arXiv:2606.14589 arXiv:2606.16409 arXiv:2606.17512 arXiv:2606.19544 arXiv:2606.19787 arXiv:2606.20295 arXiv:2606.26458 arXiv:2606.28070 arXiv:2607.00406 arXiv:2607.00482 arXiv:2607.01774 arXiv:2607.02574 arXiv:2607.02588 arXiv:2607.04763 arXiv:2607.05196 arXiv:2607.05382 arXiv:2607.05391 arXiv:2607.05708 arXiv:2607.05876 arXiv:2607.06560 arXiv:2607.06815 arXiv:2607.06820 arXiv:2607.07050 arXiv:2607.07383 arXiv:2607.07702 arXiv:2607.07740 arXiv:2607.07858 arXiv:2607.07953 arXiv:2607.08028 arXiv:2607.08057 arXiv:2607.08269 arXiv:2607.08395 arXiv:2607.08404 arXiv:2607.08459 arXiv:2607.08495 arXiv:2607.08646 arXiv:2607.08662 arXiv:2607.08700 arXiv:2607.08716 arXiv:2607.08765 arXiv:2607.08964 arXiv:2607.08973 arXiv:2607.09092 arXiv:2607.09172 arXiv:2607.09322 arXiv:2607.09349 arXiv:2607.09424 arXiv:2607.09701 arXiv:2607.10183 arXiv:2607.10400 arXiv:2607.10463 arXiv:2607.10522 arXiv:2607.11079 arXiv:2607.11111 arXiv:2607.11172 arXiv:2607.11250 arXiv:2607.11423 arXiv:2607.11505 arXiv:2607.11523 arXiv:2607.11594 arXiv:2607.11643 arXiv:2607.11683 arXiv:2607.11706 arXiv:2607.11736 arXiv:2607.11783 arXiv:2607.11862 arXiv:2607.11881 arXiv:2607.11886 arXiv:2607.12227 arXiv:2607.12310 arXiv:2607.12340 arXiv:2607.12395 arXiv:2607.12406 arXiv:2607.12463 arXiv:2607.12477 arXiv:2607.12746 arXiv:2607.12747 arXiv:2607.12764 arXiv:2607.13027 arXiv:2607.13034 arXiv:2607.13104 arXiv:2607.13125 arXiv:2607.13276 arXiv:2607.13399 arXiv:2607.13705 arXiv:2607.13988 arXiv:2607.14076 arXiv:2607.14187 arXiv:2607.14277 arXiv:2607.14387 arXiv:2607.14541 arXiv:2607.14777 arXiv:2607.14811 arXiv:2607.14830 arXiv:2607.14952 arXiv:2607.15058 arXiv:2607.15095 arXiv:2607.15161 arXiv:2607.15207 arXiv:2607.15257 arXiv:2607.15263 arXiv:2607.15278 arXiv:2607.15434 arXiv:2607.15495 arXiv:2607.15657 arXiv:2607.15901 arXiv:2607.16165 arXiv:2607.16190 arXiv:2607.16617 arXiv:2607.16955 arXiv:2607.17247 arXiv:2607.17250 arXiv:2607.17524 arXiv:2607.17715 arXiv:2607.17986 arXiv:2607.18069 arXiv:2607.18141 arXiv:2607.18142 arXiv:2607.18144 arXiv:2607.18149 arXiv:2607.18155 arXiv:2607.18171 arXiv:2607.18213 arXiv:2607.18529 arXiv:2607.18603 arXiv:2607.18754 arXiv:2607.18772 arXiv:2607.18825 arXiv:2607.19011 arXiv:2607.19215 arXiv:2607.19238 arXiv:2607.19297 arXiv:2607.19604 arXiv:2607.19636 arXiv:2607.19747 arXiv:2607.19865 arXiv:2607.19867 arXiv:2607.20061 arXiv:2607.20145 arXiv:2607.20346 arXiv:2607.20368 arXiv:2607.20465 arXiv:2607.20709 arXiv:2607.20734 arXiv:2607.20785 arXiv:2607.20868 arXiv:2607.20891 arXiv:2607.20911 arXiv:2607.20957 arXiv:2607.21051 arXiv:2607.21072 arXiv:2607.21324 arXiv:2607.21461 arXiv:2607.21485 arXiv:2607.21503 arXiv:2607.21553 arXiv:2607.21556 arXiv:2607.21557 arXiv:2607.21576 arXiv:2607.21596 arXiv:2607.21653 arXiv:2607.21655 arXiv:2607.21694 arXiv:2607.21962 arXiv:2607.22043 arXiv:2607.22091 arXiv:2607.22098 arXiv:2607.22157 arXiv:2607.22375 arXiv:2607.22389 arXiv:2607.22529 arXiv:2607.22561 arXiv:2607.22798 arXiv:2607.23193 arXiv:2607.23242 arXiv:2607.23402 arXiv:2607.23514 arXiv:2607.23518 arXiv:2607.23588 arXiv:2607.23802 arXiv:2607.23855 arXiv:2607.23909 arXiv:2607.24000 arXiv:2607.24027 arXiv:2607.24062 arXiv:2607.24117 arXiv:2607.24223 arXiv:2607.24280 arXiv:2607.24352 arXiv:2607.24368 arXiv:2607.24475 arXiv:2607.24554 arXiv:2607.24651 arXiv:2607.24653 arXiv:2607.24663 arXiv:2607.24720 arXiv:2607.24731 arXiv:2607.24744 arXiv:2607.24882 arXiv:2607.24904 arXiv:2607.24957 arXiv:2607.25236 arXiv:2607.25294 arXiv:2607.25308 arXiv:2607.25337 arXiv:2607.25379 arXiv:2607.25380 arXiv:2607.25398 arXiv:2607.25431 arXiv:2607.25498 arXiv:2607.25537 arXiv:2607.25565 arXiv:2607.25572 arXiv:2607.25600 arXiv:2607.25659 arXiv:2607.25675 arXiv:2607.25857 arXiv:2607.25895 arXiv:2607.25959 arXiv:2607.25996 arXiv:2607.26004 arXiv:2607.26037 arXiv:2607.26055 arXiv:2607.26057 arXiv:2607.26314 arXiv:2607.26410 arXiv:2607.26451 arXiv:2607.26475 arXiv:2607.26497 arXiv:2607.26520 arXiv:2607.26571 arXiv:2607.26637 arXiv:2607.26654 arXiv:2607.26760 arXiv:2607.26769 arXiv:2607.26784 arXiv:2607.27090 arXiv:2607.27146 arXiv:2607.27167 arXiv:2607.27180 arXiv:2607.27201 arXiv:2607.27205 arXiv:2607.27506 arXiv:2607.27600 arXiv:2607.27616 arXiv:2607.27816 arXiv:2607.27851 arXiv:2607.27918 arXiv:2607.27919 arXiv:2607.27958 arXiv:2607.28074 arXiv:2607.28126 arXiv:2607.28227 arXiv:2607.28229 arXiv:2607.28263 arXiv:2607.28319 arXiv:2607.28362 arXiv:2607.28374 arXiv:2607.28397 arXiv:2607.28509 arXiv:2607.28580 arXiv:2607.28595 arXiv:2607.28609 arXiv:2607.28617 arXiv:2607.28618 arXiv:2607.28633 arXiv:2607.28675 arXiv:2607.29007 arXiv:2607.29167 arXiv:2607.29402 arXiv:2607.29459 arXiv:2607.29591 arXiv:2607.29610 arXiv:2607.29677 arXiv:2607.29678 arXiv:2608.00267 arXiv:2608.00650 arXiv:2608.00675 arXiv:2608.00677 arXiv:2608.00730 arXiv:2608.00881 arXiv:2608.00902 arXiv:2608.00922 arXiv:2608.01247 arXiv:2608.01526 arXiv:2608.01651 arXiv:2608.01678 arXiv:2608.01735 arXiv:2608.01964 arXiv:2608.02218 arXiv:2608.02583 arXiv:2608.02703 arXiv:2608.02713 arXiv:2608.02870 arXiv:2608.02989 arXiv:2608.03451 arXiv:2608.03499 arXiv:2608.03506 arXiv:2608.03756 arXiv:2608.03764 arXiv:2608.03874 arXiv:2608.03887 arXiv:2608.03893 arXiv:2608.03979 arXiv:2608.04003 arXiv:2608.04530 arXiv:2608.04569 arXiv:2608.04964 arXiv:2608.05102 arXiv:2608.05138 arXiv:2608.05604 arXiv:2608.05703 arXiv:2608.05747 arXiv:2608.05784 arXiv:2608.06020 arXiv:2608.06033 arXiv:2608.06130 arXiv:2608.06146 arXiv:2608.06197 arXiv:2608.06216 arXiv:2608.06301 arXiv:2608.06312 arXiv:2608.06329 arXiv:2608.06352 arXiv:2608.06729 arXiv:2608.06790 arXiv:2608.06867 arXiv:2608.07009 arXiv:2608.07152 arXiv:2608.07370 arXiv:2608.07446 arXiv:2608.07458 arXiv:2608.07545 arXiv:2608.07645 arXiv:2608.08020 arXiv:2608.08097 arXiv:2608.08119 arXiv:2608.08160 arXiv:2608.08311 arXiv:2608.08466 arXiv:2608.08621 arXiv:2608.08676 arXiv:2608.08722 arXiv:2608.08814 arXiv:2608.08975 arXiv:2608.09096 arXiv:2608.09158 arXiv:2608.09766 arXiv:2608.09779 arXiv:2608.09802 arXiv:2608.09867 arXiv:2608.09888 arXiv:2608.09900 arXiv:2608.10288 arXiv:2608.10299 arXiv:2608.10450 arXiv:2608.10708 arXiv:2608.10720 arXiv:2608.10744 arXiv:2608.10875 arXiv:2608.11030 arXiv:2608.11205 arXiv:2608.11367 arXiv:2608.11632 arXiv:2608.11660 arXiv:2608.11745 arXiv:2608.11924 arXiv:2608.12036 arXiv:2608.12149 arXiv:2608.12184 arXiv:2608.12218 arXiv:2608.12253 arXiv:2608.12304 arXiv:2608.12307 arXiv:2608.12313 arXiv:2608.12314 arXiv:2608.12440 arXiv:2608.12743 arXiv:2608.12781 arXiv:2608.12875 arXiv:2608.13120 arXiv:2608.13237 arXiv:2608.13410 arXiv:2608.13489 arXiv:2608.13505 arXiv:2608.13545 arXiv:2608.13546 arXiv:2608.13547 arXiv:2608.13552 arXiv:2608.13558 arXiv:2608.13560 arXiv:2608.13622 arXiv:2608.13947 arXiv:2608.14036 arXiv:2608.14229 arXiv:2608.14333 arXiv:2608.14376 arXiv:2608.14929 arXiv:2608.15089 arXiv:2608.15669 arXiv:2608.15767 arXiv:2608.15888 arXiv:2608.16072 arXiv:2608.16157 arXiv:2608.16590 arXiv:2608.16859 arXiv:2608.16885 arXiv:2608.16977 arXiv:2608.17050 arXiv:2608.17067 arXiv:2608.17253 arXiv:2608.17271 arXiv:2608.17310 arXiv:2608.17379 arXiv:2608.17393 arXiv:2608.17402 arXiv:2608.17426 arXiv:2608.17528 arXiv:2608.17536 arXiv:2608.17597 arXiv:2608.17781 arXiv:2608.17950 arXiv:2608.17960 arXiv:2608.18027 arXiv:2608.18063 arXiv:2608.18077 arXiv:2608.18184 arXiv:2608.18484 arXiv:2608.18489 arXiv:2608.18565 arXiv:2608.18607 arXiv:2608.18613 arXiv:2608.18746 arXiv:2608.18852 arXiv:2608.19197 arXiv:2608.19758 arXiv:2608.19799 arXiv:2608.19854 arXiv:2608.19857 arXiv:2608.19880 arXiv:2608.19936 arXiv:2608.20169 arXiv:2608.20246 arXiv:2608.20281 arXiv:2608.20317 arXiv:2608.20319 arXiv:2608.20331 arXiv:2608.20335 arXiv:2608.20338 arXiv:2608.20438 arXiv:2608.20574 arXiv:2608.21031 arXiv:2608.21159 arXiv:2608.21208 arXiv:2608.21249 arXiv:2608.21252 arXiv:2608.21360 arXiv:2608.21833 arXiv:2608.22872 arXiv:2608.23035
7.2 CVE、DOI 与 URL
CVE-2025-32711 CVE-2025-49596 CVE-2026-14890 CVE-2026-22778 CVE-2026-26029 CVE-2026-3059 CVE-2026-3060 CVE-2026-30623 CVE-2026-3172 CVE-2026-33626 CVE-2026-3989 CVE-2026-4372 CVE-2026-5059 CVE-2026-54769 CVE-2026-57572 CVE-2026-59726 CVE-2026-61447 CVE-2026-73558
DOI:10.1145/3770854.3780171 DOI:10.1145/3770855.3818074 DOI:10.48550/arXiv.2602.23368
https://aembit.io/blog/the-ultimate-guide-to-mcp-security-vulnerabilities https://alice-labs.com/best-ai-agent-frameworks-2026 https://alphasignalai.substack.com/p/rag-and-long-context-arent-enough https://anthropic.com/news/discovering-cryptographic-weaknesses-with-claude https://anthropic.com/news/three-real-world-incidents-cybersecurity-evaluations https://app.opencve.io/cve?product=vllm&vendor=vllm-project https://arxiv.org/abs/2602.23368 https://arxiv.org/abs/2604.25724 https://arxiv.org/html/2606.14589v1 https://arxiv.org/html/2608.06301v1 https://ascendai.csdn.net/69d4c85172111d255bf7caad.html https://blog.bytebytego.com/p/how-chatgpt-optimizes-its-agent-loop https://blog.cloudflare.com/agent-access-model https://blog.csdn.net/xx_nm98/article/details/158851692 https://blog.gitguardian.com/hugging-face-breach-ai-agent-security-lessons https://buzzgrewal.medium.com/ai-agents-dont-need-vector-search-anymore-inside-the-agentic-search-stack-replacing-rag-in-2026-58efcabe4f6f https://cameronrwolfe.substack.com/p/agentic-rl https://chatpaper.com/chatpaper/paper/241604 https://christian-schneider.net/blog/rag-security-forgotten-attack-surface https://codingwithroby.substack.com/p/the-2026-ai-agent-stack-drawn-from https://cockroachlabs.com/blog/a2a-agent-state-data-layer/ https://www.datadoghq.com/state-of-ai-engineering https://dblp.org/rec/journals/corr/abs-2602-23368 https://developers.googleblog.com/scaling-ai-agent-infrastructure-with-the-mcp-stateless-updates https://docs.aws.amazon.com/sagemaker/latest/dg/monitoring-cloudwatch-detailed-observability.html https://emergentmind.com/topics/harnessopt https://forbes.com/sites/janakirammsv/2026/08/19/trueforge https://futureagi.com/blog/llm-incident-response-playbook-2026 https://futureagi.substack.com https://futureagi.substack.com/p/the-llm-incident-runbook-six-steps-f27 https://github.com/AMAP-ML/LongHorizon-Harness https://github.com/JustVugg/colibri https://github.com/LLMSecurity/awesome-agent-skills-security https://github.com/TencentCloud/TencentDB-Agent-Memory https://github.com/ai-boost/awesome-harness-engineering https://github.com/cyberlife-coder/VelesDB https://github.com/epoch-research/MirrorCode https://github.com/google-research/envharness https://github.com/karpathy/autoresearch https://github.com/karpathy/nanochat https://github.com/lyogavin/airllm https://github.com/microsoft/Echoverse https://github.com/microsoft/orchard https://github.com/microsoft/SymCrypt/tree/feature/verifiedcrypto https://github.com/sgl-project/sglang https://github.com/simonw/datasette-mcp https://github.com/simonw/mcp-explorer https://github.com/truefoundry/trueforge https://github.com/ulab-uiuc/AgentDebug https://github.com/volcengine/OpenViking https://hodgesj.substack.com/p/zero-to-hero-benchmarksdatasets-for https://huggingface.co/blog/agent-intrusion-technical-timeline https://huggingface.co/blog/security-incident-july-2026 https://huggingface.co/datasets/microsoft/Echoverse https://importai.substack.com/p/import-ai-469-science-ai-rsi-simulator https://kili-technology.com/blog/agentic-ai-benchmarks-guide-what-they-are-how-they-work https://kodemsecurity.com/resources/cve-2026-22778-critical-remote-code-execution-in-vllm-multimodal-inference https://labs.cloudsecurityalliance.org/agentic/agentic-mcp-security-best-practices-v1 https://labs.cloudsecurityalliance.org/research/csa-research-note-huggingface-autonomous-agent-breach-202607 https://labs.scale.com/papers/harnessopt-bench https://lilianweng.github.io/posts/2026-07-04-harness/ https://mem0.ai/blog/state-of-ai-agent-memory-2026 https://microsoft.com/en-us/research/blog/echoverse-deep-evolving-environments-for-computer-use-agents/ https://microsoft.com/en-us/research/blog/orchard-an-open-framework-for-scalable-agentic-ai/ https://openai.com/index/hugging-face-model-evaluation-security-incident https://opensourcedofu.com/2026/08/truefoundry-launches-trueforge https://orca.security/resources/blog/sglang-llm-framework-rce-vulnerabilities https://parallel.ai/articles/what-is-an-agent-harness https://particula.tech/blog/sglang-vs-vllm-inference-engine-comparison https://pulumi.com/blog/building-ai-agents-cli-vs-mcp https://shadowdancer-1.github.io https://simonwillison.net/2026/Aug/7/openai-timeline/ https://simonwillison.net/2026/Aug/8/now-we-have-a-timeline-of-the-openai-accidental-attack-against-h https://simonwillison.net/2026/Jul/28/anatomy-of-a-frontier-lab-agent-intrusion https://simonwillison.net/2026/Jul/31/stateless-mcp/ https://snyk.io/news/snyk-2026-state-of-agentic-ai-adoption-volume-ii https://sparai.org/projects/f26/recPcCQjmdWCEjPJL https://spheron.network/blog/vllm-vs-tensorrt-llm-vs-sglang-benchmarks https://sysdig.com/blog/cve-2026-33626-how-attackers-exploited-lmdeploy-llm-inference-engines-in-12-hours https://syncsoft.ai/en/blog/agentic-rag-evaluation-metrics-2026 https://theaiengineer.substack.com/p/the-2026-ai-agent-stack-drawn-from https://theaiengineer.substack.com/p/the-ai-agents-stack-2026-edition https://theaiengineer.substack.com/p/the-agents-stack-2026-edition https://theaiengineer.substack.com/p/why-ai-agents-keep-failing-in-production https://theaiengineer.substack.com/p/vllm-vs-ollama-vs-sglang-vs-tensorrt https://thenewstack.io/model-context-protocol-roadmap-2026 https://velesdb.com https://vllm.ai/blog/2026-07-22-kimi-k3-preview https://witness.ai/blog/rag-security https://www.amazon.science/publications/keyword-search-is-all-you-need-achieving-rag-level-performance-without-vector-databases-using-agentic-tool-use https://www.braintrust.dev/articles/best-ai-agent-debugging-tools-2026 https://www.cockroachlabs.com/blog/a2a-agent-state-data-layer/ https://www.datadoghq.com/state-of-ai-engineering https://www.freecodecamp.org/news/ai-evaluation-engineering-build-a-production-grade-llm-evaluation-platform-handbook https://www.microsoft.com/en-us/research/blog/echoverse-deep-evolving-environments-for-computer-use-agents/ https://www.microsoft.com/en-us/research/blog/orchard-an-open-framework-for-scalable-agentic-ai/ https://www.opensourceforu.com/2026/08/truefoundry-launches-trueforge https://www.preprints.org/manuscript/202604.0428/v1 https://www.sysdig.com/blog/cve-2026-33626-how-attackers-exploited-lmdeploy-llm-inference-engines-in-12-hours https://aiamastery.substack.com https://aimultiple.com/agentic-llm https://zenn.dev/retrieva_tech/articles/f4386f6b246b34