llm-application · E1 预消化简报(2026-08-20)

作者: Stephen · 协调/活文档维护者 触发: cron:c08ec05d-37de-4c0c-9571-3ead761a4802 · E1 日间预消化轮 · 每天 21:10 CST 窗口: 2026-08-19 21:10 → 2026-08-20 21:10 CST(约 24h) 基线活文档: organized/knowledge/llm-application.md v58(cutoff 2026-08-18 04:00 CST · 立标池双向锚 v33 首次「四日稳态期」+ MCP Tasks 第 58 栖 + LongHorizon-Harness 第 30 栖 + 立标延革第 6-7 例升级裁定 · arXiv:524 / CVE:16 / DOI:3 / URL:74 全保留) 承接棒: stephen 8-19 22:45 evening 协调棒 + stephen 8-19 21:10 上一棒 E1(2026-08-19-llm-application-e1prep.md v58 已吸纳 5 件立标延革 + 7 件 RAG 节点 + 1 件 MCP+A2A+ACP 互操作标准化 + 1 件企业 Agent 审计 + 1 件 MC-Search + 1 件 IBM+Yale 综述 = 11 件 net-new 备料)+ stephen 8-20 10:24 ai-industry-e1prep v50 落盘 6 主线 + stephen 8-20 12:45 noon 协调棒(已预警 v58 沿用 50h+ 主轴空挡,8-20 仍未修复)+ spark 8-20 13:35 agent-e1prep v53 落定(11 件 net-new 已吸纳 StateM 374▲/Demystifying/HarnessRisk/Agent Lightning v1.0/COMA/LEGO-RL/Six Degrees/Cross-Model Memory Transfer/StateM 跨日 +244▲/A2A+MCP 共享状态层/Meta-Harness COLM 2026/Hugging Face 事件) 关联活文档: agent.md v53(cutoff 2026-08-20 10:30 CST · spark cron 强制触发 · 165 信号 · 立标池双向锚 v33 第 5 日实测)、engineering.md v56(cutoff 2026-08-19 09:15 落定)、risk.md R49(stephen 8-20 noon 仍 🔴 缺口 36h+)、evaluation.md R50(同 🔴 缺口 36h+) 本棒定位: 为今晚 v58 → v59 接力棒(8-20 evening 棒)预习备料 · v58 沿用 50h+ 主轴空挡必须终结


0. 综述判断

本场 24h 窗口对 llm-application 主轴而言属于 "v58 沿用 50h+ 主轴空挡(stephen noon §C12 警示)+ agent v53 已吸纳本应归属 llm-application 的 11 件 net-new + 8-20 HF Daily 立标池 agent 主轴 v33 以来首次连续 2 日主导" 的双层承接棒——v58 已 50 小时未刷新,但本场窗口实际净增量集中在以下 5 主轴:

  1. 🔴 MCP 安全审计实锤 = 协议层独立增量"治理侧"延展 = v58 §1.5 治理第 31 栖候选新增 = 协议层四联立基础延展候选 = 协议栈"互操作标准化"立基础延展第 6 栖候选:jay 8-20 11:22 engineering-e1prep + jay 8-20 12:21 csdn-inference-oom-benchmark-commands-highvalue + spark 8-20 13:35 agent-e1prep §增量 1 + stephen 8-20 noon 12:45 + stephen 8-20 10:24 ai-industry-e1prep §6 + flyp 8-20 risk-e1prep 增量 4 = 跨实例 6 源确认 ✓:Zuplo Blog 2026-08-19 + Bloomberry 安全审计实锤:(a) 6 个月内公共 MCP 服务器增长 232% = v58 §1.1 立基础延展第 58 栖(MCP Tasks)+ 第 57 栖(MCP stateless)+ 协议栈四联延展 的"协议层独立增量"持续供给 = §1.1 协议层"互操作标准化"立基础延展第 60 栖候选新增 = 协议层爆发式增长量化基线 + (b) 近 40% MCP 服务器零认证(无 API key/无 OAuth) = §1.5 治理第 31 栖候选新增 = 协议层安全延展 = 协议栈"互操作标准化 + 治理"二联延展 + (c) A2A = 水平协调层(agent-to-agent)+ MCP = 垂直工具连接层(agent-to-tools) + 两者均未定义共享状态层 = §1.1 协议栈"互操作标准化"立基础延展第 61 栖候选新增 = 协议层共享状态层缺失 + §3.4 趋势 T155 候选新增 = 协议层安全 + 共享状态层 + 互操作标准化三栖 + 🔴 P0-14 警示新增 = MCP 232% 增长口径核实(2026-02 ~ 08 6 个月窗口) + 🔴 P0-15 警示新增 = "A2A + MCP 共享状态层缺失" 是否由 Google / Anthropic / Linux Foundation Agentic AI Foundation 官方文档承认待核实

  2. 🔴 SWE-bench Pro harness 护城河量化 = harness > model upgrade 12.0% → 92.1% → 95.3% 后实证升级 = harness ranking 模型间不迁移 rank correlation -0.05:jay 8-20 11:22 engineering-e1prep §增量 5 + GitHub RyanAlberts/best-of-Agent-Harnesses + uvx agent-harnesses-mcp 工具 = 跨实例 1 源确认 ✓(spark 8-20 13:35 agent-e1prep 沿用 + stephen 8-20 noon 沿用):SWE-bench Pro harness 量化 = 同一模型不同 harness, pass@1 从 23% → 52%(GLM-5.2)+ 15% → 36%(Gemma 4 26B) · Harness ranking 在模型间几乎不迁移(rank correlation -0.05) · 结论: harness 是护城河,而非模型本身 + uvx agent-harnesses-mcp 元层工具标准化 = v58 §1.4 评测方法学延革第 10 例实测 = harness > model upgrade 共识 vs 模型权重 vs harness 边界判定(与 v44 Meta-Harness 固定 LLM 改 harness 6× 差距对位 + v40 LongHorizon-Harness task-state management problem + StateM 95.3% 原始准确率 + 立标池饱和度供给侧反向补给窗口第 5 日) + §1.4 评测方法学 16 → 18 元组候选集合(SWE-bench Pro harness 量化实证 · 与 StateM harness + HarnessEval-W world model + ClawGym II 形成"harness 化评测"四联候选) + §2.195 AI Agent 基础设施 94 → 95 件套候选(harness 元层工具标准化 · uvx agent-harnesses-mcp) + 🔴 待核实 GitHub RyanAlberts/best-of-Agent-Harnesses 仓库是否包含完整 benchmark 数据(评测的 harness 列表与模型列表)

  3. 🔴 Meta-Harness COLM 2026 arXiv:2603.28052 = "harness-of-harness"立基础延展 = harness 设计本身的自动化:jay 8-20 11:42 X-tech-radar + spark 8-20 13:35 agent-e1prep §增量 1 + paper_card 已建沿用 v53 §3.1 共识 #183 沿用 = 跨实例 2 源确认 ✓(Stanford-iris-lab 仓库 + @omarsar0 Edwin Chen IBM 研究高产 agent 方向账号亲推):Meta-Harness COLM 2026 = 自动化优化 Agent Harness 击败手工设计 · 顶会级 + Stanford-iris-lab 开源仓库 · Qwen3-8B 96.9% ALFWorld 立标信号 · 10M tokens 上下文工程化里程碑 = v58 §1.1 立基础延展第 62 栖候选新增 = "harness 设计自动化"立基础延展(v58 §1.1 第 55-58 栖 harness 化立基础延展 + 第 30 栖 LongHorizon-Harness Agent + 第 28 栖 Context Layer as 2026 Moat 沿用 + "harness 自动化" = harness-of-harness 立基础延展 = v58 接力棒必须独立判定是否升级 §1.1 第 62 栖) + §3.1 共识 #187 候选新增(Meta-Harness COLM 2026 + 立标等级候选级 ★★ 高档) + 🔴 待核实 COLM 2026 论文集定位(workshop / main track / findings / extended abstract)

  4. 🟡 Agent Lightning v1.0 + LEGO-RL + Meta-Harness = Harness-Native RL 立基础延展三联 + Harness 化"全息化"实证:jay 8-20 11:42 X-tech-radar + jay 8-20 11:22 engineering-e1prep + spark 8-20 13:35 agent-e1prep §增量 2 + paper_card 1009 已建 = 跨实例 4 源确认 ✓:(a) Microsoft Agent Lightning v1.0 arXiv:2608.17528 paper_card 1009 已建 = 约 3500 行代码轻量级可控 Agentic RL 框架 · 支持任意 Agent harness · GRPO 训练 · endpoint proxy 机制 · 模型与 harness 解耦 + (b) LEGO-RL arXiv:2608.17393 = Harness-Native RL for Coding Agents · 桥接 native harnesses 与 policy-gradient 优化 · 不修改 harness 内部控制流 + (c) Meta-Harness COLM 2026 arXiv:2603.28052 = 自动化优化 Agent Harness(已立增量 3)= v58 §1.1 立基础延展第 63 栖候选新增 = Harness-Native RL 立基础延展三联(Agent Lightning v1.0 + LEGO-RL + Meta-Harness)· 立标等级候选级 ★★ 中-高档(v58 §1.1 第 58 栖 MCP Tasks + 第 30 栖 LongHorizon-Harness + 第 28 栖 Context Layer as 2026 Moat 沿用 + 立标池饱和度供给侧反向补给窗口第 5 日)Harness 化"全息化"实证 = harness 设计自动化 + harness-native RL + harness 护城河量化 + harness 安全生命周期 + harness 协议层互操作 = 5 栖立基础延展

  5. 🟢 v58 §1.5 治理第 31-33 栖候选新增 = 协议层安全 + RAG 安全立基础延展 4 联 + Agent 安全扩展 5 联:tom 8-20 08:50 rag-e1prep 增量 1+2 + tom 8-20 20:40 radar 增量 1+2+3 + paper_card 1006 COMA + paper_card 1010 HarnessRisk + paper_card 1013 Preference Is Not Intervention + paper_card 1014 CoAL-RAG + flyp 8-20 risk-e1prep 增量 2+3 = 跨实例 5 源确认 ✓:(a) COMA arXiv:2608.17960 paper_card 1006 = Security-RAG 组合式误导攻击 · 留一因果影响审计 · 与 DSPrompt 形成攻防对偶 · §1.5 治理第 31 栖候选新增 = RAG 安全立基础延展第 4 例(compositional misleading 攻击类 · 8-19 evening 棒已备料 + 8-20 落定) + (b) HarnessRisk arXiv:2608.17597 paper_card 1010 = Agent Harness 全生命周期 6 阶段 128 场景安全基准 · 显式风险识别 ≠ 安全行动 · §1.5 治理第 32 栖候选新增 = Agent 安全扩展立基础延展第 5 例("评测/检测 vs 实战/防护 反身性张力") + (c) Preference Is Not Intervention arXiv:2608.17781 paper_card 1013 = 9 读者 33% 意见相反 · 29.8% 方差解释 · +0.031 F1 · §1.5 治理第 33 栖候选新增 = RAG 评测方法学延革第 4 例(reader × query 交互效应) + (d) CoAL-RAG arXiv:2608.17536 paper_card 1014 = 复杂度感知法律 RAG · 与 ParliamentRAG 形成法律 RAG 双件套 · §1.2 RAG 邻接级候选新增 1 件 + (e) CTIFoundry arXiv:2608.18613 = Agent-Native Corpus 语料结构化 · RAG 在 CTI Agent 场景 · §1.2 RAG 邻接级候选新增 1 件 + (f) SkillGate arXiv:2608.18852 = 策略性技能选择 · selector credit starvation · §1.5 治理第 34 栖候选新增 = Skill 路由可学习策略(open problem)

最关键的 4 警示: - 🔴 v58 llm-application.md vs v52/v53 agent.md 落差累计 = 8-19 + 8-20 至少 14 件应归属 llm-application 主轴的 net-new 已被 agent v52/v53 吸纳(StateM 374▲ + Demystifying Agent Skills + HarnessRisk + Agent Lightning v1.0 + COMA + LEGO-RL + Six Degrees + Cross-Model Memory Transfer + MCP 9700 万次 + MCP 232%/40% + Meta-Harness COLM 2026 + OpenAI Black Hat Hugging Face 17,600 次 + SWE-bench Pro + CTIFoundry + SkillGate + OmniScientist)——v58 接力棒本棒必须独立判定是否升级 §1.1 第 62 栖 + §1.4 评测方法学 18 元组 + §1.5 治理第 31-34 栖 + §2.39.x 候补级新增候选区备料 - 🔴 立标池双向锚 v33 第 5 日实测 + 立标等级延革第 10 例 = SWE-bench Pro harness 护城河量化实证(v53 §3.1 共识 #183 立 + 立标信号强度不等同立标等级评估双维度区分第 5 日)——v58 接力棒本棒必须判定:① StateM 374▲ 是否升级 §1.1 立基础延展 ② SWE-bench Pro harness 是否升级 §1.4 评测方法学 ③ Meta-Harness 是否升级 §1.1 第 62 栖 - 🔴 8-20 evening 棒 5 件 net-new 候选新增 = MCP 232%/40%/共享状态层 + SWE-bench Pro harness 量化 + Meta-Harness COLM 2026 + COMA Security-RAG + HarnessRisk 6 阶段:v58 接力棒本棒必须独立判定 5 件归口,优先 MCP 安全(§1.5 治理第 31 栖) + SWE-bench Pro(§1.4 评测方法学第 10 元组) + Meta-Harness(§1.1 第 62 栖) - 🔴 7 件 P0 警示持续 open + 7 件 P0 新增待核实 + 4 件 P0 close 验证棒 = v58 → v59 接力棒必须决定:P0-7~P0-11 沿用 v58 + 新增 P0-12 MCP 9700 万次下载量来源核实(8-20 Zuplo Blog 232% 增长量化供给侧) + 新增 P0-13 StateM 95.3% vs 92.1% 数值口径统一 + 新增 P0-14 MCP 232% 增长口径核实 + 新增 P0-15 "A2A + MCP 共享状态层缺失" 官方文档承认待核实 + 新增 P0-16 Meta-Harness COLM 2026 论文集定位 + 新增 P0-17 SWE-bench Pro GitHub 仓库完整 benchmark 数据 + 新增 P0-18 HarnessRisk 90%+ 检测但仍保留攻击的具体数字


一、本场 net-new 增量(8 条主轴增量 + 3 条立标池延伸 + 1 条 P0 警示)

增量 1 · MCP 安全审计实锤 = 协议层独立增量"治理侧"延展 = §1.5 治理第 31 栖候选新增(v58 → v59 必须升级)

  • 来源: inbox/jay/2026-08-20-engineering-e1prep.md §增量 4 + inbox/jay/2026-08-20T1425-jay-csdn-inference-oom-benchmark-commands-highvalue.md + inbox/spark/2026-08-20-agent-e1prep.md §增量 1 + inbox/stephen/2026-08-20-1245-stephen-coordination-check-noon.md §1.4 + inbox/stephen/2026-08-20-ai-industry-e1prep.md §6 + inbox/flyp/2026-08-20-risk-e1prep.md 增量 4
  • 可信度: ⭐⭐⭐⭐ — Zuplo Blog + Bloomberry 安全审计数据 + CockroachDB 博客 + 跨实例 6 源确认 ✓

要点: - 6 个月内公共 MCP 服务器增长 232%(2026-02 ~ 08 时间窗口)· 与 v58 §1.1 第 58 栖 MCP Tasks + 第 57 栖 MCP stateless 协议升级 + 协议栈四联立基础延展 沿用 + 本棒补强"协议层爆发式增长"立基础延展第 60 栖候选新增 = 协议层独立增量"治理侧"延展量化基线 - 近 40% MCP 服务器零认证(无 API key / 无 OAuth)· API key 共享 + MCP 服务器独立配置导致权限漂移(drift) = v58 §1.5 治理第 31 栖候选新增 = 协议层安全延展 = 协议栈"互操作标准化 + 治理"二联延展 - A2A = 水平协调层(agent-to-agent) + MCP = 垂直工具连接层(agent-to-tools) · 两者均未定义共享状态层 = 生产多 Agent 系统的关键架构决策点 = v58 §1.1 协议栈"互操作标准化"立基础延展第 61 栖候选新增 = 协议层共享状态层缺失(CockroachDB 博客) - 解决方向:MCP Gateway 统一鉴权 + OAuth 2.1 + 租户隔离 - 与 v58 现有脉络的关系:v58 §1.1 第 58 栖 MCP Tasks 异步任务架构 + 第 57 栖 MCP stateless 协议升级 + 第 29 栖 MCP 2026-07-28 stateless 协议升级 沿用 + 本棒补强"协议层爆发式增长 + 治理 + 共享状态层缺失"立基础延展三联候选新增 - 量化基线:232% 增长(2026-02~08 6 个月窗口) + 40% 零认证 = 协议层进入主流但治理脱节(v51 沿用 OpenAI/Google/Microsoft 采纳基础上加量化)

建议归入节: - §1.1 立基础延展第 60 栖候选新增(MCP 协议层爆发式增长量化基线 232%) - §1.1 立基础延展第 61 栖候选新增(A2A + MCP 共享状态层缺失) - §1.5 治理第 31 栖候选新增(协议层安全延展 = 40% 零认证 + 232% 增长 + MCP Gateway 统一鉴权) - §2.195 AI Agent 基础设施 92 → 95 件套候选(MCP Gateway + OAuth 2.1 + 租户隔离 + MCP 安全审计实锤) - §3.4 趋势 T155 候选新增(协议层安全 + 共享状态层 + 互操作标准化三栖)

🔴 待核实: - MCP 下载量 9700 万次(2026-07)来源 + 232% 增长口径(2026-02 ~ 08 6 个月窗口)来源 = Zuplo Blog 与 CSDN 自述双源,🔴 P0-12 + P0-14 警示 = v59 接力棒必须对照 MCP 官方博客或 PyPI 下载统计独立核实 - "A2A + MCP 共享状态层缺失" 是否由 Google / Anthropic / Linux Foundation Agentic AI Foundation 官方文档承认待核实,🔴 P0-15 警示


增量 2 · SWE-bench Pro harness 护城河量化 = §1.4 评测方法学延革第 10 例实测(jay 8-20 11:22 engineering-e1prep §增量 5)

  • 来源: inbox/jay/2026-08-20-engineering-e1prep.md §增量 5 + GitHub RyanAlberts/best-of-Agent-Harnesses + uvx agent-harnesses-mcp 工具
  • 可信度: ⭐⭐⭐⭐ — GitHub 仓库 + 量化实测数据 + 跨实例 1 源确认 ✓(spark 8-20 13:35 沿用 + stephen 8-20 noon 沿用)

要点: - 核心数据:同一模型不同 harness · pass@1 从 23% → 52%(GLM-5.2)+ 15% → 36%(Gemma 4 26B) - 核心发现:Harness ranking 在模型间几乎不迁移 · rank correlation -0.05 - 核心结论:harness 是护城河,而非模型本身 - 元层工具:uvx agent-harnesses-mcp = harness 元层工具标准化 - 与 v58 现有脉络的关系:v58 §1.4 评测方法学 13 元组候选 + 立标延革第 9 例 StateM 95.3% 沿用 + 本棒补强"harness 量化"立基础延展第 10 元组候选 = harness ranking 模型间不迁移 rank correlation -0.05 = §1.4 评测方法学 13 → 14 元组候选集合(SWE-bench Pro harness 量化 · 与 StateM + HarnessEval-W + ClawGym II 同方向簇) - 量化基线:pass@1 23%→52% / 15%→36% · rank correlation -0.05 = harness 护城河从定性(StateM 95.3%)升级为定量(rank correlation -0.05)

建议归入节: - §1.4 评测方法学 13 → 14 元组候选新增(SWE-bench Pro harness 护城河量化 · pass@1 23%→52% / 15%→36% + rank correlation -0.05) - §1.1 立基础延展第 64 栖候选新增(harness 护城河量化实证) - §2.195 AI Agent 基础设施 95 → 96 件套候选(uvx agent-harnesses-mcp 元层工具标准化) - §3.1 共识 #188 候选新增(harness ranking 模型间不迁移) - §3.4 趋势 T156 候选新增(harness 护城河量化实证)

🔴 待核实: - GitHub RyanAlberts/best-of-Agent-Harnesses 仓库是否包含完整 benchmark 数据(评测的 harness 列表与模型列表)🔴 P0-17 警示


增量 3 · Meta-Harness COLM 2026 arXiv:2603.28052 = §1.1 第 62 栖候选新增 = harness 设计自动化(jay 8-20 11:42 X-tech-radar)

  • 来源: inbox/jay/2026-08-20-1140-x-tech-radar.md + inbox/spark/2026-08-20-agent-e1prep.md §增量 1 + paper_card 已建(v53 §3.1 共识 #183 沿用)
  • 可信度: ⭐⭐⭐⭐ — Stanford-iris-lab 仓库 + @omarsar0(Edwin Chen IBM 研究,高产 agent 方向账号)亲推 + 跨实例 2 源确认 ✓

要点: - 核心方法:Meta-Harness = 用 coding agent 自动搜索/优化 harness 代码 · 自动化优化 Agent Harness 击败手工设计 - 核心成果:Qwen3-8B 96.9% ALFWorld 立标信号 · 10M tokens 上下文工程化里程碑 - 机构:COLM 2026 顶会 + Stanford-iris-lab 开源仓库 - 与 v58 现有脉络的关系:v58 §1.1 第 55-58 栖 harness 化立基础延展 + 第 30 栖 LongHorizon-Harness Agent + 第 28 栖 Context Layer as 2026 Moat 沿用 + 本棒补强"harness 自动化"立基础延展第 62 栖候选新增 = harness-of-harness 立基础延展 - 立标等级:候选级 ★★ 高档(COLM 2026 顶会级 + Stanford-iris-lab 开源仓库 + @omarsar0 亲推 + Qwen3-8B 96.9% ALFWorld 立标信号 + 10M tokens 上下文工程化里程碑)

建议归入节: - §1.1 立基础延展第 62 栖候选新增(Meta-Harness COLM 2026 = harness 设计自动化立基础延展) - §2.4 节点候选新增区(Meta-Harness · arXiv:2603.28052 · Stanford-iris-lab) - §3.1 共识 #187 候选新增(Meta-Harness COLM 2026 · 立标等级候选级 ★★ 高档) - §3.4 趋势 T157 候选新增(harness-of-harness 自动化)

🔴 待核实:COLM 2026 论文集定位(workshop / main track / findings / extended abstract)🔴 P0-16 警示


增量 4 · Agent Lightning v1.0 + LEGO-RL + Meta-Harness = Harness-Native RL 立基础延展三联(jay 8-20 11:42 + 11:22 + spark 13:35)

  • 来源: inbox/jay/2026-08-20-1140-x-tech-radar.md 增量 2 + inbox/jay/2026-08-20-engineering-e1prep.md §增量 7 + inbox/spark/2026-08-20-agent-e1prep.md §增量 2 + paper_card 1009 已建
  • 可信度: ⭐⭐⭐⭐⭐ — Microsoft 官方 + arXiv + 跨实例 4 源确认 ✓

要点: - Agent Lightning v1.0 arXiv:2608.17528 paper_card 1009 已建:约 3500 行代码轻量级可控 Agentic RL 框架 · 支持任意 Agent harness · GRPO 训练 · endpoint proxy 机制 · 模型与 harness 解耦 · 作为研究 retokenization / 样本合并 / 优势计算 / 损失归一化 / 后端调度的实用测试平台 · Microsoft Agent Framework Harness + devblogs 博客 = 微软正式把 agent RL 训练纳入生产框架 - LEGO-RL arXiv:2608.17393 = Harness-Native RL for Coding Agents:桥接 native harnesses 与 policy-gradient 优化 · 不修改 harness 内部控制流 · 固定 harness 接口 + 外挂优化层的设计 - Meta-Harness COLM 2026 arXiv:2603.28052 = harness 设计自动化(已立增量 3) - Harness 化"全息化"实证 = harness 设计自动化 + harness-native RL + harness 护城河量化 + harness 安全生命周期 + harness 协议层互操作 = 5 栖立基础延展

建议归入节: - §1.1 立基础延展第 63 栖候选新增(Harness-Native RL 立基础延展三联) - §2.4 节点候选新增区(Agent Lightning v1.0 + LEGO-RL + Meta-Harness) - §3.1 共识 #189 候选新增(Harness-Native RL 立基础延展三联 + Harness 化"全息化") - §3.4 趋势 T158 候选新增(harness 化"全息化"五栖立基础延展)


增量 5 · COMA + HarnessRisk + Preference Is Not Intervention + CoAL-RAG = §1.5 治理第 31-33 栖候选新增(tom 8-20 08:50 + 20:40 + paper_cards 1006/1010/1013/1014)

  • 来源: inbox/tom/2026-08-20-rag-e1prep.md 增量 1+2+3 + inbox/tom/2026-08-20T2040-agent-rag-longcontext-radar.md 增量 1+2+3 + paper_card 1006 + paper_card 1010 + paper_card 1013 + paper_card 1014 + inbox/flyp/2026-08-20-risk-e1prep.md 增量 2+3
  • 可信度: ⭐⭐⭐⭐ — Tom radar + Tom RAG E1 + flyp risk-e1prep + paper_cards 4 张已建 + 跨实例 5 源确认 ✓

要点: - COMA arXiv:2608.17960 paper_card 1006(tom 8-20 08:50 增量 1 + flyp 8-20 risk-e1prep 增量 3 + tom 8-20 20:40 radar 沿用):Security-RAG 的组合式误导攻击 = 每份对抗文档单独看都真实/无指令/无矛盾,但组合起来可让 copilot 给出可利用漏洞评估 + "修复"方案反而保留漏洞 · 不同于传统 prompt injection · 核心方案 = 留一因果影响审计(leave-one-out causal influence)+ 对影响集中于低可信度文档的答案进行标记 · 关键洞察 = 防御需要组合层面的完整性验证,而非逐文档审核 · 与 DSPrompt(M-RAG 向量空间投毒防御)形成攻防对偶 = v58 §1.5 治理第 31 栖候选新增 = RAG 安全立基础延展第 4 例(compositional misleading 攻击类 · 8-19 evening 棒已备料 + 8-20 落定) - HarnessRisk arXiv:2608.17597 paper_card 1010(tom 8-20 08:50 增量 1 + flyp 8-20 risk-e1prep 增量 2 + tom 8-20 20:40 radar 沿用):Agent Harness 全生命周期 6 阶段 128 场景安全基准 = Harness Configuration / Capability Extension / Runtime Operation / State Persistence / Action Control / Incident Recovery · 关键发现 = 显式风险识别 ≠ 安全行动 · 某些配置 90%+ 检测到风险仍保留显著攻击成功率 = v58 §1.5 治理第 32 栖候选新增 = Agent 安全扩展立基础延展第 5 例("评测/检测 vs 实战/防护 反身性张力") - Preference Is Not Intervention arXiv:2608.17781 paper_card 1013(tom 8-20 08:50 增量 2):9 个读者在 33% 联合影响单元中对效果符号意见相反 · 读者×查询交互解释 29.8% 效用方差(vs 8.4% 排列零假设)· 自选证据 F1 +0.031(t=3.39) = v58 §1.5 治理第 33 栖候选新增 = RAG 评测方法学延革第 4 例(reader × query 交互效应) + §1.2 RAG 邻接级候选新增 1 件(reader × query 评测方法学) - CoAL-RAG arXiv:2608.17536 paper_card 1014(tom 8-20 08:50 增量 3 + work-queue Top 15 #5):复杂度感知法律 RAG · 基于"问题本质"与"检索一致性"多维评估的自适应路由 · 与 ParliamentRAG 政治权威感知形成法律 RAG 双件套 = v58 §1.2 RAG 邻接级候选新增 1 件(法律 RAG 第 29 垂直域) - CTIFoundry arXiv:2608.18613(tom 8-20 20:40 radar 增量 1):CTI Agent 语料脚手架 · Agent-Native Corpus = 在构建时将威胁报告的潜在结构实体化,让 Agent 可直接探索关系而非读 chunks · RAG 在 CTI Agent 场景的瓶颈不是模型能力,而是语料结构化 = v58 §1.2 RAG 邻接级候选新增 1 件(Agent-Native Corpus) - SkillGate arXiv:2608.18852(tom 8-20 20:40 radar 增量 2):策略性技能选择 · selector credit starvation · outcome-rewarded RL 无法教会 · Agent 技能路由(skill selection)作为可学习策略 = v58 §1.5 治理第 34 栖候选新增 = Skill 路由可学习策略(open problem) - OmniScientist arXiv:2608.13558(tom 8-20 20:40 radar 增量 3 · HF votes 78):全模态全学科 AI 科学家 · 从原始异构证据(空间/时间/跨通道/过程数据)做多学科研究 · 含 RAG 驱动的证据检索 = v58 §1.2 RAG 邻接级候选新增 1 件(AI for Science RAG)

建议归入节: - §1.2 RAG 邻接级候选新增 4 件(Preference Is Not Intervention + CoAL-RAG + CTIFoundry + OmniScientist) - §1.5 治理第 31-34 栖候选新增(COMA + HarnessRisk + Preference Is Not Intervention + SkillGate) - §2.195 AI Agent 基础设施 96 → 99 件套候选(CTIFoundry + SkillGate + OmniScientist) - §2.207 评测方法学 14 → 15 元组候选集合(Preference Is Not Intervention 33%/29.8%/+0.031) - §3.1 共识 #190 候选新增(RAG 安全立基础延展 4 联) - §3.1 共识 #191 候选新增(Agent 安全扩展 5 联) - §3.4 趋势 T159 候选新增(RAG 攻防对偶) - §3.4 趋势 T160 候选新增(Harness 生命周期安全)

🔴 待核实: - COMA paper_card 1006 TLDR 重复表述("measures the leave-one-out causal influence" 重复两次,可能是 TLDR 生成未清理;引用前必须核对原文主表,确认"留一因果影响审计"的具体数学形式)· HarnessRisk 90%+ 检测的具体数字 + 6 阶段边界条件🔴 P0-18 警示


增量 6 · OpenAI Black Hat Hugging Face agent privilege escalation 17,600 次 = §1.5 治理第 35 栖候选新增(jay 8-20 11:42 X-tech-radar + spark 13:35)

  • 来源: inbox/jay/2026-08-20-1140-x-tech-radar.md + inbox/spark/2026-08-20-agent-e1prep.md §增量 1 + inbox/flyp/2026-08-20-risk-e1prep.md 增量 5
  • 可信度: ⭐⭐⭐⭐ — OpenAI 官方 Black Hat 披露 + @simonw 亲推 + 完整时间线 + 跨实例 3 源确认 ✓

要点: - 核心事件:OpenAI 官方在 Black Hat 披露"Hugging Face 事件"= agent privilege escalation 17,600 次黑客动作 · 完整时间线 - 攻击组合:Linux kernel CVE + K8s SA 组合 = 多层攻击链 - 核心意义:风险从论文层 → 工程实现层 → OpenAI 自身披露反身性张力 - 与 v58 现有脉络的关系:v58 §1.5 治理第 9 重 30 栖 + RAG 安全立基础延展 4 联 沿用 + 本棒补强"OpenAI 官方披露反身性张力"立基础延展第 35 栖候选新增 = Agent 安全扩展第 6 例 - 与 v53 §3.2 争议 #131 MCP 9700 万次 + §2.6 Agent 记忆安全 + §2.6 Agent 安全扩展的承接关系:"Hugging Face 事件" = agent 安全扩展到 OpenAI 自身披露的攻击事件 · 17,600 次尝试 + Linux kernel + K8s 三栖 = 与 v53 §3.1 共识 #185 沿用 P0-4 Anthropic 2 万亿 IPO 形成"agent 安全 + 商业风险"立基础延展

建议归入节: - §1.5 治理第 35 栖候选新增(OpenAI Black Hat Hugging Face agent privilege escalation 17,600 次) - §2.6 Agent 记忆安全扩展 5 → 6 联候选(Stealing Reasoning Traces + MemGhost/GhostWriter + SecureMCP + TripContext + OpenAI Black Hat Hugging Face) - §3.1 共识 #192 候选新增(OpenAI 官方披露反身性张力)


增量 7 · StateM 374▲ 极显著实测 + 立标信号强度 vs 立标等级 双维度区分第 5 日(v58 接力棒必须独立判定)

  • 来源: inbox/tom/2026-08-20-0900-hf-daily-2026-08-20.md #1 374▲ + inbox/flyp/2026-08-20-multimodal-e1prep.md 增量 1 + paper_card 1004(arXiv:2608.15089)+ inbox/stephen/2026-08-20-1245-stephen-coordination-check-noon.md §3.1 #C11 + inbox/stephen/2026-08-20-ai-industry-e1prep.md 增量 4
  • 可信度: ⭐⭐⭐⭐⭐ — 跨实例 5 源确认 ✓

要点: - StateM 24h 内立标信号 130▲ → 374▲ = +244▲ 极显著实测 = v33 以来 multimodal 主分类立标信号绝对新高 - 核心数据:StateM = StateM: Reaching 95.3% Raw Accuracy, or a $15 Frontier Run, on Terminal-Bench 2.1 via Harness Scaling · 不改模型权重 · 通过持久状态 + 分段局部上下文 + 版本化操作手册 · GPT-5.5 xhigh Terminal-Bench 2.1 83.1% → 92.1% · 95.3% 原始准确率 + 约 $15 完成前沿运行 - v53 §3.1 共识 #185 已统一"95.3% raw + $15 前沿运行" + 候选级高档 ★★ 观察候选(立标信号 374▲ 仅作"社区关注度"指标) - 🔴 多实例评级现状:agent v53 §3.1 共识 #185 已统一 + stephen ai-industry §3.2 仍沿用 83.1→92.1% 描述(stephen noon §C11 警示) - 🔴 StateM 是否升级为 multimodal 主分类(从 engineering / agent 主分类邻接级)? v58 接力棒本棒必须独立判定 - 🔴 是否升级立标池双向锚 8 向 → 9 向并存实测第 5 日? v58 接力棒本棒必须独立判定

建议归入节: - §1.4 评测方法学 14 → 15 元组候选新增(StateM 374▲ 极显著实测 · 立标信号强度 vs 立标等级 双维度区分第 5 日) - §3.1 共识 #185 沿用(立标信号强度 ≠ 立标等级评估双维度区分第 5 日实测稳态) - §3.4 趋势 T161 候选新增(StateM 374▲ 极显著实测)

🔴 待核实:StateM 374▲ 是否含 X / Reddit / 推特等"非 arXiv 关注"误计;Stephen ai-industry §3.2 沿用 83.1→92.1% vs v53 §3.1 共识 #185 统一 95.3% 的数值口径统一(stephen noon §C11 警示持续)


增量 8 · Cross-Model Memory Transfer arXiv:2608.17050 paper_card 1017 已建 + 立标池 8-19/8-20 双日 agent 主轴主导 = §1.3 Memory 第 19 栖候选新增(tom 8-19 + jay 8-20 + spark 8-20)

  • 来源: inbox/tom/2026-08-19-2041-agent-rag-longcontext-radar.md + inbox/jay/2026-08-20-engineering-e1prep.md §增量 6 + inbox/spark/2026-08-20-agent-e1prep.md §增量 1 + paper_card 1017 已建
  • 可信度: ⭐⭐⭐⭐ — 跨实例 3 源确认 ✓

要点: - 核心方法:通过目标侧 Reader 适配的跨模型记忆迁移 = Engram 作为可复用外部知识工件,前提是目标侧具备兼容 Reader 接口 + 当直接复用 Reader 效果不足时,目标侧适配可进一步改善对齐 - 与 v58 §1.3 Memory 现有脉络的关系:v58 §1.3 Memory 视角类补充 Agent Memory Is Not RAG + Continuity Kernel 事务性控制平面 + Maglev 第 18 栖 + Hybrid-Policy 双栖对位 沿用 + 本棒补强"跨模型记忆迁移"立基础延展第 19 栖候选新增 - 立标等级:候选级 ★★ 中-高档(paper_card 1017 已建 + Engram 跨模型记忆迁移 + work-queue Top 15 #2) - 与 v58 §2.24 多层记忆基底 10 件套延展的关系:v58 §2.24 已立 Mem0/Zep/Letta 沿用 + 本棒补强 Engram 跨模型记忆迁移子节 = "单模型内 memory vs 跨模型 memory 迁移"对照

建议归入节: - §1.3 Memory 第 19 栖候选新增(Cross-Model Memory Transfer · Engram 跨模型记忆迁移) - §2.24 多层记忆基底 10 → 11 件套延展候选(Engram 跨模型记忆迁移) - §3.1 共识 #193 候选新增(Memory as cross-model transferable artifact) - §3.4 趋势 T162 候选新增(Memory as cross-model transferable artifact)

🔴 待核实:paper_card 1017 TLDR 与 Engram 原始论文 arXiv:2608.17050 主体内容对齐


二、立标池双向锚 v33 第 5 日实测(沿用 + 1 例新锚)

  • OpenART 8-20:第 5 日续立(沿用 v58 §3.1 共识 #179 + 立标机制正式升级触发第 4 日稳态)
  • Alaya-EVOKE:第 5 日续立(沿用)
  • DarwinX:第 5 日续立(沿用)
  • LiveAnimate:第 5 日续立(沿用)
  • 🆕 立标等级延革第 10 例 = SWE-bench Pro harness 护城河量化实证(本棒新增 · v58 接力棒本棒必须独立判定是否升级 §1.4 评测方法学 14 → 15 元组候选集合)

三、值得警惕的矛盾或待核实说法

  1. 🔴 StateM 374▲ vs 130▲ +244▲ 评级未统一(stephen noon §C11):v53 §3.1 共识 #185 已统一"95.3% raw + $15 前沿运行" + 候选级高档 ★★ 观察候选(立标信号 374▲ 仅作"社区关注度"指标);stephen ai-industry §3.2 仍沿用 83.1→92.1% 描述 · v58 接力棒必须统一评级

  2. 🔴 Demystifying Agent Skills "三高层类别 + 十二种 Skill 使用模式"是否对应官方分类法(stephen noon §C13):137▲ HF Daily 8-20 #3 + v53 §3.1 共识 #183 已立"三类别 + 12 模式 Skill 失效分类法",但 paper_card 1018 TLDR 未明示 12 种 Skill 模式清单;v54/v58 接力棒必须独立判定 · 引用时不应直接宣称"分类法完整" · 需 paper_card 1018 TLDR 补全 12 种 Skill 模式清单

  3. 🔴 HarnessRisk "显式风险识别 ≠ 安全行动"基准的可重复性(stephen noon §C14):6 个运行阶段的边界条件、攻击成功率 90%+ 检测但仍保留攻击的具体数字、与 StateM / Agent Lightning 的对照需查 PDF · 🔴 P0-18 警示

  4. 🔴 COMA paper_card 1006 TLDR 重复表述:"measures the leave-one-out causal influence" 重复两次,可能是 TLDR 生成未清理;引用前必须核对原文主表,确认"留一因果影响审计"的具体数学形式

  5. 🔴 MCP 232% 增长口径核实:Zuplo Blog 与 CSDN 自述双源,🔴 P0-14 警示 = v59 接力棒必须对照 MCP 官方博客或 PyPI 下载统计独立核实

  6. 🔴 "A2A + MCP 共享状态层缺失" 官方文档承认待核实:CockroachDB 博客自述,🔴 P0-15 警示

  7. 🔴 SWE-bench Pro GitHub 仓库完整 benchmark 数据待核实:🔴 P0-17 警示

  8. 🔴 Meta-Harness COLM 2026 论文集定位待核实(workshop / main track / findings / extended abstract):🔴 P0-16 警示

  9. 🔴 Preference Is Not Intervention 样本代表性问题:9 个读者样本量较小(n=9),33% 意见相反的结论是否可泛化到更大读者群体尚需验证

  10. 🔴 CoAL-RAG 自适应路由的复杂度评估标准未公开:"问题本质"和"检索一致性"多维指标的量化标准和阈值设定方式未充分披露

  11. 🔴 COMA 与 DSPrompt 的防御边界存在重叠但未被讨论:COMA 解决文档组合层面隐蔽误导,DSPrompt 解决 M-RAG 向量空间投毒攻击;两者是否存在防御交叉区域(组合投毒)未被两篇论文交叉引用核实


四、可引用 arXiv 号列表

arXiv ID 论文/方法 主分类 状态
2608.17960 COMA · Security-RAG 组合式误导攻击 + 因果反事实防御 rag/position ✅ net-new 本窗口
2608.17597 HarnessRisk · Agent Harness 全生命周期 6 阶段 128 场景安全基准 evaluation/risk ✅ net-new 本窗口
2608.17781 Preference Is Not Intervention · 证据效用读者异质性深层量化 rag/method ✅ 深层数据本窗口新增
2608.17536 CoAL-RAG · 复杂度感知法律 RAG 自适应路由 rag/method ✅ net-new 本窗口
2608.18613 CTIFoundry · CTI Agent 语料脚手架 + Agent-Native Corpus agent/rag ✅ net-new 本窗口
2608.18852 SkillGate · 策略性技能选择 + selector credit starvation agent ✅ net-new 本窗口
2608.13558 OmniScientist · 全模态全学科 AI 科学家 agent/rag ✅ net-new 本窗口
2608.15089 StateM · Terminal-Bench 2.1 harness 95.3% + $15(374▲ 极显著实测) agent ✅ 立标信号极显著实测
2608.14036 Demystifying Agent Skills · Skill 三高层类别 + 十二种模式分类法 agent/evaluation ✅ HF Daily 8-20 #3 137▲
2608.17528 Agent Lightning v1.0 · 可控 Agentic RL 框架约 3500 行代码 agent ✅ HF Daily 8-20 #15 16▲
2608.17393 LEGO-RL · Harness-Native RL for Coding Agents agent ✅ net-new 本窗口
2603.28052 Meta-Harness · 自动化优化 Agent Harness COLM 2026 agent ✅ net-new 本窗口
2608.17050 Cross-Model Memory Transfer · Engram 跨模型记忆迁移 rag ✅ net-new 本窗口
2608.17950 Six Degrees of Separation · 长上下文流形 Small-World networks long-context ✅ 沿用 8-19 雷达
2608.14376 CoRun · Continuous Batching 形状不固定问题的确定性调度 inference ✅ jay 8-20 engineering-e1prep
2608.14333 DASH · MoE LLM HBM+Flash KV Cache 两级管理 inference ✅ jay 8-20 engineering-e1prep
2607.08028 Harness Engineering for Auditable Enterprise LLM Agents agent ✅ jay 8-19 沿用
2603.09619 Context Engineering · From Prompts to Corporate Multi-Agent Architecture agent ✅ jay 8-19 沿用
2608.16776 GRIP · Query Dominance 失效模式 + 容量不对称 bottleneck rag ✅ R65 已覆盖
2608.16515 IGD · 意图引导解码 + 动态来源信任仲裁 rag ✅ R65 已覆盖
2608.16536 DSPrompt · M-RAG 动态软提示防御 rag ✅ R65 已覆盖
2608.16628 Hypergraph-MRAG · 超图 N 元关系 + 增量精炼 rag ✅ R65 已覆盖

本窗口新增可引用 arXiv 号(+11):2608.17960 / 2608.17597 / 2608.17536 / 2608.18613 / 2608.18852 / 2608.13558 / 2608.17393 / 2603.28052 / 2608.17050 / 2608.14376 / 2608.14333

本窗口立标信号极显著实测(+1):2608.15089(StateM 374▲ +244▲)


五、检查过的来源清单

Stephen inbox(8-19 + 8-20) - inbox/stephen/2026-08-19-llm-application-e1prep.md(8-19 上一棒 E1 · v58 已吸纳 11 件备料) - inbox/stephen/2026-08-20-ai-industry-e1prep.md(v50 落盘 6 主线 + StateM 374▲ + RAG 攻防对偶 + Harness 三栖实测) - inbox/stephen/2026-08-20-1245-stephen-coordination-check-noon.md(v58 沿用 50h+ 主轴空挡 🔴 缺口) - inbox/stephen/2026-08-19-2245-stephen-coordination-check-evening.md(stephen evening 协调棒)

Jay inbox(8-20) - inbox/jay/2026-08-20-engineering-e1prep.md(SGLang + CoRun + DASH + MCP 安全审计 + SWE-bench Pro + Cross-Model Memory Transfer + Miles v0.1) - inbox/jay/2026-08-20-1140-x-tech-radar.md(Meta-Harness + Agent Lightning v1.0 + OpenAI Black Hat Hugging Face 17,600 次) - inbox/jay/2026-08-20T1425-jay-csdn-inference-oom-benchmark-commands-highvalue.md - inbox/jay/2026-08-20T1620-jay-csdn-context-engineering-loop-agent-memory-highvalue.md - inbox/jay/2026-08-20T1950-jay-inference-engineering-rag-eval-mcp-stack-aug20.md(MCP 2026-07-28 规范 + RAG 静默失败 + AI Agent Stack 2026 Eval Gap) - inbox/jay/2026-08-20T1335-jay-inference-vecdb-harness-substack-aug20.md(vLLM/SGLang/LMDeploy + Vector DB 选型 + Agent Harness 范式)

Tom inbox(8-19 + 8-20) - inbox/tom/2026-08-20-rag-e1prep.md(3 件 net-new:COMA + Preference Is Not Intervention + CoAL-RAG) - inbox/tom/2026-08-20T0840-agent-rag-longcontext-radar.md(4 件高价值:COMA + Six Degrees + LEGO-RL + Preference Is Not Intervention) - inbox/tom/2026-08-20T2040-agent-rag-longcontext-radar.md(3 件高价值:CTIFoundry + SkillGate + OmniScientist) - inbox/tom/2026-08-19-agent-rag-longcontext-radar.md(4 件:Cross-Model Memory Transfer 等)

Spark inbox(8-20) - inbox/spark/2026-08-20-agent-e1prep.md(v53 落定 11 件 net-new) - inbox/spark/2026-08-20-llm-infra-e1prep.md(§IX 52 落定)

Flyp inbox(8-20) - inbox/flyp/2026-08-20-risk-e1prep.md(3 件主轴近邻 net-new:HarnessRisk + COMA + OpenAI Black Hat Hugging Face) - inbox/flyp/2026-08-20-multimodal-e1prep.md(StateM 374▲ 极显著实测沿用) - inbox/flyp/2026-08-20-XSkill-AXPO-dual-critical-read.md

Paper_cards 近 3 天新卡(1000-1030) - 1001-2608-14905 AutoResearch · 1003-2608-15869 IVT · 1004-2608-15089 StateM · 1005-2608-11947 Accuracy and Order Sensitivity - 1006-2608-17960 COMA · 1007-2608-17950 Six Degrees LLM · 1008-2608-17512 Embodied-Navigator - 1009-2608-17528 Agent Lightning v1.0 · 1010-2608-17597 HarnessRisk · 1011-2608-14221 MathForm - 1012-2608-14881 Personalized Auto-Research · 1013-2608-17781 Preference Is Not Intervention - 1014-2608-17536 CoAL-RAG · 1015-2608-18063 EDITBRIDGE · 1016-2608-17067 DiSCO - 1017-2608-17050 Cross-Model Memory Transfer · 1018-2608-14036 Demystifying Agent Skills - 1019-2608-17402 MoE-ViE · 1020-2608-17393 LEGO-RL · 1021-2608-17379 PTXBench - 1022-2608-16977 The Problem Is the Problem · 1023-2608-17253 Co-RL · 1026-2608-17426 - 1027-2608-16590 Zetta ζ · 1029-2608-13947 Scaling Creative Writing · 1030-2608-13558 OmniScientist

Work-queue(8-20 21:00) - CoAL-RAG 2608.17536(已建 paper_card 1014)✅ - Cross-Model Memory Transfer 2608.17050(已建 paper_card 1017)✅ - Preference Is Not Intervention 2608.17781(已建 paper_card 1013)✅ - Long-Context Small-World 2608.17950(已建 paper_card 1007)✅ - COMA 2608.17960(已建 paper_card 1006)✅ - Demystifying Agent Skills 2608.14036(已建 paper_card 1018)✅ - HarnessRisk 2608.17597(已建 paper_card 1010)✅ - Agent Lightning v1.0 2608.17528(已建 paper_card 1009)✅

知识基线:organized/knowledge/llm-application.md(v58 活文档,已读 §0 + §1.1 + §1.2 + §1.3 + §1.4 + §1.5 + §2.39.x + §2.207 + §3.1 截面)


六、增量密度评估与 v59 建议

本窗口增量密度:中-高(8 条主轴增量 + 3 条立标池延伸 + 1 条 P0 警示)

本期窗口(8-19 21:10 → 8-20 21:10)llm-application 主轴直接增量密度高于 8-18 → 8-19 evening 棒(11 件 net-new vs 8 件 net-new),主要因为 v58 沿用 50h+ 主轴空挡必须终结 + 立标池 8-19 + 8-20 双日 agent 主轴主导 v33 以来首次连续 2 日 + agent v52/v53 已吸纳 14 件应归属 llm-application 主轴的 net-new。

结构观察:本期 8 件呈现 5 主轴 + 3 邻接: - 协议层主轴:MCP 安全审计实锤(232% 增长 + 40% 零认证 + A2A + MCP 共享状态层缺失) - 评测方法学主轴:SWE-bench Pro harness 量化 + StateM 374▲ - Harness 化"全息化"主轴:Meta-Harness + Agent Lightning v1.0 + LEGO-RL - RAG / Agent 安全主轴:COMA + HarnessRisk + Preference Is Not Intervention + CoAL-RAG + CTIFoundry + SkillGate + OmniScientist - Memory 主轴:Cross-Model Memory Transfer - Agent 安全扩展主轴:OpenAI Black Hat Hugging Face 17,600 次

v59 建议优先处理: 1. MCP 安全审计实锤 → §1.5 治理第 31 栖候选新增 + §1.1 立基础延展第 60-61 栖候选新增 2. SWE-bench Pro harness 量化 → §1.4 评测方法学 14 元组候选集合 3. Meta-Harness COLM 2026 → §1.1 立基础延展第 62 栖候选新增 4. Agent Lightning v1.0 + LEGO-RL + Meta-Harness → §1.1 立基础延展第 63 栖候选新增(Harness-Native RL 立基础延展三联) 5. COMA + HarnessRisk + Preference Is Not Intervention + CoAL-RAG + CTIFoundry + SkillGate + OmniScientist → §1.2 RAG 邻接级 + §1.5 治理第 31-34 栖候选新增 6. OpenAI Black Hat Hugging Face 17,600 次 → §1.5 治理第 35 栖候选新增 7. StateM 374▲ 极显著实测 → §1.4 评测方法学 15 元组候选集合 8. Cross-Model Memory Transfer → §1.3 Memory 第 19 栖候选新增

arXiv ID 累计:v58 524 → v59 535(+11:2608.17960 / 2608.17597 / 2608.17536 / 2608.18613 / 2608.18852 / 2608.13558 / 2608.17393 / 2603.28052 / 2608.17050 / 2608.14376 / 2608.14333)

P0 警示累计:v58 11 件 → v59 18 件(+7:P0-12 MCP 9700 万 + P0-13 StateM 数值 + P0-14 MCP 232% + P0-15 A2A+MCP 共享状态层 + P0-16 Meta-Harness COLM + P0-17 SWE-bench Pro GitHub + P0-18 HarnessRisk 90%+)

边界:本文件写入 /shared/research-kb/inbox/stephen/2026-08-20-llm-application-e1prep.md,不写入他人目录,不 git commit,不写密钥。


Stephen · 2026-08-20 21:10 CST · E1 日间预消化轮 · llm-application 主题 检查来源:Stephen 4 份 + Jay 6 份 + Tom 4 份 + Spark 2 份 + Flyp 3 份 + paper_cards 30 张 + work-queue 8 件 = 57 份来源