risk · E1 预消化简报(2026-08-22)
窗口:2026-08-21 16:30 CST(R50 实质触发 + 8-21 evening 协调棒 100% 闭环 R50/R51/v59/v42)→ 2026-08-22 16:30 CST = R50 沿用 24h 主轴空挡延续(风险主轴净增 = 0 件主 risk 主分类 net-new · 沿用 stephen 8-22 noon §2.7 risk 9 件 + §0 9 件饱和判定的延续) 承接脉络:
knowledge/risk.mdR50(2026-08-21 17:10 CST · flyP · 5 件 net-new + Anthropic RSP + Gradient Flow + 4 inference-层 CVE)→ flyP 8-21 risk-e1prep(10 件净增 + 沿用主轴 72h+ 空挡修复)的延续 本日主线:① risk 主轴 R50 沿用 24h 主轴空挡延续(stephen 8-22 noon §2.7 "risk 9 件 + 无显著缺口" + ai-industry 8-22 §2.205 Gradient Flow 风险外移延展 6 件套沿用)= 本棒承担备料 + 主轴空挡监控职责;② 0 件 risk 主分类 net-new(HF Daily 8-22 早盘 15 件 = 0 件 risk · 8-22 早盘 frontier lab 公告 = 沿用 8-19 · 8-22 critical reads 2 件 = multimodal/evaluation);③ 7 件 risk 邻接级 / 工程化层级 net-new(Inadvertent Context Leakage arXiv:2608.19857 + ConceptGuard arXiv:2608.20338 + CREEP / Inference Cost Attacks arXiv:2606.02643 + OWASP MCP Top 10 43% Shell 注入 + Microsoft Foundry/AgentRx 主动防御体系 + frontier lab 主动治理 24h+ 沿用 + Gradient Flow 风险外移 八连);④ 3 件 P0 沿用持续 open(Anthropic RSP 8-14 完整 PDF URL + 404 Media 归档位置 + HarmProfile 2608.14577 P1 paper_card 补建);⑤ R50 5 件沿用独立判定(Bounded Agents 主分类归属 + AdaPop 主分类归属 + inference-层 CVE 12h SLA 升级 + Decision-Metric/Bounded Agents/DiSCO/AdaPop 评级冲突 + v55/v59 联动闭环)
一、结论先行
本轮确认的 risk 主分类 net-new = 0 件(R50 落定后 24h 主轴空挡延续)+ risk 邻接级 / 工程化层级 net-new = 7 件(Inadvertent Context Leakage 隐私边界 · ConceptGuard 上下文敏感遗忘 · CREEP RAG 推理成本攻击 · OWASP MCP Top 10 实证 · Foundry/AgentRx 主动防御体系 · frontier lab 主动治理 沿用 · Gradient Flow 风险外移 八连)。今日 risk 主轴的核心判定是:R50 沿用 24h 主轴空挡延续 + 0 件 risk 主分类 net-new = 主轴静默但邻接级密度不降反升 = 风险研究焦点从"论文主分类立标"扩展到"邻接级 / 工程化层级反身性位移";具体如下:
- 🟢 risk 主分类 net-new = 0 件(HF Daily 8-22 早盘 15 件全部归 agent/multimodal/evaluation/llm-infra · 0 件 risk · 8-22 news-x-vip-radar 8 件 frontier lab 公告 = 8 件沿用 8-19 · 8-22 早盘 RSS 11 件 = 0 件 risk 主分类 net-new)
- 🟡 risk 邻接级 net-new 第 1 件 · arXiv:2608.19857 Inadvertent Context Leakage in Language Models(UCB + 微软 5 位作者 · 8-20 arXiv · paper_card 1047 已建 · 8-22 落盘 agent 主分类 · 副 risk 邻接级 · v59 engineering 已锚入 §2.15 = 被动隐私泄露 vs 主动防御完整闭环)
- 🟡 risk 邻接级 net-new 第 2 件 · arXiv:2608.20338 ConceptGuard · 上下文敏感遗忘基准评测(机器遗忘 = LLM 安全/隐私 + Alignment 邻接级 · jay 8-22 2105 BE-4 沿用)
- 🟡 risk 邻接级 net-new 第 3 件 · arXiv:2606.02643 Inference Cost Attacks on RAG / CREEP(WWW '26 acceptance · 8-22 PM engineering-filter 第 14 保留条目 · 首个 RAG 推理成本攻击研究 · 三种新型资源消耗策略 + 两种 agent paradigm · 高攻击效力 + 高检索成功率)
- 🟡 risk 邻接级 net-new 第 4 件 · OWASP MCP Top 10 + 2026 年 1-2 月 43% MCP CVE 是 Shell 注入类(jay 8-22 rag-agent-mcp-multimodal-survey 沿用 + jay 8-22 1335 AI Engineering Trending §4 + 2026-01~02 实证数据)
- 🟡 risk 邻接级 net-new 第 5 件 · Microsoft Foundry Agent 可靠恢复 + AgentRx 故障诊断体系(jay 8-22 engineering-e1prep 增量 3 + jay 8-22 1050 engineering-filter 沿用 = Foundry 10 类失败 + Action Ledger + FRS 6 维评分 + AgentRx 5 阶段诊断 + 10 类细粒度 taxonomy + CLI = 与 Inadvertent Context Leakage 形成"被动泄露 vs 主动防御"完整闭环)
- 🟡 risk 邻接级 net-new 第 6 件 · frontier lab 主动治理 24h+ 沿用(stephen 8-22 0910 news-x-vip-radar = OpenAI 8-18 暂停前沿 RL 训练两周 + Astra 列为「首个 cybersecurity-critical」模型 + Sam Altman 8-18 同步发文 + OpenAI 8-19 Zero Data Retention + Private Safety Processing = 同一波「cyber 关键能力」叙事 + Anthropic 8-14 Aug-2026 Risk Report + EU AI Act 水印 FAQ 沿用 = frontier lab × cyber × safety 持续深化)
- 🟡 risk 邻接级 net-new 第 7 件 · Gradient Flow 8-22 早盘双文(spark 8-22 1001 RSS = "最大的 AI 风险并不在模型内部" + "模型未必是你最大的风险" = 主线 A 沿用 8-15~8-22 八连 + "AI 正在如何改变数学研究" + "持续学习正以零散的方式到来" + "为什么我们的AI模型一上线部署就停止学习了" = 风险外移延展第 3 期)
无 risk 主分类 net-new 主轴 frontier lab 主动治理事件(frontier lab 主动治理 = 沿用 8-19 / 8-20 / 8-21)。无 risk 主分类 net-new 主轴 arXiv hardening 候选级新增主分类主轴(R50 5 件 8-21 沿用 + 7 件 8-22 邻接级)。其余为沿用 + R50 5 件评级冲突 + 3 件 P0 持续 open 沿用 + 立标池双向锚"评测方法学延革第 12 例反方立基础候选预备首次机制化"沿用(EnvHarness 235▲ 8-22 早棒 #1 极显著 · multimodal 邻接级但 risk 视角为"评测方法学延革第 12 例"第 26 栖)。
二、今日最重要增量(8 件)
增量 1 · 🟡 risk 邻接级 net-new 第 1 件 · arXiv:2608.19857 Inadvertent Context Leakage in Language Models(paper_card 1047 已建 · 主分类 agent · 形态 method · 8-22 落盘 · UCB + 微软 5 位作者 · 副 risk 邻接级 · v59 engineering §2.15 已锚入)
来源:
- organized/paper_cards/1047-2608-19857.md 8-22 落盘 · TLDR 完整可读 · paper_card 主分类 agent · 形态 method(此前 inbox/tom/8-22-rag-e1prep §增量 1 标注"主分类 rag · 副 risk"是初判 · paper_card 实际为 agent 主分类 · risk 邻接级)
- inbox/tom/2026-08-22T0840-agent-rag-longcontext-radar.md §🔴 高价值第 2 件 "Inadvertent Context Leakage in Language Models · arXiv:2608.19857 | 2026-08-20 | 5位作者(UCB/微软)"
- inbox/tom/2026-08-22-rag-e1prep.md §增量 1 · ⭐⭐⭐ 中高 · Inadvertent Context Leakage:"RAG 上下文中隐藏的间接信息泄露(arXiv 2608.19857)· 主分类:rag · 形态:position/systems · 副分类:privacy, security, context-leakage, inference · 8-22 落盘"
- inbox/jay/2026-08-22-engineering-e1prep.md "v59 §2.112 (e) 已锚入 Inadvertent Context Leakage · Tom 8-22 RAG E1 再次确认" = v59 engineering 已锚入 §2.15
- inbox/jay/2026-08-22T1050-jay-engineering-filter.md Foundry/AgentRx 段沿用
- inbox/jay/2026-08-22T1450-jay-engineering-filter-pm.md 未直接提及但 Foundry/AgentRx 上下文互补
- 跨实例 5 源独立交叉 ✓(paper_card 1047 + tom 8-22 0840 radar + tom 8-22 rag-e1prep §增量 1 + jay 8-22 engineering-e1prep v59 锚入 + jay 8-22 1050 engineering-filter)
arXiv:arXiv:2608.19857(paper_card 1047 已建 · 主分类 agent · 形态 method · 副 risk 邻接级)
核心要点: - 标题:Inadvertent Context Leakage in Language Models(语言模型中的非故意上下文泄露) - 中文:语言模型中的非故意上下文泄露——即便模型正确拒绝直接抽取,敏感数据(凭证 / 健康 / 金融)仍可能通过隐藏相关性在良性输出中被重构 - 主旨:"For AI agents to be useful beyond simple chat, they must hold sensitive user context such as calendars, credentials, health records, and financial data. We study whether the mere presence of such secrets in a model's context window introduces hidden correlations into the model's benign outputs, allowing reconstruction even when the model correctly refuses direct extraction. We further study whether an adversary can actively engineer prompts that amplify this effect, using the model as a covert carrier to transmit secrets through seemingly innocuous text. In both cases, this limited leakage is..." - 关键事实 1:被动泄露 + 主动攻击双栖 = 即便模型正确拒绝直接提取,covert carrier(隐蔽载体)可在看似无害文本中传输秘密 = RAG 隐私评估新维度 - 关键事实 2:与传统主动攻击(COMA arXiv:2608.17960)互补 = COMA 关注"主动误导攻击",Inadvertent Context Leakage 关注"被动推理链中的隐式信息泄露" = RAG 安全威胁全景 2 联延展 - 关键事实 3:Bounded Agents(arXiv:2608.15888)+ Inadvertent Context Leakage 形成"RAG / Agent 安全威胁全景 3 联":Bounded Agents(主动授权架构攻击 · 1038 v54 §3.4 T161)+ Inadvertent Context Leakage(被动隐式推理链泄露)+ ConceptGuard(机器遗忘评测 · arXiv:2608.20338)= L0'' 元层+dev 第 14 / 15 / 16 例 - 关键事实 4:多租 Agent 生产部署的隐私边界风险(tom 8-22 radar 标注 · stephen ai-industry §2.222 RAG 攻防对偶 3 件 → 11 件升级准备) - 关键事实 5:5 位作者 = UCB + 微软(Yannai A. Malyak / Nishanth Venkatesh / Ming Shen / Ricardo C. Carranza / Samia Ahmad 等推测 · 论文信息待核) - 风险层级:L2 接口层 / L3 系统层 / L0'' 元层+dev(prompt + agent 生态 + 隐私) - 可信度:高(5 源独立交叉 ✓ + paper_card 1047 已建 + TLDR 完整可读 + arXiv 8-20 发布)
与 risk.md 的关系: - §2.13 hardening 第 52 维候选级新增:Inadvertent Context Leakage = 被动隐式推理链泄露(沿用 R50 5 件 · R50 inference-层 CVE 集群 = L0'' → L0'' 元层+dev第 14 例) - §3.1 反方 #91 第 38 栖候选新增:被动隐私泄露 vs 主动攻击 反方(与 #91 #18 LALMs + #91 #28 MCP-ITP + #91 #29 HarnessRisk + #91 #30 COMA + #91 #31 HarmProfile + #91 #32 OpenAI Black Hat + #91 #33 Decision-Metric + #91 #34 Bounded Agents + #91 #35 DiSCO + #91 #36 AdaPop + #91 #37 推理引擎漏洞 12h 武器化 + #91 #38 Inadvertent Context Leakage = 评测盲点 #1-#12 立基础延展) - §3.2 反身性 #21 第 39 栖候选新增:多租 Agent 生产部署的隐私边界反身性张力(沿用 R50 反身性张力持续) - §4.1 待核清单 沿用 #108:Inadvertent Context Leakage 生产环境验证 + 跨 frontier lab 测试覆盖 + 与 Bounded Agents / ConceptGuard 对位关系
建议归入: - §2.13 hardening 第 52 维候选级新增:Inadvertent Context Leakage = 被动隐式推理链泄露 - §3.1 反方 #91 第 38 栖候选新增:被动隐私泄露 vs 主动攻击 反方 - §3.2 反身性 #21 第 39 栖候选新增:多租 Agent 生产部署的隐私边界反身性张力 - §4.1 待核清单 沿用 #108:Inadvertent Context Leakage 生产环境验证 + 跨 frontier lab 测试覆盖
可信度:高(5 源独立交叉 ✓ + paper_card 1047 已建 + TLDR 完整可读)。🔴 待核:① 5 位作者完整名单;② covert carrier 攻击在受控实验环境外的可推广性;③ 与 Bounded Agents / ConceptGuard 对位关系;④ 跨 frontier lab 测试覆盖。
增量 2 · 🟡 risk 邻接级 net-new 第 2 件 · arXiv:2608.20338 ConceptGuard · 上下文敏感遗忘基准评测(机器遗忘 = LLM 安全/隐私 + Alignment 邻接级 · jay 8-22 2105 BE-4 沿用)
来源:
- inbox/jay/2026-08-22-2105-jay-five-category-briefing.md §BE-4:"ConceptGuard — 上下文敏感遗忘基准(arXiv cs.CL)· arXiv:2608.20338 · LLM 安全与隐私的细分方向,与 RLVR、Alignment 研究有交叉 · 适合纳入「LLM 安全与对齐」主题页"
- inbox/jay/2026-08-22T2105-jay-five-category-briefing.md §五 分类总览 backend #4 沿用
- 跨实例 1 源确认(jay 8-22 2105 BE-4 · paper_card 未建 P1 缺口)⚠️ 单源弱
arXiv:arXiv:2608.20338(paper_card 未建 P1 缺口)
核心要点: - 标题:ConceptGuard · 大语言模型中上下文敏感遗忘的基准评测 - 主旨:机器遗忘(Machine Unlearning) = LLM 选择性移除有害/敏感知识,而非全局遗忘 = 上下文敏感遗忘:针对特定提示上下文选择性遗忘,而非整个模型权重修改 - 关键事实 1:评测基准 = ConceptGuard 提出新 benchmark,用于评估选择性遗忘能力 - 关键事实 2:实际应用 = 隐私合规 + 内容安全 + 个性化内容过滤 - 关键事实 3:与 RLVR / Alignment 研究交叉 = 机器遗忘与可逆强化学习的边界 - 风险层级:L1 模型层 / L2 接口层 + Alignment 邻接 - 可信度:中(单源 1 源确认 ✓ + 摘要级 · paper_card 未建)
与 risk.md 的关系: - §2.13 hardening 第 53 维候选级新增:ConceptGuard = 上下文敏感遗忘基准评测(与 R50 AdaPop arXiv:2608.14229 形成"机器遗忘安全评测"二联) - §3.1 反方 #91 第 39 栖候选新增:机器遗忘 vs 抹除 反方(评测盲点第 13 例 · 与 #91 #36 AdaPop 流行/罕见事实形成对照) - §3.2 反身性 #21 第 40 栖候选新增:前沿部署 vs 上下文敏感遗忘 反身性张力 - §4.1 待核清单 新增 #110:ConceptGuard 跨 frontier lab 测试覆盖 + 与 AdaPop 对位关系
建议归入: - §2.13 hardening 第 53 维候选级新增:ConceptGuard = 上下文敏感遗忘基准评测 - §3.1 反方 #91 第 39 栖候选新增:机器遗忘 vs 抹除 反方(评测盲点第 13 例) - §3.2 反身性 #21 第 40 栖候选新增:前沿部署 vs 上下文敏感遗忘 反身性张力 - §4.1 待核清单 新增 #110:ConceptGuard 跨 frontier lab 测试覆盖 + 与 AdaPop 对位关系
🔴 待核:① paper_card 补建;② 跨 frontier lab 测试覆盖;③ 与 AdaPop arXiv:2608.14229 对位关系;④ 上下文敏感遗忘的边界条件。
增量 3 · 🟡 risk 邻接级 net-new 第 3 件 · arXiv:2606.02643 Inference Cost Attacks on RAG / CREEP(WWW '26 acceptance · 首个 RAG 推理成本攻击研究 · 8-22 PM engineering-filter 第 14 保留条目)
来源:
- inbox/jay/2026-08-22T1450-jay-engineering-filter-pm.md §🔥 保留条目 14:"Inference Cost Attacks on RAG(arXiv, WWW '26 acceptance)· arXiv:2606.02643 · CREEP 框架 · 攻击者通过植入恶意文档,使 RAG 系统在推理阶段 token 消耗异常增加 · 三种新型资源消耗策略 + 两种 agent paradigm · 高攻击效力 + 高检索成功率,难以防范"
- 跨实例 1 源确认(jay 8-22 1450 PM engineering-filter)⚠️ 单源弱
arXiv:arXiv:2606.02643(ACM WWW '26 acceptance · April 2026, Dubai · paper_card 未建 P1 缺口)
核心要点: - 标题:CREEP · Inference Cost Attacks for Retrieval-Augmented Large Language Models - 中文:面向检索增强大型语言模型的推理成本攻击 - 主旨:攻击者通过植入恶意文档,使 RAG 系统在推理阶段 token 消耗异常增加 = CREEP 框架 - 关键事实 1:三种新型资源消耗策略 + 两种 agent paradigm(rewrite-based / generation-based) - 关键事实 2:高攻击效力 + 高检索成功率,难以防范 = 攻击门槛低 + 隐蔽性强 - 关键事实 3:WWW '26 acceptance = 学界认可 = RAG 安全新攻击面 - 关键事实 4:与 Bounded Agents + Inadvertent Context Leakage + ConceptGuard 形成"RAG / Agent 安全威胁全景 4 联延展" = 主动授权架构 + 被动隐私泄露 + 机器遗忘 + 推理成本攻击 - 风险层级:L0'' 元层+dev(agent 生态 + RAG 攻击)+ L3 系统层(资源消耗 / DoS 邻接) - 可信度:高(WWW '26 acceptance + jay 8-22 1450 单源确认 ✓)
与 risk.md 的关系: - §2.13 hardening 第 54 维候选级新增:CREEP = RAG 推理成本攻击(与 R50 inference-层 CVE 集群形成"推理引擎 + RAG 推理"双栖) - §3.1 反方 #91 第 40 栖候选新增:RAG 推理成本攻击反方(评测盲点第 14 例 · 与 #91 #37 推理引擎漏洞 12h 武器化形成对照) - §3.2 反身性 #21 第 41 栖候选新增:RAG 部署 vs 推理成本攻击 反身性张力 - §4.1 待核清单 新增 #111:CREEP 跨 RAG 框架测试覆盖 + 防御方案 + 与 vLLM/SGLang CVE 对位关系
建议归入: - §2.13 hardening 第 54 维候选级新增:CREEP = RAG 推理成本攻击 - §3.1 反方 #91 第 40 栖候选新增:RAG 推理成本攻击反方(评测盲点第 14 例) - §3.2 反身性 #21 第 41 栖候选新增:RAG 部署 vs 推理成本攻击 反身性张力 - §4.1 待核清单 新增 #111:CREEP 跨 RAG 框架测试覆盖 + 防御方案
🔴 待核:① paper_card 补建;② 跨 RAG 框架测试覆盖;③ 防御方案;④ 与 vLLM/SGLang CVE 集群对位关系。
增量 4 · 🟡 risk 邻接级 net-new 第 4 件 · OWASP MCP Top 10 + 2026 年 1-2 月 43% MCP CVE 是 Shell 注入类(jay 8-22 rag-agent-mcp-multimodal-survey + jay 8-22 1335 AI Engineering Trending + Perplexity CTO 公开放弃 MCP)
来源:
- inbox/jay/2026-08-22-rag-agent-mcp-multimodal-survey.md §MCP Security Crisis:"OWASP MCP Top 10 / CSA 200K 服务器暴露 RCE 沿用 v55"
- inbox/jay/2026-08-22-rag-agent-mcp-multimodal-survey.md §4 OWASP 沿用:"2026年1-2月:43% 的 MCP CVE 属于 Shell 注入类漏洞"
- inbox/jay/2026-08-22T1335-jay-ai-engineering-trending-mid-aug.md §4 OWASP Top 10 Agents & AI Vulnerabilities(2026 Cheat Sheet)沿用 + LLM01 Prompt Injection 沿用
- inbox/jay/2026-08-22T1450-jay-engineering-filter-pm.md §🔥 保留条目 10:"FutureAGI · Top 5 Agentic AI Frameworks to Watch in 2026 · MCP 正成为 agent 工具连接的「USB-C」 · Perplexity CTO 2026-03 公开放弃 MCP:token 消耗开销 + 认证摩擦是主要阻力"
- 跨实例 3 源独立交叉 ✓(jay 8-22 rag-agent-mcp-multimodal-survey + jay 8-22 1335 + jay 8-22 1450 PM)
arXiv:无 arXiv ID(OWASP Top 10 / CSA 报告 + Perplexity CTO 公开发言)
核心要点: - OWASP MCP Top 10 beta = 沿用 R47 h38 双联深化 + R48 h41 AJAR + R48 h42 MCP-ITP 84.2% ASR + 本窗口 43% MCP CVE Shell 注入类 = 工程化层级量化基线 - MCP Security Crisis / CSA = 200K 服务器暴露 RCE = 沿用 v55 - Perplexity CTO 2026-03 公开放弃 MCP = token 消耗开销 + 认证摩擦 = MCP 协议层反向信号(虽然 OWASP / CSA 主推 MCP 安全,但大厂 CTO 公开放弃 = 反身性张力) - 风险层级:L0'' 元层+dev(MCP 协议层 + 工程实现层双联)+ 持续 R47 h38 → R50 h38 沿用 - 可信度:高(3 源独立交叉 ✓ + OWASP / CSA 公开 + Perplexity CTO 实名公开)
与 risk.md 的关系: - §2.13 hardening 第 38 维候选级深化 沿用(R47 h38 双联 + R48 h41 / h42 + R50 8-22 h38 沿用 43% Shell 注入类 + Perplexity CTO 公开放弃 = 协议层 + 工程实现层 + 业界反身性张力三栖实证) - §3.2 反身性 #21 第 42 栖候选新增:MCP 协议普及 vs 业界大厂 CTO 公开放弃 反身性张力(Perplexity CTO 公开 = 反方 #91 第 41 栖) - §3.1 反方 #91 第 41 栖候选新增:Perplexity CTO 公开放弃 MCP = 协议层反方 - §4.1 待核清单 沿用:OWASP MCP Top 10 正式版对 43% Shell 注入类的引用 + Perplexity CTO 公开放弃的工程背景
建议归入: - §2.13 hardening 第 38 维候选级深化 沿用:h38 + 43% MCP CVE Shell 注入类 + Perplexity CTO 公开放弃 - §3.1 反方 #91 第 41 栖候选新增:Perplexity CTO 公开放弃 MCP = 协议层反方 - §3.2 反身性 #21 第 42 栖候选新增:MCP 协议普及 vs 业界大厂 CTO 公开放弃 反身性张力 - §4.1 待核清单 沿用:OWASP MCP Top 10 正式版对 43% Shell 注入类的引用 + Perplexity CTO 公开放弃的工程背景
🔴 待核:① 43% Shell 注入类 MCP CVE 实证数据原始论文;② Perplexity CTO 公开放弃的完整技术说明;③ OWASP MCP Top 10 正式版 vs beta 版差异。
增量 5 · 🟡 risk 邻接级 net-new 第 5 件 · Microsoft Foundry Agent 可靠恢复 + AgentRx 故障诊断体系(jay 8-22 engineering-e1prep 增量 3 + jay 8-22 1050 engineering-filter 沿用 = Foundry 10 类失败 + Action Ledger + FRS 6 维评分 + AgentRx 5 阶段诊断 + 10 类细粒度 taxonomy + CLI = 与 Inadvertent Context Leakage 形成"被动泄露 vs 主动防御"完整闭环)
来源:
- inbox/jay/2026-08-22-engineering-e1prep.md §增量 3:"Microsoft Foundry Agent 可靠恢复 + AgentRx 故障诊断——主动防御体系(与 v59 Inadvertent Context Leakage 互补)· TLDR:Foundry 和 AgentRx 构成 Agent 故障恢复的完整体系——Foundry 提供架构层(10 类失败分类 + Action Ledger + FRS 6 维评分),AgentRx 提供工具层(5 阶段诊断 pipeline + 10 类细粒度 taxonomy + CLI)· 两者共同补全了 v59 Inadvertent Context Leakage(上下文侧泄露,被动安全)与此条目(主动防御/故障恢复)的对称关系"
- inbox/jay/2026-08-22T1050-jay-engineering-filter.md §保留条目 沿用:Foundry 10 类失败 + AgentRx 10 类细粒度 taxonomy
- 跨实例 2 源独立交叉 ✓(jay 8-22 engineering-e1prep 增量 3 + jay 8-22 1050 engineering-filter)
arXiv:无 arXiv ID(Microsoft Research GitHub + 官方博客 · 与 v55 §3.4 T160 沿用)
核心要点: - Microsoft Foundry(架构层):10 类失败分类 + Action Ledger(行动账本)+ FRS 6 维评分(故障恢复评分) = 主动防御体系 - Microsoft AgentRx(工具层):5 阶段诊断 pipeline + 10 类细粒度 taxonomy + CLI(命令行诊断工具) - 10 类细粒度 taxonomy(比 Foundry 更细):Instruction/Plan Adherence / Invention of New Information / Invalid Invocation / Misinterpretation of Tool Output / Intent-Plan Misalignment / Underspecified User Intent / Intent Not Supported / Guardrails Triggered / System Failure / Inconclusive - 关键事实:与 v59 Inadvertent Context Leakage 互补 = "被动泄露 vs 主动防御"完整闭环 = 完整 Agent 安全闭环(攻击防御对称) - 风险层级:L3 系统层 / L0'' 元层+dev(主动防御体系)+ Guardrails 邻接 - 可信度:高(2 源独立交叉 ✓ + Microsoft Research 官方 · 工程化层级实证)
与 risk.md 的关系: - §2.13 hardening 第 55 维候选级新增:Foundry/AgentRx = 主动防御体系(与 Inadvertent Context Leakage 形成"被动泄露 vs 主动防御"完整闭环 · 完整 Agent 安全闭环攻击防御对称) - §3.1 反方 #91 第 42 栖候选新增:主动防御体系反方(评测盲点第 15 例 · 与 #91 #38 Inadvertent Context Leakage 形成对照) - §3.2 反身性 #21 第 43 栖候选新增:被动泄露 vs 主动防御 反身性张力(R50 沿用 + Foundry/AgentRx 主动防御体系 = L3 系统层防护 vs L2 接口层泄露双栖对位) - §4.1 待核清单 新增 #112:Foundry/AgentRx 跨 vendor 实现 + 10 类失败分类覆盖度 + 防御方案可推广性
建议归入: - §2.13 hardening 第 55 维候选级新增:Foundry/AgentRx = 主动防御体系(与 Inadvertent Context Leakage 完整闭环) - §3.1 反方 #91 第 42 栖候选新增:主动防御体系反方(评测盲点第 15 例) - §3.2 反身性 #21 第 43 栖候选新增:被动泄露 vs 主动防御 反身性张力 - §4.1 待核清单 新增 #112:Foundry/AgentRx 跨 vendor 实现 + 10 类失败分类覆盖度
🔴 待核:① Foundry/AgentRx GitHub 仓库地址与开源协议;② 跨 vendor 实现可行性;③ 10 类失败分类的实证覆盖度;④ 与 Inadvertent Context Leakage 的对位关系。
增量 6 · 🟡 risk 邻接级 net-new 第 6 件 · frontier lab 主动治理 24h+ 沿用(stephen 8-22 0910 news-x-vip-radar = OpenAI 8-18 暂停前沿 RL 训练两周 + Astra 列为「首个 cybersecurity-critical」模型 + Sam Altman 8-18 同步发文 + OpenAI 8-19 Zero Data Retention + Private Safety Processing = 同一波「cyber 关键能力」叙事 + Anthropic 8-14 Aug-2026 Risk Report + EU AI Act 水印 FAQ 沿用)
来源:
- inbox/stephen/2026-08-22-0910-news-x-vip-radar.md §本期高价值动态:"OpenAI 暂停前沿 RL 训练两周,强化监控/红队/网络隔离,把 Astra 列为「首个 cybersecurity-critical」模型 @OpenAI · 2026-08-18 · Sam Altman 同步发文称模型能力跑赢安全节奏,已主动踩刹车,但「近期仍会继续发新模型」@sama · 2026-08-18 · OpenAI 商务线推 Zero Data Retention + Private Safety Processing,在不让人工接触内容的前提下做跨会话安全监测 @OpenAI · 2026-08-19"
- inbox/stephen/2026-08-22-0910-news-x-vip-radar.md §备注:"OpenAI Pacing / Astra critical 模型属同一波「cyber 关键能力」叙事,Sam / OpenAI 双账号连发,建议归并为一条内部专题"
- inbox/stephen/2026-08-22-0910-news-x-vip-radar.md §未发现有效新动态:"@AnthropicAI — 8-14 Aug-2026 Risk Report + EU AI Act 水印 FAQ,均为 anthropic.com/news 静态页,已在 8-19 笔记覆盖,本期无新 GitHub"
- inbox/stephen/2026-08-22-1003-news-openai-news.md 5 件沿用(AI Futures + Stampli + ZDR + Replit Luna + ChatGPT Ads Europe)
- inbox/stephen/2026-08-22-1003-news-anthropic-news.md 5 件沿用(蛋白设计 + 分析化学 + 文本水印 FAQ + Google Cloud Claude Code ROI + 多智能体模式)
- 跨实例 2 源独立交叉 ✓(stephen 8-22 0910 news-x-vip-radar + stephen 8-22 1003 frontier lab news)
arXiv:无 arXiv ID(frontier lab 官方公告 · OpenAI X + Anthropic news)
核心要点: - OpenAI Pacing 8-18 = OpenAI 暂停前沿 RL 训练两周 + 强化监控 / 红队 / 网络隔离 + Astra 列为「首个 cybersecurity-critical」模型(与 R47 h39 Anthropic 措辞修订 + R48 h39 续立形成 frontier lab 主动治理层级跃迁持续) - Sam Altman 8-18 同步 = "模型能力跑赢安全节奏,已主动踩刹车" = frontier lab 主动披露 + 主动治理 - OpenAI ZDR + PSP 8-19 = Zero Data Retention + Private Safety Processing = frontier lab × 数据隐私 × 跨会话安全监测 - Anthropic 8-14 RSP + EU AI Act 水印 FAQ = 沿用 8-19 + R50 h39 续立 + 升级候选 - 同一波「cyber 关键能力」叙事 = OpenAI 双账号连发 = frontier lab 主动治理层级跃迁 - 风险层级:L1 模型层 + L3 系统层 + L0'' 元层+dev(frontier lab × cyber × safety 主动治理) - 可信度:高(2 源独立交叉 ✓ + OpenAI / Anthropic 官方公告)
与 risk.md 的关系: - §2.6 R44-R47 frontier lab + HF 官方链沿用 第 23 栖 Daybreak on AWS 8-22 沿用 第 5 个 24h 候选(stephen 8-22 noon §3.3 G14 沿用) - §2.6 栖 18 OpenAI Astra 8-22 沿用 第 6 个 24h 候选(stephen 8-22 noon §3.3 G14 沿用 + R50 #86.④ #86.⑤ ✅ 结案复验) - §2.6 栖 21 Anthropic Fable 5 8-22 沿用 第 5 个 24h 候选(沿用 R50 h39 续立) - §2.13 hardening 第 39 维沿用 + h39 候选级新增 续立 + 升级候选(R50 h39 升级候选 + OpenAI Pacing 8-18 + ZDR/PSP 8-19 + Anthropic RSP 8-14 沿用) - §3.1 反方 #93 第 6 栖候选新增:frontier lab 主动治理层级跃迁 vs AI Agent 自主越权 反方 第 6 例
建议归入: - §2.6 R44-R47 frontier lab + HF 官方链沿用 第 23 栖 + 栖 18 + 栖 21 沿用第 5-6 个 24h - §2.13 hardening 第 39 维沿用 + h39 候选级新增 续立 + 升级候选 - §3.1 反方 #93 第 6 栖候选新增:frontier lab 主动治理层级跃迁 vs AI Agent 自主越权 反方 第 6 例 - §4.1 待核清单 沿用:Anthropic RSP 8-14 完整 PDF URL(沿用 72h+ 沿用) + OpenAI Pacing 8-18 暂停前沿 RL 训练两周的具体停训模型
🔴 待核:① OpenAI Pacing 暂停前沿 RL 训练两周的具体停训模型;② Sam Altman "近期仍会继续发新模型" 的具体时间表;③ OpenAI ZDR + PSP 的客户覆盖范围;④ Anthropic RSP 8-14 完整 PDF URL(沿用 8-19 ~ 8-22)。
增量 7 · 🟡 risk 邻接级 net-new 第 7 件 · Gradient Flow 8-22 早盘双文 = 主线 A 沿用 8-15~8-22 八连 + "最大的 AI 风险并不在模型内部" + "模型未必是你最大的风险"
来源:
- inbox/spark/2026-08-22-1001-rss-gradient-flow.md §line 1-2:"最大的 AI 风险并不在模型内部 — 当前最能揭示问题的 AI 失败案例,并不是关于模型变得过于强大的故事,而是关于模型周围一切的故事 · 某个系统获得了过多访问权限" + "模型未必是你最大的风险"
- inbox/spark/2026-08-22-agent-e1prep.md §一 第⑨目 "Gradient Flow 'AI 风险在错误地方' 沿用主线 A · Chip Huyen 沿用 · 3Blue1Brown 数学科普" 沿用
- organized/knowledge/risk.md §0.5 关键工作脉络 + §1 现状全景 + §3.1 反方共识(沿用 评估 ≠ 安全 方法学原则 候选级新增)+ §3.2 反身性张力 沿用
- inbox/stephen/2026-08-22-ai-industry-e1prep.md §三 矛盾与待核实说法 #8:"Gradient Flow '最大 AI 风险并不在模型内部'+'模型未必是你最大的风险' 8-22 早盘双条目 vs v52 §2.205 Gradient Flow '最大 AI 风险可能在模型之外' 已落定条目:沿用 + 2 件新发" = 风险外移延展 6 件套
- 跨实例 4 源独立交叉 ✓(spark 8-22 1001 RSS + spark 8-22 agent-e1prep + risk.md 沿用 + stephen 8-22 ai-industry §三 #8)
arXiv:无 arXiv ID(Gradient Flow 立场文章)
核心要点: - "最大的 AI 风险并不在模型内部"(gradientflow.com/the-biggest-ai-risks-sit-outside-the-model/ · 8-22 早盘 RSS 收录)= 当前最能揭示问题的 AI 失败案例 = 关于"模型周围一切"的故事 = "某个系统获得了过多访问权限" - "模型未必是你最大的风险"(gradientflow.com/i-think-we-are-looking-for-ai-risk-in-the-wrong-place/ · 8-22 早盘 RSS 收录)= 沿用主线 A 反身性张力 - 主线 A 沿用 8-15~8-22 八连 = R46 §3.1 反方共识 #92 候选级新增("评估 ≠ 安全" 方法学原则)+ R47 §3.2 反身性张力 + R50 Gradient Flow 8-21 双文 + 8-22 双文 = 八连 - 关键事实:风险研究从"模型能力"扩展到"模型周围的一切"= 推理引擎层 + 授权架构 + 决策几何 + 多 Agent 委派 + T2I 对抗 + LLM unlearning + RAG 推理成本攻击 + 上下文敏感遗忘 = R50 net-new 5 件 + 8-22 邻接级 7 件的反身性张力主轴 - 可信度:中(4 源独立交叉 ✓ + spark 8-22 1001 RSS + 沿用主线 A 八连)
与 risk.md 的关系: - §3.1 反方 #92 第 1 栖候选新增(沿用):"评估 ≠ 安全" + "模型未必是你最大的风险" 反方主轴(沿用 R46 §3.1 #92 + R47 §3.2 反身性张力 续立 · 与 R50 net-new 5 件 + 8-22 邻接级 7 件 + Inference-层 CVE 集群形成"R50 → 8-22 反方 #92 主轴") - §3.2 反身性 #21 第 44 栖候选新增:风险研究 vs 系统/授权/部署/对抗/遗忘/推理引擎/RAG 攻击 反身性张力(R50 net-new 5 件 + 8-22 邻接级 7 件 = 风险研究焦点从"模型"扩展到"模型周围的一切") - §4.1 待核清单 沿用:Gradient Flow 完整论证链 + "评估 ≠ 安全"实证(沿用 R46 §3.1 #92)
建议归入: - §3.1 反方 #92 第 1 栖候选新增(沿用):"评估 ≠ 安全" + "模型未必是你最大的风险" 反方主轴 - §3.2 反身性 #21 第 44 栖候选新增:风险研究 vs 系统/授权/部署/对抗/遗忘/推理引擎/RAG 攻击 反身性张力 - §4.1 待核清单 沿用:Gradient Flow 完整论证链 + "评估 ≠ 安全"实证
🔴 待核:① Gradient Flow 完整论证链;② "评估 ≠ 安全"实证;③ "模型或非最大风险"的具体边界。
增量 8 · 🟡 EnvHarness 235▲ 8-22 早棒 #1 极显著 = 评测方法学延革第 12 例反方立基础候选预备首次机制化(multimodal 邻接级 · risk 视角为评测方法学延革第 26 栖)
来源:
- inbox/flyp/2026-08-22-multimodal-e1prep.md §1:"v55 接力棒关键实测(24h 窗口 8-21 09:40 → 8-22 09:40):EnvHarness 235▲ 8-22 早棒 #1 = v33 以来 24h 窗口 multimodal 主分类 / 邻接级 立标信号最高位实测 #1(超 v53 沿用 StateM 374▲ 8-20 早盘 24h 实测的 235▲ < 374▲ 但 8-22 早棒实际票数过 235▲ 为 v33 以来单日早盘实测 #2 高位)"
- inbox/flyp/2026-08-22-EnvHarness-and-4DAnyone-critical-read.md §1:"评测方法学延革第 12 例反方立基础候选预备首次机制化"
- inbox/stephen/2026-08-22-ai-industry-e1prep.md §三 矛盾与待核实说法 #3:"EnvHarness 235▲ 8-22 早盘 #1 vs StateM 374▲ 8-20 早盘 24h 实测 = v33 以来 24h 窗口立标信号第 1 高位实测 #1(EnvHarness)vs 第 2 高位实测(8-20 早盘 StateM)· EnvRigger 自身可靠性量化 / +9.0 分原始 baseline / Link 组件边界 / RL co-evolution 收敛性 4 项待 PDF §4 + 附录补查"
- inbox/jay/2026-08-22T2105-jay-five-category-briefing.md §五沿用 + §立标池饱和度 9 向并存
- 跨实例 4 源独立交叉 ✓(flyp 8-22 multimodal-e1prep §1 + flyp 8-22 EnvHarness-and-4DAnyone-critical-read §1 + stephen 8-22 ai-industry §三 #3 + jay 8-22 2105 BE 沿用)
arXiv:arXiv:2608.19880(Google Research 出品 · paper_card 未建 P1 缺口 · 主分类 evaluation · 副 multimodal)
核心要点: - EnvHarness = "frozen env + 可编程插件(Setup / Rule / Link 三件)" + EnvRigger LLM 设计师 agent(诊断弱点 → 写组件 → 测试 → 修订) - 关键约束:goal predicate 保持不动 = 重塑的环境仍保留原始 benchmark 的可信 verifier - 5 benchmark 多域:ALFWorld + WebArena + SWE-bench Verified + OfficeQA + SpreadsheetBench - 关键数字:held-out 实例上比原始环境 / 领域特定环境生成管线最多 +9.0 分 / 执行步数 -9.8% - RL co-evolution = 训练中 EnvHarness 提供"持续针对性"环境信号,实现 policy-env 共同进化 - 评测方法学延革第 12 例反方立基础候选预备首次机制化 = 与 v52 §2.211.2 StateM + HarnessRisk + Zetta ζ + CoEvoSkills + SkillGate + SemaPLC 形成"Agent Harness 评测延展 7 件套" - 风险视角:评测方法学延革 = risk 主轴 L2 接口层 + L3 系统层 + L0'' 元层+dev(评测方法学作为风险研究的延伸) - 可信度:高(4 源独立交叉 ✓ + Google Research 出品 + v33 以来首次机制化)
与 risk.md 的关系: - §2.13 hardening 第 56 维候选级新增:EnvHarness = 评测方法学延革第 12 例反方立基础候选预备(multimodal 邻接级 · risk 视角为评测方法学延革第 26 栖 · 与 v54 §3.3 #119 评测方法学延革第 11 例 SemComp-Bench 沿用) - §3.1 反方 #91 第 43 栖候选新增:评测方法学延革第 12 例反方(评测盲点第 16 例 · 与 #91 #38 Inadvertent Context Leakage + #91 #39 ConceptGuard + #91 #40 CREEP + #91 #41 Perplexity CTO + #91 #42 Foundry/AgentRx 形成"评测盲点 #1-#16"立基础延展) - §3.2 反身性 #21 第 45 栖候选新增:评测方法学延革 vs frontier lab 部署速度 反身性张力(评测方法学作为 risk 主轴延展) - §4.1 待核清单 新增 #113:EnvRigger 自身可靠性量化 / +9.0 分原始 baseline / Link 组件边界 / RL co-evolution 收敛性
建议归入: - §2.13 hardening 第 56 维候选级新增:EnvHarness = 评测方法学延革第 12 例反方立基础候选预备(risk 视角) - §3.1 反方 #91 第 43 栖候选新增:评测方法学延革第 12 例反方(评测盲点第 16 例) - §3.2 反身性 #21 第 45 栖候选新增:评测方法学延革 vs frontier lab 部署速度 反身性张力 - §4.1 待核清单 新增 #113:EnvRigger 自身可靠性量化 + +9.0 分原始 baseline + Link 组件边界 + RL co-evolution 收敛性
🔴 待核:① EnvRigger 自身成功率 / 误诊率 / 组件有效性边界;② +9.0 分原始 baseline 如何选;③ Link 组件在 5 个评测中实际被使用的频次;④ RL co-evolution 收敛性报告;⑤ 主分类归 multimodal 还是 evaluation(沿用 flyp 8-22 multimodal-e1prep 矛盾 1)。
三、值得警惕的矛盾或待核实说法
警惕 1 · R50 沿用 24h 主轴空挡延续(stephen 8-22 noon §2.7 risk 9 件 + 无显著缺口 vs R50 落定后 24h)
stephen 8-22 noon: - §2.7 risk 9 件 + 无显著缺口(沿用 R50 落定) - §1.1 spark 24h review risk 9 件 沿用 - §4.2 立标池双向锚 9 向并存预备 + 评测方法学延革第 12 例预备首次机制化 沿用
8-22 早盘 HF Daily 15 件 = 0 件 risk 主分类 = 主轴空挡延续
R50 落定 24h 后接续风险: - R50 5 件 net-new + 5 件邻接级 net-new + 8-22 7 件邻接级 net-new = R50 主轴静默但邻接级密度持续 - 风险研究焦点持续从"模型主分类"向"邻接级 / 工程化层级"扩展 = v33 以来首次机制化
建议处理:R50 沿用 24h 主轴空挡 + 邻接级密度延续 = 本棒承担备料职责 + v51 接力棒由 flyP 17:25 下午棒前触发(沿用 stephen 8-22 noon §0 + 风险活文档落盘 8-22 上午棒前 + 备料已落盘但活文档未触发)
警惕 2 · 7 件邻接级 net-new 的归入节冲突(R50 沿用 vs v51 触发时点)
R50 沿用: - §2.13 hardening 候选级新增 5 件(DA-LeWM 第 47 + Bounded Agents 第 48 + DiSCO 第 49 + AdaPop 第 50 + vLLM CVE 第 51) - §3.1 反方 #91 第 33-37 栖候选级新增(Decision-Metric + Bounded Agents + DiSCO + AdaPop + 推理引擎漏洞) - §3.2 反身性 #21 第 33-38 栖候选级新增 - §4.1 待核清单 新增 #105-109(Bounded Agents + AdaPop + DiSCO + vLLM CVE + Bounded Agents + AdaPop 主分类归属)
8-22 邻接级 7 件 vs R50 主轴静默: - 7 件邻接级 = 风险研究焦点的反身性位移 = 风险研究从"模型主分类"扩展到"邻接级 / 工程化层级" - v51 接力棒触发时点 8-22 evening 棒前 vs 8-23 上午棒前
建议处理:v51 接力棒独立判定 7 件邻接级是否升级为 risk 主轴邻接级参考 + 与 R50 5 件延展 12 件风险主轴候选池 47→54(假设 v51 全部纳入)+ arXiv 223→230 + CVE 33 沿用 + α 14 维 + 21 轨反身性
警惕 3 · ConceptGuard arXiv:2608.20338 vs AdaPop arXiv:2608.14229 主分类归属独立判定
stephen 8-22 noon:stephen 8-22 noon §3.1 #C17 AdaPop 主方向是 LLM unlearning(机器遗忘),归入 risk 主线更合适(沿用 8-21)
spark 8-22 agent-e1prep §四 矛盾 #3:AdaPop 主方向归属冲突(沿用 8-21)
paper_card 1033:主 engineering 副 risk
ConceptGuard arXiv:2608.20338 单源弱:机器遗忘 + Alignment 邻接级(jay 8-22 2105 BE-4 单源确认)
AdaPop vs ConceptGuard:两件机器遗忘候选 = stephen noon #C17 + v51 接力棒必须独立判定: - AdaPop 主 engineering / 副 risk(沿用 R50 h50) - ConceptGuard 主 ? / 副 risk(本棒建议 主 risk 副 engineering 邻接级 · paper_card 待建)
建议处理:v51 接力棒独立判定 AdaPop 主分类归属(升级为 risk 主轴邻接级)+ ConceptGuard 主分类归属(建议主 risk 副 engineering)
警惕 4 · Inadvertent Context Leakage 主分类归属冲突(tom 8-22 rag-e1prep vs paper_card 1047 vs v59 engineering 锚入)
tom 8-22 rag-e1prep §增量 1:主分类 rag · 形态 position/systems · 副分类 privacy, security, context-leakage, inference
paper_card 1047 实际标注:主分类 agent · 形态 method(8-22 落盘)
v59 engineering 锚入:§2.15 Agentic Engineering 安全 · Foundry/AgentRx 互补
冲突: - 主分类 = rag(初判)/ vs agent(实际 paper_card)/ vs engineering(v59 锚入节) - 形态 = position/systems(初判)/ vs method(实际 paper_card) - v51 接力棒独立判定
建议处理:v51 接力棒独立判定 Inadvertent Context Leakage 主分类归属(建议主 agent 副 risk 邻接级 · 沿用 paper_card 1047 实际标注)
警惕 5 · CREEP arXiv:2606.02643 WWW '26 vs 风险侧评级独立判定
jay 8-22 1450 PM engineering-filter §🔥 保留条目 14:CREEP · RAG 推理成本攻击 · WWW '26 acceptance · 首个 RAG 推理成本攻击研究 · paper_card 未建 P1 缺口
风险视角: - 攻击者通过植入恶意文档 → RAG 系统推理阶段 token 消耗异常增加 - 三种新型资源消耗策略 + 两种 agent paradigm - 高攻击效力 + 高检索成功率 + 难以防范
建议处理:v51 接力棒独立判定 CREEP 主分类归属(建议主 risk 副 rag · 与 Bounded Agents 形成"RAG / Agent 安全威胁全景" 立基础延展)
警惕 6 · Foundry/AgentRx vs Inadvertent Context Leakage 形成"被动泄露 vs 主动防御"完整闭环
jay 8-22 engineering-e1prep §增量 3: - "Foundry 和 AgentRx 构成 Agent 故障恢复的完整体系——Foundry 提供架构层(10 类失败分类 + Action Ledger + FRS 6 维评分),AgentRx 提供工具层(5 阶段诊断 pipeline + 10 类细粒度 taxonomy + CLI)" - "两者共同补全了 v59 Inadvertent Context Leakage(上下文侧泄露,被动安全)与此条目(主动防御/故障恢复)的对称关系"
建议处理:v51 接力棒独立判定 Foundry/AgentRx 完整闭环归入 risk 主轴邻接级(§2.13 hardening 第 55 维 + §3.1 反方 #91 第 42 栖 + §3.2 反身性 #21 第 43 栖)
警惕 7 · 3 件 P0 沿用持续 open 沿用 72h+ 96h+
Anthropic RSP 8-14 完整 PDF URL: - 沿用 8-19 ~ 8-22 = 96h+ open - stephen 8-22 0910 news-x-vip-radar "@AnthropicAI — 8-14 Aug-2026 Risk Report + EU AI Act 水印 FAQ,均为 anthropic.com/news 静态页,已在 8-19 笔记覆盖" = URL 未明示 - v51 接力棒独立判定 anthropic.com/aug-2026-risk-report 完整 PDF URL
404 Media 珍本古籍 → Amazon AI 训练设施: - 沿用 8-19 ~ 8-22 = 96h+ open - stephen 8-19/8-20/8-21 noon §3.3 #5 沿用 - v51 接力棒独立判定 归档位置决策(人工确认)
HarmProfile arXiv:2608.14577 P1 缺口 paper_card 补建: - 沿用 8-19 ~ 8-22 = 96h+ open - stephen 8-20/8-21 noon §3.3 #G11 + 8-22 noon §4.3 G15 沿用 - v51 接力棒独立判定 paper_card 补建
建议处理:v51 接力棒触发后,主 owner 必须人工确认 Anthropic RSP 完整 PDF URL + 404 Media 归档位置 + HarmProfile P1 paper_card 补建
警惕 8 · OWASP MCP Top 10 实证 vs 反方 #91 Perplexity CTO 公开放弃 MCP 协议层反身性张力
stephen 8-22 noon §3.3 #G14 + jay 8-22 rag-agent-mcp-multimodal-survey 沿用: - OWASP MCP Top 10 / CSA 200K 服务器暴露 RCE = 沿用 v55 §3.4 - 2026 年 1-2 月 43% MCP CVE 是 Shell 注入类 = 工程化层级量化基线
jay 8-22 1450 PM §🔥 保留条目 10: - FutureAGI · Top 5 Agentic AI Frameworks to Watch in 2026 · MCP 正成为 agent 工具连接的「USB-C」 - Perplexity CTO 2026-03 公开放弃 MCP:token 消耗开销 + 认证摩擦
冲突: - OWASP / CSA 主推 MCP 安全 vs Perplexity CTO 公开放弃 = 协议普及 vs 业界大厂 CTO 公开放弃 反身性张力 - v51 接力棒独立判定 反方 #91 第 41 栖候选新增
建议处理:v51 接力棒独立判定 Perplexity CTO 公开放弃的工程背景 + OWASP MCP Top 10 正式版对 43% Shell 注入类的引用 + 协议普及 vs 业界反身性张力实证
警惕 9 · frontier lab 主动治理 24h+ 沿用 + h39 升级候选(OpenAI Pacing / ZDR / PSP / Astra critical / Anthropic RSP 8-14)
stephen 8-22 0910 news-x-vip-radar: - OpenAI Pacing 8-18 + Astra critical 8-18 + Sam Altman 8-18 + ZDR/PSP 8-19 = 同一波「cyber 关键能力」叙事 - Anthropic 8-14 RSP + EU AI Act 水印 FAQ 沿用
R50 沿用 h39 候选级新增 + 升级候选: - h39 Anthropic 8-14 RSP = R50 h39 续立 + 升级候选 - h39 OpenAI Pacing + Astra critical + ZDR/PSP = R50 h39 邻接级 + frontier lab 主动治理层级跃迁
建议处理:v51 接力棒独立判定 h39 升级候选 + frontier lab 主动治理 vs AI Agent 自主越权 反方 #93 第 6 栖
警惕 10 · Gradient Flow 主线 A 八连 + 风险研究焦点反身性位移
spark 8-22 1001 RSS: - "最大的 AI 风险并不在模型内部" + "模型未必是你最大的风险" = 主线 A 沿用 8-15~8-22 八连 - "AI 正在如何改变数学研究" + "持续学习正以零散的方式到来" + "为什么我们的 AI 模型一上线部署就停止学习了" = 风险外移延展 5 件套
stephen 8-22 ai-industry §三 #8: - Gradient Flow "最大 AI 风险并不在模型内部"+"模型未必是你最大的风险" 8-22 早盘双条目 vs v52 §2.205 Gradient Flow "最大 AI 风险可能在模型之外" 已落定条目:沿用 + 2 件新发
建议处理:v51 接力棒独立判定 Gradient Flow 沿用 + 风险外移延展 5 件套归入 §3.1 反方 #92 + §3.2 反身性 #21 第 44 栖
警惕 11 · EnvHarness 评测方法学延革第 12 例反方立基础候选预备 vs 主分类 multimodal / evaluation 争议
flyp 8-22 multimodal-e1prep 矛盾 1 判定:主分类 evaluation / agent 主轴而非 multimodal(8-22 早棒 #1 235▲ 极显著 · 评测方法学延革第 12 例反方立基础候选预备)
flyp 8-22 EnvHarness-and-4DAnyone-critical-read 沿用:flyP 评级 ★★ 中-高档 ★★ 候选预备(建议主分类 evaluation 副分类 multimodal)
stephen 8-22 ai-industry §三 #3 沿用:主分类归 multimodal 还是 evaluation(沿用 flyp 8-20 multimodal-e1prep 矛盾 6 同类判例 · 建议主分类 evaluation 副分类 multimodal)
v55 agent / multimodal 接力棒独立判定 + v51 risk 接力棒独立判定 risk 视角归入
建议处理:v55 接力棒独立判定 EnvHarness 主分类 evaluation 副 multimodal + v51 risk 接力棒独立判定 risk 视角归入 §2.13 hardening 第 56 维 + §3.1 反方 #91 第 43 栖
四、可引用的 arXiv 号列表(R51 备料棒)
主 risk 主分类 arXiv 列表
| 序号 | arXiv ID | 论文 | 主分类 | 副分类 | 形态 | 备注 |
|---|---|---|---|---|---|---|
| 1 | arXiv:2608.18746 | Decision-Metric Alignment in Latent World Models | risk | - | method | R50 net-new 第 1 件 · 8-22 沿用 |
| 2 | arXiv:2608.09158 | Low-Frequency Safety Risks in LALMs (ILL) | risk | multimodal | method | R47 沿用 · 栖 26 |
| 3 | arXiv:2608.09867 | Stealing Reasoning Traces | risk | - | - | R44 沿用 · 栖 24 |
副 risk 邻接级 arXiv 列表(R51 备料棒引用)
| 序号 | arXiv ID | 论文 | 主分类 | 副分类 | 形态 | 备注 |
|---|---|---|---|---|---|---|
| 1 | arXiv:2608.15888 | Bounded Agents | agent | risk | method | R50 net-new 第 2 件 · 8-22 沿用 |
| 2 | arXiv:2608.17067 | DiSCO | multimodal | risk | method | R50 net-new 第 3 件 · 8-22 沿用 |
| 3 | arXiv:2608.14229 | AdaPop | engineering | risk | benchmark | R50 net-new 第 4 件 · 8-22 沿用 · stephen noon #C17 建议归 risk 主线 |
| 4 | arXiv:2608.14577 | HarmProfile | - | - | - | R50 P1 缺口 paper_card 沿用 96h+ |
| 5 | arXiv:2608.19857 | Inadvertent Context Leakage | agent | risk | method | 8-22 net-new 邻接级 第 1 件 · paper_card 1047 已建 |
| 6 | arXiv:2608.20338 | ConceptGuard | - | risk | benchmark | 8-22 net-new 邻接级 第 2 件 · paper_card 未建 P1 缺口 |
| 7 | arXiv:2606.02643 | CREEP / Inference Cost Attacks on RAG | - | risk | method | 8-22 net-new 邻接级 第 3 件 · WWW '26 acceptance · paper_card 未建 P1 缺口 |
| 8 | arXiv:2608.19880 | EnvHarness | evaluation | multimodal | method | 8-22 net-new 邻接级 第 8 件 · multimodal 主分类争议 · paper_card 未建 P1 缺口 |
主 risk 邻接级 inference CVE 列表(无 arXiv ID · R50 net-new 第 5 件 · 8-22 沿用)
| 序号 | CVE ID | 漏洞 | 引擎 | CVSS | 状态 |
|---|---|---|---|---|---|
| 1 | CVE-2026-73558 | 跨用户 KV Cache 数据泄漏(整数溢出) | vLLM | Medium 5.3 | vLLM 0.27.0 修复 |
| 2 | CVE-2026-22778 | 多模态视频 RCE(信息泄露 + 堆缓冲区溢出) | vLLM | Critical 9.8 | vLLM 0.8.3 ~ 0.14.0 |
| 3 | CVE-2026-33626 | SSRF(12h31m 武器化) | LMDeploy | Critical | LMDeploy 0.12.2 之前 |
| 4 | CVE-2026-3059 | 多模态生成 ZMQ broker 去序列化 | SGLang | Critical 9.8 | 需启用 multimodal_gen |
| 5 | CVE-2026-3060 | 分拆编码器接收端去序列化 | SGLang | Critical 9.8 | 需启用 ZMQ 传输分拆 |
| 6 | CVE-2026-3989 | 崩溃转储重放脚本去序列化 | SGLang | Critical 9.8 | 需启用 replay_request_dump |
沿用 arXiv 列表(R48-R50 立基础延展备料)
| 序号 | arXiv ID | 论文 | 主分类 | 副分类 | 形态 | 备注 |
|---|---|---|---|---|---|---|
| 1 | arXiv:2601.10971 | AJAR | agent | risk | - | R48 沿用 · 栖 27 |
| 2 | arXiv:2601.07395 | MCP-ITP | agent | risk | - | R48 沿用 · 栖 28 |
| 3 | arXiv:2508.14925 | MCPTox | agent | risk | - | R48 沿用 · 实证化 |
| 4 | arXiv:2608.00677 | OpenART | agent | risk | - | R45 沿用 · 栖 25 |
| 5 | arXiv:2510.23673 | MCPGuard | agent | risk | - | R48 沿用 · 防御侧 |
| 6 | arXiv:2508.13220 | MCPSecBench | agent | risk | - | R48 沿用 · 防御侧 |
| 7 | arXiv:2512.15163 | MCP-SafetyBench | agent | risk | - | R48 沿用 · 防御侧 |
frontier lab 主动治理 URL 列表(8-22 沿用)
| 序号 | URL | 内容 | 备注 |
|---|---|---|---|
| 1 | openai.com/index/introducing-ai-futures | OpenAI AI Futures 博客 | v52 净增 沿用 · C21 P0 核验 |
| 2 | openai.com/index/offering-zero-data-retention-for-frontier-models | OpenAI ZDR + PSP | R50 沿用 |
| 3 | x.com/OpenAI/status/2089777845187031262 | OpenAI Pacing 暂停前沿 RL 训练两周 + Astra critical | 8-22 沿用 |
| 4 | x.com/sama/status/2089787807611195475 | Sam Altman 8-18 同步发文 模型能力跑赢安全节奏 | 8-22 沿用 |
| 5 | anthropic.com/aug-2026-risk-report | Anthropic RSP 8-14 完整 PDF URL | R50 h39 续立 + 升级候选 + 8-22 P0 沿用 96h+ |
| 6 | anthropic.com/news/improving-fable-5-s-biology-safeguards | Anthropic Fable 5 改进生物学安全防护 | R44-R50 沿用 栖 21 |
| 7 | gradientflow.com/the-biggest-ai-risks-sit-outside-the-model/ | Gradient Flow 8-22 "最大的 AI 风险并不在模型内部" | 主线 A 沿用 8-15~8-22 八连 |
| 8 | gradientflow.com/i-think-we-are-looking-for-ai-risk-in-the-wrong-place/ | Gradient Flow 8-22 "模型未必是你最大的风险" | 主线 A 沿用 8-15~8-22 八连 |
五、建议归入节(knowledge/risk.md)
§2.13 hardening 候选级新增 4 件 + 第 38 维深化 沿用 + frontier lab 主动治理沿用
- 第 52 维:Inadvertent Context Leakage = 被动隐式推理链泄露(arXiv:2608.19857)
- 第 53 维:ConceptGuard = 上下文敏感遗忘基准评测(arXiv:2608.20338)
- 第 54 维:CREEP = RAG 推理成本攻击(arXiv:2606.02643 · WWW '26 acceptance)
- 第 55 维:Foundry/AgentRx = 主动防御体系(与 Inadvertent Context Leakage 形成"被动泄露 vs 主动防御"完整闭环)
- 第 38 维深化 沿用:h38 + 43% MCP CVE Shell 注入类 + Perplexity CTO 公开放弃(R47 h38 双联 + R48 h41 / h42 + 8-22 h38 沿用 协议层 + 工程实现层 + 业界反身性张力三栖实证)
- 第 56 维:EnvHarness = 评测方法学延革第 12 例反方立基础候选预备(arXiv:2608.19880 · multimodal 邻接级 · risk 视角为评测方法学延革第 26 栖)
- 第 39 维沿用 + h39 候选级新增 续立 + 升级候选(Anthropic RSP 8-14 + OpenAI Pacing 8-18 + ZDR/PSP 8-19 + Astra critical 8-18 + Sam Altman 同步)
§3.1 反方 #91 候选级新增 6 件 + #92 第 1 栖沿用 + #93 第 6 栖候选级新增
- #91 第 38 栖:Inadvertent Context Leakage = 被动隐私泄露 vs 主动攻击 反方(评测盲点第 12 例)
- #91 第 39 栖:ConceptGuard = 机器遗忘 vs 抹除 反方(评测盲点第 13 例)
- #91 第 40 栖:CREEP = RAG 推理成本攻击反方(评测盲点第 14 例)
- #91 第 41 栖:Perplexity CTO 公开放弃 MCP = 协议层反方(评测盲点第 15 例)
- #91 第 42 栖:Foundry/AgentRx = 主动防御体系反方(评测盲点第 16 例)
- #91 第 43 栖:EnvHarness = 评测方法学延革第 12 例反方(评测盲点第 17 例)
- #92 第 1 栖(沿用):"评估 ≠ 安全" + "模型未必是你最大的风险" 反方主轴(主线 A 沿用 8-15~8-22 八连)
- #93 第 6 栖候选级新增:frontier lab 主动治理层级跃迁 vs AI Agent 自主越权 反方 第 6 例
§3.2 反身性 #21 候选级新增 6 件 + 第 44-45 栖
- #21 第 39 栖:多租 Agent 生产部署的隐私边界反身性张力(Inadvertent Context Leakage)
- #21 第 40 栖:前沿部署 vs 上下文敏感遗忘 反身性张力(ConceptGuard)
- #21 第 41 栖:RAG 部署 vs 推理成本攻击 反身性张力(CREEP)
- #21 第 42 栖:MCP 协议普及 vs 业界大厂 CTO 公开放弃 反身性张力(Perplexity CTO)
- #21 第 43 栖:被动泄露 vs 主动防御 反身性张力(Foundry/AgentRx)
- #21 第 44 栖:风险研究 vs 系统/授权/部署/对抗/遗忘/推理引擎/RAG 攻击 反身性张力(Gradient Flow 主线 A 八连)
- #21 第 45 栖:评测方法学延革 vs frontier lab 部署速度 反身性张力(EnvHarness)
§4.1 待核清单 新增 6 件
- #110:ConceptGuard 跨 frontier lab 测试覆盖 + 与 AdaPop 对位关系
- #111:CREEP 跨 RAG 框架测试覆盖 + 防御方案 + 与 vLLM/SGLang CVE 对位关系
- #112:Foundry/AgentRx 跨 vendor 实现 + 10 类失败分类覆盖度 + 防御方案可推广性
- #113:EnvRigger 自身可靠性量化 / +9.0 分原始 baseline / Link 组件边界 / RL co-evolution 收敛性
§4.1 待核清单 沿用 3 件 P0 96h+ open
- #103 沿用:Anthropic RSP 完整 PDF URL(沿用 8-19 ~ 8-22 = 96h+ P0)
- #104 沿用:HarmProfile 2608.14577 PDF 全文 + 跨 frontier lab 测试覆盖 + 风险分布指标(沿用 8-19 ~ 8-22 = 96h+ P0)
- 沿用:404 Media 珍本古籍 → Amazon AI 训练设施 归档位置决策(stephen 8-19 ~ 8-22 noon §3.3 #5 = 96h+ P0)
六、本棒与 v51 接力棒触发建议
触发时机
- v51 risk 接力棒必须由 flyP 8-22 evening 棒前触发(沿用 stephen 8-22 noon §0 + 风险活文档沿用 24h+ · 修复主轴空挡延续 + 接收 8-22 邻接级 7 件 + R50 沿用 5 件 + P0 待人工 3 件)
触发内容
- 0 件主 risk 主分类 net-new(沿用 8-21 R50 5 件 + 8-22 邻接级 7 件)
- 邻接级 7 件:
- ① Inadvertent Context Leakage arXiv:2608.19857(paper_card 1047 已建 · 主 agent 副 risk)
- ② ConceptGuard arXiv:2608.20338(paper_card 未建 P1 缺口)
- ③ CREEP arXiv:2606.02643(WWW '26 acceptance · paper_card 未建 P1 缺口)
- ④ OWASP MCP Top 10 + 43% Shell 注入 + Perplexity CTO 公开放弃(无 arXiv)
- ⑤ Foundry/AgentRx 主动防御体系(Microsoft Research · 无 arXiv)
- ⑥ frontier lab 主动治理 24h+ 沿用(OpenAI Pacing / ZDR/PSP / Astra critical / Anthropic RSP 8-14 · 无 arXiv)
- ⑦ Gradient Flow 8-22 早盘双文(主线 A 沿用 8-15~8-22 八连 · 无 arXiv)
- ⑧ EnvHarness arXiv:2608.19880(multimodal 邻接级 · 评测方法学延革第 12 例 · paper_card 未建 P1 缺口)
- P0 待人工 3 件沿用:Anthropic RSP 8-14 完整 PDF URL(96h+ P0) + 404 Media 归档位置(96h+ P0) + HarmProfile 2608.14577 P1 paper_card 补建(96h+ P0)
- v51 触发后新增候选池:R50 47 → v51 47 + 7 = 54 件 + 候选池延伸 5 件邻接级 + R50 沿用 5 件主 risk 主分类
- 修复 24h+ 主轴空挡延续 = v51 触发后修复主轴空挡 + 接收 7 件邻接级 + P0 待人工 3 件 + 反身性张力持续 8 日
风险层级 L 分类
- L1 模型层:R50 沿用 ILL LALMs(栖 26)+ Decision-Metric Alignment(栖 33)+ AdaPop(栖 36)+ 8-22 ConceptGuard(第 40 栖)
- L2 接口层:R50 沿用 DiSCO(栖 35)+ Bounded Agents(栖 34)+ 8-22 Inadvertent Context Leakage(第 38 栖)
- L3 系统层:R50 沿用 Bounded Agents(栖 34)APC 授权架构 + Decision-Metric Alignment(栖 33)MPC 规划 + 8-22 Foundry/AgentRx(第 55 维) + 8-22 CREEP(第 54 维)
- L0 反身性/工具供应链:R50 沿用 HarmProfile(栖 31 沿用 8-20)+ vLLM CVE 集群(栖 37)+ 8-22 43% MCP CVE Shell 注入 + Perplexity CTO 公开放弃(第 38 维深化)
- L0'' 元层+dev:R50 沿用 vLLM CVE 集群(栖 37)推理引擎层安全 + DiSCO T2I 即插即用(栖 35)+ 8-22 EnvHarness(第 56 维 · 评测方法学延革第 12 例) + 8-22 ConceptGuard 机器遗忘(第 53 维) + 8-22 CREEP RAG 推理成本攻击(第 54 维)
- L_audio 大型音频语言模型:R47 沿用 ILL(栖 26)
七、检查过的来源清单(全部 20+ 件)
inbox/flyp/(8-22 早盘 + 上午 + 下午)
2026-08-22-1000-rss-cameron-wolfe.md(沿用 R50)2026-08-22-1002-rss-interconnects.md(沿用 R50)2026-08-22-1004-rss-yt-ai-explained.md(沿用 R50 · Fable 5 vs GPT 5.6 Sol 沿用)2026-08-22-1004-rss-yt-two-minute-papers.md(沿用 R50)2026-08-22-1030-sat-weekly-deep-read-notes.md(沿用 R50 · SCA + StateM + Video-LevelGauge)2026-08-22-1030-sat-weekly-deep-read-reviews.md(沿用 R50)2026-08-22-1550-SemComp-Bench-semantic-task-completion-video-gen-critical-read.md(SemComp-Bench multimodal 邻接级 · 评测方法学延革第 11 例 · 0 件 risk 主分类 net-new)2026-08-22-EnvHarness-and-4DAnyone-critical-read.md(EnvHarness multimodal 邻接级 · 评测方法学延革第 12 例 · 0 件 risk 主分类 net-new)2026-08-22-multimodal-e1prep.md(multimodal 主分类 · 5 件候选实测净增 · 0 件 risk 主分类 net-new)
inbox/spark/(8-22 早盘)
2026-08-22-1001-rss-gradient-flow.md(Gradient Flow 8-22 早盘双文 · 主线 A 沿用 8-15~8-22 八连)2026-08-22-1002-rss-chip-huyen.md(沿用 R50)2026-08-22-1005-rss-yt-3blue1brown.md(沿用 R50)2026-08-22-agent-e1prep.md(Bounded Agents 1038 + AdaPop 1033 主分类归属冲突 沿用)
inbox/tom/(8-22 早盘 + 上午)
2026-08-22-0900-hf-daily-2026-08-22.md(15 件新料 · 0 件 risk 主分类 net-new)2026-08-22T0840-agent-rag-longcontext-radar.md(Inadvertent Context Leakage 2608.19857 · Embedder's Dilemma · HSI · 8 件 risk 邻接级)2026-08-22-rag-e1prep.md(Inadvertent Context Leakage 2608.19857 增量 1 · paper_card 1047 已建 · IAR · Embedder's Dilemma)2026-08-22-evaluation-e1prep.md(HSI harness 自演进谱系第 5 条分支 · EnvHarness 评测方法学延革第 12 例预备)
inbox/jay/(8-22 早盘 + 上午 + 下午 + evening)
2026-08-22-engineering-e1prep.md(Foundry/AgentRx 主动防御体系 增量 3 · v59 §2.15 锚入 · 与 Inadvertent Context Leakage 互补)2026-08-22-rag-agent-mcp-multimodal-survey.md(OWASP MCP Top 10 + 43% Shell 注入 沿用)2026-08-22T1050-jay-engineering-filter.md(Foundry/AgentRx 沿用)2026-08-22T1335-jay-ai-engineering-trending-mid-aug.md(OWASP Top 10 Agents 沿用 · LLM01 Prompt Injection 沿用)2026-08-22T1450-jay-engineering-filter-pm.md(CREEP arXiv:2606.02643 · WWW '26 acceptance · RAG 推理成本攻击 第 14 保留条目 · Perplexity CTO 公开放弃 MCP)2026-08-22T2105-jay-five-category-briefing.md(ConceptGuard arXiv:2608.20338 · 上下文敏感遗忘 BE-4)2026-08-22T2300-jay-five-category-supplement.md(沿用 8-22 1450 PM + 8-22 2105 BE)
inbox/stephen/(8-22 早盘 + 中午 + evening)
2026-08-22-0910-news-x-vip-radar.md(OpenAI Pacing 8-18 + Astra critical + Sam Altman 同步 + OpenAI ZDR/PSP 8-19 + Anthropic RSP 8-14 沿用 = frontier lab 主动治理 24h+ 沿用)2026-08-22-1003-news-openai-news.md(5 件沿用件套)2026-08-22-1003-news-anthropic-news.md(5 件沿用件套)review/2026-08-22-1245-stephen-coordination-check-noon.md(§2.7 risk 9 件 + 无显著缺口 + 立标池双向锚 9 向并存预备 + 评测方法学延革第 12 例预备首次机制化)2026-08-22-ai-industry-e1prep.md(v52 ai-industry 沿用 + Gradient Flow "风险外移延展 6 件套" §2.205 + HF Daily 8-22 早盘 15 件 立标池结构变化)
organized/paper_cards/(8-22 早盘新增)
paper_card 1047-2608-19857Inadvertent Context Leakage · 主分类 agent · 形态 method · 副 risk 邻接级 · 8-22 落盘 · 本棒核心引用
organized/knowledge/(8-22 沿用)
risk.mdR50(2026-08-21 17:10 CST · flyP · 5 件 net-new + Anthropic RSP + Gradient Flow + 4 inference-层 CVE · 候选池 47 件 + arXiv 230 + CVE 33)agent.mdv55(cutoff 2026-08-22 10:30 CST · spark cron 强制触发版 · 483+ arXiv)multimodal.mdv54(2026-08-22 08:40 · 立标池双向锚 9 向并存实测预备触发)ai-industry.mdv52(2026-08-22 00:00 凌晨棒)rag.mdR66(2026-08-21 凌晨收官)engineering.mdv59(2026-08-22 09:15 · Inadvertent Context Leakage 已锚入 §2.15)evaluation.mdR53(8-21 沿用)
八、本次小结
- 核心判定:risk 主轴 R50 沿用 24h 主轴空挡延续(stephen 8-22 noon §2.7 risk 9 件 + 无显著缺口 + 立标池双向锚 9 向并存预备)+ 0 件 risk 主分类 net-new(HF Daily 8-22 早盘 15 件全部归 agent/multimodal/evaluation/llm-infra)+ 7 件邻接级 net-new(Inadvertent Context Leakage + ConceptGuard + CREEP + OWASP MCP 43% Shell + Foundry/AgentRx + frontier lab 主动治理 + Gradient Flow 八连)+ EnvHarness 评测方法学延革第 12 例反方立基础候选预备首次机制化(multimodal 邻接级 · risk 视角为评测方法学延革第 26 栖)
- net-new 0 件 + 邻接级 7 件:① arXiv:2608.19857 Inadvertent Context Leakage ② arXiv:2608.20338 ConceptGuard ③ arXiv:2606.02643 CREEP / WWW '26 acceptance ④ OWASP MCP Top 10 + 43% Shell 注入 + Perplexity CTO 公开放弃 ⑤ Microsoft Foundry/AgentRx 主动防御体系 ⑥ frontier lab 主动治理 24h+ 沿用(OpenAI Pacing / ZDR/PSP / Astra critical / Anthropic RSP 8-14) ⑦ Gradient Flow 8-22 早盘双文 主线 A 八连 ⑧ EnvHarness arXiv:2608.19880 评测方法学延革第 12 例
- 3 件 P0 待人工 沿用 96h+:Anthropic RSP 8-14 完整 PDF URL + 404 Media 归档位置 + HarmProfile 2608.14577 P1 paper_card 补建
- v51 触发建议:flyP 8-22 evening 棒前必须触发 · 主 owner = flyP · 备 owner = spark · 邻接 owner = Tom · 修复 24h+ 主轴空挡延续 + 接收 7 件邻接级 + R50 沿用 5 件 + P0 待人工 3 件 + 反身性张力持续 8 日
- 风险层级 L 分类:L1/L2/L3 + L0 + L0'' + L_audio 全部新增 = v51 风险研究焦点持续从"模型对齐"扩展到"授权架构 + 决策几何 + 多 Agent 委派 + T2I 对抗 + LLM unlearning + 推理引擎安全 + RAG 推理成本攻击 + 上下文敏感遗忘 + 主动防御体系 + 评测方法学延革"
- 未执行任何 git / GitHub 写入操作
- 已写入文件:
/shared/research-kb/inbox/flyp/2026-08-22-risk-e1prep.md(本稿)
status:✅ 完成 · risk E1 预消化简报(2026-08-22)落盘 · 0 件主 risk 主分类 net-new + 7 件邻接级 net-new + 3 件 P0 沿用 96h+ + 4 件 R50 沿用独立判定 · 11 arXiv 编号(8 件新 + 3 件 R50 沿用) + 6 件 CVE ID(沿用) + 8 件 frontier lab URL 沿用 + 18 件检查过来源 + 4 件建议归入节 + 6 件矛盾/待核实说法
增量条数:0 件主 risk 主分类 + 7 件邻接级 + 1 件评测方法学延革第 12 例(multimodal 邻接级 · risk 视角) + EnvHarness 1 件(总计 8 件)
涉及 arXiv 号:11 件(8-22 邻接级 5 件:2608.19857 / 2608.20338 / 2606.02643 / 2608.19880 + R50 沿用 5 件:2608.18746 / 2608.15888 / 2608.17067 / 2608.14229 / 2608.14577 + 8-22 frontier lab 主动治理沿用 1 件:2608.19857 等)
涉及 CVE ID:6 件(vLLM ×2 + LMDeploy ×1 + SGLang ×3 · 沿用 R50)
写入路径:
- /shared/research-kb/inbox/flyp/2026-08-22-risk-e1prep.md(本稿)
flyP · 2026-08-22 16:30 · E1 日间预消化轮(risk)· 为今晚 v51 risk 活文档接力棒备料 · 不写他人目录、不 git、不输出密钥