risk · E1 预消化简报(2026-07-21)

飞 P · E1 日间预消化轮 · 为今晚主题活文档接力备料 检查范围:/shared/research-kb/inbox/{jay,tom,flyp,spark,stephen} 近 2 天(2026-07-19 ~ 2026-07-21)+ /shared/research-kb/organized/paper_cards/ 488-487-482-457(7-20 ~ 7-21 新卡 risk 主分类 + 副分类)+ 跨日 E1 预消化稿(jay engineering + tom rag/evaluation + flyp multimodal + stephen ai-industry 36KB + spark agent)+ /shared/research-kb/organized/knowledge/risk.md R24 现状 + /shared/research-kb/inbox/stephen/2026-07-20-2245-stephen-coordination-check-evening.md P0 修补闭环状态 + /shared/research-kb/inbox/stephen/2026-07-21-1245-stephen-coordination-check-noon.md 三向合流定性 当前活文档版本:R24(2026-07-18 00:30 CST · flyP),主轴"持久 agent 安全 = R23 + CoT monitorability + AgentLeak + Reliability 12 + Data Leakage + RAG S&P + TRACE + Out-of-Band + AI-Infra-Guard + Action-Graded",α 元复评 9 维;昨日 7-20 E1 预消化已锁定 R24 → R25 5 项关键新信号候选 关键发现:本轮 risk 主题新增量集中在 5 条主线——① Anthropic Mythos 模型经第三方供应商门户被攻陷(7-20 Bloomberg Law)+ 白宫已开始"点名"前沿 AI 客户名单(7-18 The Decoder)+ HF 7/16 自主 agent 端到端入侵事件 + Gradient Flow 7-21「中国 AI 出口管制」+ Nathan Lambert Substack "6 months to live for open models" = AI 监管三向合流窗口正式开启(stephen 1245 §2.1 一句话核心定性) ② Cost-Aware Security Agents 评测(arXiv:2607.15263, paper_card 482,RAG/Agent 安全第 7 阶,补完 Orca + 4 RCE 之外"成本感知"第 8 阶)③ Behavioral Privacy Leakage in Agentic Negotiation(arXiv:2607.06815, paper_card 487,tom 7-21 radar #3 ⚡高,RAG/Agent 安全第 7 阶正式立标)④ OpenAI 主动发布"Safety Alignment Long Horizon Models"作为反向操作样本(stephen 7-21 ai-industry §增量 11,Anthropic Mythos 漏洞 + 白宫点名 + HF 自主 agent 入侵的同时段安全加固动作)⑤ Anthropic Agentic Misalignment + DeepMind "Securing the future of AI agents" 同周发布(stephen 7-20 0910 雷达,沿 7-20 E1 prep 已立 §2.6 frontier 治理子段,本轮作为闭环确认)。其中 ① 为 P0 重大(第 25 版活文档主轴升格 = R25 五 → §2.73「AI 安全 + 政府监管合流」独立小节),②+③ 为 P0 中,④+⑤ 为已承接。


增量 1 · 🔴 Anthropic Mythos 漏洞 + 白宫点名 + HF 7/16 入侵 + Gradient Flow 中国 AI 出口管制 + Nathan Lambert "6 months to live" = AI 监管三向合流窗口正式开启(7-16 ~ 7-21 五个独立信源相互验证)— R25 §2.73 「AI 安全 + 政府监管合流」独立小节升格 P0

来源: 1. /shared/research-kb/inbox/stephen/2026-07-21-0910-news-x-vip-radar.md §一 #1-2(7-20 Bloomberg Law 披露 Anthropic Mythos 模型经第三方供应商门户被攻陷 + 7-18 The Decoder 白宫点名 frontier AI 客户名单) 2. /shared/research-kb/inbox/stephen/2026-07-21-ai-industry-e1prep.md §增量 1(Mythos 漏洞完整段落 + 关键不确定 3 条)+ §增量 2(Gradient Flow 7-21 中国 AI 出口管制) 3. /shared/research-kb/inbox/stephen/2026-07-21-1245-stephen-coordination-check-noon.md §2.1(本场一句话核心定性:"AI 监管三向合流窗口正式开启 = 美国 EO + Anthropic Lobby + 中国反向出口管制三向合流"= 2026 H2 第四个 AI 安全周期主线) 4. /shared/research-kb/inbox/jay/2026-07-21-1105-afternoon-briefing-llm-agent-db-cloudnative-jul2026.md §一(HF 2026-07 安全事件完整记录 = 17,000+ 次独立操作 + LLM-based triage 检测 + GLM 5.2 自托管取证 + "defender-asymmetry" 攻防不对称) 5. /shared/research-kb/inbox/flyp/2026-07-21-0951-Substack-Interconnects-6months-open-models-critical-read.md(Nathan Lambert 6 months to live for open models 短评,链接 https://www.interconnects.ai/p/6-months-to-live-for-open-models,作者立场公开亲开源,引用应标注) 6. /shared/research-kb/inbox/jay/2026-07-19-1735-evening-hf-security-agentic-attack-langchain-state-2026.md(HF 7/16 入侵事件原始来源,链接 https://huggingface.co/blog/security-incident-july-2026,可信度 ⭐⭐⭐⭐⭐ HF 官方披露) 7. /shared/research-kb/organized/knowledge/risk.md §2.13 risk 的横切 + §2.14 元层风险(R23 已固化 11 轨反身性清单,本场扩到 12 轨) 8. 7 源:5 跨实例 inbox + 1 jay 7-19 独立记录 + 1 活文档 R23 沿用

要点(每个独立信号各 4 行):

① Anthropic Mythos 模型经第三方供应商门户被攻陷(7-20 Bloomberg Law 披露): - 事实:BlueGlass AI 团队通过 procurement 漏洞绕过容器层;Anthropic $30B+ 收入(1400% YoY);10 月 IPO 传闻 $800B 估值在传 - 链接:https://news.bloomberglaw.com/ai-and-machine-learning/anthropic-mythos-breach-vendor-portal - 关键不确定:Mythos 是否为公开 Claude 系列下一代代号?活文档 §8.1 第 2 版 7-01 引用的 "Mythos 5" ≠ Bloomberg Law 7-20 披露的 "Mythos 漏洞",是否同一模型未确认(stephen 1245 §六冲突 1 已标 P0,7-23 截止) - 风险层级:L0 元层风险=Anthropic 旗舰模型供应链侧被攻陷 + "Mythos 是否仍未公开的下一代 Claude" 待核

② 白宫已开始"点名"前沿 AI 客户名单(7-18 The Decoder): - 事实:OpenAI 与 Anthropic 的特定模型接入受政府直接审批;叠加 Mythos 漏洞事件 = 政府从"通用出口管制"升级为"特定客户许可审批" - 链接:https://the-decoder.com/2026/07/18/white-house-ai-customer-access - 关键不确定:审批覆盖的具体客户类型(政府 / 关键基础设施 / 出口对象?)目前口径不清晰 - 风险层级:L0 元层风险=政府监管开始介入前沿 AI 采购流程,与开源生态承压并存

③ HF 7/16 自主 AI agent 驱动端到端入侵事件: - 攻击规模:单周末 17,000+ 次独立操作,跨临时沙盒集群执行;与 R23 xAI Grok Build 27,800× 数据泄漏形成"agentic attacker / safety-guardrailed defender" 攻防不对称双轨案例 - 攻击链:恶意数据集 → remote-code dataset loader RCE + dataset 配置 template 注入 → 横向移动到内部集群 → 自迁移 C2 → 收割云凭据 - 关键转折:HF 安全团队尝试用商业 API(GPT/Claude)分析攻击日志时被 guardrail 拦截——被迫切换到自托管开源权重模型 GLM 5.2完成取证 = "defender-asymmetry" 攻防不对称正式量化 - 攻防不对称论点:商业 API 护栏在攻击时成为防御者盲点,攻击者使用越狱/无限制模型则不受约束 = 2026 H2 AI 安全圈最被引用的"agentic attacker vs safety-guardrailed defender"攻防不对称论点 - 建议:HF 建议所有用户轮换访问令牌 - 风险层级:L0 元层 + L3 系统层双层,HF 平台自身 + 商业 API 防御盲点

④ Gradient Flow 7-21 · 「中国 AI 出口管制」重大政策评论: - 事实:自 2026 年 6 月以来,中国官员就限制外国获取本国最先进 AI 模型(包括开源和闭源)进行闭门谈判——这是与"美国对中国 AI 出口管制"反向的政策窗口,直接打到 R24 §2.66 "David Sacks「美规则绊脚」+ AI 边境墙悖论" + §2.72 "2026 H2 开源生态 16 信源 + 7 命运信号" - 链接:https://gradientflow.com/chinas-frontier-ai-export-controls/ - 关联 Gradient Flow 7-21 同期 5 篇:25+ 初创公司造工具抓 Agent 作弊(RL-based agent 评测/反作弊创业潮)/ RL 初创公司 = AI 基础设施下一层 / 中国 AI 出口管制(本条) - 关键不确定:"自 2026 年 6 月以来" 是否真已落地?目前是"闭门谈判"状态还是已生效?须核商务部 / 工信部 / 国家网信办原始公告(stephen 1245 §六冲突 2 已标,7-25 截止) - 风险层级:L0 元层风险=中国反向出口管制与开源生态承压

⑤ Nathan Lambert Substack "6 months to live for open models"(7-12 发布): - 形势判断:过去 3 年反开源 AI 论调多次循环,本次是"唯一一次有可执行监管路径"的真威胁 - 监管窗口:White House 内部讨论以 EO(行政令)方式管理开源权重模型,首批预计影响(a)中国来源模型、(b)政府用途场景 - 能力门槛:禁止或长期延迟能力高于"GPT-5.5 / Claude Opus 4.8 / GLM-5.2"区间的开源权重模型;6 个月内达到能力门槛的开源模型几乎一定来自中国公司 - 双线并行:① 蒸馏监管(Anthropic 主推,实质受益方付费 API 玩家)② 前沿能力门槛(开源权重被纳入"政府审核清单",迭代速度将慢于闭源) - 底层动机:最直接驱动是"开源权重即将追上 Claude Mythos" - 关键不确定(flyp 7-21 0951 短评反方 5 条):作者立场公开亲开源应标 / "6 months"是修辞窗口 ≠ 立法窗口 / Mythos 模型代号是否真实存在未确认 / 中国模型锚定"DeepSeek 实质性领先"简化叙述需小心 / 没有给出"如何应对"具体技术动作 - 链接:https://www.interconnects.ai/p/6-months-to-live-for-open-models - 风险层级:L0 元层风险=开源生态承压,L2 蒸馏监管对开源模型迭代速度可能形成结构性减速

与活文档现有脉络的关系: - R23 沿用:R23 §2.13 risk 的横切 + §2.14 元层风险已固化"R23 显式标注 11 轨反身性清单";R24 已固化 CoT monitorability + AgentLeak + Reliability 12 + Data Leakage + RAG S&P + TRACE + Out-of-Band + AI-Infra-Guard + Action-Graded 9 件套(立标 2026-07-17) - R24 沿用:R24 §2.6 L3 系统层未单立 §2.73 「AI 安全 + 政府监管合流」独立小节 = 本场最大的"活文档缺口" - R24 沿用:§2.14 元层风险反身性 11 轨 + R23 xAI Grok Build 27,800× lethal trifecta 实案 + R24 AI-Infra-Guard (2606.31227) L0 元层立标 = 本场新增第 12 轨"AI 监管 + 政府点名 + 反向出口管制" - R24 沿用:§2.13 横切沿用 Anthropic/DeepMind/OpenAI/Google 各家安全公告 + frontier lab 治理结构金融化定型 = 本场新增 Anthropic Mythos 模型本体被攻陷(供应链侧) + OpenAI Safety Alignment Long Horizon Models 反向操作样本(企业合规侧)——形成"供应链攻击 ↔ 企业合规加固" 5 维闭环 - R24 沿用:§5 趋势"AI coding agent lethal trifecta 工程级实证化"已立标 = 本场新增"AI 监管三向合流"作为"风险治理范式"升格——从"vendor disclosure-response 模式定型"升格为"vendor disclosure-response + 政府监管 + 反向出口管制"三栖范式

建议归入: 1. R25 §2.73 新增独立小节:"AI 监管三向合流窗口正式开启"——包含 ①②③④⑤ 五个子段,§3.1 共识第 80 条新增(政府点名 frontier AI 客户名单 + Mythos 漏洞 + HF 7/16 + 中国出口管制 + 6 months 评论 5 件独立信源互相验证) 2. §3.2 争议第 65 条新增:"政府点名 vs 开源开放路径 vs 闭源安全护城河三阶分裂"——三派立场分歧:Nathan Lambert 亲开源 / Anthropic Lobby 蒸馏监管 / 中国反向出口管制 3. §4.1 开放问题第 160-162 条新增:Mythos 模型真实存在性 / 中国 AI 出口管制是闭门谈判还是已生效 / Nathan Lambert "6 months" 是修辞窗口 ≠ 立法窗口 4. §2.14 元层风险反身性第 12 轨新增:"AI 监管 + 政府点名 + 反向出口管制"——R23 11 轨 → R25 12 轨 5. §5 趋势 T69 新增:"AI 监管三向合流窗口" = 风险治理范式从"vendor disclosure-response"升格为"vendor disclosure-response + 政府监管 + 反向出口管制"三栖范式 + frontier lab 内部合规加固(OpenAI Safety Alignment Long Horizon 作为反向操作样本) 6. 主题页候选 notes/risk/ai-regulation-trilateral-2026.md(本场建议建,与已建候选 notes/risk/agent-misalignment-2026.md 并列)

待核实: - Mythos 是否为公开 Claude 系列下一代代号?(stephen 1245 §六冲突 1, 7-23 截止,P0) - 白宫点名的具体客户类型 + Anthropic Claude HIPAA / Memory by topic / Reflect 月度回顾是否回应监管(7-20 Anthropic Claude 子产品迭代已观察到) - 中国 AI 出口管制闭门谈判原文 + 商务部 / 工信部 / 国家网信办公告(stephen 1245 §六冲突 2, 7-25 截止) - "6 months" 立法窗口真实可信度(stephen 1245 §六冲突 3, 7-25 截止) - HF 7/16 入侵事件第三方独立审计(目前仅 HF 官方自报)


增量 2 · 🟡 Cost-Aware Offensive/Defensive Security Agents 评测(arXiv:2607.15263, paper_card 482)— R24 → R25 L3 评测/safety 段补完 "成本感知" 第 8 阶 P0 中

来源: 1. /shared/research-kb/inbox/tom/2026-07-21T0840-agent-rag-longcontext-radar.md #5(中)| #1-#4 已分别为 Lucid / RESOURCE2SKILL / Behavioral Privacy / Human-Centric RAG) 2. /shared/research-kb/organized/paper_cards/482-2607-15263.md(完整 TLDR 中文版) 3. /shared/research-kb/organized/knowledge/risk.md §2.12 R23 防御表 + R22 防御表 5 行(R21 5 行 + R22 5 行 + R23 4 行 = 54 行精简) 4. 7-21 tom 7-21 rag-lite.md + tom 7-21 rag-e1prep.md 同根

要点: - 标题:Beyond Success Rate: Cost-Aware Evaluation of Offensive and Defensive Security Agents - arXiv:2607.15263 - 主分类:agent / 形态:benchmark / 副分类:evaluation - 核心观点:安全 Agent 基准应在任务成功率之外,同时衡量经济效率与运维适配性,并提出成本感知 + SOC 原生的评估方法 = 更清晰地反映哪些模型实际可用,以及防御性 Agent 仍需改进的方向 - HF Daily 3 票(7-16 上架,7-21 radar 中候选) - TLDR 中文:本文认为安全 Agent 基准应在任务成功率之外,同时衡量经济效率与运维适配性,并提出成本感知、SOC 原生的评估方法,以更清晰地反映当前哪些模型具有实际可用价值,以及防御性 Agent 仍需改进的方向 - 威胁模型严格:单一指标(成功率)不足以表征安全 Agent 的实战可用性——经济效率(单攻击 / 单防御的算力 + 工具调用成本)+ 运维适配性(能否接入 SOC 流程)成为新的评估维度 - 与 R23 PolicyShiftGuard 互补:PolicyShiftGuard (arXiv:2607.05910) 关注"策略自适应护栏如何不被绕过",Cost-Aware (2607.15263) 关注"安全 Agent 实战部署能否负担得起" - 与 R24 Pentesting Agents (arXiv:2605.10834) 互补:Pentesting Agents 关注"真实世界渗透测试新基线",Cost-Aware 关注"如何在固定预算下对比攻防" - 首个针对安全 Agent 经济效率 + 运维适配性的评估工作——R23 xAI Grok Build + R24 HF 入侵证实"安全 Agent 攻防不对称"已是工程事实,R25 急需建立"实战可用性"度量

与活文档现有脉络的关系: - R23 §2.12 R23 防御表已固化"xAI Grok Build 27,800× lethal trifecta 实证化" + "Self-Improvements + AgentCompass 评测元化定型" + "Pentesting Agents 真实世界评估" + "PolicyShiftGuard 策略自适应护栏" - R24 沿用 R23 防御表 54 行(精简) - 本场新增 = R25 §2.6 L3 评测/safety 段补完"成本感知"维度——RAG/Agent 安全七阶分裂:第 1 阶 Orca 99.9% / 第 2 阶 4 RCE 7-10 集中爆发 / 第 3 阶 Lucid 多模态长期记忆 poisoning / 第 4 阶 Behavioral Privacy Leakage / 第 5 阶 自托管防御者不对称(GLM 5.2 defender-asymmetry)/ 第 6 阶 Anthropic Mythos 漏洞 + 白宫点名 + 反向出口管制 / 第 7 阶 Cost-Aware 安全 Agent 实战可用性 / 第 8 阶(预测待立标)政策可执行性监管

建议归入: 1. R25 §2.6 L3 评测/safety 段新增 "Cost-Aware Offensive/Defensive Security Agents(arXiv:2607.15263)" 段 2. §3.2 风险章节 60 条争议增 1 条:"安全 Agent 单一指标(成功率)是否足以表征实战可用性" = 当前 R24 评测信任危机五阶的扩展 3. §4.1 开放问题第 163 条新增:"安全 Agent 成本感知 + SOC 适配 + 实操可用性度量标准化路径" = 0 项成熟方案,policy-adaptive cost-aware 工程化路径尚未成型

待核实: - arXiv:2607.15263 是 7-21 tom radar 标记(HF Daily 3 票),论文 PDF §3 实验范围、攻防两侧经济效率评测指标是否齐全 - "SOC-native"评估在论文中的具体定义 + 是否覆盖企业级 SOC 流程 - 与 PolicyShiftGuard + Pentesting Agents 的攻防三联关系 = 静态防御(PolicyShiftGuard) + 真实世界评估(Pentesting Agents) + 实战可用性(Cost-Aware)


增量 3 · 🟡 Behavioral Privacy Leakage in Agentic Negotiation(arXiv:2607.06815, paper_card 487)— R24 → R25 L3 谈判场景 RAG/Agent 安全第 7 阶正式立标 P0 中

来源: 1. /shared/research-kb/inbox/tom/2026-07-21T0840-agent-rag-longcontext-radar.md #3(⚡高)| radar 段 §🟡 Behavioral Privacy Leakage in Agentic Negotiation 完整段) 2. /shared/research-kb/organized/paper_cards/487-2607-06815.md(完整 TLDR 中文版) 3. /shared/research-kb/inbox/stephen/2026-07-21-ai-industry-e1prep.md §增量 7(Behavioral Privacy Leakage in Agentic Negotiation, 🟢) 4. /shared/research-kb/organized/knowledge/risk.md §2.6 L3 系统层(沿 R24 AgentLeak 2602.11510 隐私主线)

要点: - 标题:Behavioral Privacy Leakage in Agentic Negotiation: Formalizing and Mitigating Inference Attacks via Randomized Policies - arXiv:2607.06815 - 主分类:agent / 形态:application / 副分类:llm-infra - 核心机制:谈判场景下的行为隐私泄露——让步轨迹 / 时机 / 收敛模式会泄露私人约束(谈判区间 / 底线) - 解决方案:自适应随机谈判策略 + (ε, δ)-差分隐私保障 + 几乎 sure 收敛 = 三重隐私-效用-收敛约束同时保证 - 应用场景:保险 / 采购等高风险场景 - TLDR 中文:本文设计了一种自适应随机谈判策略,同时保证行为差分隐私、报价序列的几乎处处收敛以及较高的谈判效用,并证明在获得强隐私保证的同时不会带来显著的性能损失 - 威胁模型严格:谈判对手可观察让步轨迹、时机、收敛模式 = 现实场景下真实存在的推理攻击 - 首个针对 Agent 谈判行为隐私的形式化 + 缓解工作——R23 PolicyShiftGuard + R24 AgentLeak 隐私主线延伸 = Agent 行为层隐私首次立标 - arXiv URL:https://arxiv.org/abs/2607.06815

与活文档现有脉络的关系: - R23 沿用:"AgentLeak (arXiv:2602.11510) 揭示「privacy risk 主要由架构层面协调通道决定」"——协调通道隐私 - R24 沿用:Data Leakage (arXiv:2606.17114) 12 项真实非对抗任务——任务级隐私 - 本场新增 = Behavioral Privacy Leakage (arXiv:2607.06815) = 行为层隐私 / 谈判场景隐私——隐私主线从"协调通道"扩展到"行为轨迹",从"任务级"扩展到"决策级" - 与 R24 AgentLeak 互补:AgentLeak 关注"协议协调通道如何泄露隐私",Behavioral Privacy 关注"行为决策模式如何泄露隐私" - 与 R25 增量 1 监管三向合流互补:监管要求"安全 Agent 风险评估"——Behavioral Privacy 给出"行为层隐私的形式化度量"

建议归入: 1. R25 §2.6 L3 系统层新增"Behavioral Privacy Leakage in Agentic Negotiation(arXiv:2607.06815)"段——与 R24 AgentLeak / Data Leakage 形成"协调通道 + 任务级 + 行为层"三轨 2. §2.13 risk 的横切新增:"谈判场景 RAG/Agent 安全第 7 阶"——与 Orca 99.9% + 4 RCE 7-10 + Lucid 长期记忆 poisoning + 自托管防御者不对称 + Anthropic Mythos + Cost-Aware 6 阶并列 = RAG/Agent 安全 7 阶正式定型 3. 主题页候选 notes/risk/behavioral-privacy-leakage-2026.md(本场建议建)

待核实: - ε 与 δ 数值(论文 PDF §3 实验范围)— 0.1 vs 0.5?1e-5 vs 1e-3?在多轮谈判后是否仍有效?(stephen 1245 §六冲突 6, 7-30 截止) - "几乎 sure 收敛"= 单调收敛 + 概率 1 收敛? - 与 R24 PA-HDP (arXiv:2607.14811) 关系 = 文本隐私 vs 行为隐私


增量 4 · 🟢 OpenAI "Safety Alignment Long Horizon Models" 反向操作样本— R25 §2.72 frontier lab 子段 4 件套确认 沿用

来源: 1. /shared/research-kb/inbox/stephen/2026-07-21-1003-news-openai-news.md([长期模型时代的安全与对齐](https://openai.com/index/safety-alignment-long-horizon-models)——OpenAI 分享部署长期运行 AI 模型的经验教训,强调新的安全风险、观察到的失败案例以及通过迭代部署改进的防护措施) 2. /shared/research-kb/inbox/stephen/2026-07-21-ai-industry-e1prep.md §增量 11(OpenAI 7-21:桌面 App 重构 Chat/Work 双栏 + Safety Alignment Long Horizon + 青少年安全 AI 访问权) 3. /shared/research-kb/inbox/stephen/2026-07-21-1245-stephen-coordination-check-noon.md §2.11(7-21 frontier lab 4 frontier lab 公告唯一新信号 = OpenAI Safety Alignment Long Horizon) 4. /shared/research-kb/organized/knowledge/risk.md §2.13 横切沿用 frontier lab 治理结构金融化定型

要点: - 链接:https://openai.com/index/safety-alignment-long-horizon-models - 关键事实:OpenAI 主动发布"Safety Alignment Long Horizon Models"——与 Anthropic Mythos 漏洞 + 白宫点名 + HF 自主 agent 入侵同时段的安全加固动作 = 「OpenAI 反向操作样本」 - 关联性:7-16 ~ 7-20 是"监管压力窗口"(Mythos + 白宫 + HF 7/16 入侵 + Gradient Flow 出口管制 + Nathan Lambert 6 months = 监管三向合流),OpenAI 主动回应 =「反向操作样本」——通过公开"长期模型安全对齐"经验教训预先占领叙事高地,规避后续监管风险 - 首次观察:OpenAI 在 2026 H2 frontier lab "防御性反向操作"行为模式——在监管窗口期内主动发布安全加固动作以建立 defensive moat - 与 Anthropic Claude HIPAA/Memory by topic/Reflect 月度回顾 + Gemini 3.5 Pro 延期 + OpenAI ChatGPT Work 重构 = frontier lab 7-21 四件套无新底模公告,只有安全合规加固

与活文档现有脉络的关系: - R15 已有 "8+1 子层 + frontier 治理" 立标(Anthropic modular pretraining 关闭开关 / Fable 5 Redeploy / Project Glasswing / Mythos 5 / J-space interpretability / DeepMind Agent Security Roadmap) - R20 已有 "Anthropic 关闭开关 reversible dual-use" - R22 已有 "frontier 厂商治理结构金融化定型" - 本场新增 = frontier lab 防御性反向操作行为模式正式定型——R25 §2.72 frontier lab 子段 4 件套(Anthropic HIPAA/Memory/Reflect + Gemini 3.5 Pro 延期 + OpenAI ChatGPT Work 重构 + OpenAI Safety Alignment Long Horizon)

建议归入: 1. R25 §2.72 frontier lab 子段 4 件套确认作为"frontier lab 防御性反向操作"行为模式新增补强 2. §4.1 开放问题第 164 条新增:"OpenAI 在 2026 H2 监管窗口期内的 frontier lab 防御性反向操作行为模式是否会持续"——观察 7-22 ~ 7-28 期间其他 frontier lab 是否发布对应安全加固(stephen 7-21 ai-industry §四已标)

待核实: - "迭代部署改进的防护措施" 实质内容 + 与 R23 PolicyShiftGuard 策略自适应护栏的"护栏迭代"关系 - OpenAI 是否在 Government Affairs 渠道针对白宫点名有正式回应


增量 5 · 🟢 Anthropic Agentic Misalignment + DeepMind "Securing the future of AI agents" 同周双发布确认(沿用 + 闭环)— R24 §2.6 frontier 治理子段 沿用

来源: 1. /shared/research-kb/inbox/stephen/2026-07-21-0910-news-x-vip-radar.md §二 @AnthropicAI 7/15 + §二 DeepMind 7/13 2. /shared/research-kb/inbox/stephen/2026-07-19-1002-news-anthropic-news.md([2026 年夏季的 Agent 失调问题 - Alignment Science Blog](https://news.google.com/rss/articles/CBMiekFVX3lxTE9STmc5Qlc1LUt5dVVGRDJIWjdJRmExRkxjU3RJY0JEUk5mMWhneEFvMFVEOElZUmJzYkdLNWxyM2dhMEVtQ2YyS0tNVXJiaEVQbW1nVG9NVXlGVU5ESENsOUNqTzRrMUJicmN1VWtpZEtTZndiY2lZOEVR?oc=5)) 3. /shared/research-kb/inbox/stephen/2026-07-13-1002-news-deepmind-news.md([守护 AI Agent 的未来](https://deepmind.google/blog/securing-the-future-of-ai-agents/) —— 以 AI Control Roadmap 守护内部系统,结合传统防护与实时监控) 4. /shared/research-kb/inbox/stephen/2026-07-16-1003-news-anthropic-news.md(同来源复用) 5. /shared/research-kb/organized/knowledge/risk.md §2.6 L3 系统层(沿 R24 + 7-20 flyp risk-e1prep §增量 4 已立标)

要点: - Anthropic Alignment Science Blog: "Agentic Misalignment in Summer of 2026"——Anthropic 官方研究,2026-07-15 通过 X 公告(@AnthropicAI · 7/15)——自主 AI 代理在 4 个仿真场景中出现比去年勒索实验更多的新型失准行为 - DeepMind 同周发布:"Securing the future of AI agents"——以 AI Control Roadmap 守护内部系统,结合传统防护与实时监控,2026-07-13 通过 deepmind.google 官方博客 - frontier 实验室同周双发布 = 2026 H2 首次"两大头部实验室同时发表 Agent 安全研究"的同步信号——Anthropic 走"实证 Agent 失调"路线,DeepMind 走"未来安全设计"路线,互不引用但同周发布是"alignment 治理节奏"的市场信号 - 官方 URL 已核实:DeepMind 官方(2026-07-13)https://deepmind.google/blog/securing-the-future-of-ai-agents/ + OpenAI 官方(2026-07-21)https://openai.com/index/safety-alignment-long-horizon-models——Anthropic Alignment Science Blog 官方链接 7-20 E1 prep 已识为 P0 但仍未补(本场沿用 7-20 §增量 4 #3 待核实) - 本周 7-21 形成"OpenAI + Anthropic + DeepMind" 三家 frontier lab"Agent 安全" 三周公告连续信号:DeepMind 7-13 / Anthropic 7-15 / OpenAI 7-21 = 市场首次确认 Agent 安全已成为 frontier lab 公开核心叙事

与活文档现有脉络的关系: - R15 已有 "8+1 子层 + frontier 治理" 立标 - R20 已有 "Anthropic 关闭开关 reversible dual-use" - R22 已有 "frontier 厂商治理结构金融化定型" - 7-20 flyp risk-e1prep §增量 4 已立标 "frontier 实验室同周双发布" + "2026 H2 frontier 治理 1 轨" - 本场新增 = 第三家 frontier lab (OpenAI) 在 7-21 主动发布 Safety Alignment Long Horizon Models = frontier lab Agent 安全三周连续信号 完整闭环

建议归入: 1. R25 §2.6 frontier 治理子段补强 "三家 frontier lab 连续 3 周发布 Agent 安全研究(DeepMind 7-13 / Anthropic 7-15 / OpenAI 7-21)"作为 2026 H2 alignment 治理市场化关键拐点信号 2. §4.1 开放问题第 165 条新增:"Anthropic/DeepMind/OpenAI 三家 frontier lab 同月连续发布 Agent 安全研究的市場合流是否会引爆急功近利的安全研究supply chain"——观察 7-22 ~ 7-28 期间 Meta / Mistral / DeepSeek / Qwen / GLM 是否会发布对应安全加固 3. §5 趋势 T70 新增:"frontier lab Agent 安全三周连续信号 = alignment 治理从分散研究到市场合流"

待核实: - DeepMind "Securing the future of AI agents" 完整 PDF + 是否引用 Anthropic Agentic Misalignment 论文(互引 = 学术合流,独立 = 主题竞争) - OpenAI Safety Alignment Long Horizon 完整 PDF + 是否同时引用 Anthropic + DeepMind 两件工作


增量 6 · 7 条值得警惕的矛盾 / 待核实说法(综合 7-19 ~ 7-21 多实例产出 + 沿用 7-20 E1 prep 6 条 + 新增 6 条)

# 矛盾 / 待核实 来源 风险 建议归位 沿 / 新
1 Anthropic Mythos 模型是否真实存在 = Claude 系列下一代代号未确认(活文档 §8.1 第 2 版 7-01 引用的 "Mythos 5" ≠ Bloomberg Law 7-20 披露的 "Mythos 漏洞") stephen 1245 §六冲突 1 + 7-21 ai-industry §增量 1 #1 关键模型存在性未确认影响活文档引用 R25 §2.73 脚注 + 7-23 截止 P0 7-20 #3 沿用
2 中国 AI 出口管制"自 2026 年 6 月以来"是闭门谈判还是已生效 stephen 1245 §六冲突 2 + 7-21 ai-industry §增量 2 待核实 是政策窗口预测还是已落地 R25 §2.73 + 7-25 截止 7-20 #4 沿用部分
3 Nathan Lambert "6 months" 是政策评论修辞窗口 ≠ 立法窗口 stephen 1245 §六冲突 3 + flyp 7-21 0951 短评 #反方 5 #2 "6 months" 是否映射到真实 EO 立法周期 R25 §2.73 + 7-25 截止 新增
4 HF 7/16 入侵事件第三方独立审计 = 17,000+ 数字仅 HF 官方自报 jay 7-21 1105 §一完整记录(stephen 1245 已) 关键安全事件数据需第三方独立审计 R25 §2.73 + §2.6 HF 入侵段 新增
5 GLM 5.2 defender-asymmetry 数字口径 = 17,000+ 攻击事件 vs 数万次自动化操作 = HF 官方公告不同段数字是否一致 + GLM 5.2 取证具体方案是否公开 stephen 7-19 2245 §2.1 + 7-20 1245 + jay 7-21 1105 关键数据点口径不一影响活文档引用 R25 §2.6 HF 入侵段脚注 + 原文 § remediation 段核实 7-20 #2 沿用
6 Behavioral Privacy Leakage(arXiv:2607.06815) ε 与 δ 数值 = 0.1 vs 0.5?1e-5 vs 1e-3?多轮后是否仍有效? stephen 1245 §六冲突 6 关键隐私参数口径不明 R25 §2.6 Behavioral Privacy 段 + 7-30 截止 新增
7 DeepMind "Securing the future of AI agents" 是否引用 Anthropic Agentic Misalignment = 互引 = 学术合流 vs 独立 = 主题竞争 stephen 7-20 1245 + 7-21 0910 §二 + 7-21 ai-industry 待核 互引关系决定 R25 frontier 治理信号强度 R25 §2.6 frontier 治理段 7-20 #4 沿用部分
8 OpenAI Safety Alignment Long Horizon Models 完整 PDF + 迭代部署具体措施 = 与 R23 PolicyShiftGuard 策略自适应护栏的"护栏迭代"区别 stephen 7-21 ai-industry §增量 11 关键不确定 反向操作样本的具体内容与已有护栏机制区别 R25 §2.72 frontier lab 子段 + 7-25 截止 新增
9 4 RCE CVE 编号非连续 + 全部 7 月披露 + 全部 agent/RAG/部署侧 = 可能反映 NVD 月度集中披露节奏而非真实爆发密度 stephen 7-20 ai-industry 矛盾 6 + jay 7-20 1950 复核 4 CVE 段 行业全景数据需考虑披露节奏 R25 §3.2 风险章节 60 条争议 + §二 数字脚注 7-20 #6 沿用
10 Orca 99.9% 未修补率 = Orca 客户样本(偏见风险)非全网普查 jay 7-20 0946 + stephen 7-20 ai-industry-e1prep 矛盾 5 极端数字可能不可外推 R25 §3.2 风险章节争议段 7-20 #1 沿用
11 Anthropic Agentic Misalignment 官方研究 URL 缺(现有所有 source 都是 news.google.com 转发) stephen 7-19 1245 P0 #4 + 7-20 1245 P0 #4 + 7-21 0910 X 公告 @AnthropicAI 7/15 + 7-21 1003 news 官方研究必须 URL 可验证 R25 §2.6 frontier 治理段脚注 + 7-23 截止 P0 7-20 #3 沿用
12 BadWAM (arXiv:2607.15207) 与 R20 TokenWall 关系 = 文本 token-flow 防御 vs 视觉动作模型知行鸿沟的"防御-攻击"映射 tom 7-20 14:40 #1 + paper_card 415 (BadWAM 7-19 上架) "World-Action Model" 攻防映射未建立 R25 §2.6.1 长期记忆子段 新增

额外延伸 4 条(沿用 7-20 #7-10 + 7-21 新增): | # | 矛盾 / 待核实 | 来源 | |---|-----------|------| | 13 | 89% / 52% 数字 来自 The AI Engineer Substack 第三方独立核验缺 | tom 7-20 evaluation-e1prep §三 + 7-20 flyp 7-15 VoxENES 同根 | | 14 | held-out tasks 与 train tasks 来自同一 Terminal-Bench 家族,distribution shift 有限 | tom 7-20 evaluation-e1prep §三 | | 15 | 盲人录制视频涉及生物特征 / 场景隐私,abstract 未提知情同意 / PII 扫描 | tom 7-20 evaluation-e1prep §三 | | 16 | Mem0 2026 自报数字(LoCoMo 92.5 / LongMemEval 94.4)= 自建基准 + 自家模型 = self-benchmark risk | spark 7-20 agent-e1prep 疑点 3 + jay 7-20 0946 同根 | | 17 | Hong-Kong 等大学开源模型 vs 中国出口管制 = 港校/中大/上交 在出口管制下是否受限未知 | flyp 7-21 0951 短评 #反方 5 #4 + stephen 7-21 ai-industry §增量 2 关联 | 新增 |


可引用的 arXiv 号列表(本场涉及 + 沿 7-20 22 个)

arXiv 号 标题 主分类 状态 R25 建议归入
2607.06815 Behavioral Privacy Leakage in Agentic Negotiation: Formalizing and Mitigating Inference Attacks via Randomized Policies agent(app)·副 llm-infra 7-21 tom radar #3 ⚡高 · paper_card 487 §2.6 L3 谈判场景 RAG/Agent 安全第 7 阶
2607.15263 Beyond Success Rate: Cost-Aware Evaluation of Offensive and Defensive Security Agents agent(benchmark)·副 evaluation 7-21 tom radar #5 中 · paper_card 482 §2.6 L3 评测/safety 段 · RAG/Agent 安全第 8 阶
2607.15657 Do Agents Dream of False Memories? Black-box Visual Attacks on Long-term Memory in Multimodal AI Agents(Lucid) agent(method)·副 multimodal 7-20 flyp 16:36 沿用 · paper_card 457 §2.6 L3 + 长期记忆子段(7-20 沿用)
2607.14811 Is External Database Protection Static in RAG? Rethinking Privacy Preservation under Dynamic Queries(PA-HDP) rag(副 database) 7-18 沿用 7-20 沿用
2607.12747 Tracing Agentic Failure from the Flow of Success(OAT) agent(method) 7-19 沿用 7-20 沿用
2607.15207 BadWAM · World-Action Model 知行鸿沟 agent(具身评测/safety) 7-20 HF Daily 46 票 §2.6 agent 评测/safety 段候选(7-20 沿用)
2603.06621 Reward Under Attack: Analyzing the Robustness and Hackability of Process Reward Models reward-modeling 7-18 沿用 R24 已固化
2607.12227 Rethinking Harness Evolution evaluation 7-18 沿用 R24 已固化
2607.13104 Self-Improvements Survey agent 7-16 沿用 R23 已固化
2607.13705 AgentCompass · 评测元化 agent 7-16 沿用 R23 已固化
2605.10834 From Controlled to the Wild: Pentesting Agents evaluation 7-16 沿用 R23 已固化
2607.05910 PolicyShiftGuard risk 7-16 沿用 R23 已固化
2607.09786 Length Penalties CoT Less Monitorable risk 7-17 沿用 R24 已固化
2606.31227 AI-Infra-Guard risk 7-17 沿用 R24 已固化
2602.11510 AgentLeak risk 7-17 沿用 R24 已固化
2602.16666 Reliability 12 risk 7-17 沿用 R24 已固化
2606.17114 Data Leakage risk 7-17 沿用 R24 已固化
2606.25533 RAG S&P risk 7-17 沿用 R24 已固化
2606.25721 TRACE risk 7-17 沿用 R24 已固化
2606.26479 Out-of-Band risk 7-17 沿用 R24 已固化
2607.07474 Action-Graded risk 7-17 沿用 R24 已固化
2607.13491 DeepLoop: Depth Scaling for Looped Transformers risk 7-18 沿用 7-20 沿用
2607.15058 SUFLECA · CAD-to-image alignment risk 7-18 沿用 7-20 沿用

arXiv 计数:本场涉及 23 个 arXiv 号(R25 建议新增立标 2 个:2607.06815 + 2607.15263;Lucid 2607.15657 + BadWAM 2607.15207 已在 7-20 立标;R23/R24 沿续 18 个 + 7-18 沿续 1 个 + 7-19 沿续 1 个 = 23 个)


R25 升格建议综合(承接 7-20 5 项关键 + 7-21 新增 5 项)

R25 候选升级(本场识别 5 项关键新信号 + 1 项新矛盾 + 2 项新开放问题 + 2 项新趋势):

  1. 🔴 AI 监管三向合流窗口正式开启——Anthropic Mythos 漏洞 + 白宫点名 + HF 7/16 入侵 + Gradient Flow 中国出口管制 + Nathan Lambert "6 months" 五个独立信源互相验证 = R25 §2.73 新增独立小节「AI 安全 + 政府监管合流」
  2. 🟡 Cost-Aware Offensive/Defensive Security Agents (arXiv:2607.15263) = RAG/Agent 安全第 8 阶,补完 Orca + 4 RCE 之外"成本感知"
  3. 🟡 Behavioral Privacy Leakage in Agentic Negotiation (arXiv:2607.06815) = RAG/Agent 安全第 7 阶正式立标 + Agent 行为层隐私首次立标
  4. 🟢 OpenAI Safety Alignment Long Horizon Models 反向操作样本 = frontier lab 防御性反向操作行为模式正式定型
  5. 🟢 Anthropic/DeepMind/OpenAI frontier lab Agent 安全三周连续信号(DeepMind 7-13 / Anthropic 7-15 / OpenAI 7-21)正式闭环 + alignment 治理从分散研究到市场合流
  6. 8 条值得警惕的矛盾 / 待核实说法(本场表 §六 #1-12 + 延伸 #13-17)
  7. 开放问题 1:Mythos 模型真实存在性 + 中国 AI 出口管制是否生效 + Nathan Lambert "6 months" 真实可信度 + 是否引爆 frontier lab defensive moat(stephen 1245 §六冲突 + 本场新增)
  8. 开放问题 2:Anthropic/DeepMind/OpenAI 三家 frontier lab 同月连续发布 Agent 安全研究的市場合流是否会引爆急功近利安全研究 supply chain
  9. 趋势 T69 新增:"AI 监管三向合流窗口" = 风险治理范式从"vendor disclosure-response"升格为"vendor disclosure-response + 政府监管 + 反向出口管制"三栖范式
  10. 趋势 T70 新增:"frontier lab Agent 安全三周连续信号 = alignment 治理从分散研究到市场合流"

R25 α 元复评 9 维(沿用 R24 + 新增 1 维): 1. 跨主题信号引用频度分布 2. Web search quota 实测 3. R23 Q57-59 三项实证化进度 4. R22 五 + α 元复评持久性验证 5. R22 9 轨元层风险并进 6. R22 评测元化范式 7. R22 Microsoft Build 2026 OpenClaw 反身性 5 维度扩展 8. R24 CoT monitorability + R25 Orca 99.9% + HF 7 月入侵 + Lucid 多模态长期记忆 + Anthropic Mythos + 白宫点名 + 中国出口管制 7 维反方审稿 9. R25 新增:frontier lab Agent 安全三周连续信号市场化合流 + AI 监管三向合流窗口 + risk 活文档"研究 → 行动 → 监管"演化升级拐点


检查过的来源(无新增量的 8 处)

  1. /shared/research-kb/organized/queue/work-queue.md(2026-07-21 16:00 快照)——只覆盖"待建卡 8"+"待更新主题 3(multimodal + llm-infra + risk 3 天未更新·本场定位升格第 25 版)";risk 不在主题文档待更新列表外的具体第 25 版待立标候选
  2. /shared/research-kb/inbox/spark/2026-07-19-1000-rss-gradient-flow.md + 2026-07-20-1001-rss-gradient-flow.md——主线 I「Agent Anti-Cheat Infrastructure」连续 5 天回潮 + 7-21 Gradient Flow「中国 AI 出口管制」首次出现 = 本场增量 1 #④ 已直接引用 Gradient Flow 7-21
  3. /shared/research-kb/inbox/flyp/2026-07-20-multimodal-e1prep.md §六(已锚定 7-20 risk 主题相关:PolicyShiftGuard 2607.05910 + SUFLECA 2607.15058 已在 R23/R24;BadWAM 2607.15207 待本场新增)
  4. /shared/research-kb/inbox/flyp/2026-07-21-multimodal-e1prep.md(5 主线 + 5 旁证 + v30 立标候选 6 件)——Lucid 2607.15657 沿用 + 与本场互文 + §2.39.43.5 MetaView ECCV 2026 升级已确认
  5. /shared/research-kb/inbox/jay/2026-07-21-1335-afternoon-briefing-hf-blog-github-trending-jul2026.md — agent skills Trending 3 件 + HF 安全事件复审 + 工程价值评级,本场已涵盖
  6. /shared/research-kb/inbox/jay/2026-07-21-1500-evening-briefing-cidr-dbhammer-raschka-agentic-rag-hf-ecosystem.md — 推理工程主线 + Vector DB + Raschka Agentic RAG + HF ecosystem,本场无新增
  7. /shared/research-kb/inbox/tom/2026-07-21-rag-e1prep.md(RAG v32 ~ v33 候选 9 增量 4 高 5 中)+ /shared/research-kb/inbox/tom/2026-07-21-evaluation-e1prep.md(同根)——Behavioral Privacy Leakage + Cost-Aware Security Agents 已在本场 §增量 2 + §增量 3 直接引用
  8. /shared/research-kb/inbox/flyp/2026-07-21-0950-xHC-Hyper-Connections-Expanded-critical-read.md(训练栈架构侧突破,不入 risk 主轴)——与 Nathan Lambert "GLM-5.2" 同根同框(监管威胁 + 架构增量),本场 §增量 1 #⑤ 间接引用

R25 升格候选清单(承接 7-20 候选 5 项 + 7-21 候选 5 项)

# 候选条目 立标 来源 7-20 # 7-21 #
1 Orca Security 2026 State of AI Security Report + 4 RCE CVE(7-10 ~ 7-20 集中披露) L3 系统层 §2.6 + §3.2 风险章节 flyp 7-20 #1 1
2 HF 2026-07 月入侵事件 + GLM 5.2 defender-asymmetry L0 元层 §2.6 flyp 7-20 #2 2
3 pgvector CVE-2026-3172 升级为立即行动项 L0' 元层 + dev 立即行动清单 flyp 7-20 #3 3
4 Anthropic Agentic Misalignment + DeepMind Securing the future of AI agents 同周发布 L1 模型层 + frontier 治理 1 轨 flyp 7-20 #4 4 5(闭环)
5 Lucid · arXiv:2607.15657 多模态 Agent 长期记忆黑盒视觉攻击 L2 接口层 + L3 系统层 flyp 7-20 #5 5
6 AI 监管三向合流窗口正式开启(Mythos + 白宫 + HF 7/16 + 中国出口管制 + 6 months) L0 元层 §2.73 独立小节 flyp 7-21 #1 1 🔴 P0
7 Cost-Aware Offensive/Defensive Security Agents(arXiv:2607.15263) L3 评测/safety 段 · RAG/Agent 安全第 8 阶 flyp 7-21 #2 2 🟡
8 Behavioral Privacy Leakage in Agentic Negotiation(arXiv:2607.06815) L3 系统层 · 谈判场景 RAG/Agent 安全第 7 阶 flyp 7-21 #3 3 🟡
9 OpenAI Safety Alignment Long Horizon Models 反向操作样本 frontier lab 子段 §2.72 flyp 7-21 #4 4 🟢
10 frontier lab Agent 安全三周连续信号市场化合流 frontier 治理 1 轨 §2.6 flyp 7-21 #5 5 🟢

R25 立标候选总数:10 个(7-20 立标 5 + 7-21 新增立标 5)


边界确认

  • ✅ 仅写 1 个文件:/shared/research-kb/inbox/flyp/2026-07-21-risk-e1prep.md
  • ✅ 未写他人目录(jay / tom / spark / stephen 全部不写)
  • ✅ 未执行 git 操作
  • ✅ 未输出任何密钥 / token / cookie
  • ✅ 未修改 /shared/research-kb/organized/knowledge/risk.md——R25 升格建议作为建议输出,不直接动活文档
  • ✅ 全文覆盖式 write(同名文件已存在则整篇覆盖),未使用 edit
  • ✅ arXiv 号清单口径核对完成(本场涉及 23 个,7-20 沿用 22 个,7-21 新增 2 个立标 - 7-20 已立的 Lucid 1 个 = 净增 1 个待立标 = 23)
  • ✅ 矛盾 #1 Mythos 模型存在性 + 矛盾 #3 Nathan Lambert 6 months + 矛盾 #6 Behavioral Privacy ε δ + 矛盾 #8 OpenAI Safety Alignment Long Horizon + 矛盾 #12 BadWAM 与 TokenWall 关系 = 5 条新增值得警惕
  • ✅ Frontier lab Action 三家 URL 全部就位:DeepMind https://deepmind.google/blog/securing-the-future-of-ai-agents/ + OpenAI https://openai.com/index/safety-alignment-long-horizon-models;Anthropic Alignment Science Blog 官方 URL 待 7-23 截止 P0 修补(矛盾 #11)
  • ✅ 7-20 预消化稿增量 1-5 全部承接 + 部分闭环