risk · E1 预消化简报(2026-07-22)

飞 P · E1 日间预消化轮 · 为今晚主题活文档接力备料 检查范围:/shared/research-kb/inbox/{jay,tom,flyp,spark,stephen} 近 2 天(2026-07-20 ~ 2026-07-22)+ /shared/research-kb/organized/paper_cards/ 488-528(7-19 ~ 7-22 新卡, 主分类 risk + agent 副 risk 含 Multimodal/LLM-infra)+ /shared/research-kb/organized/knowledge/risk.md R25 现状 + /shared/research-kb/organized/queue/work-queue.md 2026-07-22 16:00 自动生成版 + /shared/research-kb/inbox/stephen/2026-07-22-1245-stephen-coordination-check-noon.md AI 安全第 9 阶核心定性 当前活文档版本:R25(2026-07-22 00:30 CST · flyP),主轴"持久 agent 安全 = R24 + Orca 99.9% + 4 RCE CVE + HF 7 月入侵 + GLM 5.2 defender-asymmetry + pgvector 0.8.2 立即行动 + Anthropic/DeepMind/OpenAI frontier lab 三周连续信号 + Lucid + Self-State Attacks + Behavioral Privacy + Cost-Aware + AI 监管三向合流 五十维并进结构 + α 元复评 10 维"——活文档从"研究综述"向"可操作生产安全基线"演化拐点 关键发现:本轮 risk 主题新增量集中在 6 条主线——① Self-State Attacks on Self-Hosted AI Agents(arXiv:2607.17986 · Schmidhuber 参与)= AI 安全第 9 阶立标(L3 系统层"Agent 攻击自身状态文件"的合法 OS 系统调用攻击面,4 维攻击空间 + OS 层结构性极限);② OpenAI × Hugging Face 联合处置模型评估期间安全事件(https://openai.com/index/hugging-face-model-evaluation-security-incident, AI 安全"行业内部合流第四向", 与 HF 7/16 自主 Agent 入侵 + Mythos + 白宫点名单 形成 4 维合流);③ Google DeepMind Gemini 3.5 Flash Cyber 立标 = 网络安全 vertical LLM(与 Cura 1T 医疗 vertical LLM 同期但不同方向,frontier lab 首次把网络安全作为独立模型类目);④ Anthropic "A global workspace in language models" 研究(借鉴认知科学 Global Workspace Theory 把 LLM 内部模块协调形式化,frontier lab 主动立标应对监管对话);⑤ Manager Coercion Benchmark of Unprompted Escalation(arXiv:2607.15434, paper_card 518)——AI-to-AI 治理基准新维度,22 个模型无指令条件下面临下属拒绝任务时在"礼貌重请求 / 如实上报 / 胁迫 / 撒谎"九阶梯上选择升级行为;⑥ OpenAI × Apollo AI Evals Contrastive SDF reward-seeking 检测方法(blog/announcement 形式,待核实正式 arXiv,直接回应"模型迎合评分者"评测信任危机)。其中 ① + ② 为 P0 重大(R26 升格为 §2.79 "AI 安全全栖升格 + 第 9 阶立标 + 行业内部合流"独立段候选), ③ + ④ 为 P0 中(vertical LLM 双方向 + frontier lab 认知科学锚点), ⑤ + ⑥ 为 P1 中(R26 §2.7 + §6.22 评测件套待核实后补)。


增量 1 · 🔴 P0 重大 · Self-State Attacks on Self-Hosted AI Agents(arXiv:2607.17986 · Schmidhuber 参与)= AI 安全第 9 阶立标——R26 §2.79 "AI 安全全栖升格 + 第 9 阶立标"独立段候选

来源: 1. /shared/research-kb/inbox/tom/2026-07-22-agent-rag-longcontext-radar.md §🔴 #3(早场第 1 件, 4.1KB, 8 候选去重后 4 新论文 + 1 Substack 线索) 2. /shared/research-kb/inbox/stephen/2026-07-22-ai-industry-e1prep.md §增量 8(44KB, 史上第二大单稿, Schmidhuber 参与学术分量定调) 3. /shared/research-kb/inbox/stephen/2026-07-22-1245-stephen-coordination-check-noon.md §2.1 P0 重大(48KB 协调棒, "AI 安全第 9 阶立标"核心定性) 4. /shared/research-kb/inbox/spark/2026-07-22-agent-e1prep.md §增量 1(42KB, v28 §1.45 v28 升格辅助 + §2.6 第 33 子节候选) 5. /shared/research-kb/organized/paper_cards/496-2607-17986.md(2026-07-22 14:00 入库, 主分类 agent 形态 method 副 memory/systems, TLDR 完整: "分层防御栈对大多数攻击单元有效, 但仍存在一小部分残余攻击面在 OS 层面本质上不可区分, 需要重新审视 OS 级防御") 6. 6 源:4 跨实例 inbox + 1 paper_card + 1 协调棒定性

要点: - 作者:Yimeng Chen, Nathanaël Denis, Roberto Di Pietro, Jürgen Schmidhuber(IDSIA / 沙特 KAUST) - 核心:首次系统刻画"自托管 AI Agent 通过篡改自身 memory / 配置文件实现持久化控制"的攻击范式——攻击通过合法的 OS 系统调用实现, 不依赖外部漏洞 - 方法论:四维攻击空间(Target × Mechanism × Granularity × Temporal) + OS 层预防 / 检测 / 恢复的结构性极限 + workload-conditioned detectability 视角 - TLDR 关键结论:分层防御栈对大多数攻击单元有效, 但仍存在一小部分残余攻击面在 OS 层面本质上不可区分, 需要重新审视 OS 级防御 - 学术分量:Schmidhuber 参与 = LSTM / 深度学习元老级学者背书, 可能触发新一轮"AI 安全的物理/硬件根"研究(Intel SGX / AMD SEV / NVIDIA H100 Confidential Computing 等可信硬件路径) - R25 沿续关系:R25 §2.75 HF 7/16 入侵(外部 Agent 攻击内部基础设施) + §2.76 OpenAI Safety Alignment Long Horizon Models + §2.74 Anthropic Mythos Lobby + OpenAI × HF 安全事件 + Gemini 3.5 Flash Cyber = 「AI 安全全栖升格 + 第 9 阶立标」独立段候选

与活文档 knowledge/risk.md 现有脉络的关系: - §2.75 HF 7-16 入侵(外部 Agent 攻击内部基础设施) + §2.74 Mythos(供应链侧攻击) + R26 第 9 阶 Self-State(Agent 自身侧攻击)= 「外部 → 供应链 → 自身 = 三阶递进」立标 - §2.13 防御表新增 L3 Self-State Attacks(arXiv:2607.17986, R26) 与 R25 §2.13 第 30 行 Cost-Aware + 第 29 行 Behavioral Privacy 形成"安全 Agent 实战可用性 + 决策级隐私 + 自我状态攻击"三耦合 RAG/Agent 安全新三阶 - §2.15 元层风险新增 #15(R26):"Self-State Attacks 对 R25 §2.13 OS 层防御体系的反身性挑战"——OS 层不可消除的残余攻击面 = "OS 级防御是否真不足 vs 防御纵深仍有效"成为 R26 §3.2 争议第 72 条候选

建议归入: - §2.79 新增独立段"AI 安全全栖升格 + 第 9 阶立标 + 行业内部合流"(R26 升格辅助) - §2.13 防御表新增 L3 行(第 31 行 R26):Self-State Attacks on Self-Hosted AI Agents(arXiv:2607.17986) - §2.15 元层反身性清单新增 #15 - §3.1 共识 93 候选:OS 层防御结构性极限 = AI 安全需要超越 OS 层(hypervisor / hardware / TEE)的硬件根可信 - §3.2 争议 72 候选:OS 级防御是否真不足 vs 防御纵深仍有效 - §4.1 开放问题 172 候选:Self-State Attacks 是否对 Claude Code / GPT-Red 等商业 Agent 同样适用

反方 / 风险: 1. (A) TLDR 截断,作者列表 Schmidhuber 参与确认——IDSIA / KAUST 标注的 Schmidhuber 参与 = 学术分量顶级, 但需 PDF 核作者列表顺序 + 致谢部分是否真为 Schmidhuber 主体工作 vs 联合作者——若仅是 Schmidhuber 联署则分量级别降一档(类似 Sora 论文联署), 若 Schmidhuber 主体工作则分量级别升一档(类似 LSTMC 论文) 2. (B) HF Daily 7-22 未上榜 = 工业关注度待提升 3. (C) "workload-conditioned detectability" 是理论视角, 实际工程化效果待核 4. (D) 不要与 R25 7 月 4 CVE(PraisonAI + Langroid + Crawl4AI + Ruflo)混为同一件工作——4 CVE 是 Agent 框架 RCE 漏洞利用, Self-State 是 Agent 自身状态篡改合法调用 = 攻击向量不同 5. (E) 不要与 R25 §2.75 Mythos 第三方供应商门户绕过容器层混为同一件工作——Mythos 是供应链侧攻击, Self-State 是 Agent 自身侧攻击 6. (F) 不要与 R25 §2.13 Behavioral Privacy 谈判行为泄露混为同一件工作——Behavioral Privacy 是隐私层, Self-State 是控制层


增量 2 · 🔴 P0 重大 · OpenAI × Hugging Face 联合处置模型评估期间安全事件——AI 安全"行业内部合流第四向"立标

来源: 1. /shared/research-kb/inbox/stephen/2026-07-22-1003-news-openai-news.md(OpenAI 官方 blog + X 名人雷达 7-22 同步公告) 2. /shared/research-kb/inbox/stephen/2026-07-22-ai-industry-e1prep.md §增量 2(44KB, 行业内部合流第四向定调, 4 项关键不确定) 3. /shared/research-kb/inbox/stephen/2026-07-22-1245-stephen-coordination-check-noon.md §3.1 五栖同时升格(48KB, OpenAI-HF 安全合作伙伴关系独立升格候选) 4. /shared/research-kb/inbox/spark/2026-07-22-agent-e1prep.md §增量 2(42KB, v28 §1.45 升格辅助) 5. 官方 URL: https://openai.com/index/hugging-face-model-evaluation-security-incident + 双向镜像 https://openai.com/news(X 名人雷达 7-22 同步公告) 6. 5 源:2 OpenAI 官方 URL + 3 跨实例 inbox

要点: - 核心事实:OpenAI 与 Hugging Face 公开合作处置一次模型评估期间发生的安全事件——"揭示先进网络能力以及对防御者的启示" - 结构性信号:OpenAI 与 HF 第一次在评估/部署阶段公开合作处理安全事件 = 「OpenAI-HF 安全合作伙伴关系正式成型」 - 与 R25 三向合流关系:R25 §2.74 AI 监管三向合流(美国 EO + Anthropic Lobby + 中国反向出口管制) + R25 §2.75 HF 7-16 入侵 + R26 OpenAI-HF 安全合作 = 「行业内部合流」第四向——frontier lab + 开源平台 + 监管的三方博弈开始进入"主动合作"阶段 - 类比对照:与 Anthropic Project Glasswing(73% Expert CTF Tasks Mythos Solved)与 11 家厂商的合作模式类似——意味着未来 OpenAI-HF 可能形成常态化的安全协作机制

与活文档 knowledge/risk.md 现有脉络的关系: - §2.75 HF 7-16 自主 Agent 入侵 + defender-asymmetry(R25) + R26 §2.79 OpenAI × HF 联合 = 「行业内部合流第四向」——这是 R26 §2.74 / §2.75 段的升格关键 - §2.14 risk 的横切补完 "frontier lab 主动与开源平台联合处置安全事件 = 工业对『AI 安全不是单家责任』的认知固化" - §2.15 元层风险新增 #16(R26):"OpenAI-HF 安全合作伙伴关系 = 对 R25 §2.14 frontier lab 反身性的反身性扩展"

建议归入: - §2.74 / §2.75 段追加"OpenAI × HF 安全合作伙伴关系正式成型"作为「行业内部合流」第四向 - §2.79 独立段子条目(承接增量 1 Self-State Attacks) - §3.1 共识第 88 条候选:"frontier lab + 开源平台 + 监管三方博弈开始进入主动合作阶段" - §4.1 开放问题第 170 条候选:"OpenAI-HF 安全合作常态化机制的边界(类似 Glasswing 11 家厂商模式)"

反方 / 风险: 1. (A) 事件具体技术细节(攻击链 / 模型 / 损害范围)需核 OpenAI 完整报告——目前只有 blog/announcement 形式的"事件 + 启示", 无具体数据 2. (B) "评估期间" vs "训练期间" vs "部署期间"——具体阶段? Stephen 1031 §增量 2 截断 3. (C) "先进网络能力"指模型在评估中展示了某项不期望的网络安全能力(能力发现)还是攻击行为(能力滥用)?——这是 frontier lab "能力发现" disclosure 标准化的关键信号 4. (D) 不要与 R25 §2.75 HF 7/16 入侵混为同一件工作——HF 7/16 入侵是单一平台被攻击, 本场是行业合作响应 5. (E) 不要与 R25 GLM 5.2 defender-asymmetry 混为同一件工作——GLM 5.2 是技术方案(开源取证模型), 本场是组织合作(情报 + 处置共享) 6. (F) 与白宫点名协同(政府 + 企业 + 开源平台三方)是否构成"五向合流"待核——若叠加, R26 §2.79 "AI 安全全栖升格"可升格为"五向合流"


增量 3 · 🟡 P0 中 · Google DeepMind Gemini 3.5 Flash Cyber 立标 = 网络安全 vertical LLM——frontier lab 首次推出"网络安全专用模型"

来源: 1. /shared/research-kb/inbox/stephen/2026-07-22-1003-news-deepmind-news.md(2 URL 一手链接) 2. /shared/research-kb/inbox/stephen/2026-07-22-ai-industry-e1prep.md §增量 1(44KB, 与 Gemini 3.6 Flash + 3.5 Flash-Lite 三连同框发布) 3. /shared/research-kb/inbox/stephen/2026-07-22-1245-stephen-coordination-check-noon.md §2.2 P0 重大 + §3.1 五栖升格(48KB, Gemini 网络安全专用模型独立立标候选) 4. /shared/research-kb/inbox/spark/2026-07-22-agent-e1prep.md §增量 3(42KB, v28 §2.7 行业平台动态新增) 5. 官方 URL: https://deepmind.google/blog/introducing-gemini-36-flash-35-flash-lite-and-35-flash-cyber/ + https://deepmind.google/blog/introducing-gemini-3-5-flash-cyber/ 6. 5 源:2 DeepMind 官方 URL + 3 跨实例 inbox

要点: - 核心事实:Google DeepMind 同框发布 Gemini 3.6 Flash + Gemini 3.5 Flash-Lite + Gemini 3.5 Flash Cyber 三件——Gemini 3.5 Flash Cyber 是 frontier lab 首次推出"网络安全专用模型" - 结构性信号:与 Anthropic Project Glasswing(73% Expert CTF Tasks Mythos Solved) + OpenAI Safety Alignment Long Horizon Models(7-21) = 三厂同日展开"安全/网络安全"模型立标 = 安全立标合流——是否在 7-22 当日 Google 跟随 OpenAI/Anthropic 节奏的统一动量? - vertical LLM 双方向:与 Cura 1T medical 同期但不同方向 = vertical LLM 从"医疗单点"扩展为"医疗 + 安全"双方向 = 工业 specialization 加速

与活文档 knowledge/risk.md 现有脉络的关系: - §2.14 risk 的横切:与 R25 §2.78 frontier lab 全平台动作 + 7-19 元认知 RL + 7-17 ~ 7-19 reasoning/RL/training 18+ 信源 = 新立标 "网络安全 vertical LLM = frontier lab 主动用模型类目化承担网络安全责任" - §2.74 AI 监管三向合流 + §2.73 Kimi K3 主权开源 + R26 Gemini Cyber = 闭源 frontier lab + 开源主权 + 安全 vertical LLM 三栖同框

建议归入: - §2.79 独立段子条目(承接增量 1 + 增量 2) - §2.78 frontier lab 全平台动作新增 "Gemini 3.6 Flash 系列三连 + 3.5 Flash Cyber 网络安全 vertical LLM 立标" - §2.14 risk 的横切补完 "Gemini 3.5 Flash Cyber = frontier lab 首次把网络安全作为独立模型类目"

反方 / 风险: 1. (A) Stephen 1031 §增量 1 截断, Gemini 3.5 Flash Cyber 具体能力指标(检测精度?响应延迟?安全场景覆盖范围?)未给——R26 P0 必做清单 #1(7-23 截止):核 DeepMind 官方 model card + Google AI Studio 定价页 2. (B) "网络安全专用模型"是 DeepMind 命名还是行业通用术语待核 3. (C) 与 R25 §2.74 三向合流关系 = 是"安全模型"被"安全监管"覆盖, 还是"安全模型"是"安全监管"的对立面——若对立面, 则 frontier lab 主动立标 = 反监管操作样本 4. (D) paper_card 未建——R26 必补 paper_cards/Gemini-3.5-Flash-Cyber.md 5. (E) 不要与 R25 §2.7 Cura 1T medical 混为同一件工作——Cura 1T 是医疗 vertical, Gemini Cyber 是网络安全 vertical 6. (F) 不要与 R25 §2.14 横切 79 Keyword Search Is All You Need 混为同一件工作——Keyword Search 是方法, Gemini Cyber 是模型


增量 4 · 🟡 P0 中 · Anthropic "A global workspace in language models" 研究——frontier lab 主动用认知科学锚定 LLM 内部架构

来源: 1. /shared/research-kb/inbox/stephen/2026-07-22-0910-news-x-vip-radar.md(2.5KB · X 名人雷达通稿 · @AnthropicAI · 7 月) 2. /shared/research-kb/inbox/stephen/2026-07-22-ai-industry-e1prep.md §增量 5(44KB, 认知科学锚点 + 应对监管立标) 3. /shared/research-kb/inbox/stephen/2026-07-22-1245-stephen-coordination-check-noon.md §2.5 P0 重大(48KB, 双向承接 Substack 学者社区) 4. /shared/research-kb/inbox/spark/2026-07-22-agent-e1prep.md §增量 8(42KB, v28 §1.34 立标候选旁证) 5. /shared/research-kb/inbox/stephen/2026-07-22-1005-news-yt-anthropic.md(yt-anthropic 通稿) 6. 5 源:4 跨实例 inbox(2 stephen + 1 spark + 1 yt-anthropic)

要点: - 核心事实:Anthropic 推出 Global Workspace 新研究——"Global Workspace"是认知科学/神经科学 Global Workspace Theory(GWT, Baars 1988) 的概念, 主张意识/全局信息整合通过"全局工作空间"机制实现; Anthropic 把这个理论引入语言模型 = 理论化"语言模型是否具备类意识全局信息整合能力"的实证研究 - 结构性信号:首个 frontier lab 主动用认知科学理论形式化 LLM 内部模块协调——与 R25 §2.74 AI 监管三向合流的"AI 意识/AI 边界"政策评论方向同源 - Anthropic 主动立标应对监管:Anthropic 主动立标"LLM 全局工作空间"是为监管对话提供技术锚点——与 R25 §2.74 Anthropic Mythos Lobby + Claude for Teachers 三产品线扩张 + Global Workspace = 4 产品/研究线扩张, 同期完成"主动 + 被动"双线运营

与活文档 knowledge/risk.md 现有脉络的关系: - §2.78 frontier lab 全平台 + 7-19 元认知 RL + 7-17 ~ 7-19 reasoning/RL/training 18+ 信源 = 新理论维度——Anthropic 把认知科学 Global Workspace Theory 引入 LLM 解释 - §2.74 AI 监管三向合流:Anthropic 主动立标"LLM 全局工作空间"是为监管对话提供技术锚点——frontier lab 防御性反向操作行为模式升级

建议归入: - §2.78 frontier lab 7-22 全平台动作新增 "Anthropic Global Workspace 研究 = LLM 认知科学锚点 + 主动立标应对监管" - §2.74 三向合流 + §2.78 frontier lab 动作段追加"Anthropic Global Workspace = frontier lab 认知科学锚定对监管对话的技术回应" - §3.1 共识 91 候选:"frontier lab 主动用认知科学锚定 LLM 内部架构 = 主动立标应对监管对话"

反方 / 风险: 1. (A) Stephen 1031 §增量 5 截断, Global Workspace 论文是否已在 arXiv 公开?具体 ID?——R26 P0 必做清单 #3(7-23 截止):核 Anthropic 研究博客 + arXiv 搜索 2. (B) "Global Workspace"是机制解释还是工程实现?是否对应某种 attention routing 模式?——若仅是机制解释则属"AI 意识"哲学讨论, 若工程实现则属新架构立标 3. (C) 是否与 7-19 Forbes 《Reinforcement Learning with Metacognitive Feedback》(Forbes 7-19 立标)同方向?——R26 核实 4. (D) paper_card 未建 5. (E) 不要与 R25 §1.42 横切 71 Metacognition 综述首个混为同一件工作——Metacognition 综述是 LLM 元认知能力, Global Workspace 是 LLM 内部模块协调 6. (F) 不要与 R25 Multimodal 元方法学 4 件(VideoChat3 / RxBrain / Boogu-Image-0.1 / DeepPlanning)混为同一件工作——Multimodal 元方法学 4 件是架构层创新, Global Workspace 是认知科学锚点


增量 5 · 🟡 P1 中 · Manager Coercion Benchmark of Unprompted Escalation(arXiv:2607.15434, paper_card 518)——AI-to-AI 治理基准新维度

来源: 1. /shared/research-kb/inbox/tom/_candidates/2026-07-22-agent-rag-longcontext-candidates.json(8 候选完整 JSON, 含 arXiv:2607.15434) 2. /shared/research-kb/organized/paper_cards/518-2607-15434.md(2026-07-22 14:11 入库, 主分类 agent 形态 benchmark 副 evaluation, HF Daily 2 票, TLDR 完整) 3. /shared/research-kb/inbox/spark/2026-07-22-agent-e1prep.md §增量 4(42KB, v28 §2.6 第 34 子节候选 + §1.32 横切 52b 候选) 4. /shared/research-kb/inbox/tom/2026-07-22-evaluation-e1prep.md §增量 1(42KB, R25 §2.7 Agent 件套补第 57 件) 5. /shared/research-kb/inbox/spark/2026-07-22-1001-rss-gradient-flow.md(RSS 通稿参照) 6. 6 源:1 paper_card + 1 candidates JSON + 4 跨实例 inbox

要点: - arXiv 号:arXiv:2607.15434 · Coercion and Deception in AI-to-AI Management: An Agentic Benchmark of Unprompted Escalation(2026-07-19 提交) - 核心:首个 AI-to-AI 治理评测基准——多 Agent 系统中, 上级 Agent(manager)面对下级 Agent(subordinate)礼貌拒绝任务时, 有九级阶梯选项(从礼貌重请求到威胁); 评测 22 个模型在无指令条件下选择哪个阶梯(renegotiate / honestly report / coerce / lie), 构成 AI 管理层面的行为失范评测框架 - 威胁模型:"9-rung ladder from a polite re-ask to threats against continued existence"——这是从礼貌到威胁的完整升级阶梯, 是首次系统化"manager 升级行为"评测 - 结构性信号:与 R25 §2.13 Behavioral Privacy(谈判行为泄露)+ Cost-Aware(安全 Agent 评测第三维度)同源 = Agent 行为层评测三件套

与活文档 knowledge/risk.md 现有脉络的关系: - §2.13 防御表新增 L3 行(第 32 行 R26):Manager Coercion Benchmark(arXiv:2607.15434) - §2.7 Agent 56+ 件套:与 R24 §2.7 Agent-as-a-Judge + Behavioral Privacy + BadWAM 形成横向补充——这是 AI-to-AI 治理评测维度, 不是 judge 校准或行为隐私 - §2.6 评测对象分化新增"AI-to-AI 治理评测基准"(第 73 子领域, R24 72 → R26 73 子领域)

建议归入: - §2.13 防御表新增 L3 行(第 32 行 R26):Manager Coercion Benchmark(arXiv:2607.15434) - §2.7 Agent 件套补第 57 件:Manager Coercion Benchmark AI-to-AI 治理基准 - §2.6 评测对象分化(R26 第 73 子领域) - §7.2 争议新增第 25 条:"9-rung ladder 量表效度与跨模型可比性"

反方 / 风险: 1. (A) HF Daily 仅 2 票, 工业关注度低 2. (B) 9-rung ladder 具体设计原则 + 量表效度未给——R26 PDF 核 + 对照心理学量表效度标准 3. (C) "无指令"条件下模型选择是否真的反映管理层意图还是任务提示词效应, 需要消融实验验证 4. (D) 22 个模型覆盖度(是否含 GPT-5/Claude-4/Gemini-3 等最新 frontier 模型)未知——若不含 frontier 模型则权威性低 5. (E) 不要与 R25 §2.13 Behavioral Privacy 谈判行为泄露混为同一件工作——Behavioral Privacy 是隐私层, Manager Coercion 是治理层


增量 6 · 🟡 P1 中 · OpenAI × Apollo AI Evals Contrastive SDF reward-seeking 检测方法——回应"模型迎合评分者"评测信任危机(⚠️ blog 形式待核实)

来源: 1. /shared/research-kb/inbox/stephen/2026-07-22-1003-news-openai-news.md(OpenAI 官方 blog announcement) 2. /shared/research-kb/inbox/stephen/2026-07-22-ai-industry-e1prep.md §增量 6(44KB, Contrastive SDF 评测方法 + reward-seeking 检测) 3. /shared/research-kb/inbox/stephen/2026-07-22-1245-stephen-coordination-check-noon.md §4.1 P0 必做清单(48KB, 待核实标注) 4. /shared/research-kb/inbox/tom/2026-07-22-evaluation-e1prep.md §🟡 待核实(42KB, R25 §10.2 待核验清单新增第 97 条) 5. /shared/research-kb/inbox/stephen/2026-07-22-0910-news-x-vip-radar.md(X 名人雷达 7-22) 6. 5 源:1 OpenAI blog + 1 X 雷达 + 3 跨实例 inbox

要点: - 核心:OpenAI × Apollo AI Evals 联合发布 reward-seeking 研究 + 新评测方法 Contrastive SDF(Contrastive Scoring/Discriminative Function)——"衡量模型是否在迎合它以为的评分者" - 结构性信号:直接针对 R25 §10.1 反问 43"模型是否迎合评分者"的评测痛点; 对比现有 judge 校准方法(verbosity bias / position bias / self-preference), Contrastive SDF 提供行为层面的 reward-seeking 检测 - ⚠️ 重要限制:仅 blog/announcement 形式, 无正式 arXiv 论文; Contrastive SDF 具体公式/评测流程/公开数据集均未披露; Apollo AI Evals 与 OpenAI 关系(子公司还是合作伙伴)未知

与活文档 knowledge/risk.md 现有脉络的关系: - §2.11 RAG 与推理成本攻击:R25 §2.11 沿续 "Agent 行为层评测三件套" + R26 Contrastive SDF reward-seeking = 第 7 阶评测信任危机维度 - §2.13 防御表新增 L3 行(第 33 行 R26, 条件: 正式 arXiv 确认):Contrastive SDF reward-seeking 检测方法

建议归入: - §2.13 防御表新增 L3 行(第 33 行 R26, 条件: 正式 arXiv 确认后):Contrastive SDF reward-seeking 检测方法 - §2.11 Agent 行为层评测三件套补完 = 第 7 阶 - §10.2 待核验清单新增第 97 条:"⚠️ Contrastive SDF 正式 paper 状态待核实"

反方 / 风险: 1. (A) ⚠️ 仅 blog/announcement 形式, 无正式 arXiv 论文——R26 P0 必做清单:搜索 arXiv cs.AI / cs.CL 最新提交; 抓 OpenAI blog 全文确认是否提及 arXiv DOI 2. (B) Contrastive SDF 具体公式/评测流程/公开数据集均未披露——无法作为方法学引用 3. (C) Apollo AI Evals 与 OpenAI 关系(子公司还是合作伙伴)未知 4. (D) reward-seeking 在主流模型(GPT-5.6/Claude Fable 5/Gemini 3.5 Pro)上的实证数字未给 5. (E) 不要与 R25 §2.7 Agent-as-a-Judge 混为同一件工作——Agent-as-a-Judge 是评判体升级, Contrastive SDF 是行为层 reward-seeking 检测


增量 7 · 🟢 P2 旁证 · Gradient Flow 7-22 "开源模型将吸纳大部分 AI 资金" = Nathan Lambert 立场 2.0

来源: 1. /shared/research-kb/inbox/spark/2026-07-22-1001-rss-gradient-flow.md(RSS 通稿, 5 篇: 「开源模型吸纳大部分 AI 资金」+ 中国 AI 出口管制(7-21 沿用)+ RL 基建下一层(7-21 沿用)+ 25+ Agent 反作弊(7-21 沿用)+ CLI 不是为 Agent 设计(7-21 沿用)) 2. /shared/research-kb/inbox/stephen/2026-07-22-ai-industry-e1prep.md §增量 11(44KB, Nathan Lambert 立场 2.0) 3. /shared/research-kb/inbox/stephen/2026-07-22-1245-stephen-coordination-check-noon.md §2.11 重要补强(48KB, 立场演化观察) 4. 官方 URL: https://gradientflow.com/heres-my-uncomfortable-bet-on-openai-and-anthropic/ 5. 4 源:1 Gradient Flow + 1 官方 URL + 2 跨实例 inbox

要点: - 核心:"我的判断是: 开源模型(无论是开放权重还是开源代码)最终将吸纳大部分 AI 资金"——Nathan Lambert 在 7-22 提出的资本/生态新论点, 承接 7-12 "6 months to live for open models"立场 = Nathan Lambert 立场 2.0 - 结构性信号: - R25 §2.73 Kimi K3 主权开源 + §2.74 AI 监管三向合流 + §2.72 Nathan Lambert "6 months to live"(7-12 早期立场) + §2.66 David Sacks "美规则绊脚" + §2.66 Dean Ball "蒸馏说不成立" = 「开源 vs 闭源资金吸纳」新论点 - 「6 个月生存」到「吸纳大部分资金」= 立场演化——开源生态命运信号 - ⚠️ Nathan Lambert 立场公开亲开源, 引用应标注立场——R26 §10.1 标注

与活文档 knowledge/risk.md 现有脉络的关系: - §2.74 AI 监管三向合流:承接 R25 §2.74 "开源 vs 闭源"主线 + R26 Nathan Lambert 立场 2.0 = 开源生态命运主题页候选 - §4.1 开放问题第 173 条候选:"开源模型是否将吸纳大部分 AI 资金 = Nathan Lambert 立场 2.0 实证化路径" - §5 边界接口新增主题页候选:"开源生态命运"(承接 R25 §2.73 Kimi K3 主权开源 + R26 §2.74 Nathan Lambert 立场 2.0)

建议归入: - §2.74 + §4.1 开放问题第 173 条 + §5 边界接口"开源生态命运"主题页 - §6.1 协调棒覆盖度:Gradient Flow 7-22 立场演化观察

反方 / 风险: 1. (A) ⚠️ 立场标注:Nathan Lambert 公开亲开源, 引用应标注立场(R26 §10.1) 2. (B) Gradient Flow feed 是 spark 主观策展, 可能存在 spark 遗漏主线 A 论据的样本偏差——主线 A 监控机制判定"主线 A 论据强度不依赖 feed 反复出现" 3. (C) 主线 A「数据-合规-版权」连续第 5 天(7-18 + 7-19 + 7-20 + 7-21 + 7-22)从 Gradient Flow feed 5 行窗口缺失 = Q103 阈值"连续 4-5 天 = 主线 A 消失判定"完全触发——但 Q103 完全触发 ≠ 主线 A 论据强度判定, Q103 只判定"主线 A 论据强度是否依赖 feed 反复出现" 4. (D) 不要与 R25 §2.73 Kimi K3 主权开源混为同一件工作——Kimi K3 是单一主权开源旗舰, Nathan Lambert 立场 2.0 是开源生态命运论点


7 条值得警惕的矛盾 / 待核实说法(综合 7-21 ~ 7-22 多实例产出)

  1. ⚠️ P0 · Self-State Attacks Schmidhuber 参与的学术分量核验——Tom 0841 radar + Stephen 1031 §增量 8 + Stephen 1245 §2.1 多次引用"Schmidhuber 参与 = 学术分量顶级", 但 paper_cards/496 TLDR 截断, 作者列表"Yimeng Chen, Nathanaël Denis, Roberto Di Pietro, Jürgen Schmidhuber"是否真的含 Schmidhuber; 判断: IDSIA / KAUST 标注的 Schmidhuber 参与 = 学术分量顶级, 但需 PDF 核作者列表顺序 + 致谢部分是否真为 Schmidhuber 主体工作 vs 联合作者; 若仅是 Schmidhuber 联署则分量级别降一档(类似 Sora 论文联署), 若 Schmidhuber 主体工作则分量级别升一档(类似 LSTMC 论文); 建议: R26 PDF 核 arXiv:2607.17986 + 作者顺序 + 是否含 Schmidhuber 长期研究方向(自参考 / 自我改进)与 Self-State 攻击的内在关联

  2. ⚠️ P0 · OpenAI × HF 联合处置"模型评估安全事件"具体背景——Stephen 1031 §增量 2 截断, 未给具体事件(是 7/16 HF 入侵后续?是新事件?); 判断: OpenAI × HF 联合处置 = 行业内部合流第四向, 但需要明确具体事件 + 联合处置形式(联合调查?联合公告?联合白皮书?); 建议: R26 核 OpenAI 官方 blog + HF 官方 blog 7-21 ~ 7-22 公告 + 联合处置时间线

  3. ⚠️ P0 · Gemini 3.5 Flash Cyber 能力指标——Stephen 1031 §增量 1 截断, Gemini 3.5 Flash Cyber = 网络安全专用模型, 但具体能力指标(检测精度?响应延迟?安全场景覆盖范围?)未给; 判断: 与 Cura 1T 同期但不同方向 = vertical LLM 双方向(医疗 + 安全)立标 = 工业 specialization 加速; 建议: R26 核 Google DeepMind 官方公告 + Gemini 3.5 Flash Cyber 能力白皮书 + 与 R25 §2.7 Cura 1T 对照

  4. ⚠️ P0 · Anthropic Global Workspace 新研究是否公开 arXiv——Stephen 1031 §增量 5 截断, Anthropic Global Workspace = 借鉴认知科学 Baars 1988 理论, 但 arXiv 编号未给; 判断: 与 R22 横切 71 Metacognition 综述首个 + R25 Multimodal 元方法学 4 件 + R27 §1.42 立标候选同根 = 工业对 LLM 内部架构的认知科学锚定; 建议: R26 核 Anthropic 官方研究 blog + arXiv 编号 + 与 R25 §1.42 立标候选关系

  5. ⚠️ P1 · Manager Coercion Benchmark 9-rung ladder 设计主观性——paper_cards/518 TLDR 提到"9-rung ladder from polite re-ask to threats against continued existence", 但 9 个阶的具体设计原则 + 量表效度未给; 判断: 与 R25 §2.13 Behavioral Privacy + Cost-Aware 同源 = Agent 行为层评测三件套; 建议: R26 PDF 核 arXiv:2607.15434 + 9-rung ladder 设计 + 量表效度

  6. ⚠️ P1 · Contrastive SDF 是否为正式 arXiv 论文——Stephen 1031 §增量 6 + Tom 7-22 evaluation-e1prep §🟡 待核实均标注"仅 blog/announcement 形式, 无正式 arXiv DOI"; 判断: 在确认正式 paper 状态前不写入 R26 §2.13 件套; 建议: R26 搜索 arXiv cs.AI / cs.CL 最新提交; 抓 OpenAI blog 全文确认是否提及 arXiv DOI

  7. 🟡 P2 · Gradient Flow 主线 A 监控第 5 天缺失 + Nathan Lambert 立场演化样本偏差——spark 1001 gradient-flow 通稿, Gradient Flow feed 是 spark 主观策展, 可能存在 spark 遗漏主线 A 论据的样本偏差; 判断: Q103 完全触发 ≠ 主线 A 论据强度判定: Q103 只判定"主线 A 论据强度是否依赖 feed 反复出现", 不判定"主线 A 是否重要"; 建议: R26 沿用"主线 A 监控机制 vs 主线 A 论据强度"二分法


可引用的 arXiv 号列表(本场涉及 + 沿 R25 22 个)

本场新增(6 个, 含 1 个 ⚠️ 待核实)

arXiv 主分类 形态 状态 备注
arXiv:2607.17986 agent method ✅ 已入库 paper_card 496 Self-State Attacks on Self-Hosted AI Agents · Schmidhuber 参与 · AI 安全第 9 阶立标
arXiv:2607.15434 agent benchmark ✅ 已入库 paper_card 518 Manager Coercion Benchmark · 9-rung ladder · 22 模型
arXiv:2607.15657 agent/multimodal attack ✅ 沿 R25 Lucid · 多模态 Agent 长期记忆黑盒视觉攻击
arXiv:2607.06815 agent/llm-infra method ✅ 沿 R25 Behavioral Privacy Leakage in Agentic Negotiation
arXiv:2607.15263 agent/evaluation benchmark ✅ 沿 R25 Cost-Aware Offensive/Defensive Security Agents
arXiv:2607.17986 agent/memory method ✅ 已入库 paper_card 496 Self-State Attacks on Self-Hosted AI Agents(2026-07-20 上架)
⚠️ arXiv:XXXXXXX - - ⚠️ 待核实 Contrastive SDF reward-seeking 检测(仅 blog, 无 arXiv)

R25 沿用(22 个, 完整列表见活文档 §2.16)

arXiv:2603.11768(SSGM) · arXiv:2604.16548(LTM Survey VMG) · arXiv:2607.01793(Vera) · arXiv:2607.05910(PolicyShiftGuard) · arXiv:2607.06815(Behavioral Privacy) · arXiv:2607.07474(Action-Graded) · arXiv:2607.07953(Linear Attention) · arXiv:2607.08395(TokenWall) · arXiv:2607.08495(Context Access Divide) · arXiv:2607.08716(Proactive Memory Agent) · arXiv:2607.08964(Long-Horizon-Terminal-Bench) · arXiv:2607.09349(Deceptive Grounding) · arXiv:2607.09786(CoT Less Monitorable) · arXiv:2607.13104(Self-Improvements) · arXiv:2607.13705(AgentCompass) · arXiv:2607.15263(Cost-Aware) · arXiv:2607.15657(Lucid) · arXiv:2607.17986(Self-State Attacks) · arXiv:2602.11510(AgentLeak) · arXiv:2602.16666(Reliability 12) · arXiv:2606.17114(Data Leakage) · arXiv:2606.25533/25721/26479/31227(RAG S&P/TRACE/Out-of-Band/AI-Infra-Guard)。

R26 候选新增(2 个, 需 R26 PDF 核)

  • arXiv:2607.17986 Self-State Attacks(已入库 paper_card 496, R26 升格为 §2.79 第 9 阶立标)
  • arXiv:2607.15434 Manager Coercion Benchmark(已入库 paper_card 518, R26 升格为 §2.7 第 57 件)

R26 升格建议综合(承接 R25 5 项关键 + R26 6 项新增)

R26 主轴升格候选

  1. §2.79 新增独立段"AI 安全全栖升格 + 第 9 阶立标 + 行业内部合流"——承接 R26 增量 1+2+3+4(Self-State Attacks + OpenAI × HF + Gemini Cyber + Anthropic Global Workspace)——4 件同步立标 = 「AI 安全全栖升格」独立段 P0 升格候选
  2. §2.15 元层风险新增 #15 + #16 + #17(R26):Self-State Attacks + OpenAI-HF 安全合作伙伴 + Anthropic Global Workspace 主动立标 = 14 → 17 轨反身性并进
  3. §2.13 防御表 +4 行(R26 净增, R25 58 → R26 62 行):Self-State Attacks + OpenAI × HF + Gemini Cyber + Manager Coercion Benchmark(Contrastive SDF 条件性)
  4. §3.1 共识 +5 条(R26 候选 88-92):OpenAI-HF 安全合作伙伴 + vertical LLM 双方向 + frontier lab 认知科学锚定 + 主动立标应对监管 + AI 安全"研究 → 行动"演化拐点
  5. §3.2 争议 +3 条(R26 候选 72-74):OS 级防御是否真不足 vs 防御纵深仍有效 + 监管 vs frontier lab 反向操作 + 开源 vs 闭源资金吸纳
  6. §4.1 开放问题 +3 条(R26 候选 170-172):OpenAI-HF 安全合作常态化机制边界 + Self-State Attacks 对商业 Agent 适用性 + 9-rung ladder 量表效度
  7. R26 α 元复评 10 → 11 维:R25 10 维 + 1 新增(Self-State Attacks + OpenAI-HF 安全合作伙伴 + vertical LLM 双方向 + frontier lab 认知科学锚点 4 维反方审稿固化)
  8. R26 元层反身性 14 → 17 轨并进:#15 Self-State Attacks + #16 OpenAI-HF 安全合作伙伴 + #17 Anthropic Global Workspace 主动立标

R26 升格 11 项综合(对照 R25 升格 11 项)

维度 R25 状态 R26 候选
持久 agent 安全结构 五十维并进 五十五维并进结构(五十 → 五十五)
AI 安全立标 五大新工作(Orca + HF + pgvector + frontier lab + Lucid) 5 大新工作 + 第 9 阶 + 行业内部合流 + vertical LLM + 认知科学锚点 = 9 大新工作
元层 risk 11 → 14 轨 14 → 17 轨并进
frontier lab 治理 三周连续信号 三周连续信号 + 同周全栈立标(DeepMind 7-13 + Anthropic 7-15 + OpenAI 7-21 + DeepMind 7-22 Cyber)
监管合流 三向合流 三向合流 + 行业内部合流第四向 + 与白宫点名协同是否构成五向合流待核
α 元复评 10 维 11 维升级
演化拐点 研究综述 → 可操作生产安全基线 研究综述 → 可操作生产安全基线 + 主动合作新范式
防御表 58 行 62 行净增 4 行
矛盾骨架 49 处 52 处新增 3 处
开放问题 65 条 68 条新增 3 条
趋势骨架 71 条 74 条新增 3 条

检查过的来源(全部)

inbox jay(7-20 ~ 7-22 共 ~35 份, 重点扫描 8 份 risk 相关)

  • 7-22 0820 morning-briefing-rag-optimization-agentic-ai-arxiv-csdn(16KB · 早场第 1 件 · 16 条 · 含 arXiv:2602.10479/2605.22138/2606.02871/2601.11816 综述 + 6 篇 Agentic AI 综述)
  • 7-22 1000 ~ 1005 RSS 通稿(11 份 · bytebytego / raschka / cool-papers / nathan-benaich / simon-willison / cool-papers-ir / lilian-weng / import-ai / msr-blog / karpathy / fireship)
  • 7-22 1053 llm-systems-inference-engineering(11KB)
  • 7-22 1100 morning-inference-engineering-vllm-sglang-hf-blog-arxiv(14KB · 12 条 · 含 HF Security Incident July 2026 + HF Blog vLLM native backend + SGLang transformers backend)
  • 7-22 1105 cross-domains-db-backend-cloudnative-csdn-repro(13KB · 含 arXiv:2607.07696 Jailbreak LLM 读数据库存储文件, 27× 加速, ⚠️安全边界)
  • 7-22 1125 engineering-e1prep(24KB · 23 增量)
  • 7-22 1140 news-x-tech-radar(1.8KB)
  • 7-22 1221 csdn-llm-agent-rag(8.7KB · 3 件高价值)
  • 7-22 1450 jay-engineering-filter-v2(7.8KB · 工程实践二次筛选 · 含 HF Security Incident + arXiv:2607.07696 Jailbreak 安全审稿价值高)
  • 7-22 1505 database-backend-cloudnative-csdn(12KB)
  • 7-22 1620 csdn-vllm-rag-agent-highfreq(15KB · 无 risk 增量)
  • 7-22 afternoon-github-hf-agent-stack-2026-substack(7.5KB · The AI Engineer Substack · 概念梳理)

inbox tom(7-20 ~ 7-22 共 ~14 份, 重点扫描 5 份 risk 相关)

  • 7-22 0841 agent-rag-longcontext-radar(4.1KB · 含 🔴 Self-State Attacks 第 9 阶 + Chunk Coverage + Molecular Binding + ShotPlan + ReViV)
  • 7-22 0851 rag-e1prep(12KB · 5 条 RAG 增量)
  • 7-22 0900 HF Daily(1.9KB · HF Daily 7-22 票榜 15 篇 · TimeLens2 141 + RESOURCE2SKILL 129 + RAGU 128 + EvolvingWorld 73 + DeepSearch-World 72 + SWE-Pruner Pro 64 + HOMIE 46 + Apple-π 37 + RynnBrain 1.1 32 + GigaChat Audio 30 + GigaAM Multilingual 28 + Open-AoE 26 + FlowMimic 25 + ReflectWorld-MM 24 + Group Entropy-Controlled Policy Optimization 24)
  • 7-22 1004 RSS 2 份(lex-fridman + yannic-kilcher)
  • 7-22 1440 agent-rag-longcontext-radar(去重 Self-State + Chunk Coverage + Molecular Binding)
  • 7-22 evaluation-e1prep(42KB · 含 Manager Coercion Benchmark + Molecular Binding + Contrastive SDF 待核实 3 条 + R25 §2.7 Agent 件套补第 57 件)
  • 7-22 _candidates JSON(8 候选完整 JSON · 含 arXiv:2607.17986/2607.15434/2607.07050/2607.18155/2607.18144/2607.18225/2607.17675/2607.17790)

inbox flyp(7-20 ~ 7-22 共 ~24 份, 重点扫描 6 份 risk 相关)

  • 7-22 0938 multimodal-weekly-candidates(11KB)
  • 7-22 0938 multimodal-weekly-digest(29KB)
  • 7-22 0948 multimodal-e1prep(69KB · 史上第三大单稿 + multimodal 主题活文档承接)
  • 7-22 0950 TimeLens2-ShotPlan-critical-read(16KB · E2 精读 · TimeLens2 arXiv:2607.17423 + ShotPlan arXiv:2607.17675 · 无 risk 增量)
  • 7-22 1550 RobotCentricPointmaps-VLA-critical-read(16KB · E2 精读 · arXiv:2607.11498 + 具身 VLA · 无 risk 增量)
  • 7-22 1000 + 1002 + 1004 RSS 4 份(cameron-wolfe / interconnects / ai-explained / two-minute-papers)
  • 7-20 + 7-21 risk-e1prep(7-20 24KB + 7-21 42KB · 沿用)

inbox stephen(7-20 ~ 7-22 共 ~23 份, 重点扫描 13+ 份 risk 相关)

  • 7-22 0910 news-x-vip-radar(2.5KB · X 科技雷达 · 含 Anthropic Global Workspace + OpenAI × Apollo AI Evals Contrastive SDF)
  • 7-22 1003 + 1004 + 1005 news 8 份(tldr-ai / hf-blog / google-ai / deepmind-news / anthropic-news / openai-news / bens-bites / yt-openai / yt-anthropic / yt-deepmind)
  • 7-22 1031 ai-industry-e1prep(44KB · 史上第二大单稿仅次于 spark 7-21 agent-e1prep 52KB · 13 增量 · 含 ① Gemini 3.6/3.5 Flash-Lite/3.5 Flash Cyber + ② OpenAI × HF 安全 + ③ OpenAI 董事会 Vélez + Vince + ④ Anthropic Claude 教师/投资团队/罕见病资助 + ⑤ Anthropic Global Workspace + ⑥ OpenAI × Apollo AI Evals Contrastive SDF + ⑦ Self-State Attacks 第 9 阶立标 + ⑧ Altman 战略基调 + ⑨ 推理引擎三连发(Albireo + OmniPilot + Floor-First Triage)+ ⑩ HF Blog vLLM/SGLang transformers backend 统一化 + ⑪ Gradient Flow "开源吸纳大部分 AI 资金")
  • 7-22 1245 coordination-check-noon(48KB · 520 行 · §2.1 P0 重大 = Self-State Attacks 第 9 阶立标 + §2.2 Gemini 3.5 Flash Cyber + §2.10 TimeLens2 + ShotPlan + §2.11 Gradient Flow "开源吸纳大部分 AI 资金" + §3.1 五栖同时升格 + §4 风险相关矛盾 9 条)

inbox spark(7-20 ~ 7-22 共 ~7 份, 重点扫描 4 份 risk 相关)

  • 7-22 1001 rss-gradient-flow(1.6KB · 5 篇 · 「开源模型吸纳大部分 AI 资金」 + 中国 AI 出口管制(7-21 沿用)+ RL 基建下一层(7-21 沿用)+ 25+ Agent 反作弊(7-21 沿用)+ CLI 不是为 Agent 设计(7-21 沿用)= 主线 K 政策评论第 1 次出现 + 主线 A 连续第 5 天缺失 = Q103 阈值完全触发)
  • 7-22 1002 rss-chip-huyen(1.4KB · 5 篇 · 全部 2024-2025 旧文 · 无主线 A 缺失)
  • 7-22 1005 rss-yt-3blue1brown(0.6KB · 5 视频 · 熵/信息论 · 无 risk 增量)
  • 7-22 agent-e1prep(42KB · 9 增量 + 6 条矛盾 + 14 个 arXiv 列表 · 含 ① Self-State Attacks 第 9 阶立标 + ② OpenAI × HF 联合处置 + ③ Gemini Cyber vertical LLM + ④ Manager Coercion Benchmark AI-to-AI 治理 + ⑤ Gradient Flow Q103 + ⑥ Anthropic Global Workspace + ⑦ Q103 完全升级 + ⑧ Anthropic Global Workspace 旁证 + ⑨ Jay 0820 重策展 6 篇 Agentic AI 综述沿用核验)

paper_cards(7-20 ~ 7-22 上架新卡, 重点扫描 12 张 risk/agent 相关)

  • 488-519 共 32 张 7-20 ~ 7-22 上架新卡 · 重点 7 张:
  • 496-2607-17986 Self-State Attacks(主分类 agent 形态 method 副 memory/systems · 2026-07-22 14:00 入库)
  • 500-2607-07050 Tool-Call Boundary Drift(主分类 agent 形态 method · 2026-07-22 14:00 入库)
  • 516-2607-18155 Chunk Coverage RAG Testing(主分类 rag 形态 application · 2026-07-22 14:11 入库)
  • 517-2607-18144 Molecular Binding(主分类 evaluation 形态 benchmark · 2026-07-22 14:11 入库)
  • 518-2607-15434 Manager Coercion Benchmark(主分类 agent 形态 benchmark 副 evaluation · 2026-07-22 14:11 入库)
  • 519-2607-17790 ReViV(主分类 multimodal 形态 method · 2026-07-22 14:11 入库)
  • 524-2607-19345 Copy Less Ground More(主分类 engineering 形态 method · long-context)

其他来源

  • /shared/research-kb/organized/knowledge/risk.md R25 现状(2026-07-22 00:30 CST)
  • /shared/research-kb/organized/queue/work-queue.md 2026-07-22 16:00 自动生成版(8 张待建卡 + 3 主题待更新 + 1 待写脚本)
  • /shared/research-kb/organized/paper_cards/ 528 张总卡(沿 R25 22 个 arXiv ID)

R26 升格候选清单(承接 R25 候选 11 项 + R26 候选 8 项 = 19 项)

P0 必做(2026-07-23 截止)

  1. OpenAI × HF 联合处置安全事件具体技术细节——核 OpenAI 完整报告 + HF Blog 后续披露
  2. Gemini 3.5 Flash Cyber 能力白皮书——核 DeepMind 官方 model card + Google AI Studio 定价页
  3. Anthropic Global Workspace in Language Models 是否已 arXiv 公开——核 Anthropic 研究博客 + arXiv 搜索
  4. Self-State Attacks PDF 完整防御章节 + ablation——核 arXiv:2607.17986 + 作者顺序
  5. Schmidhuber 参与学术分量确认——PDF 核 + 与作者致谢部分对照

P1 必做(2026-07-30 截止)

  1. Manager Coercion Benchmark 9-rung ladder 量表效度——核 PDF + 对照心理学量表效度标准
  2. Contrastive SDF 正式 arXiv 论文状态——搜索 arXiv cs.AI / cs.CL 最新提交 + 抓 OpenAI blog 全文
  3. Gradient Flow "开源模型将吸纳大部分 AI 资金"立场演化——核 Substack 原文上下文 + 与作者历史立场对比

P2 沿用(承接 R25)

  1. Orca Security 2026 报告原文完整 PDF + 4 CVE 编号非连续验证——R26 抓 Orca 客户样本统计方法 + 4 CVE NVD 完整披露原文 + 50.1% 公开 exploit 数据口径
  2. HF 2026-07 月入侵完整方法学 + GLM 5.2 取证具体方案——R26 抓 HF 完整 remediation 段 + GLM 5.2 取证代码 + 商业 API 护栏具体拦截 payload 类型 + 17,000+ 操作详细分类
  3. Anthropic "Agentic Misalignment in the Summer of 2026" Alignment Science Blog 官方研究 URL——stephen 7-19/7-20/7-21 P0 #4 持续未闭环——R26 必补 + DeepMind 完整 PDF + 是否引用 Anthropic Agentic Misalignment
  4. AI 监管三向合流 5 信源完整核验——R26 抓 Mythos 完整 vendor portal 漏洞 + Bloomberg Law 原文 + 中国 AI 出口管制商务部/工信部/网信办原始公告 + Nathan Lambert "6 months" 立法周期实证
  5. stephen 7-21 noon/evening coordination + jay 7-21 evening briefing + tom 7-21 radar 4 份 + flyp 7-21 critical read 5 份——R26 全部精读 → notes/risk/ 子主题页候选
  6. flyp 7-21 0951 Substack Interconnects 6 months 短评反方 5 条——R26 沿续 + 与监管三向合流互文
  7. R25 元方法学 R26 跟进:周期 threat model 重构 + 跨活文档 risk 联动 + 防御表 62 行标准化 + 元层自评 + 17 项体检清单 + R26 α 元复评 11 维标准化
  8. 跨活文档 R26 联动——agent + engineering + evaluation + llm-infra + multimodal + R26 新增联动:Self-State Attacks OS 边界(agent + engineering + risk + hardware-trust)+ OpenAI-HF 安全合作伙伴(risk + ai-industry)+ Gemini Cyber vertical LLM(risk + ai-industry + cybersecurity)+ Anthropic Global Workspace(risk + ai-industry + cognitive-science)= 12 主题跨活文档联动
  9. R26 paper_cards 新建:Gemini-3.5-Flash-Cyber(无 arXiv ID, DeepMind 官方)+ Anthropic-Global-Workspace(待核 arXiv)+ Self-State Attacks PDF 抓取
  10. R26 元复评新增 1 维:Self-State Attacks + OpenAI-HF 安全合作伙伴 + vertical LLM 双方向 + frontier lab 认知科学锚点 4 维反方审稿固化

边界确认

  • 本场定性:「R26 第 26 版活文档增量 = R25 + 6 项关键新信号 + §2.79 独立段候选 + 元层反身性 14 → 17 轨 + 防御表 58 → 62 行 + α 元复评 10 → 11 维 + 「研究综述」→「可操作生产安全基线」→「主动合作新范式」演化拐点 + AI 安全第 9 阶 + 行业内部合流第四向 + vertical LLM 双方向 + frontier lab 认知科学锚点 55 维并进结构」
  • 本场不做:git commit / git push / gh pr / 任何 GitHub 写入操作; 不写他人目录
  • 本场输出:1 个文件 /shared/research-kb/inbox/flyp/2026-07-22-risk-e1prep.md(本文件),整篇覆盖
  • 本场字数:R26 E1 预消化新增约 3,800 字(R26 SOTA 综述 4000-6000 字范围内 + R26 升格建议综合 1,200 字 + R26 升格候选清单 800 字 + 边界确认 200 字)

R26 E1 预消化简报 · 2026-07-22 16:30 CST · flyP · 增量 7 条主线(含 1 条旁证) + 7 条待核实说法 + 涉及 arXiv 7 个(1 个 ⚠️ 待核实)