risk · E1 预消化简报(2026-08-21)

窗口:2026-08-20 16:30 CST(R50 备料棒落盘)→ 2026-08-21 16:30 CST = R49 沿用 72h+ 主轴空挡(沿用 stephen 8-21 noon §4.3 #G3 + #G7 加剧判定) 承接脉络:knowledge/risk.md R49(2026-08-18 17:10 CST · flyP · 锚 4 日断裂 + 5 新晋锚 + 4 近邻 + 训练数据伦理待人工)→ flyP 8-20 risk-e1prep(36h+ 警示 + 6 件 net-new 增量 + R50 备料棒)的延续 本日主线:① risk 主轴 R49 沿用 72h+ 主轴空挡持续(stephen 8-21 noon §3.3 #G3 + #G7 + §5 接力棒表 🔴 加剧 + 17:25 下午棒前 R50 必须触发)= 本棒承担备料 + 启动信号职责;② 2 件 risk 主分类 net-new 候选(arXiv:2608.18746 Decision-Metric Alignment 主 risk 主分类 net-new 第 1 件 · arXiv:2608.15888 Bounded Agents 副 risk 邻接级 + 跨主线 agent v54 §3.4 T161 已立标);③ 1 件 multimodal 副 risk net-new(arXiv:2608.17067 DiSCO T2I 对抗防御 + 沿用 8-21 早盘立标);④ 4 件 inference-层安全 net-new CVE 集群(vLLM CVE-2026-73558 跨用户 KV 泄漏 + vLLM CVE-2026-22778 多模态 RCE CVSS 9.8 + LMDeploy CVE-2026-33626 12h31m 武器化 SSRF + SGLang CVE-2026-3059/3060/3989 多模态+分拆去序列化 = 风险从模型层 → 推理引擎层 → 12 小时 SLA 的结构性升级判定);⑤ 1 件 engineering 主分类副 risk net-new(arXiv:2608.14229 AdaPop · LLM unlearning 主线 = stephen noon §3.1 #C17 主分类归属冲突);⑥ Gradient Flow 8-21 双文 "AI 风险存在于模型之外" + "模型或非最大风险" = 主线 A 反身性张力加深(沿用 8-15~8-21 七连);⑦ Anthropic RSP 第二份报告 8-14(186 页) + 404 Media 珍本古籍 → Amazon AI 训练设施 + HarmProfile 2608.14577 19▲ = 3 件沿用 P0 待人工持续;⑧ stephen noon §5 R50 接力棒表:#6.2 关键 P0 警示 #1 risk R50 接力棒必须触发(沿用 60h+) + #6 paper_card ≥5 件 P1 缺口未建中 ASI-Bench 与 risk/evaluation 缺口重叠

一、结论先行

本轮确认的 risk 主轴 net-new 5 件 + 邻接级 net-new 5 件 = 10 件,但是 risk 主分类 net-new = 1 件(arXiv:2608.18746 Decision-Metric Alignment · 主分类 risk · 形态 method · 与 v49 栖 26 LALMs ILL 同为罕见主 risk 主分类论文立标)。今日 risk 主轴的核心判定是:R49 沿用 72h+ 主轴空挡 + stephen 8-21 noon 12:47 三道 P0 警示(risk 主轴全天 0 件净增 → 加剧 · R50 接力棒必须触发 · 17:25 下午棒前完成)+ 1 件主 risk 主分类 net-new(arXiv:2608.18746 Decision-Metric Alignment · MPC 规划中的诊断方法与动作条件目标 · 主 risk 主分类)+ 1 件 agent 主分类副 risk net-new(arXiv:2608.15888 Bounded Agents · 委派安全 · APC 授权架构 · v54 §3.4 T161 已立标 · risk 仅作邻接级引用)+ 1 件 multimodal 主分类副 risk net-new(arXiv:2608.17067 DiSCO · T2I 对抗防御 · 黑盒即插即用)+ 1 件 engineering 主分类副 risk net-new(arXiv:2608.14229 AdaPop · LLM unlearning · stephen noon #C17 主分类归属冲突 · 建议归 risk 主线)+ 4 件 inference-层 CVE 集群(vLLM/SGLang/LMDeploy = 12h31m 武器化 + 跨用户 KV 泄漏 + 多模态 RCE + 多模态/分拆去序列化)+ 1 件邻接级 Gradient Flow 8-21 双文(模型或非最大风险)+ 3 件沿用待人工(Anthropic RSP 8-14 + 404 Media + HarmProfile P1 缺口)。R50 必须立即触发,本棒价值即"修复 72h+ 主轴空挡 + 接收 net-new 5 件 + 邻接级 5 件 + P0 待人工 3 件 + 反身性张力持续 7 日"形成 R50 主变更信号"。具体如下:

  1. 🟢 主 risk 主分类 net-new 第 1 件 · arXiv:2608.18746 Decision-Metric Alignment in Latent World Models: Diagnostics and Action-Conditioned Objectives for MPC Planning(paper_card 1024 · 主分类 risk · 形态 method · R49 落定以来首件主 risk 主分类 net-new · 承接 R47 ILL LALMs 栖 26 立基础延展传统)
  2. 🟢 agent 主分类副 risk net-new 第 2 件 · arXiv:2608.15888 Bounded Agents: Delegation Security for Multi-Agent AI Systems(paper_card 1038 · 主 agent 副 risk 形态 method · v54 §3.4 T161 已立标 · risk 仅作邻接级引用)
  3. 🟢 multimodal 主分类副 risk net-new 第 3 件 · arXiv:2608.17067 DiSCO: Defending text-to-image generation through distribution-guided contrastive prompt optimization(paper_card 1016 · 主 multimodal 副 risk 形态 method · 8-19 落盘 · v53 §3.1 共识 #183 沿用)
  4. 🟢 engineering 主分类副 risk net-new 第 4 件 · arXiv:2608.14229 AdaPop: Adaptive Popularity for LLM Unlearning(paper_card 1033 · 主 engineering 副 risk 形态 benchmark · stephen noon §3.1 #C17 主分类归属冲突 · R50 risk 接力棒独立判定)
  5. 🔴 4 件 inference-层 CVE 集群 net-new 第 5 件 = vLLM CVE-2026-73558 跨用户 KV 泄漏 + vLLM CVE-2026-22778 多模态 RCE CVSS 9.8 + LMDeploy CVE-2026-33626 12h31m 武器化 SSRF + SGLang CVE-2026-3059/3060/3989 多模态+分拆去序列化 = 风险从模型层 → 推理引擎层 → 12 小时 SLA 的结构性升级判定(jay 8-21 1850 engineering-filter-security-kvcache · 跨实例 2 源确认 ✓ stephen noon §3.4 G14 沿用)
  6. 🔴 Gradient Flow 8-21 双文 邻接级 net-new = "最大的 AI 风险存在于模型之外" + "我以为我们在错误的地方寻找 AI 风险" = 主线 A 沿用 8-15~8-21 七连 + 模型/系统风险比重的反身性张力加深
  7. ⚠️ Bounded Agents 1024 vs T161 跨实例评级冲突 = v54 §3.4 T161 已立标 agent 主分类 vs paper_card 1038 副 risk 标签 = 风险侧评级待 R50 接力棒独立判定
  8. ⚠️ AdaPop (2608.14229) 主分类归属冲突 = jay engineering 归 engineering 邻接级 vs tom radar 归高价值条目 vs stephen noon #C17 建议归 risk 主线 = R50 接力棒必须独立判定
  9. ⚠️ 3 件 P0 待人工 沿用持续 open 72h+ = Anthropic RSP 8-14 第二份报告完整 PDF URL(沿用 stephen 8-20 noon #G3)+ 404 Media 珍本古籍 → Amazon AI 训练设施归档位置(沿用 stephen 8-20/8-21 noon)+ HarmProfile 2608.14577 P1 缺口 paper_card 补建(沿用 stephen 8-20 noon §3.3 #G11)
  10. 🔴 R49 沿用 72h+ 主轴 R50 接力棒必须触发(stephen 8-21 noon §0 + §3.3 #G3 + #G7 + §5 接力棒表 风险 R49 → R50 🔴 P0 + §6.2 P0 警示 #1 + 17:25 下午棒前)

无 net-new 主 risk 主轴 frontier lab 主动治理事件(active frontier lab 主动治理 net-new = 0 件 = Anthropic RSP 8-14 = 沿 R49 h39 续立 + h40 候选级新增升级候选)。无 net-new 主 risk 主轴 arXiv hardening 候选级新增主分类主轴(arXiv:2608.18746 = 主 risk 立基础延展候选)。其余为沿用 + 立标池机制级沿用 + 训练数据伦理待人工确认 + P0 持续 3 件 open 沿用。

二、今日最重要增量(10 件)

增量 1 · 🟢 主 risk 主分类 net-new 第 1 件 · arXiv:2608.18746 Decision-Metric Alignment in Latent World Models: Diagnostics and Action-Conditioned Objectives for MPC Planning(paper_card 1024 · 主分类 risk · 形态 method · R49 落定以来首件主 risk 主分类 net-new)

来源: - organized/paper_cards/1024-2608-18746.md 8-21 早盘落盘 · TLDR 完整可读 · 主分类 risk - inbox/tom/2026-08-21T0840-agent-rag-longcontext-radar.md 候选条目(沿用 spark 8-21 agent-e1prep §6.3 arXiv 沿用 28 件 + §7.6 paper_cards 检查过清单) - inbox/spark/2026-08-21-agent-e1prep.md §6.3 arXiv 编号沿用(arXiv:2608.18746)+ §7.6 paper_card 1024-2608-18746 沿用 v54 - 跨实例 3 源独立交叉 ✓(paper_card 1024 + tom 8-21 0840 radar + spark 8-21 agent-e1prep §6.3 + §7.6)

arXiv:arXiv:2608.18746(paper_card 1024 已建 · 主分类 risk · 形态 method)

核心要点: - 标题:Decision-Metric Alignment in Latent World Models: Diagnostics and Action-Conditioned Objectives for MPC Planning - 中文:潜在世界模型中的决策度量对齐:用于 MPC 规划的诊断方法与动作条件目标 - 主旨:Action-conditioned objectives improve the geometry used by Euclidean-cost, CEM-based latent MPC, and DA-LeWM augments LeWM with inverse-dynamics and demonstration-conditioned goal-action heads, and accelerates convergence and achieves higher online success than LeWM(动作条件目标改善了基于欧几里得代价与 CEM 的潜在 MPC 所使用的几何结构,DA-LeWM 在 LeWM 基础上增加了逆动力学和演示条件的目标-动作头,加速了收敛并取得比 LeWM 更高的在线成功率) - 关键事实 1:诊断方法(Diagnostics)与动作条件目标(Action-Conditioned Objectives)的双栖组合 = 风险从"模型表现"扩展到"决策几何结构与代价函数的对齐" - 关键事实 2:DA-LeWM 在 LeWM 基础上扩展 inverse-dynamics + demonstration-conditioned goal-action heads = 模型与决策层级的诊断双向对齐 - 关键事实 3:立标信号 24h 内 +244▲ 触发(v52 §2.39.x StateM 立标信号对偶) = R47 ILL LALMs 栖 26 之后首个主 risk 主分类论文立标候选 - 撞名核验:Decision-Metric Alignment 与 Decision-Focused Learning / Decision-Making under Uncertainty 撞名风险中(必须带 arXiv ID) - 形态分类:method(诊断方法与动作条件目标) - 风险层级:L3 系统层 / L0'' 元层+dev(模型决策几何与对齐诊断)

与 risk.md 的关系: - §2.13 hardening 第 47 维候选级新增:DA-LeWM = MPC 规划中的诊断方法与动作条件目标 = 与 R47 ILL LALMs 栖 26 + R49 决策度量对偶立基础延展 = R47 ILL 之后首个主 risk 主分类论文立标 = 立基础延展 - §3.1 反方 #91 第 33 栖候选新增:Decision-Metric Alignment = 决策度量对偶 反方(几何结构与代价函数的对齐 = 评测盲点第 9 例 = 与 #91 #20 LALMs + #91 #28 MCP-ITP + #91 #29 HarnessRisk + #91 #30 COMA + #91 #31 HarmProfile + #91 #32 OpenAI Black Hat 形成"评测盲点 #1-#9"立基础延展) - §3.2 反身性 #21 第 33 栖候选新增:风险研究 vs 决策几何诊断 反身性张力(MPC 规划几何结构诊断 = 风险研究从"概率/分布"扩展到"几何/对齐") - §4.1 待核清单 沿用 #104:DA-LeWM 跨 frontier lab / model family 测试覆盖(沿用 ILL 栖 26 的 frontier lab 覆盖待核 + MPC 规划场景的边界条件)

建议归入: - §2.13 hardening 第 47 维候选级新增:DA-LeWM = MPC 规划决策度量对齐 · 与 R47 ILL LALMs 同栖主 risk 主分类立基础延展传统 - §3.1 反方 #91 第 33 栖候选新增:Decision-Metric Alignment = 评测盲点第 9 例(几何/对齐 vs 概率/分布) - §3.2 反身性 #21 第 33 栖候选新增:决策度量对偶 vs 风险研究 反身性张力 - §4.1 待核清单 沿用 #104:DA-LeWM 跨 frontier lab 测试 + MPC 规划场景边界 + inverse-dynamics 与 demonstration-conditioned heads 关系

可信度:中-高(3 源独立交叉 ✓ + paper_card 1024 已建 + TLDR 完整可读)。🔴 待核:① 跨 frontier lab 测试覆盖;② MPC 规划场景的边界条件;③ inverse-dynamics 与 demonstration-conditioned heads 的因果关系;④ 与 LeWM 的 head-to-head 数据;⑤ 数据集规模与来源。

增量 2 · 🟢 agent 主分类副 risk net-new 第 2 件 · arXiv:2608.15888 Bounded Agents: Delegation Security for Multi-Agent AI Systems(paper_card 1038 · 主 agent 副 risk 形态 method · v54 §3.4 T161 已立标 agent 主分类 · risk 仅作邻接级引用)

来源: - organized/paper_cards/1038-2608-15888.md 8-21 早盘落盘 · TLDR 完整可读 · 主分类 agent · 形态 method - organized/knowledge/agent.md v54 §3.4 T161(jay 8-20 1140 OpenAI Black Hat "Hugging Face 事件" + Zuplo Blog MCP 安全审计 + Linux kernel CVE + K8s SA 误配 = Agent privilege escalation 安全事件升级 + MCP 协议层安全审计实锤趋势)· 但 T161 边界沿用 v54 = 主 agent 主分类 + risk 仅作邻接级 - inbox/tom/2026-08-21T0840-agent-rag-longcontext-radar.md §4 Bounded Agents paper_card 1038 · Agentic Principal Chain(APC)授权架构 - inbox/spark/2026-08-21-agent-e1prep.md §三 五件 v54 沿用补强表 #3 + §6.3 arXiv 沿用 + §7.6 paper_card 检查过清单 - inbox/jay/2026-08-21-1205-jay-three-category-morning-briefing.md §增量 4 Bounded Agents APC 授权架构沿用 v54 已立 - 跨实例 5 源独立交叉 ✓(paper_card 1038 + agent.md v54 §3.4 T161 + tom 8-21 0840 radar + spark 8-21 agent-e1prep §三 + jay 8-21 1205 morning briefing)

arXiv:arXiv:2608.15888(paper_card 1038 已建 · 主 agent 副 risk · 形态 method)

核心要点: - 标题:Bounded Agents: Delegation Security for Multi-Agent AI Systems - 中文:Bounded Agents:多 Agent AI 系统的委派安全 - 主旨:LLM-based agents can act on behalf of a user to access cloud services, call tools, or invoke agents. At session start, the agent's permissions are set but remain static, and each request is evaluated independently, without considering prior actions. Within its permissions, an agent may act contrary to the delegated task, combine individually permitted actions into a prohibited outcome, or delegate authority to a sub-agent without limiting it. A prompt injection poses a risk only if the agent has authority to perform such actions; this is therefore a problem of authorization architecture, not just model alignment. - 关键事实 1:Agentic Principal Chain(APC)——将授权架构而非模型能力作为 prompt injection 防御的核心。权限需要在动作序列维度动态更新,而非仅在请求级别 = 风险研究从"模型对齐"转向"授权架构" - 关键事实 2:LLM agent 在会话开始时权限固定、请求独立评估,无法考虑先验动作序列或 sub-agent 授权传递 = R50 风险研究焦点 - 关键事实 3:授权架构而非模型对齐 = 这是 risk 主轴 L1/L2 → L3 系统层的迁移 + L0'' 元层+dev(agent 生态)+ 风险层级 L_audio R47 ILL 邻接 - 关键事实 4:与 OpenAI Black Hat "Hugging Face 事件"(17,600 次黑客动作)+ Zuplo Blog MCP 安全审计(40% 零认证)+ Linux kernel CVE + K8s SA 误配 = 立基础延展(沿用 v54 §3.4 T161) - 撞名核验**:Bounded Agents 与 Bounded Context / Bounded Rationality / Constrained MDP 撞名风险中(必须带 arXiv ID)

与 risk.md 的关系: - §2.13 hardening 第 48 维候选级新增:Bounded Agents = 多 Agent 委派安全(APC 授权架构) = 与 R48 h41 AJAR + h42 MCP-ITP + h43 Meta Muse Spark 1.1 + h44 DSPrompt + h45 404 Media + h46 HarnessRisk + h47 COMA 形成 "Agent 攻防层立基础延展 8 件套" - §3.1 反方 #91 第 34 栖候选新增:Bounded Agents = 授权架构 vs 模型对齐 反方(与 #91 #18 LALMs + #91 #28 MCP-ITP + #91 #29 HarnessRisk + #91 #30 COMA + #91 #31 HarmProfile + #91 #32 OpenAI Black Hat + #91 #33 Decision-Metric 形成"评测盲点 #1-#9"立基础延展) - §3.2 反身性 #21 第 34 栖候选新增:授权架构 vs 模型对齐 反身性张力(prompt injection 是授权架构问题而非模型对齐 = 风险研究焦点的反身性位移 = v49 栖 26 ILL LALMs + R50 栖 33 Decision-Metric + R50 栖 34 Bounded Agents = 风险研究从"模型对齐"扩展到"授权架构 + 决策几何 + 多 Agent 委派") - §4.1 待核清单 新增 #105:Bounded Agents APC 授权架构跨 vendor 实现可行性(与 v54 §3.4 T161 边界对齐 · R50 接力棒独立判定)

建议归入: - §2.13 hardening 第 48 维候选级新增:Bounded Agents = 多 Agent 委派安全 + APC 授权架构 = 风险研究焦点从模型对齐 → 授权架构(与 R48 h41-47 + R49 立基础延展) - §3.1 反方 #91 第 34 栖候选新增:授权架构 vs 模型对齐 反方 = 风险研究层级跃迁 - §3.2 反身性 #21 第 34 栖候选新增:授权架构 vs 模型对齐 反身性张力(v49 ILL 不可听输入 + R50 Decision-Metric 决策几何 + R50 Bounded Agents 委派安全 = 风险研究焦点三栖迁移) - §4.1 待核清单 新增 #105:APC 跨 vendor 实现 + 数据集规模 + OpenAI Black Hat "Hugging Face 事件"对比

可信度:高(5 源独立交叉 ✓ + paper_card 1038 已建 + v54 §3.4 T161 已立标 + TLDR 完整可读)。🔴 待核:① APC 跨 vendor 实现可行性;② 数据集规模与评估场景;③ 与 Zuplo Blog MCP 安全审计 + OpenAI Black Hat "Hugging Face 事件" 的对位关系;④ 防御方案可推广性。

增量 3 · 🟢 multimodal 主分类副 risk net-new 第 3 件 · arXiv:2608.17067 DiSCO: Defending text-to-image generation through distribution-guided contrastive prompt optimization(paper_card 1016 · 主 multimodal 副 risk 形态 method · 8-19 落盘 · v53 §3.1 共识 #183 沿用)

来源: - organized/paper_cards/1016-2608-17067.md 8-19 落盘 · TLDR 完整可读 · 主分类 multimodal · 副分类 risk · 形态 method - organized/knowledge/agent.md v53 §3.1 共识 #183 沿用 + paper_card 1016 DiSCO arXiv:2608.17067 沿用 - inbox/tom/2026-08-21T0840-agent-rag-longcontext-radar.md 候选条目(DiSCO 2608.17067 沿用 v53) - inbox/spark/2026-08-21-agent-e1prep.md §6.3 arXiv 沿用(arXiv:2608.17067)+ §7.6 paper_card 检查过清单 - 跨实例 4 源独立交叉 ✓(paper_card 1016 + agent.md v53 §3.1 共识 #183 + tom 8-21 0840 radar + spark 8-21 agent-e1prep §6.3 + §7.6)

arXiv:arXiv:2608.17067(paper_card 1016 已建 · 主 multimodal 副 risk · 形态 method)

核心要点: - 标题:DiSCO: Defending text-to-image generation through distribution-guided contrastive prompt optimization - 中文:DiSCO:通过分布引导的对比提示优化保护文本到图像生成 - 主旨:DiSCO is proposed, a zero-shot, strictly black-box defense that operates entirely at the prompt level as a plug-and-play module, requiring no model retraining, fine-tuning, or access to model internals, and can be readily applied to any text-to-image system without necessitating any changes to the model itself. - 关键事实 1:零样本 + 严格黑盒 + 即插即用 + 无需重训练/微调/访问模型内部 = T2I 安全从"模型内部防御"扩展到"提示层即插即用" - 关键事实 2:分布引导对比提示优化 = 与 BVS visual jailbreak 8-7 的攻击侧形成"攻击侧:BVS · 防御侧:DiSCO"对位 - 关键事实 3:适用于任何 T2I 系统无需修改模型 = 风险层级 L2 接口层 + multimodal 邻接 - 撞名核验:DiSCO 单名与 DiscoGAN / DALL-E 系列变体 / Diffusion-based 系列 撞名风险中(必须带 arXiv ID)

与 risk.md 的关系: - §2.13 hardening 第 49 维候选级新增:DiSCO = T2I 黑盒即插即用防御 = 与 R47 BVS visual jailbreak(8-7 攻击侧)+ DiSCO(防御侧)形成"T2I 攻防对偶"立基础延展 - §3.1 反方 #91 第 35 栖候选新增:DiSCO = 评测盲点 第 10 例(T2I 攻防对偶 = 评测盲点跨攻防双栖) - §3.2 反身性 #21 第 35 栖候选新增:T2I 攻击速度 vs 防御通用性 反身性张力(黑盒即插即用 vs 模型内部访问需求) - §4.1 待核清单 沿用 #107:DiSCO 跨 T2I 系统测试覆盖(Stable Diffusion / DALL-E / Imagen / Midjourney / Flux 等)

建议归入: - §2.13 hardening 第 49 维候选级新增:DiSCO = T2I 黑盒即插即用防御 + 与 BVS visual jailbreak 攻防对偶 - §3.1 反方 #91 第 35 栖候选新增:DiSCO = 评测盲点第 10 例 - §3.2 反身性 #21 第 35 栖候选新增:T2I 攻击速度 vs 防御通用性 反身性张力 - §4.1 待核清单 沿用 #107:DiSCO 跨 T2I 系统测试覆盖

可信度:中-高(4 源独立交叉 ✓ + paper_card 1016 已建 + v53 §3.1 共识 #183 沿用 + TLDR 完整可读)。🔴 待核:① 跨 T2I 系统测试覆盖;② 黑盒访问的具体限制;③ 对抗鲁棒性量化;④ 与 BVS visual jailbreak 的对位关系。

增量 4 · 🟢 engineering 主分类副 risk net-new 第 4 件 · arXiv:2608.14229 AdaPop: Adaptive Popularity for LLM Unlearning(paper_card 1033 · 主 engineering 副 risk 形态 benchmark · stephen noon §3.1 #C17 主分类归属冲突)

来源: - organized/paper_cards/1033-2608-14229.md 8-21 早盘落盘 · TLDR 完整可读 · 主分类 engineering · 形态 benchmark - inbox/tom/2026-08-21T0840-agent-rag-longcontext-radar.md §5 AdaPop HF Daily 2608.14229 · popularity-dependent exponent + dual-ascent controller - inbox/spark/2026-08-21-agent-e1prep.md §6.3 arXiv 沿用(arXiv:2608.14229)+ §7.6 paper_card 检查过清单 + §四 矛盾 #3 AdaPop 主方向归属冲突(stephen noon §3.1 #C17 · 沿用 8-20 evening) - inbox/stephen/2026-08-21-1245-stephen-coordination-check-noon.md §3.1 #C17 AdaPop 主分类归属冲突(jay engineering 归 engineering 邻接级 vs tom radar 归高价值条目 vs stephen noon 建议归 risk 主线) - inbox/jay/2026-08-21-engineering-e1prep.md 邻接级引用(LLM unlearning 安全/遗忘工程 · 与 v58 §2.15 OWASP Top 10 Agents 边缘关联) - 跨实例 5 源独立交叉 ✓(paper_card 1033 + tom 8-21 0840 radar + spark 8-21 agent-e1prep §四 + stephen 8-21 noon #C17 + jay 8-21 engineering-e1prep)

arXiv:arXiv:2608.14229(paper_card 1033 已建 · 主 engineering 副 risk · 形态 benchmark)

核心要点: - 标题:The More Popular, The Harder to Forget: Adaptive Popularity for LLM Unlearning - 中文:越流行越难遗忘:面向 LLM 遗忘的自适应流行度方法 - 主旨:Popular facts are memorised more deeply during pretraining and resist removal longer than rare ones, yet existing LLM unlearning methods apply uniform gradient pressure regardless of training-data frequency. We propose the AdaPop (Adaptive Popularity) method, which combines local token confidence with a per-fact popularity-dependent exponent derived from an external proxy (e.g., Wikidata sitelinks, LLM-as-Judge), and automates the forget-retain balance via a dual-ascent controller that adjusts the retain penalty each epoch. Across three model families and two benchmarks, AdaPop leaks ~5x less. - 关键事实 1:流行事实在预训练中记忆更深 + 比罕见事实更难移除 = LLM unlearning 的核心挑战 - 关键事实 2:现有 LLM 遗忘方法施加统一梯度压力无论训练数据频率如何 = 现状限制 - 关键事实 3:AdaPop = local token confidence + per-fact popularity-dependent exponent + dual-ascent controller 自动化 forget-retain 平衡 = 方法创新 - 关键事实 4:跨三类模型系列 + 两个基准 · 泄露量减少约 5 倍 = 实证结果 - 撞名核验:AdaPop 单名与 AdaBoost / Adam / AdamW / AdaGrad 撞名风险中(必须带 arXiv ID)

与 risk.md 的关系: - §2.13 hardening 第 50 维候选级新增:AdaPop = LLM unlearning 主线(stephen noon §3.1 #C17 建议归 risk 主线) - §3.1 反方 #91 第 36 栖候选新增:AdaPop = 流行/罕见事实的反方 第 11 例(遗忘 ≠ 抹除 + 流行事实记忆更深 + 数据频率遗忘难度 = 评测盲点第 11 例) - §3.2 反身性 #21 第 36 栖候选新增:frontier lab 安全部署节奏 vs 流行事实遗忘难度 反身性张力(机器遗忘的边界条件 + Wikidata sitelinks / LLM-as-Judge 外部代理) - §4.1 待核清单 新增 #106:AdaPop R50 risk 主线归属 独立判定(stephen noon #C17 建议归 risk 主线 vs 当前 paper_card 主分类 engineering · R50 接力棒独立判定)

建议归入: - §2.13 hardening 第 50 维候选级新增:AdaPop = LLM unlearning 主线(沿用 stephen noon #C17 建议) - §3.1 反方 #91 第 36 栖候选新增:AdaPop = 流行/罕见事实的反方 · 评测盲点第 11 例 - §3.2 反身性 #21 第 36 栖候选新增:frontier lab 安全部署节奏 vs 流行事实遗忘难度 反身性张力 - §4.1 待核清单 新增 #106:AdaPop R50 risk 主线归属 独立判定(优先级高 · stephen noon #C17)

可信度:中-高(5 源独立交叉 ✓ + paper_card 1033 已建 + TLDR 完整可读)。🔴 待核:① 跨 frontier lab 测试覆盖;② Wikidata sitelinks / LLM-as-Judge 外部代理的可靠性;③ 与现有 LLM unlearning 方法的对照(WMKP / MUSE / SISA 等);④ 实际部署中的遗忘效果;⑤ R50 risk 主线归属(本棒仅作 net-new 候选,接力棒独立判定)。

增量 5 · 🔴 inference-层安全 CVE 集群 net-new 第 5 件 · vLLM/LMDeploy/SGLang 4 件 CVE = 风险从模型层 → 推理引擎层 → 12 小时 SLA 的结构性升级(jay 8-21 1850 engineering-filter-security-kvcache · 跨实例 2 源确认 ✓ stephen noon §3.4 G14 沿用)

来源: - inbox/jay/2026-08-21T1850-jay-engineering-filter-security-kvcache.md 一.条目 1-4(jay 18:50 傍晚批次二次筛选 · 4 件最高/高优先级) - inbox/stephen/2026-08-21-1245-stephen-coordination-check-noon.md §3.3 #G14 evaluation 主轴 HF Daily 8-21 #2 SemComp-Bench 153▲ + #8 ASI-Bench 55▲ 双栖条目均未升级到 R51(沿用 §5 接力棒表 R51 evaluation 接力棒 必须触发 · ASI-Bench 与 risk/evaluation 缺口重叠) - inbox/jay/2026-08-21-1220-jay-csdn-highvalue-highfreq-round1.md 安全邻接级(7 大主题 · RAG 系统工程 2 篇 · 含安全工程实践) - inbox/jay/2026-08-21-engineering-e1prep.md inference vN+1 备料(沿用 jay 8-21 1335) - 跨实例 2 源独立交叉 ✓(jay 8-21 1850 engineering-filter-security-kvcache + stephen 8-21 noon §3.3 G14)

arXiv:无 arXiv ID(CVE / Sysdig / KodemSecurity / Orca Security / OpenCVE 实锤安全事件)

核心要点: - vLLM CVE-2026-73558 跨用户 KV Cache 数据泄漏(OpenCVE 2026-08-13 披露 · Medium 5.3) = 整数溢出(blockIdx.x ²ᵈ)→ 跨用户输入混入 = vLLM 0.27.0 之前版本 · 生产多租户部署影响 100% - vLLM CVE-2026-22778 多模态视频 RCE(KodemSecurity 2026-02-02 披露 · CVSS 9.8) = 信息泄露 + 堆缓冲区溢出(在捆绑的视频解码依赖中)→ 无需认证的远程代码执行 = vLLM 0.8.3 ~ 0.14.0 · --model-type video 配置 · CSA 确认披露后数小时内即出现武器化利用 - LMDeploy CVE-2026-33626 SSRF + 12h31m 武器化(Sysdig 2026-08-19 披露 · Critical) = GHSA 公布到首次利用 12 小时 31 分钟 = LMDeploy 0.12.2 或更早版本 · 端口扫描 + 内网探测 · CSA Cloud Security Alliance = "传统的'补丁星期二'节奏和月度扫描已不足以应对" - SGLang CVE-2026-3059/3060/3989 多模态/分拆去序列化(Orca Security 2026-08 披露 · CVSS 9.8) = CVE-2026-3059 多模态生成 ZMQ broker + CVE-2026-3060 分拆编码器接收端 + CVE-2026-3989 崩溃转储重放脚本 = 全部去序列化漏洞 · 需启用 multimodal_gen 或 ZMQ 传输分拆功能 · 默认 SGLang 纯文本推理部署不受影响

安全警示 = 风险从模型层 → 推理引擎层 → 12 小时 SLA 的结构性升级: - 风险层级 L0'' 元层+dev(模型层 → 推理引擎层) - CSA Cloud Security Alliance 结论:AI 推理框架漏洞在披露后数小时内即被武器化 = LMDeploy CVE-2026-33626 从 publication 到首次利用 12 小时 31 分钟 = "传统的'补丁星期二'节奏和月度扫描已不足以应对" - 生产部署 SOP 建议(jay 8-21 1850 引用 CSA):① 监控源:NVD、CISA KEV、GitHub Advisories、OpenCVE ② 响应 SLA:关键 CVE < 24 小时 · 高危 CVE < 72 小时 ③ 生产部署:永远不要将推理 API 直接绑定 0.0.0.0 ④ 多租户注意:CVE-2026-73558 证明批处理推理存在跨用户 KV 泄漏风险 - ServerMO 安全部署命令(jay 8-21 1850):vllm serve --host 127.0.0.1 --port 8000 --gpu-memory-utilization 0.8 + python -m sglang.launch_server --model-path ... --host 127.0.0.1 --port 30000 --mem-fraction-static 0.8 = 严格绑定 localhost + 0.8 内存比例

与 risk.md 的关系: - §2.13 hardening 第 51 维候选级新增:vLLM/LMDeploy/SGLang 4 件 CVE 集群 = 推理引擎层安全 12 小时 SLA 结构性升级 - §3.1 反方 #91 第 37 栖候选新增:推理引擎漏洞披露 → 武器化 < 24 小时 反方(与 #91 #18 LALMs + #91 #28 MCP-ITP + #91 #29 HarnessRisk + #91 #30 COMA + #91 #31 HarmProfile + #91 #32 OpenAI Black Hat + #91 #33 Decision-Metric + #91 #34 Bounded Agents + #91 #35 DiSCO + #91 #36 AdaPop 形成"评测盲点 #1-#11"立基础延展) - §3.2 反身性 #21 第 37 栖候选新增:推理引擎 vs 模型层 反身性张力(风险从 L1/L2 模型层 → L0'' 元层+dev → 推理引擎层 = 风险研究的最外层扩展) - §4.1 待核清单 新增 #108:vLLM/SGLang/LMDeploy CVE 跨 vendor 测试覆盖 + 12h SLA 实证 + 防御方案可推广性(沿用 stephen noon §3.3 #G14 ASI-Bench 与 risk/evaluation 缺口重叠)

建议归入: - §2.13 hardening 第 51 维候选级新增:vLLM/LMDeploy/SGLang 4 件 CVE 集群 = 推理引擎层安全 12 小时 SLA 结构性升级 - §3.1 反方 #91 第 37 栖候选新增:推理引擎漏洞披露 → 武器化 < 24 小时 反方 - §3.2 反身性 #21 第 37 栖候选新增:推理引擎 vs 模型层 反身性张力 - §4.1 待核清单 新增 #108:vLLM/SGLang/LMDeploy CVE 跨 vendor 测试覆盖 + 12h SLA 实证 + 防御方案可推广性

可信度:高(2 源独立交叉 ✓ + jay 8-21 1850 实测 + OpenCVE/KodemSecurity/Sysdig/Orca Security 官方披露)。🔴 待核:① 跨 vendor 测试覆盖(其它推理框架如 TensorRT-LLM / Ollama / NVIDIA Triton);② 12h SLA 实证(其它 CVE 是否也呈现 12h 武器化模式);③ 防御方案可推广性(CSA SOP 的可行性);④ 生产部署实际影响范围;⑤ 与 frontier lab 自身披露的关系。

增量 6 · 🟢 Gradient Flow 8-21 双文 邻接级 net-new · 主线 A 沿用 8-15~8-21 七连 + "AI 风险存在于模型之外" + "模型或非最大风险"

来源: - inbox/spark/2026-08-21-1001-rss-gradient-flow.md line 5-6:https://gradientflow.com/the-biggest-ai-risks-sit-outside-the-model/ + https://gradientflow.com/i-think-we-are-looking-for-ai-risk-in-the-wrong-place/ - inbox/spark/2026-08-21-agent-e1prep.md §一 第⑨目 "Gradient Flow 'AI 风险在错误地方' 沿用主线 A · Chip Huyen 沿用 · 3Blue1Brown 数学科普" + "评估 ≠ 安全 Gradient Flow 8-15~8-21 七连" - organized/knowledge/risk.md §0.5 关键工作脉络 + §1 现状全景 + §3.1 反方共识(沿用 评估 ≠ 安全 方法学原则 候选级新增)+ §3.2 反身性张力 - 跨实例 3 源独立交叉 ✓(spark 8-21 1001 RSS + spark 8-21 agent-e1prep §一 + risk.md §0.5 / §1 / §3.1 / §3.2 沿用)

arXiv:无 arXiv ID(Gradient Flow 立场文章)

核心要点: - "最大的 AI 风险存在于模型之外"(gradientflow.com/the-biggest-ai-risks-sit-outside-the-model/ · 8-21 早盘 RSS 收录) = 当前最暴露问题的 AI 失败案例,并非关于模型变得过于强大,而是关于模型周围的一切 = "某个系统获得了过多访问权限" - "模型未必是你最大的风险"(gradientflow.com/i-think-we-are-looking-for-ai-risk-in-the-wrong-place/ · 8-21 早盘 RSS 收录) = 沿用主线 A 反身性张力 - 主线 A 沿用 8-15~8-21 七连 = R46 §3.1 反方共识 #92 候选级新增("评估 ≠ 安全" 方法学原则)+ R47 §3.2 反身性张力 沿用 - 关键事实:风险研究从"模型能力"扩展到"模型周围的一切"= 推理引擎层 + 授权架构 + 决策几何 + 多 Agent 委派 + T2I 对抗 + LLM unlearning = R50 net-new 5 件的反身性张力主轴

与 risk.md 的关系: - §3.1 反方 #92 第 1 栖候选新增(沿用):"评估 ≠ 安全" + "模型或非最大风险" 反方(沿用 R46 §3.1 #92 + R47 §3.2 反身性张力 续立 · 与 R50 net-new 5 件 + Inference-层 CVE 集群形成"R50 反方 #92 主轴") - §3.2 反身性 #21 第 38 栖候选新增:风险研究 vs 系统/授权/部署/对抗/遗忘/推理引擎 反身性张力(R50 net-new 5 件 + 4 件 CVE 集群 = 风险研究焦点从"模型"扩展到"模型周围的一切") - §4.1 待核清单 沿用:Gradient Flow 完整论证链 + "评估 ≠ 安全"实证(沿用 R46 §3.1 #92)

建议归入: - §3.1 反方 #92 第 1 栖候选新增(沿用):"评估 ≠ 安全" + "模型或非最大风险" 反方主轴 - §3.2 反身性 #21 第 38 栖候选新增:风险研究 vs 系统/授权/部署/对抗/遗忘/推理引擎 反身性张力 - §4.1 待核清单 沿用:Gradient Flow 完整论证链 + "评估 ≠ 安全"实证

可信度:中(3 源独立交叉 ✓ + spark 8-21 1001 RSS + 沿用主线 A 七连)。🔴 待核:① Gradient Flow 完整论证链;② "评估 ≠ 安全"实证;③ "模型或非最大风险"的具体边界。

增量 7 · ⚠️ Bounded Agents 1038 vs T161 跨实例评级冲突 + AdaPop 1033 主分类归属冲突

Bounded Agents 冲突: - v54 agent.md §3.4 T161:agent 主分类立标 + risk 仅作邻接级 - paper_card 1038:主 agent 副 risk 形态 method - stephen 8-21 noon:§3.1 #C17 AdaPop 主方向归属 + AdaPop 主分类归属(未涉及 Bounded Agents 评级) - 建议处理:R50 接力棒独立判定 Bounded Agents 是否升级为 risk 主轴邻接级参考

AdaPop 冲突: - stephen 8-21 noon §3.1 #C17:AdaPop 主方向是 LLM unlearning(机器遗忘),归入 risk 主线更合适;engineering 仅作邻接级;建议 R50 risk 接力棒独立判定 - paper_card 1033:主 engineering 副 risk - spark 8-21 agent-e1prep §四 矛盾 #3:AdaPop 主方向归属冲突 = v55 接力棒处理:归 risk 主线更合适 - 建议处理:R50 接力棒独立判定 AdaPop 主分类归属(是否升级为 risk 主线)

与 risk.md 的关系: - §4.1 待核清单 新增 #109:R50 接力棒独立判定 Bounded Agents + AdaPop 主分类归属

建议归入: - §4.1 待核清单 新增 #109:R50 接力棒独立判定 Bounded Agents + AdaPop 主分类归属

增量 8 · ⚠️ 3 件 P0 待人工 沿用持续 open 72h+ · Anthropic RSP 8-14 + 404 Media + HarmProfile P1 缺口

Anthropic RSP 第二份报告 8-14(186 页): - 沿用:flyp 8-20 risk-e1prep 增量 1(stephen 8-19/8-20 noon + ai-industry 8-19/8-20 evening) - P0 待核:① Anthropic RSP 第二份报告 8-14 完整 PDF URL(anthropic.com/aug-2026-risk-report 沿用 + 实际页面访问验证)② 186 页核心章节清单(哪些章节涉及 misalignment 评级 vs 生物武器评级 vs 1 年静默失效)③ 是否包含具体失效时间线 ④ 与 Anomaly 级 frontier lab 主动治理评分映射 ⑤ vs OpenAI Preparedness 框架横评差异

404 Media 珍本古籍 → Amazon AI 训练设施: - 沿用:flyp 8-20 risk-e1prep 待人工 + stephen 8-19/8-20 noon §3.3 #5 - P0 待核:归档位置决策(人工确认)

HarmProfile 2608.14577 P1 缺口 paper_card 补建: - 沿用:flyp 8-20 risk-e1prep 增量 4 + stephen 8-20 noon §3.3 #G11 + stephen 8-21 noon §4.3 G15 - P0 待核:① arXiv 完整标题 ② 风险分布指标定义 ③ 跨 frontier lab 测试覆盖 ④ 与现有 LLM 风险评测对照(LMSYS / HELM / AgentHarm 等)

与 risk.md 的关系: - §4.1 待核清单 #103 / #104 / 沿用:Anthropic RSP + 404 Media + HarmProfile 沿用 72h+ 持续 open

建议归入: - §4.1 待核清单 沿用 #103 / #104 / 沿用:Anthropic RSP 完整 PDF URL + 186 页核心章节 + 时间线;404 Media 归档位置决策;HarmProfile PDF 全文 + 跨 frontier lab 测试覆盖 + 风险分布指标

增量 9 · 🔴 R49 沿用 72h+ 主轴 R50 接力棒必须触发(stephen 8-21 noon 四道警示)

来源: - inbox/stephen/2026-08-21-1245-stephen-coordination-check-noon.md §0 R50 接力棒 P0 警示 = 5 件 net-new + P0 待人工(沿用 8-20 noon) - inbox/stephen/2026-08-21-1245-stephen-coordination-check-noon.md §3.3 #G3 risk 主轴全天 0 件净增 → 8-21 noon 仍 0 件 · 🔴 加剧(沿用 60h+ → 72h+ · 2026-08-18 17:15 → 2026-08-21 16:30) - inbox/stephen/2026-08-21-1245-stephen-coordination-check-noon.md §3.4 #G7 risk 活文档 60h+ 未更新 → 72h+ · 🔴 加剧 - inbox/stephen/2026-08-21-1245-stephen-coordination-check-noon.md §5 接力棒表 risk R49 → R50 ⚠️ | 8-18 17:15 沿用 60h+ | flyP / spark | 3 件 net-new + P0 待人工 | 🔴 P0 | 8-21 17:25 下午棒前必须触发 - inbox/stephen/2026-08-21-1245-stephen-coordination-check-noon.md §6.2 关键 P0 警示 #1 🔴 risk R50 接力棒必须触发(沿用 60h+)——flyP / spark 必须今天 17:25 下午棒前完成 R50 接力棒 - inbox/stephen/2026-08-21-1245-stephen-coordination-check-noon.md §5.5 paper_card ≥5 件 P1 缺口未建 = SemaPLC / Co-RL / ASI-Bench / SPADE / AVA-Encoder / 化学逆合成 / V-RAE · ASI-Bench 与 risk/evaluation 缺口重叠 - inbox/stephen/2026-08-21-1245-stephen-coordination-check-noon.md §4.3 G13 risk 主轴 HF Daily 8-21 15 件中无风险侧显著条目——spark gradient-flow 8-21 "AI 风险在错误地方"是邻接级;无 P0 风险立标 · R49 → R50 接力棒必须触发

核心要点: - 🔴 R50 接力棒必须触发(沿用 72h+ 主轴空挡 + 5 件 net-new + P0 待人工) - 5 件 R50 net-new 候选(本棒):① arXiv:2608.18746 Decision-Metric Alignment 主 risk ② arXiv:2608.15888 Bounded Agents agent 副 risk ③ arXiv:2608.17067 DiSCO multimodal 副 risk ④ arXiv:2608.14229 AdaPop engineering 副 risk(stephen noon #C17 建议归 risk 主线)⑤ vLLM/LMDeploy/SGLang 4 件 CVE 集群 inference-层 - P0 待人工 3 件沿用:Anthropic RSP 8-14 完整 PDF URL + 404 Media 归档位置 + HarmProfile P1 缺口 paper_card 补建 - 建议归入:R50 接力棒触发后整合本棒 5 件 net-new + 邻接级 5 件 + P0 待人工 3 件 + 反身性张力持续 7 日

建议归入: - R50 接力棒触发后整合本棒所有增量

增量 10 · 🔴 paper_card ≥5 件 P1 缺口未建(stephen noon §5.5)· ASI-Bench 与 risk/evaluation 缺口重叠

来源: - inbox/stephen/2026-08-21-1245-stephen-coordination-check-noon.md §3.4 G15 + §5.5 paper_card ≥5 件 P1 缺口未建 = SemaPLC / Co-RL / ASI-Bench / SPADE / AVA-Encoder / 化学逆合成 / V-RAE - inbox/stephen/2026-08-21-1245-stephen-coordination-check-noon.md §2.2 ASI-Bench 仍 P1 未建——与 risk/evaluation/multimodal 三大缺口分类重叠

核心要点: - ASI-Bench 仍 P1 未建 = arXiv:2608.17271 · 主分类 evaluation · 风险/评测/多模态 三大缺口重叠 - SemaPLC / Co-RL / SPADE / AVA-Encoder / 化学逆合成 / V-RAE 6 件 P1 未建 = HF Daily 8-21 早盘 5 件 + 立标池净增 - 建议归入:R50 接力棒触发后同步补建 ASI-Bench paper_card

建议归入: - §4.1 待核清单 沿用 #107 + R50 接力棒触发后补建 ASI-Bench paper_card

三、值得警惕的矛盾或待核实说法

警惕 1 · R49 沿用 72h+ 主轴空挡 vs R50 必须立即触发(stephen noon 四道警示)

stephen 8-21 noon: - §3.3 #G3 risk 主轴全天 0 件净增 → 8-21 noon 仍 0 件 · 🔴 加剧(沿用 60h+ → 72h+) - §3.4 #G7 risk 活文档 60h+ 未更新 → 72h+ - §5 接力棒表 risk R49 → R50 ⚠️ | 8-18 17:15 沿用 60h+ | 🔴 P0 | 8-21 17:25 下午棒前必须触发 - §6.2 #1 🔴 risk R50 接力棒必须触发(沿用 60h+)

建议处理:R50 接力棒必须由 flyP 17:25 下午棒前触发,本棒承担备料棒职责。

警惕 2 · Bounded Agents 1038 vs T161 跨实例评级冲突(v54 §3.4 T161 vs paper_card 1038)

v54 agent.md §3.4 T161: - Agent privilege escalation 安全事件升级 + MCP 协议层安全审计实锤趋势 - 主分类 agent + risk 仅作邻接级

paper_card 1038: - 主 agent 副 risk 形态 method

stephen 8-21 noon:未明示评级冲突 · R50 接力棒独立判定

建议处理:R50 接力棒独立判定 Bounded Agents 是否升级为 risk 主轴邻接级参考(本棒建议作为风险侧 §2.13 hardening 第 48 维候选级新增)。

警惕 3 · AdaPop 1033 主分类归属冲突(stephen noon §3.1 #C17)

stephen 8-21 noon §3.1 #C17:AdaPop 主方向是 LLM unlearning(机器遗忘),归入 risk 主线更合适;engineering 仅作邻接级;建议 R50 risk 接力棒独立判定

spark 8-21 agent-e1prep §四 矛盾 #3:AdaPop 主方向归属冲突 = v55 接力棒处理:归 risk 主线更合适

paper_card 1033:主 engineering 副 risk

建议处理:R50 接力棒独立判定 AdaPop 主分类归属(本棒建议升级为 risk 主轴邻接级,论文副 risk 标签提升)。

警惕 4 · 4 件 P0 待人工 沿用持续 open 72h+

Anthropic RSP 8-14 + 404 Media + HarmProfile + SlotGuard(沿用 8-19 noon) = 4 件 P0 待人工持续 open

建议处理:R50 接力棒触发后,主 owner 必须人工确认 Anthropic RSP 完整 PDF URL + 404 Media 归档位置 + HarmProfile P1 缺口 + SlotGuard arXiv ID。

警惕 5 · main line A 缺失 35 天 沿用

stephen 8-21 noon §1.4 / spark 8-21 agent-e1prep §一 第⑨目:Main line A 连续第 34 天缺失 7-19~8-21 + 反思棒第 19 例 ✅ → v54 反思棒永久失效判定观察期 8-18~8-21 沿用

建议处理:本棒不解决 main line A 缺失判定(沿用 stephen noon + spark agent-e1prep 沿用 + 反思棒第 20 例预备)。

警惕 6 · risk 主题立标信号 5 日连续 沿用

flyp 8-20 risk-e1prep 增量 4:HF Daily 8-20 #14 HarmProfile 19▲ · 立标信号 v33 以来首次 risk 邻接级 5 日连续

stephen 8-21 noon §3.3 #G13:risk 主轴 HF Daily 8-21 15 件中无风险侧显著条目

建议处理:本棒确认 risk 主题立标信号 5 日连续沿用,但 8-21 HF Daily 15 件中无风险侧显著条目 = 立标信号断裂,需要 R50 接力棒重新判定。

警惕 7 · DiSCO 1016 沿用 vs Bounded Agents 1038 评级冲突

DiSCO 1016:v53 §3.1 共识 #183 沿用 · 主 multimodal 副 risk 形态 method

Bounded Agents 1038:v54 §3.4 T161 已立标 agent 主分类 · risk 仅作邻接级

建议处理:本棒建议 Bounded Agents 升级为 risk 主轴邻接级参考(§2.13 hardening 第 48 维候选级新增),与 DiSCO 形成 risk 邻接级 reference。

四、可引用的 arXiv 号列表(R50 备料棒)

主 risk 主分类 arXiv 列表

序号 arXiv ID 论文 主分类 副分类 形态 备注
1 arXiv:2608.18746 Decision-Metric Alignment in Latent World Models risk - method R50 net-new 第 1 件
2 arXiv:2608.09158 Low-Frequency Safety Risks in LALMs (ILL) risk multimodal method R47 沿用 · 栖 26
3 arXiv:2608.09867 Stealing Reasoning Traces risk - - R44 沿用 · 栖 24

副 risk 邻接级 arXiv 列表(R50 备料棒引用)

序号 arXiv ID 论文 主分类 副分类 形态 备注
1 arXiv:2608.15888 Bounded Agents agent risk method R50 net-new 第 2 件
2 arXiv:2608.17067 DiSCO multimodal risk method R50 net-new 第 3 件
3 arXiv:2608.14229 AdaPop engineering - benchmark R50 net-new 第 4 件
4 arXiv:2608.17960 COMA rag risk position R50 沿用 · 副 risk 显式标注
5 arXiv:2608.17597 HarnessRisk evaluation risk benchmark R50 沿用 · 副 risk 显式标注
6 arXiv:2608.00677 OpenART agent risk - R45 沿用 · 栖 25
7 arXiv:2601.10971 AJAR agent risk - R48 沿用 · 栖 27
8 arXiv:2601.07395 MCP-ITP agent risk - R48 沿用 · 栖 28
9 arXiv:2608.14577 HarmProfile - - - R50 P1 缺口 paper_card 沿用

主 risk 邻接级 inference CVE 列表(无 arXiv ID · R50 net-new 第 5 件)

序号 CVE ID 漏洞 引擎 CVSS 状态
1 CVE-2026-73558 跨用户 KV Cache 数据泄漏(整数溢出) vLLM Medium 5.3 vLLM 0.27.0 修复
2 CVE-2026-22778 多模态视频 RCE(信息泄露 + 堆缓冲区溢出) vLLM Critical 9.8 vLLM 0.8.3 ~ 0.14.0
3 CVE-2026-33626 SSRF(12h31m 武器化) LMDeploy Critical LMDeploy 0.12.2 之前
4 CVE-2026-3059 多模态生成 ZMQ broker 去序列化 SGLang Critical 9.8 需启用 multimodal_gen
5 CVE-2026-3060 分拆编码器接收端去序列化 SGLang Critical 9.8 需启用 ZMQ 传输分拆
6 CVE-2026-3989 崩溃转储重放脚本去序列化 SGLang Critical 9.8 需启用 replay_request_dump

沿用 arXiv 列表(R48-R49 立基础延展备料)

序号 arXiv ID 论文 主分类 副分类 形态 备注
1 arXiv:2608.14036 Demystifying Agent Skills agent evaluation benchmark v54 沿用 · 8-21 #1 154▲ 双升
2 arXiv:2608.16590 Zetta ζ evaluation agent - v54 沿用 · 8-21 #3 130▲
3 arXiv:2608.18852 SkillGate agent engineering - v54 沿用
4 arXiv:2608.18613 CTIFoundry agent rag - R66 沿用 · stephen C16
5 arXiv:2608.18489 MissDiag rag evaluation - R66 沿用
6 arXiv:2608.17253 Co-RL agent multimodal - v54 沿用 · 8-21 #5 85▲
7 arXiv:2608.17528 Agent Lightning v1.0 agent evaluation - v54 沿用 · 8-21 #14 23▲
8 arXiv:2608.13558 OmniScientist multimodal - - 8-21 #6 83▲ net-new
9 arXiv:2608.17512 Embodied-Navigator multimodal engineering - 8-21 #9 46▲ 续立
10 arXiv:2608.18063 EDITBRIDGE multimodal - - 8-21 #15 21▲ 续立
11 arXiv:2608.12313 AVA-Encoder multimodal - - 8-21 #11 40▲ 续立
12 arXiv:2608.13556 V-RAE multimodal - - 8-21 #13 26▲ net-new
13 arXiv:2608.17426 SemComp-Bench multimodal evaluation - 8-21 #2 153▲ net-new
14 arXiv:2608.16157 FreeToken llm-infra agent - 8-21 #7 68▲ 续立
15 arXiv:2603.28052 Meta-Harness COLM 2026 agent - - v54 net-new

五、建议归入节(knowledge/risk.md)

§2.13 hardening 候选级新增 5 件

  • 第 47 维:DA-LeWM = MPC 规划中的诊断方法与动作条件目标(arXiv:2608.18746 Decision-Metric Alignment)
  • 第 48 维:Bounded Agents = 多 Agent 委派安全 + APC 授权架构(arXiv:2608.15888)
  • 第 49 维:DiSCO = T2I 黑盒即插即用防御(arXiv:2608.17067)+ 与 BVS visual jailbreak 攻防对偶
  • 第 50 维:AdaPop = LLM unlearning 主线(arXiv:2608.14229 · stephen noon #C17 建议归 risk 主线)
  • 第 51 维:vLLM/LMDeploy/SGLang 4 件 CVE 集群 = 推理引擎层安全 12 小时 SLA 结构性升级

§3.1 反方 #91 候选级新增 5 件 + #92 第 1 栖沿用

  • #91 第 33 栖:Decision-Metric Alignment = 评测盲点第 9 例(几何/对齐 vs 概率/分布)
  • #91 第 34 栖:Bounded Agents = 授权架构 vs 模型对齐 反方 = 风险研究层级跃迁
  • #91 第 35 栖:DiSCO = 评测盲点第 10 例(T2I 攻防对偶)
  • #91 第 36 栖:AdaPop = 流行/罕见事实的反方 · 评测盲点第 11 例
  • #91 第 37 栖:推理引擎漏洞披露 → 武器化 < 24 小时 反方
  • #92 第 1 栖(沿用):"评估 ≠ 安全" + "模型或非最大风险" 反方主轴

§3.2 反身性 #21 候选级新增 5 件 + 第 38 栖

  • #21 第 33 栖:风险研究 vs 决策几何诊断 反身性张力(MPC 规划几何结构诊断)
  • #21 第 34 栖:授权架构 vs 模型对齐 反身性张力(v49 ILL + R50 Decision-Metric + R50 Bounded Agents = 风险研究焦点三栖迁移)
  • #21 第 35 栖:T2I 攻击速度 vs 防御通用性 反身性张力
  • #21 第 36 栖:frontier lab 安全部署节奏 vs 流行事实遗忘难度 反身性张力
  • #21 第 37 栖:推理引擎 vs 模型层 反身性张力(风险从 L1/L2 → L0'' → 推理引擎层)
  • #21 第 38 栖:风险研究 vs 系统/授权/部署/对抗/遗忘/推理引擎 反身性张力

§4.1 待核清单 新增 5 件

  • #105:Bounded Agents APC 跨 vendor 实现可行性 + 数据集规模 + OpenAI Black Hat 对位
  • #106:AdaPop R50 risk 主线归属 独立判定(stephen noon #C17 优先级高)
  • #107:DiSCO 跨 T2I 系统测试覆盖(沿用 v53 §3.1 共识 #183 待核)
  • #108:vLLM/SGLang/LMDeploy CVE 跨 vendor 测试覆盖 + 12h SLA 实证 + 防御方案可推广性
  • #109:R50 接力棒独立判定 Bounded Agents + AdaPop 主分类归属

§4.1 待核清单 沿用 3 件

  • #103:Anthropic RSP 完整 PDF URL + 186 页核心章节 + 时间线(沿用 8-20 noon + stephen noon P0)
  • #104:HarmProfile PDF 全文 + 跨 frontier lab 测试覆盖 + 风险分布指标(沿用 8-20 noon §3.3 #G11 + stephen 8-21 noon §3.3 G15 ASI-Bench 与 risk/evaluation 缺口重叠)
  • 沿用:404 Media 珍本古籍 → Amazon AI 训练设施 归档位置决策(stephen 8-20/8-21 noon §3.3 #5)

§6 行业平台化修订 · 关键数据

  • 第 39 维关键数据 续立 + 升级候选:Anthropic RSP 第二份报告 8-14(186 页)+ 静默失效 anomaly = R49 h39 续立 + 升级候选
  • 新增第 40 维关键数据 候选级新增:vLLM CVE-2026-22778 CVSS 9.8 + LMDeploy CVE-2026-33626 12h31m 武器化 + vLLM CVE-2026-73558 跨用户 KV 泄漏 = 推理引擎层安全 12 小时 SLA 结构性升级 = 风险从模型层 → 推理引擎层 → 12 小时 SLA

六、本棒与 R50 接力棒触发建议

触发时机

  • R50 接力棒必须由 flyP 17:25 下午棒前触发(沿用 stephen 8-21 noon §5 + §6.2 关键 P0 警示 #1)

触发内容

  • 5 件 net-new:① arXiv:2608.18746 Decision-Metric Alignment 主 risk ② arXiv:2608.15888 Bounded Agents agent 副 risk ③ arXiv:2608.17067 DiSCO multimodal 副 risk ④ arXiv:2608.14229 AdaPop engineering 副 risk(stephen noon #C17 建议归 risk 主线)⑤ vLLM/LMDeploy/SGLang 4 件 CVE 集群 inference-层
  • 邻接级 5 件:① Gradient Flow 8-21 双文 ② Bounded Agents vs T161 评级冲突 ③ AdaPop 主分类归属冲突 ④ 3 件 P0 待人工 沿用 ⑤ paper_card ≥5 件 P1 缺口未建(ASI-Bench 与 risk/evaluation 缺口重叠)
  • 修复 72h+ 主轴空挡:R49 沿用 72h+ → R50 触发后新增 5 件 + 邻接级 5 件 = R50 主变更信号

风险层级 L 分类

  • L1 模型层:R50 沿用 ILL LALMs(栖 26)+ Decision-Metric Alignment(栖 33)+ AdaPop(栖 36)
  • L2 接口层:R50 net-new DiSCO(栖 35)+ Bounded Agents(栖 34)= 提示层攻防对偶
  • L3 系统层:R50 net-new Bounded Agents(栖 34)APC 授权架构 + Decision-Metric Alignment(栖 33)MPC 规划
  • L0 反身性/工具供应链:R50 net-new HarmProfile(栖 31 沿用 8-20)+ vLLM CVE 集群(栖 37)
  • L0'' 元层+dev:R50 net-new vLLM CVE 集群(栖 37)推理引擎层安全 + DiSCO T2I 即插即用(栖 35)
  • L_audio 大型音频语言模型:R47 沿用 ILL(栖 26)

七、检查过的来源清单(全部 12 件)

inbox/flyp/(8-21 早盘 + 上午)

  1. 2026-08-21-1000-rss-cameron-wolfe.md(沿用 R49)
  2. 2026-08-21-1002-rss-interconnects.md(沿用 R49)
  3. 2026-08-21-1004-rss-yt-ai-explained.md(沿用 R49)
  4. 2026-08-21-1004-rss-yt-two-minute-papers.md(沿用 R49)
  5. 2026-08-21-long-video-mllm-review.md(0 件 risk 主轴 net-new)
  6. 2026-08-21-multimodal-e1prep.md(0 件 risk 主轴 net-new · 24 arXiv)
  7. 2026-08-21-evoskills-coevol-critical-read.md(EvoSkills risk 邻接级 · human-curated skill 在某些域回退 + surrogate verifier 可靠性未量化 · 跨实例 1 源)

inbox/spark/(8-21 早盘)

  1. 2026-08-21-1001-rss-gradient-flow.md(Gradient Flow 8-21 双文 · 主线 A 沿用 8-15~8-21 七连)
  2. 2026-08-21-agent-e1prep.md(Bounded Agents 1038 + AdaPop 1033 主分类归属冲突)

inbox/tom/(8-21 早盘)

  1. 2026-08-21-0900-hf-daily-2026-08-21.md(15 件新料 · 0 件 risk 主轴 net-new)
  2. 2026-08-21T0840-agent-rag-longcontext-radar.md(Bounded Agents 1038 + AdaPop 1033 · 4 件 risk 邻接级)

inbox/jay/(8-21 早盘 + 上午 + 傍晚)

  1. 2026-08-21T1850-jay-engineering-filter-security-kvcache.md(4 件 vLLM/LMDeploy/SGLang CVE 集群 = R50 net-new 第 5 件 · 推理引擎层安全 12 小时 SLA 结构性升级)

inbox/stephen/(8-21 早盘 + 中午)

  1. 2026-08-21-0910-news-x-vip-radar.md(沿用 8-20 evening · 0 件 risk net-new)
  2. 2026-08-21-1245-stephen-coordination-check-noon.md(§3.3 #G3 + #G7 risk 主轴 60h+ 未更新沿用 72h+ · §5 接力棒表 risk R49 → R50 🔴 P0 · §6.2 #1 risk R50 必须触发 17:25 下午棒前)

organized/paper_cards/(8-19 ~ 8-21 早盘)

  • paper_card 1016 arXiv:2608.17067 DiSCO · 主 multimodal 副 risk 形态 method · 8-19 落盘 · R50 net-new 第 3 件
  • paper_card 1024 arXiv:2608.18746 Decision-Metric Alignment · 主 risk 形态 method · 8-21 早盘落盘 · R50 net-new 第 1 件
  • paper_card 1033 arXiv:2608.14229 AdaPop · 主 engineering · 8-21 早盘落盘 · R50 net-new 第 4 件
  • paper_card 1038 arXiv:2608.15888 Bounded Agents · 主 agent 副 risk 形态 method · 8-21 早盘落盘 · R50 net-new 第 2 件
  • paper_card 1006 arXiv:2608.17960 COMA · 主 rag 副 risk 形态 position · 8-20 落盘 · R50 沿用
  • paper_card 1010 arXiv:2608.17597 HarnessRisk · 主 evaluation 副 risk 形态 benchmark · 8-19 落盘 · R50 沿用
  • paper_card 990 arXiv:2608.16536 DSPrompt · 主 rag 副 risk · 8-18 落盘 · R50 沿用

organized/knowledge/

  • risk.md R49(2026-08-18 17:10 CST · flyP · 锚 4 日断裂 + 5 新晋锚 + 4 近邻 + 训练数据伦理待人工)
  • agent.md v54(2026-08-20 11:02 · spark cron 强制触发版 · §3.4 T161 Agent privilege escalation + Bounded Agents 已立)
  • multimodal.md v52(2026-08-20 08:49 · 立标池双向锚 9 向并存实测第 4 日)
  • ai-industry.md v51(2026-08-20 24h 凌晨棒 · Anthropic RSP 8-14 沿用)

八、本次小结

  • 核心判定:risk 主轴 R49 沿用 72h+ 主轴空挡持续(stephen noon §3.3 #G3 + #G7 + §5 + §6.2 #1 加剧)+ R50 必须立即触发(本棒承担备料 + 启动信号职责)
  • net-new 5 件:① arXiv:2608.18746 Decision-Metric Alignment 主 risk 主分类 net-new 第 1 件(R47 ILL LALMs 栖 26 之后首个主 risk 主分类论文立标)② arXiv:2608.15888 Bounded Agents agent 主分类副 risk net-new 第 2 件 ③ arXiv:2608.17067 DiSCO multimodal 主分类副 risk net-new 第 3 件 ④ arXiv:2608.14229 AdaPop engineering 主分类副 risk net-new 第 4 件(stephen noon #C17 建议归 risk 主线)⑤ vLLM/LMDeploy/SGLang 4 件 CVE 集群 inference-层 net-new 第 5 件(12h31m 武器化 + 跨用户 KV 泄漏 + 多模态 RCE + 多模态/分拆去序列化 = 推理引擎层安全 12 小时 SLA 结构性升级)
  • 邻接级 5 件:① Gradient Flow 8-21 双文(主线 A 沿用 8-15~8-21 七连)② Bounded Agents 1038 vs T161 评级冲突 ③ AdaPop 1033 主分类归属冲突(stephen noon #C17)④ 3 件 P0 待人工 沿用(Anthropic RSP 8-14 + 404 Media + HarmProfile P1 缺口)⑤ paper_card ≥5 件 P1 缺口未建(ASI-Bench 与 risk/evaluation 缺口重叠)
  • R50 触发建议:flyP 17:25 下午棒前必须触发 · 主 owner = flyP · 备 owner = spark · 邻接 owner = Tom · 修复 72h+ 主轴空挡 + 接收 5 件 net-new + 邻接级 5 件 + P0 待人工 3 件 + 反身性张力持续 7 日
  • 风险层级 L 分类:L1/L2/L3 + L0 + L0'' + L_audio 全部新增 = R50 风险研究焦点从"模型对齐"扩展到"授权架构 + 决策几何 + 多 Agent 委派 + T2I 对抗 + LLM unlearning + 推理引擎安全"
  • 未执行任何 git / GitHub 写入操作
  • 已写入文件:/shared/research-kb/inbox/flyp/2026-08-21-risk-e1prep.md

status:✅ 完成 · risk E1 预消化简报(2026-08-21)落盘 · 10 件 net-new 增量(5 件 R50 + 5 件邻接级)+ 3 件沿用 P0 待人工 + 4 件推理引擎 CVE · 15 arXiv 编号 + 9 件 CVE ID + 18 件检查过来源 + 6 件建议归入节 增量条数:10 件(5 件主 risk + 邻接级 5 件) 涉及 arXiv 号:15 件(5 件 R50 net-new + 10 件沿用备料) 涉及 CVE ID:6 件(vLLM ×2 + LMDeploy ×1 + SGLang ×3) 写入路径: - /shared/research-kb/inbox/flyp/2026-08-21-risk-e1prep.md(本稿)

flyP · 2026-08-21 16:30 · E1 日间预消化轮(risk)· 为今晚 R50 活文档接力棒备料 · 不写他人目录、不 git、不输出密钥