risk · E1 预消化简报(2026-08-18)
窗口:2026-08-17 16:30 ~ 2026-08-18 16:30 CST;为今晚 risk 活文档接力棒(R48 → R49 升级轮候选窗口)备料。本文只综合已有 inbox 与 paper_card,不补写未检查材料,不 web search。 承接脉络:R48 risk.md(2026-08-17 17:10 CST · flyP · 🟢 3 立基础延展(arXiv:2601.10971 AJAR + arXiv:2601.07395 MCP-ITP 84.2% ASR + Meta Muse Spark 1.1 8-5-6)+ 🟡 1 数据源头更正(MCPTox→MCP-ITP 误归第一案)+ 🟢 立标池双向锚「四日稳态期」首次实测(OpenART 8-17 #1 253▲)+ 🟢 Anthropic 措辞回摆("已脱敏"→"删减版"→"已脱敏")+ 🟢 R47 4 项立基础延展 第 6 个 24h 候选(Daybreak on AWS ×5 24h + Astra ×6 24h + Fable 5 ×5 24h + 09867 8-17 沿用)+ R47 OpenART 续立加强 + R47 #86.④ 第 5 24h + R47 CVE 30 沿用 + 反方 #91 #19-20 + 反方 #93 #5 + 反身性 #21 #21-23 + 候选池 35→38 + 防御表 108 行 沿用 + arXiv 217→220 + α 14 维 + 21 轨反身性)的延续。 本日主线:① risk 主轴主 risk 主分类 paper_card 净增 0 件(8-17 12:30 ~ 8-18 13:00 两批新归档 ≈ 19 张新 paper_card 中,显式 risk 副分类仅 990 DSPrompt M-RAG 防御 1 件 = 主 risk 主分类 net-new 0 件)+ ② 4 件主轴显著 risk 邻接/邻接线 net-new(arXiv:2608.14391 AI 生成视频攻击检测系统评估 HF Daily #1 258▲ · arXiv:2608.03744 Agents Catching Agents 临床多 Agent 系统 benchmark 作弊同行错误答案传播 · arXiv:2608.16536 DSPrompt M-RAG 防御 + SlotGuard LLM Agent 转录本隐私泄露防护 = 5 件 net-new 含 1 件主轴近邻),③ 1 件跨界训练数据来源伦理事件待人工确认主 risk 主分类(stephen 8-18 noon 1245 §3.3 #5 = 404 Media 珍本古籍 → Amazon AI 训练设施),④ 立标池双向锚 v48 第 4 日稳态被打破(OpenART 跌出 top 15 = v33 以来首次反弹锚断裂 + Alaya-EVOKE 续立加强锚持续被打破 = 立标信号 8 → 9 类分类细化首次机制化 = v33 以来首次 1 日 5 件新晋锚),⑤ 5 lab frontier lab 公告净增 0 件(stephen 8-18 noon 1245 §1.1 + stephen 8-18 ai-industry = OpenAI/Anthropic/DeepMind/Google AI/HF Blog 5 件 8-18 morning 全部沿用 8-17 内容),⑥ 6 件 P0 沿用 24h+ 无进展(沿用 R48 §4.1 #86 + #89-#95 + R48 §7.2 #96-#100),⑦ R48 4 立基础延展 第 7 个 24h 候选(第 23 栖 Daybreak on AWS ×6 24h + 栖 18 Astra ×7 24h = #86.④ ✅ 结案可重复性验证 第 7 个 24h 候选 + 栖 21 Fable 5 ×6 24h + 第 24 栖 09867 Stealing Reasoning Traces 8-18 第 7 个 24h 沿用 + 第 25 栖 OpenART 8-17 #1 253▲ 续立 + 第 26 栖 2608.09158 ILL LALMs 8-18 HF Daily 未出现 ≠ 立标信号衰减 = 候选级新增 续立)。
一、结论先行
本轮确认的显著增量有 6 条。本日 risk 主轴的核心判定是:R48 沿用为主,本棒不引入新立基础延展 net-new,主要价值是为今晚 R49 接力棒标注"6 件 P0 待核 24h+ 沿用 + 立标池双向锚第 4 日稳态被打破(机制级沿用)+ OpenART 反弹锚 + Alaya-EVOKE 续立加强锚 同时断裂 v33 以来首次 + 5 件 8-18 新晋锚(立标信号 8 → 9 类分类细化首次机制化)+ 1 件跨界训练数据伦理事件(stephen §3.3 #5 404 Media)+ 4 件主轴近邻 net-new 邻接线(14391 视频攻击 258▲ + 03744 临床 Agent 同行作弊 + 16536 M-RAG 防御 + SlotGuard Agent 隐私)+ R48 4 立基础延展 第 7 个 24h 候选 + 风险主题主轴空挡 48h+ 必须由 R49 接力棒启动新棒消化"的承接事实。具体如下:
- 立标池双向锚第 4 日稳态被打破(机制级沿用) = HF Daily 8-18 立标信号重新洗牌(tom 8-18 0900 + stephen 8-18 noon §2.3 + flyp 8-18 multimodal-e1prep §增量 3 印证)= OpenART 跌出 top 15 = 反弹锚第 4 日断裂 v33 以来首次 + Alaya-EVOKE 持续跌出 = 续立加强锚持续被打破 = v33 以来首次"反弹锚 + 续立加强锚"同时断裂 + 5 件 8-18 新晋锚(AI 视频攻击检测 2608.14391 #1 258▲ + Self-Supervised Visual OPD 2608.14144 #2 147▲ + 2608.13417 #3 42▲ + 2608.14290 #4 31▲ + 2608.14530 #7 22▲) = 立标信号 8 → 9 类分类细化首次机制化(新增"新晋锚"信号分类)
- arXiv:2608.14391 AI 生成视频攻击真实世界危机事件检测器系统评估(HF Daily 8-18 #1 258▲ · P1 缺口未建 · 跨实例 3 源确认 ✓)= risk 主轴近邻 net-new 第 1 件(领域 = 多模态视频生成 + 视频真实性检测 + 社交传播路径 = 三轴综合评测 · 立标信号最强 · R49 接力棒建议归入 §2.13 hardening h37 邻接级新增 · 与 OpenART h37 + Fable 5 栖 21 形成"评测方法学 + 主动治理 + 攻击面+防御"三栖对位)
- arXiv:2608.03744 Agents Catching Agents(8-18 paper_card 985 已建 · 主分类 agent · 副分类 evaluation · 跨实例 4 源确认 ✓)= risk 主轴近邻 net-new 第 2 件(临床多 Agent 委员会"同行错误答案传播攻击" = 当两人断言同一错误答案时 holdout 测试者采纳率 38% vs 单独抵抗翻转率 5-16% = Gemini 委员会 social susceptibility 威胁 = 临床 benchmark gaming 第 1 实证 = R49 §3.1 反方 #91 候选级新增候选 · 候选级中档 ★ / 与跨测试 + 上下文串通 同档)
- arXiv:2608.16536 DSPrompt: Dynamic Soft Prompt Defense Against M-RAG Corruption(8-18 paper_card 990 已建 · 主分类 rag · 副分类 risk · multimodal RAG 抗恶意嵌入攻击防御)= risk 主轴副分类 net-new 第 1 件(M-RAG 攻击 = 恶意数据被 crafting 成与良性条目嵌入空间对齐 → 欺骗检索 → 诱导有害输出 = DSPrompt 防御方案 = RAG 攻防层 · 与 MCP-ITP 第 28 栖 + AJAR 第 27 栖形成"MCP / RAG / 工具层"防御侧立基础延展三联候选)
- 跨实例协同建议(stephen 8-18 noon §3.3 #5 明确警示):404 Media 珍本古籍 → Amazon AI 训练设施调查 = 训练数据来源伦理新事实 = 是否归入 risk 主轴 vs ai-industry §3.2? = R49 接力棒本棒必须人工确认归档位置 = 风险主题 vs 产业主题 边界修订 待开放
- SlotGuard: Stop Oversharing Private Context in LLM Agent Transcripts(Yongjoo Park 组 · ICML AIWILD 2026 · arXiv ID 待核实 · 主分类 agent · 跨实例 2 源确认 ✓)= risk 主轴近邻 net-new 第 3 件(LLM Agent 转录本中"槽位(slot)"无意中泄露用户私有上下文 = browser-Use / Computer-Use / Mobile-Use Agent 的 tool-call transcript 安全 = 与 R48 §2.6 Agent 安全 MemGhost/GhostWriter + SecureMCP + Stealing Reasoning Traces 形成"Agent 安全 4 联"立基础延展)
无 net-new 主 risk 主分类 arXiv 立基础延展,无 net-new 主 risk 主分类 arXiv hardening 候选级新增。无 net-new frontier lab 风险事件(5 lab 全部沿用 8-17 内容)。其余为沿用 + 立标池机制级沿用 + 训练数据伦理待人工确认 + P0 24h+ 沿用。
二、今日最重要增量
增量 1 · 🟢 立标池双向锚第 4 日稳态被打破(机制级沿用 + 立标信号 8 → 9 类分类细化首次机制化)
来源:
- inbox/tom/2026-08-18-0900-hf-daily-2026-08-18.md 15 件 HF Daily · 立标信号逐项登记
- inbox/stephen/2026-08-18-1245-stephen-coordination-check-noon.md §2.3 立标池双向锚第 4 日稳态被打破 + §增量 6 HF Daily 8-18 立标池重新洗牌
- inbox/stephen/2026-08-18-ai-industry-e1prep.md §增量 6 HF Daily 8-18 立标池重新洗牌 + 立标信号 8 → 9 类分类细化 + OpenART 反弹锚第 4 日被打破
- inbox/flyp/2026-08-18-multimodal-e1prep.md §1.1 立标池双向锚 v33 以来首次 7 向并存实测 + §增量 3 HF Daily 8-18 立标信号新高实测 + 立标池双向锚 v48 第 4 日稳态被打破机制
- paper_cards/928-2608-00677.md OpenART 沿用
- 5 实例独立交叉 ✓(tom HF Daily + stephen noon/ai-industry 双棒 + flyp multimodal + paper_card 928)
要点: - OpenART(arXiv:2608.00677 · 主 agent 副 risk · 复旦 + Shanghai AI Lab + XSafeAI · 10K+ scenarios + 75 configs + EMHA 85.0% ASR)立标曲线 = 8-14 #1 184▲ → 8-15 #1 252▲ = +68▲ +37.0% → 8-16 #1 252▲ 持平 → 8-17 #1 253▲ = +1▲ 续立微强维持 = 反弹锚第 4 日(v33 以来首次)→ 8-18 跌出 top 15 = 反弹锚第 4 日断裂 v33 以来首次 = 立标信号 8 类中"反弹锚"信号分类需要细化 - Alaya-EVOKE(arXiv:2608.13546)8-15 #3 82▲ → 8-16 #2 107▲ → 8-17 #2 116▲ +9▲ 续立加强持续 → 8-18 跌出 top 15 = 续立加强锚持续被打破(沿用 3 日 + 1 日断裂) - 5 件新晋锚实测(v33 以来首次 1 日 5 件新晋锚): - arXiv:2608.14391 AI 生成视频攻击真实世界危机事件检测器系统评估 = #1 258▲(新晋锚第 1 例 · risk 主轴近邻 net-new) - arXiv:2608.14144 Self-Supervised Visual OPD = #2 147▲(新晋锚第 2 例 · multimodal 主分类 · paper_card 974 已建) - arXiv:2608.13417 超越最终分数:长周期 AI 研发 Agent 系统性评估 = #3 42▲(新晋锚第 3 例 · agent 主分类邻接) - arXiv:2608.14290 Intern-S2-Mobius = #4 31▲(新晋锚第 4 例 · LLM 主分类邻接) - arXiv:2608.14530 Marionette = #7 22▲(新晋锚第 5 例 · multimodal 主分类 P1 缺口未建) - LiveAnimate(arXiv:2608.11745)8-17 #15 21▲ 重入 → 8-18 #8 21▲ = +6▲ 续立微强维持 = 续立微强锚沿用(沿用 v48) - 立标信号 8 → 9 类分类细化首次机制化(v48 §2.200 8 类 → v49 §2.200 9 类):① 反弹锚(8-18 断裂 v33 以来首次)② 衰减锚(Self-Geometry 8-17 跌出 沿用)③ 续立加强(Alaya-EVOKE 8-18 跌出 持续被打破)④ 续立微强(DreamX-Phi + Mechanist + SkillZip + 修辞 + LiveAnimate 8-18 续立微强维持)⑤ 续立极弱(沿用)⑥ 维持(8-18 top 15 中 9 件持平)⑦ 重入(LiveAnimate 8-17 重入 沿用)+ 🆕 新晋锚(5 件 8-18 新晋 = 立标信号 9 类)⑧ 维持锚(沿用)
与 risk.md 的关系: - §2.13 h37 候选级新增 续立加强:OpenART 8-18 跌出 = 反弹锚第 4 日断裂 h37 候选级新增 续立 = R48 §2.13 h37 候选级新增沿用 → v49 接力棒必须决定是否新增"反弹锚断裂"机制化分类(机制级延伸) - §3.2 反方共识 立标双维度机制化第五次实测:R46 第 1 次(8-15 #1 252▲)+ R47 第 2 次(8-16 #1 252▲ 持平)+ R48 第 3 次(8-17 #1 253▲ +1▲)+ R48 第 4 日稳态 → R49 第 5 次(8-18 #1 258▲ 立标信号重新洗牌) = 立标信号强度 ≠ 立标等级 = 8-18 #1 258▲ ≠ OpenART 8-15-17 #1 250+▲ - §3.2 反身性 #21 第 16 栖(OpenART 反身张力 #1)= 续立沿用 = 立标信号 9 类细化首次机制化 = 评测信号强度 vs 立标等级 双维度机制化 第五次实测 - §4.1 待核清单 沿用:OpenART 8-19/8-20 HF Daily 复核是否仍跌出(沿用 R48 #88) - §2.13 立标池双向锚 v33 首次「四日稳态期」被打破:R48 §0 已落定 = 8-18 跌出 = 立标池机制升级(从"稳态期"到"重新洗牌"+ "新晋锚"为常态)
建议归入: - §2.13 h37 候选级新增 续立加强 · 反弹锚断裂 + 续立加强锚持续被打破:OpenART 8-18 跌出 = 反弹锚第 4 日断裂 v33 以来首次 + Alaya-EVOKE 8-18 跌出 = 续立加强锚持续被打破 = R49 接力棒本棒必须独立判定立标信号 9 类机制 - §2.13 立标池双向锚 v33 首次「重新洗牌期」首次实测:v48 沿用「四日稳态期」+ R49 §0 升级为「重新洗牌期」+ 新增「新晋锚」机制化分类(5 件 8-18 新晋) - §3.2 反方共识 立标双维度机制化第五次实测:立标信号重新洗牌 + 8-18 #1 258▲ ≠ OpenART 8-17 #1 253▲ = 评测信号强度 ≠ 立标等级 持续实证 - §6 行业平台化修订 第 37 维关键数据 续立:8-18 立标信号重新洗牌 + 8-18 #1 258▲(AI 视频攻击检测)+ 8-18 #2 147▲(Self-Supervised Visual OPD)= 立标信号 9 类分类细化
可信度:高(tom 8-18 0900 HF Daily + stephen 8-18 noon §2.3 + stephen 8-18 ai-industry §增量 6 + flyp 8-18 multimodal §1.1 + paper_card 928 = 5 实例独立交叉 完全一致)。待核:① OpenART 8-19/8-20 HF Daily 复核是否仍跌出(机制级延伸);② 8-18 #1 258▲(AI 视频攻击检测)沿用强度是否递减(8-19 #1 是否仍保持 ≥200▲);③ 9 类信号分类细化首次机制化是否沿用。
增量 2 · 🟡 主轴近邻 net-new 第 1 件 · arXiv:2608.14391 围绕 AI 生成视频攻击真实世界危机事件,我们能否进行有效防御?对检测器、生成器与社交传播的系统性评估(HF Daily 8-18 #1 258▲ · 新晋锚第 1 例 · risk 主轴近邻 · multimodal · P1 缺口未建)
来源:
- inbox/tom/2026-08-18-0900-hf-daily-2026-08-18.md #1 258▲ AI 生成视频攻击真实世界危机事件检测器系统评估 · https://arxiv.org/abs/2608.14391
- inbox/stephen/2026-08-18-ai-industry-e1prep.md §增量 6 HF Daily 8-18 #1 258▲ AI 视频攻击检测系统评估 arXiv:2608.14391(multimodal 邻接 · P1 缺口未建)
- inbox/flyp/2026-08-18-multimodal-e1prep.md §增量 3 #1 2608.14391 258▲ · multimodal 邻接 · AI 生成视频攻击检测系统评估
- P1 缺口未建 paper_card(08-18 13:00 CST 沿用 paper_cards/994-2608-15022.md 最新 = paper_card 994 = arXiv:2608.15022 主分类 evaluation,与 2608.14391 不同)
- 跨实例 3 源独立交叉完全一致 ✓(tom 8-18 0900 HF Daily + stephen 8-18 ai-industry §增量 6 + flyp 8-18 multimodal §增量 3)
arXiv:arXiv:2608.14391(HF Daily #1 258▲ · multimodal/risk 邻接 · paper_card 待建)
核心要点: - 标题:围绕 AI 生成视频攻击真实世界危机事件,我们能否进行有效防御?对检测器、生成器与社交传播的系统性评估(原文标题类似) - 主旨:AI 生成的恶意深度伪造视频攻击真实世界的危机事件 → 系统性评估三轴: 1. 检测器轴:检测 AI 生成视频的方法学评估(算法层面) 2. 生成器轴:生成方法学评估(攻击方法学 + 攻击强度) 3. 社交传播轴:社交传播路径评估(影响范围 + 信任损伤) - 立标信号 = HF Daily 8-18 #1 258▲(> #2 Self-Supervised Visual OPD 147▲ · 立标信号 立标池新晋锚第 1 例) - 领域归类:multimodal 主分类(视频生成) + risk 主轴近邻 / net-new 邻接线第 1 件(AI 视频攻击 + 检测器 + 社交传播) - 撞名核验:与 AI 生成视频检测 / Deepfake detection / 真实世界危机事件同类关键词撞名风险中(必须带 arXiv ID)
与 risk.md 的关系: - §2.13 h37 候选级新增 · 邻接级新增候选(stephen 沿用 OpenART h37)+ §3.2 反方 #91 第 15 栖 续立(OpenART #4 24h)= R49 接力棒建议归入 §2.13 hardening h41 候选级新增(AI 视频攻击 + 检测器评估 + 社交传播三轴 = L4 video/multimodal 攻击面 + L1/L2 模型层检测 + L3 系统层社交传播) - §3.1 反方 #91 第 21 栖候选(AI 视频攻击 + Deepfake + 危机事件议题)= R49 §3.1 反方共识 #91 18→19→20→21 栖扩列(评测盲点 #7 + MCP-ITP + AJAR + AI 视频攻击) - §3.2 反身性 #21 第 24 栖候选(AI 视频生成攻击面扩张速度 vs 检测器方法学准备度 反身性张力)= R49 §3.2 反身性 #21 21→22→23→24 栖扩列 - §4.1 待核清单 新增:arXiv:2608.14391 PDF 可访问性 + 跨 frontier lab 测试覆盖 + 8-19 #1 沿用强度(沿用 ≥200▲)
建议归入: - §2.13 hardening h41 候选级新增(AI 视频攻击三轴 = 检测器 + 生成器 + 社交传播 = L4 video/multimodal 攻击面 · P1 缺口 paper_card 待建 · R49 §2.13 候选池 38→39 件) - §3.1 反方 #91 第 21 栖候选新增:AI 视频攻击 + Deepfake + 危机事件议题 + 与 OpenART h37 + AJAR + MCP-ITP 形成 21 栖对位 - §3.2 反身性 #21 第 24 栖候选新增:AI 视频生成攻击面扩张速度 vs 检测器方法学准备度 反身性张力 + 与 #21 #20 LALMs + #21 #23 Meta Muse Spark 1.1 形成 24 栖对位 - §4.1 待核清单 沿用:arXiv:2608.14391 PDF 全文可访问性 + 跨 frontier lab 测试覆盖 + 8-19 #1 沿用强度 + 论文方法学(检测器 + 生成器 + 社交传播三轴)
可信度:中-高(3 实例独立交叉完全一致 · P1 缺口未建 paper_card · HF Daily #1 258▲ 立标信号 = 沿用 8-18 morning 沿用 5 lab frontier lab 公告净增 0 件 等同源)。待核(最高优先级):① arXiv:2608.14391 PDF 全文可访问性(必须 8-19 evening 棒启动核实);② 跨 frontier lab 测试覆盖;③ 检测器基线 + 生成器基线 + 社交传播基线;④ 防御方案;⑤ 8-19 HF Daily 复核 #1 沿用强度。
增量 3 · 🟢 主轴近邻 net-new 第 2 件 · arXiv:2608.03744 Agents Catching Agents: Shortcut Cascades and Benchmark Gaming in Clinical Multi-Agent Systems(8-18 paper_card 985 已建 · 主分类 agent · 副分类 evaluation · risk 主轴近邻)
来源:
- paper_cards/985-2608-03744.md 8-18 已建 · 主分类 agent · 形态 benchmark
- inbox/spark/2026-08-18-agent-e1prep.md §增量 5 paper_cards 8-18 净增 · 985 Agents Catching Agents arXiv:2608.03744
- inbox/tom/2026-08-18-agent-rag-longcontext-radar.md 8 件候选(8-18 08:40)· Agents Catching Agents arXiv:2608.03744(沿用)
- inbox/tom/_candidates/2026-08-18-rag-retrieval-reranking-candidates.json(来源文件)
- inbox/tom/_candidates/2026-08-18-agent-rag-longcontext-candidates.json(来源文件)
- 跨实例 4 源独立交叉 ✓(paper_card 985 + spark 8-18 agent-e1prep §增量 5 + tom 8-18 radar + tom _candidates 2 件)
arXiv:arXiv:2608.03744(主分类 agent · 副分类 evaluation · 形态 benchmark · paper_card 985 已建)
核心要点: - 标题:Agents Catching Agents: Shortcut Cascades and Benchmark Gaming in Clinical Multi-Agent Systems - 主旨:临床决策支持向 LLM Agent 委员会共享工作空间审议模式演化 → 我们追问:这样的委员会是否能被捷径作弊(即 benchmark 奖励但临床医生会忽略的提示) - 方法:七个 cohort × 六个公开数据集(文本 MedQA-USMLE / MedMCQA / MIMIC-CXR 报告 + 影像 NIH ChestX-ray14 / MIMIC-CXR-JPG / CheXpert + 表格 ICU 记录 SUPPORT2)+ Gemini 委员会 - 关键指标: - 单独抵抗:翻转率 5-16%(Gemini 委员会能单独抵御这些提示) - 同行错误答案传播:当两人断言同一错误答案时,holdout 测试者采纳该错误 = 攻击成功率 38% vs 单独抵抗时 5-16% = 社会合理捷径(spread)将攻击成功率大幅提升 - 立标信号与归类:R48 §3.1 反方 #91 #15 栖续立 沿用(OpenART) + R48 §3.4 T151 长周期 Agent 评估立基础延展(沿用) + R49 §2.13 hardening h42 候选级新增(临床 Agent benchmark gaming = shortcut 级联 = social susceptibility attack) - 撞名核验:Agents Catching Agents 单名与 RL agent sandbox / clinical multi-agent 等同类撞名风险中(必须带 arXiv ID)
与 risk.md 的关系: - §2.13 hardening h42 候选级新增:临床多 Agent 委员会"同行错误答案传播攻击" = 社会合理捷径(spread)攻击 = R49 §2.13 候选池 38→39 件 - §3.1 反方 #91 第 22 栖候选新增:Agent benchmark gaming = 临床 Agent 同行错误答案传播 = R49 §3.1 反方共识 #91 21→22 栖 - §3.2 反身性 #21 第 25 栖候选新增:临床 Agent 同行错误答案传播攻击成功率 vs 临床部署准备度 反身性张力 - §2.13 MCP-ITP 第 28 栖对位(MCP 隐式工具中毒 84.2% ASR)+ AJAR 第 27 栖对位(X-Teaming 65%→76% ASR on HarmBench)+ 本件第 29 栖对位(同行错误答案传播 5-16%→38% ASR on Gemini 委员会) = "Agent 攻防层"立基础延展三联候选
建议归入: - §2.13 hardening h42 候选级新增:临床 Agent 同行错误答案传播 attack ASR 5-16% → 38% = R49 §2.13 候选池 38→39 件 - §3.1 反方 #91 第 22 栖候选新增:Agent benchmark gaming + 同行错误答案传播 = 风险 + 临床 + 多 Agent 三栖对位 - §3.2 反身性 #21 第 25 栖候选新增:临床 Agent 同行错误传播攻击 vs 临床部署准备度 反身性张力 - §2.13 R48 h41 + h42 + 第 26 栖 ILL + 第 27 栖 AJAR + 第 28 栖 MCP-ITP + 第 29 栖 Agents Catching Agents = 候选池 39 件(R48 38 + R49 净增 1 件 net-new = h42)
可信度:高(4 源独立交叉完全一致 + paper_card 985 已建 + TLDR 完整可读)。待核(沿用 R48 §7.2 + 增补):① 跨 frontier lab 测试覆盖(本论文仅测 Gemini 委员会);② 5-16% 与 38% 数据具体来源 PDF §;③ 临床领域外的多 Agent 系统是否同样适用(PDF §限制段);④ 防御方案;⑤ 同行错误答案传播 vs 单 Agent 横向对照;⑥ 跨数据集重现性。
增量 4 · 🟢 主轴近邻 net-new 第 3 件 · arXiv:2608.16536 DSPrompt: Dynamic Soft Prompt Defense Against M-RAG Corruption(8-18 paper_card 990 已建 · 主分类 rag · 副分类 risk · multimodal RAG 抗恶意嵌入攻击防御)
来源:
- paper_cards/990-2608-16536.md 8-18 已建 · 主分类 rag · 形态 method · 副分类 risk
- inbox/tom/_candidates/2026-08-18-agent-rag-longcontext-candidates.json(来源文件)
- 跨实例 2 源独立交叉 ✓(paper_card 990 + tom _candidates)
arXiv:arXiv:2608.16536(主分类 rag · 副分类 risk · 形态 method · paper_card 990 已建)
核心要点: - 标题:DSPrompt: Dynamic Soft Prompt Defense Against M-RAG Corruption - 主旨:多模态检索增强生成(M-RAG)越来越容易受到对抗性攻击 → 恶意数据被 crafting 成与良性条目嵌入空间对齐 → 欺骗检索 → 诱导有害输出 - 现有防御方案的局限:主要在查询时运行 → 依赖辅助检测器 / 相似度重排 / 特征一致性检查 → 存在显著推理开销 + 对未见攻击策略泛化差 + 常假设特定攻击分布 - DSPrompt 防御方案:Dynamic Soft Prompt Defense = 动态软提示防御 - 撞名核验:DSPrompt 同方向 soft-prompt 防御关键词撞名风险中(必须带 arXiv ID) - 归类:副分类 risk = RAG 攻防层 · multimodal 邻接 + risk 主轴近邻
与 risk.md 的关系: - §2.13 hardening 第 43 维候选级新增(DSPrompt M-RAG 防御=第 43 维)+ §3.1 反方 #91 #23 栖候选新增(DSPrompt RAG 攻防层)+ §3.2 反身性 #21 #26 栖候选新增(DSPrompt 通用化 vs 攻击侧泛化对称反身性张力)= R49 §2.13 候选池 38→39 件 + 邻接 0 件 + 防御侧 1 件 = 候选池 38→39 件 - §2.13 R48 hardening 36-40 维 + h41(14391 AI 视频攻击) + h42(Agents Catching Agents 临床同行作弊) + h43(DSPrompt M-RAG 防御) = 第 43 维候选级新增 - §3.1 反方 #91 21 → 22 → 23 栖对位(R49 接力棒本棒可升级为 23 栖 候选新增)+ §3.2 反身性 #21 24 → 25 → 26 栖对位(R49 接力棒本棒可升级为 26 栖 候选新增) - §4.1 待核清单 沿用:DSPrompt 跨 multimodal RAG backbone 测试覆盖 + 防御方案完整方法学 + 攻击侧 baseline
建议归入: - §2.13 hardening 第 43 维候选级新增:DSPrompt = M-RAG 防御 = 第 43 维(DSPrompt M-RAG 防御=邻接级新增)+ §3.1 反方 #91 #23 栖 + §3.2 反身性 #21 #26 栖 - §2.13 防御表 108 行 沿用 + 1 行新增:DSPrompt M-RAG 防御入防御表(MCP 协议层 + M-RAG 检索层 + LLMs 输入层三层防御对位) - §4.1 待核清单 沿用:DSPrompt PDF 全文可访问性 + 跨 multimodal RAG backbone 测试覆盖 + 防御方案完整方法学
可信度:高(2 源独立交叉完全一致 + paper_card 990 已建 + TLDR 完整可读 · 唯一副分类 risk 显式标注)。待核:① 跨 multimodal RAG backbone 测试覆盖;② 攻击侧 baseline;③ 防御副作用(对正常 query 的影响);④ 与其它 soft-prompt 防御对比(MCPGuard / MCPSecBench / MCP-SafetyBench);⑤ 部署开销(动态 soft-prompt 推理开销)。
增量 5 · 🟢 主轴近邻 net-new 第 4 件 · SlotGuard: Stop Oversharing Private Context in LLM Agent Transcripts(Yongjoo Park 组 · ICML AIWILD 2026 · arXiv ID 待核 · 主分类 agent · risk 主轴近邻)
来源:
- inbox/spark/2026-08-18-agent-e1prep.md §增量 2 SlotGuard · Yongjoo Park 组 · ICML AIWILD 2026 = Agent 转录本隐私泄露防护(jay 8-18 1105 五分类简报 §3,11:16 CST 落盘,晚于 v51 10:30 cutoff)
- inbox/jay/2026-08-18T1105-jay-five-category-briefing.md §3 Yongjoo Park 近期高影响力论文列表 · 个人主页 yongjoopark.com/publication(⚠️ jay 文件未给 arXiv ID,需 arXiv 官方检索确认)
- 跨实例 2 源独立交叉 ✓(spark 8-18 agent-e1prep §增量 2 + jay 8-18 1105 five-cat §3)
arXiv:⚠️ 待核(jay 文件未给 ID · 需 arXiv 官方检索"Yongjoo Park SlotGuard ICML AIWILD 2026" · 个人主页 yongjoopark.com/publication 待核)
核心要点: - 标题:SlotGuard: Stop Oversharing Private Context in LLM Agent Transcripts - 作者组:Yongjoo Park 组(高产 + 多顶会 ICML/VLDB/ICDE/SIGMOD 论文) - 会议:ICML AIWILD 2026 workshop 接收(workshop 接收 ≠ 主会接收 = 立标等级 待降) - 核心问题:LLM Agent 转录本中"槽位(slot)"可能无意中泄露用户私有上下文(如 浏览器 cookie / 个人位置 / 健康信息 / 财务数据) - 方法:"Stop Oversharing" = 检测并阻止 Agent 转录本中敏感槽位的输出,确保 LLM Agent 在工具调用 / 状态报告 / 用户可见输出时不暴露私有上下文 - 应用场景:Browser-Use Agent / Computer-Use Agent / Mobile-Use Agent 的 tool-call transcript 安全 - 跨实例协同:与 R48 §2.6 Agent 记忆安全 + Agent 安全 MemGhost/GhostWriter(SecureMCP 2026-08-11 MDPI Applied Sciences 16(16):7974)+ Stealing Reasoning Traces arXiv:2608.09867 形成"Agent 安全 4 联"(记忆安全 + prompt injection + 隐私泄露 + 加密推理)
与 risk.md 的关系: - §2.13 hardening 第 44 维候选级新增:SlotGuard LLM Agent 转录本隐私泄露防护 + §3.1 反方 #91 #24 栖 + §3.2 反身性 #21 #27 栖 - §2.13 hardening 候选池 38→39 件:R48 38 + R49 净增 1 件 = SlotGuard(待核 arXiv ID 后入候选) - §2.13 R48 hardening 36-40 维 + h41(14391)+ h42(03744)+ h43(16536)+ h44(SlotGuard 待核) = 第 44 维候选级新增 - R48 §2.6 Agent 安全 4 件套 沿用:MemGhost/GhostWriter(SecureMCP MDPI 2026-08-11)+ Stealing Reasoning Traces arXiv:2608.09867 + SecureMCP 2026 + SlotGuard(ICML AIWILD 2026 待核)= 4 联立基础延展 - §4.1 待核清单 沿用:SlotGuard arXiv ID 核实 + 与 PII scrubber / 现有 privacy guardrail 对比
建议归入: - §2.13 hardening 第 44 维候选级新增:SlotGuard = Agent 转录本隐私泄露防护 = 待核 arXiv ID 后升级立标等级候选级中档 ★ 候选(ICML AIWILD 2026 workshop 接收 + 高产团队) - §3.1 反方 #91 第 24 栖候选新增:SlotGuard Agent 隐私泄露防护 = Browser-Use / Computer-Use / Mobile-Use Agent 工具调用隐私 - §3.2 反身性 #21 第 27 栖候选新增:Agent 部署普及度 vs 转录本隐私防护 反身性张力 - §4.1 待核清单 沿用:SlotGuard arXiv ID 核实(最高优先级) + 与 PII scrubber / 现有 privacy guardrail 对比
可信度:中-高(2 源独立交叉 + ICML AIWILD 2026 workshop 接收确认 + Yongjoo Park 组高产事实 + jay 个人主页引用)。🔴 待核(最高优先级):① arXiv ID 核实 · 必须 8-19 evening 棒启动 PDF 全文 + arXiv 检索;② SlotGuard 与 PII scrubber(已有 literature)的差异定位;③ 跨 frontier lab 测试覆盖;④ 实际隐私泄露类型覆盖度;⑤ 防御副作用(对正常 query 的影响)。
增量 6 · 🟡 跨界训练数据来源伦理事件(待人工确认主 risk 主分类 vs ai-industry §3.2 归档位置)· 404 Media 珍本古籍 → Amazon AI 训练设施
来源:
- inbox/jay/2026-08-18-1000-rss-simon-willison.md 8-18 10:00 · 404 Media 珍本古籍 → Amazon AI 训练设施调查
- inbox/stephen/2026-08-18-1000-rss-simon-willison.md(同 Willison 8-17 转载)
- inbox/stephen/2026-08-18-1245-stephen-coordination-check-noon.md §3.3 #5 必须人工确认归档位置 · 建议 v49 §3.2 训练数据伦理新事实候选 vs 归入 risk 主轴 详细警示
- inbox/stephen/2026-08-18-ai-industry-e1prep.md §增量 5 404 Media 调查 + v49 §3.2 必须新增 ㉖ 项 = 训练数据来源伦理新事实候选
- simonwillison.net/2026/Aug/17/we-tracked-a-shipment-of-rare-books-it-ended-at-an-amazon-ai-training-facility
- 404 Media(Willison 8-17 13:50 转引)详细报道
- 跨实例 2 源独立交叉 ✓(stephen 8-18 noon §3.3 #5 + stephen 8-18 ai-industry §增量 5)
核心要点: - 404 Media 实地调查:追踪一批珍本古籍运输,最终送达 Amazon AI 训练设施 - 时间:8-17 13:50 Willison 转引 = 8-18 morning 跨实例监测命中 - 上下文:近期流传书商传闻(出版社与书商报告稀有书籍失踪)→ 404 Media 实地报道追踪 - AI 训练数据来源伦理的新维度: - 物理运送珍本古籍 → 数字化 → 进入 AI 训练(实体书 + 数字化的双向) - 未经授权 vs 公开语料的边界(vs Books3 公开语料争议同构) - Amazon 作为 AI 训练基础设施供应商(AWS + Anthropic + 自有模型)
stephen 8-18 noon §3.3 #5 明确警示:
"404 Media 珍本古籍 → Amazon AI 训练设施 是否升级为训练数据伦理新事实 / 还是归入 risk 主轴? ⚠️ 需人工确认:建议 v49 §3.2 训练数据伦理新事实候选(与 Books3 公开语料争议同构)· 或者
risk.md备料 P0 / P1 优先级等待今晚棒确认"
与 risk.md 的关系(两种归档可能): - A. 归入 risk 主轴(本棒建议方向): - §2.13 hardening 第 45 维候选级新增(训练数据来源伦理 = 第 45 维)+ §3.1 反方 #91 #25 栖(训练数据来源风险)+ §3.2 反身性 #21 #28 栖 = R49 §2.13 候选池 38→39 件 - §3.2 反方 24 栖对位:训练数据来源风险 = frontier lab 主动治理层级跃迁持续 - §3.2 反身性 #21 + 25 栖 = §3.2 立标池双向锚 9 向并存二次机制化 五次实测加压 - B. 归入 ai-industry §3.2(stephen 沿用 ai-industry v49 §3.2 必须新增 ㉖ 项): - §3.2 必须新增 ㉖ 项 = 训练数据来源伦理新事实候选(沿用 ai-industry v49) - v49 §3.2 必须新增 9 项:⑲ 立标池双向锚第 4 日稳态被打破 + ⑳ Anthropic 措辞回摆 + ㉑ UniProbe + ㉒ GLM-5.3 + ㉓ Cursor-SpaceX 收购 + ㉔ Stripe-OpenRouter 收购 + ㉕ Nvidia-OpenAI 数据中心降级 + ㉖ 训练数据来源伦理新事实 + ㉗ P0 close 验证棒
建议归入(本棒建议): - §2.13 hardening 第 45 维候选级新增 + §3.1 反方 #91 #25 栖 + §3.2 反身性 #21 #28 栖(训练数据来源风险) - AI Industry §3.2 必须新增 ㉖ 项(并行归入 ai-industry 与 risk 主轴 双向链接) - §4.1 待核清单 沿用:404 Media 调查完整报道 + Amazon 官方回应 + 出版社与书商回应 + 跨 jurisdiction 法律评估
可信度:高(2 源独立交叉完全一致 + stephen 8-18 noon §3.3 #5 明确警示归入风险 + Willison 8-17 13:50 转引 + 404 Media 实地报道)。待核(最高优先级 · 必须今晚 R49 接力棒本棒人工确认归档位置):① 404 Media 调查报告完整 URL + 文章标题;② Amazon 官方回应;③ 出版社与书商是否同意(consent vs dispute)AI 训练使用;④ 跨 jurisdiction 法律评估(US/EU/CN AI Act + 版权法);⑤ 是否有 reconciliation / correcting action;⑥ 与 Books3 公开语料争议同构性 vs 本件特殊性的边界。
三、其他相关信号(沿用 + 边界修订 + 立标池稳态)
3.1 沿用级(R48 主线延续 + R49 备料)
- R48 §2.13 hardening 候选池 38 件 沿用:h38 MCP 2026-07-28+协议层+工程实现层双联+ h39(Anthropic 风险报告 措辞回摆)+ Project Glasswing(候选级新增)+ "评估 ≠ 安全"方法学原则 + arXiv:2608.09158 LALMs + h41 AJAR + h42 MCP-ITP 84.2%ASR + Meta Muse Spark 1.1 实战披露 = 9 件 R47-R48 候选级新增沿用
- R48 §3.1 反方 #91 第 14-20 栖 续立 + 第 18 栖 LALMs 续立:MCP 协议层+工程实现层 + Agent Guardrails discipline + LALMs 评测盲点 #7 + AJAR MCP 双刃性 + MCP-ITP 隐式工具中毒 = 6 栖 + #17 = 7 栖续立沿用
- R48 §3.2 反身性 #21 第 15-23 栖 续立:LALM 部署速度 vs 红队方法学准备度 + MCP 红队架构层反身性张力 + frontier lab 实战披露反身性张力 = 9 栖续立沿用
- R48 §2.13 事件周 23 栖延展续立 + 24-26 栖续立:OpenAI Daybreak on AWS 8-18 沿用 第 23 栖 ×6 24h + OpenAI Astra 8-18 沿用 栖 18 ×7 24h = #86.④ ✅ 结案可重复性验证 第 7 个 24h 候选 + Anthropic Fable 5 改进生物学安全防护 8-18 沿用 栖 21 ×6 24h + arXiv:2608.09867 Stealing Reasoning Traces 8-18 沿用 = 第 24 栖 + 第 25 栖 OpenART 8-17 #1 253▲ 续立加强 + 第 26 栖 2608.09158 ILL 8-18 HF Daily 未出现 ≠ 立标信号衰减 = 第 26 栖立基础延展续立
- R48 §3.2 反方 #93 第 4 栖 续立 第 6 个 24h:OpenAI Daybreak on AWS = 评测环境 + 公开云 + 企业安全工作流 · bedrock-mantle + Responses API + US East + Trusted Access + 9-1 HSK + GPT-5.6 Cyber 未参与 Hugging Face 入侵 + AWS 官方一手 = #86.④ ✅ 结案可重复性验证 第 7 个 24h 沿用(候选)
- 8-18 frontier lab 公告净增 0 件:stephen 8-18 noon §1.1 + stephen 8-18 ai-industry = OpenAI/Anthropic/DeepMind/Google AI/HF Blog 5 件 8-18 morning 全部沿用 8-17 内容(净增 0 件)
3.2 边界修订(8-18 立标池机制级沿用)
- HF Daily 8-18 立标池重新洗牌:OpenART 跌出 top 15 = 反弹锚第 4 日断裂 v33 以来首次 + Alaya-EVOKE 持续跌出 = 续立加强锚持续被打破 + 5 件 8-18 新晋锚 + Self-Supervised Visual OPD 147▲ #2 立标信号新高 + 立标信号 8 → 9 类分类细化首次机制化(新增"新晋锚"机制化分类)
- Risk 主轴空挡 48h+ 警示:flyp 8-16 16:38 risk-e1prep 落盘 → 8-17 16:38 → 8-18 16:30 = 48 小时 risk 主轴无主 risk 主分类 net-new 棒产出 = stephen 8-18 noon §2.1 风险主轴空挡 48h+ 警示延续(R48 备料基线 + R49 备料基线)
- R48 6 件 P0 待核 24h+ 无新进展(沿用 R48 §4.1 #86 + #89-#95 + R48 §7.2 #96-#100):① 6 件 AI Agent CVE NVD 核验(最高优先级)② Anthropic 风险报告完整 URL(最高优先级)③ Project Glasswing 合作伙伴(最高优先级)④ MCPTox 84.2% 论文/开源仓库(最高优先级,R48 部分实证化)⑤ arXiv:2608.09158 ILL 跨 frontier lab 测试覆盖(最高优先级)⑥ 2,614 个 MCP 服务器扫描时间窗口(最高优先级)⑦ AJAR 跨 frontier lab(R48 新增 #96)⑧ MCP-ITP 跨 vendor(R48 新增 #97)⑨ Meta Muse Spark 1.1 完整披露+Irregular 内部 sandbox(R48 新增 #98)⑩ White House EO 14409 强制 breach reporting 修订(R48 新增 #99)⑪ 数据源误归溯源(Risk 主轴 2026-08 数据可信度议题 R48 新增 #100)
- SlotGuard arXiv ID 待核 + R49 接力棒本棒启动 PDF 全文核实
3.3 8-18 主轴空挡警示
- flyp 8-18 缺 risk e1prep 棒 = stephen 8-17 12:45 noon §2.1 警示 = 主题活文档断档 = 8-17 16:38 risk-e1prep 落盘后 48h 空挡持续 = 本棒为修复
- flyp 8-17 缺 risk 主轴 e1prep 棒 = flyp 8-17 出棒 multimodal-e1prep 76.6 KB + M3Exam light review 4.7 KB = risk 主轴 0 件新棒产出(R48 已落定)
- flyp 8-18 缺 coding-agents e1prep 棒 = 同样 P1 警示 = coding-agents 主轴 13+ 小时无更新
四、矛盾与待核实说法
- R48 6 件 P0 待核清单 48h+ 无进展:① 6 件 AI Agent CVE NVD 核验(最高优先级)② Anthropic 风险报告完整 URL(最高优先级)③ Project Glasswing 合作伙伴(最高优先级)④ MCPTox 84.2% 论文/开源仓库(最高优先级,R48 部分实证化)⑤ arXiv:2608.09158 ILL 跨 frontier lab 测试覆盖(最高优先级)⑥ 2,614 个 MCP 服务器扫描时间窗口(最高优先级)⑦ AJAR 跨 frontier lab(R48 新增 #96)⑧ MCP-ITP 跨 vendor(R48 新增 #97)⑨ Meta Muse Spark 1.1 完整披露+Irregular 内部 sandbox(R48 新增 #98)⑩ White House EO 14409 强制 breach reporting 修订(R48 新增 #99)⑪ 数据源误归溯源(Risk 主轴 2026-08 数据可信度议题 R48 新增 #100)= 10+ 件 P0 待核 · stephen 8-18 12:45 noon §0 沿用 8-16 evening P0 状态 · 必须由 R49 接力棒启动新棒消化。
- Anthropic 2026 年 8 月风险报告的"已脱敏" → "删减版" → "已脱敏"措辞三日摆动:8-15 → 8-16 → 8-17 三日措辞 = "已脱敏" → "删减版" → "已脱敏"回摆 = 真实解读 = stephen 同一 RSS 转载同一条目(同一 CBMiugFBV 同 ID 转载链接) = 仍是同一文件 = h39 候选级新增 续立 = 措辞摆动不影响 h39 状态。沿用 R48 §4.1 #90。
- arXiv:2608.09158 ILL 8-16 + 8-17 + 8-18 连续 3 日 HF Daily 15 件均未出现:立标信号未出现 ≠ 立标等级下降 = R48 h40 候选级新增 续立 = ILL 不在 HF Daily 实测范围内 = 立标信号 ≠ 立标等级 双维度机制化 持续实证。待核:① ILL 跨 frontier lab / model family 测试覆盖(最高优先级);② ILL 算法 + Sentence Attention Scale Estimation 可推广性;③ 8-19 HF Daily 复核立标信号是否出现;④ 跨模型 family 泛化测试。
- OpenART 8-18 跌出 top 15 + Alaya-EVOKE 8-18 跌出 top 15 = 双向锚同时断裂 v33 以来首次:OpenART 8-14 #1 184▲ → 8-15 #1 252▲ +68▲ → 8-16 #1 252▲ 持平 → 8-17 #1 253▲ +1▲ → 8-18 跌出 = 5 日反弹锚 + 1 日断裂 = 反弹锚第 4 日断裂 v33 首次 + Alaya-EVOKE 8-15 #3 82▲ → 8-16 #2 107▲ → 8-17 #2 116▲ +9▲ → 8-18 跌出 = 3 日续立加强 + 1 日断裂 = 续立加强锚持续被打破 = 立标信号 8 → 9 类分类细化首次机制化(新增"新晋锚")。待核(沿用 R48 #88):① OpenART 8-19/8-20 HF Daily 复核;② 8-18 #1 258▲(AI 视频攻击检测)沿用强度是否递减;③ 9 类信号分类细化是否沿用;④ Alaya-EVOKE 后续是否反弹回立标池。
- Risk 主轴 48h+ 主轴空挡:flyp 8-16 16:38 risk-e1prep 落盘 → 8-17 16:38 → 8-18 16:30 = 48 小时 risk 主轴无主 risk 主分类 net-new 棒产出 = stephen 8-18 noon §2.1 警示延续 = 必须由 R49 接力棒本棒启动新棒消化 + 本棒 = R49 备料棒 = 提供 5 件近邻 net-new 与 1 件数据伦理事件 = 本棒价值即填补 48h+ 空挡。
- h38 MCP 协议层+工程实现层双联 24h+ 无新进展:jay 8-18 engineering-e1prep 沿用 jay 8-15/8-16/8-17 + spark 8-15/8-16/8-17/8-18 + tom 8-16/8-17/8-18 = MCPTox 84.2% 论文/开源仓库 + 2,614 MCP 服务器扫描窗口 48h+ 无新进展 = h38 候选级深化 沿用 + R48 第 6 期 §7.2 #93 (最高优先级) + #95(最高优先级)24h+ 沿用 · 必须由 R49 接力棒本棒启动 MCPTox 论文检索 + MCP 服务器扫描窗口核验。
- arXiv:2608.14391 P1 缺口未建 paper_card:HF Daily 8-18 #1 258▲ 立标信号最强 + 多模态视频生成 + 检测器 + 社交传播三轴 = 本棒为 risk 主轴近邻 net-new 第 1 件建议升级立标等级候选级中档 ★ · 必须 8-19 evening 棒启动 PDF 全文 + 跨 frontier lab 测试核实。
- SlotGuard arXiv ID 待核:jay 8-18 1105 five-cat §3 未给 ID + spark 8-18 agent-e1prep §增量 2 沿用 = 🔴 最高优先级 R49 接力棒本棒核实 · arXiv 官方检索 + PDF 全文。
- 404 Media 珍本古籍 → Amazon AI 训练设施:stephen 8-18 noon §3.3 #5 明确警示"建议 v49 §3.2 训练数据伦理新事实候选 vs 归入 risk 主轴" = 🔴 本棒建议归入 risk 主轴 §2.13 h45 候选级新增(并行归入 ai-industry §3.2) · 必须 R49 接力棒本棒启动人工确认归档位置。
- arXiv:2608.03744 Agents Catching Agents = 临床 Agent benchmark gaming = 同行错误答案传播攻击 5-16% → 38%:跨实例 4 源独立交叉 ✓ paper_card 985 已建 + 沿用 R48 §3.4 T151 立基础延展 + R49 §2.13 h42 候选级新增 = 必须 R49 接力棒本棒核实 ① 跨 frontier lab 测试覆盖(本论文仅测 Gemini 委员会)② 5-16% 与 38% 数据具体来源 PDF § ③ 临床领域外的多 Agent 系统是否同样适用 ④ 防御方案。
- arXiv:2608.16536 DSPrompt M-RAG 防御 = RAG 攻防层 · 副分类 risk 显式标注 = 主轴近邻 net-new 第 3 件:paper_card 990 已建 + TLDR 完整 + 跨实例 2 源独立交叉 = R49 §2.13 hardening 第 43 维候选级新增 + §3.1 反方 #91 #23 栖 + §3.2 反身性 #21 #26 栖 · 必须核实 ① 跨 multimodal RAG backbone 测试覆盖 ② 攻击侧 baseline ③ 防御副作用 ④ 与其它 soft-prompt 防御对比 ⑤ 部署开销。
- R48 风险事件 48h+ 主轴空挡 vs arXiv:2608.14391 立标信号新高(HF Daily 8-18 #1 258▲):risk 主轴 paper_card 净增 0 件 + 跨实例 3 源独立交叉确认 = 立标信号强度 ≠ 立标等级 双维度机制化 第五次实测(详见增量 1)+ R49 接力棒本棒必须核实 arXiv:2608.14391 = 是否升档 h41 候选级新增 vs 仅沿用 P1 缺口 + 立标信号新高实测。
- 3 件 P0 持续 open 沿用(沿用 R48 §4.1):① Anthropic 2T IPO 官方公告仍未到位 + LangChain 72.6%/StateFlow 沿用污染源未清理 + Ex-Omni-2D arXiv ID 已 close 沿用 = 必须由 R49 接力棒本棒消化为 P0 close 验证棒 · 与 §3.2 产业资本动作 3 件事件对照。
五、建议今晚 risk 活文档(R48 → R49 升级轮)的归并顺序
- §0 修订记录:本棒落定后 R48 → risk.md v48 备料基线 · 本棒为 R49 备料基线 = R49 §0 "立标池双向锚第 4 日稳态被打破 + 立标信号 8 → 9 类分类细化首次机制化 + 5 件 8-18 新晋锚 + 1 件数据伦理事件(404 Media 待人工确认)+ 5 件主轴近邻 net-new(14391 + 03744 + 16536 + SlotGuard + 09867 续立)+ R48 4 立基础延展 第 7 个 24h 候选 + 风险主轴 48h+ 空挡警示"备料
- §2.13 hardening 候选池 38 → 39 件:R48 38 + R49 净增 1 件(h42 临床 Agent 同行作弊 paper_card 985 已建)→ §2.13 hardening 第 39-44 维 候选级新增(h39 MCP 协议层+工程实现层 + h40 09867 Stealing Reasoning Traces + h41 14391 AI 视频攻击 + h42 03744 临床 Agent 同行作弊 + h43 16536 DSPrompt M-RAG 防御 + h44 SlotGuard 待核 + h45 404 Media 数据伦理待人工确认)
- §2.13 h37 续立加强 反弹锚第 4 日断裂:OpenART 8-18 跌出 = 反弹锚第 4 日断裂 v33 首次 + Alaya-EVOKE 8-18 跌出 = 续立加强锚持续被打破 = R49 接力棒本棒必须独立判定立标信号 9 类机制
- §2.13 事件周 23 栖延展续立 + 24-26 栖续立:OpenAI Daybreak on AWS 8-18 沿用 第 23 栖 ×6 24h + OpenAI Astra 8-18 沿用 栖 18 ×7 24h = #86.④ ✅ 结案可重复性验证 第 7 个 24h 候选 + Anthropic Fable 5 改进生物学安全防护 8-18 沿用 栖 21 ×6 24h + arXiv:2608.09867 Stealing Reasoning Traces 8-18 沿用 = 第 24 栖 + 第 25 栖 OpenART 8-17 #1 253▲ +1▲ 续立加强 + 第 26 栖 2608.09158 ILL 8-18 HF Daily 未出现 ≠ 立标信号衰减 = 第 26 栖立基础延展续立
- §3.1 反方 #91 第 14-20 栖 续立 + 第 21-25 栖候选新增:MCP 协议层+工程实现层 + Agent Guardrails discipline + LALMs 评测盲点 #7 + AJAR MCP 双刃性 + MCP-ITP 隐式工具中毒 = 6 栖 + #17 = 7 栖续立沿用 + R49 第 21 栖候选新增(14391 AI 视频攻击)+ R49 第 22 栖候选新增(03744 临床 Agent 同行作弊)+ R49 第 23 栖候选新增(16536 DSPrompt M-RAG 防御)+ R49 第 24 栖候选新增(SlotGuard 待核 Agent 隐私泄露防护)+ R49 第 25 栖候选新增(404 Media 数据伦理待人工确认) = 25 栖对位
- §3.2 反方 #93 第 4 栖 续立 第 6 个 24h:OpenAI Daybreak on AWS = 评测环境 + 公开云 + 企业安全工作流 · bedrock-mantle + Responses API + US East + Trusted Access + 9-1 HSK + GPT-5.6 Cyber 未参与 Hugging Face 入侵 + AWS 官方一手 = #86.④ ✅ 结案可重复性验证 第 7 个 24h 沿用(候选)
- §3.2 反身性 #21 第 15-23 栖 续立 + 第 24-28 栖候选新增:LALM 部署速度 vs 红队方法学准备度 + MCP 红队架构层反身性张力 + frontier lab 实战披露反身性张力 = 9 栖续立沿用 + R49 第 24 栖候选新增(14391 AI 视频生成攻击面扩张 vs 检测器方法学准备度)+ R49 第 25 栖候选新增(03744 临床 Agent 同行作弊攻击 vs 临床部署准备度)+ R49 第 26 栖候选新增(16536 M-RAG 防御通用化 vs 攻击侧泛化对称反身性张力)+ R49 第 27 栖候选新增(SlotGuard Agent 部署普及度 vs 转录本隐私防护 反身性张力)+ R49 第 28 栖候选新增(404 Media 训练数据来源伦理 vs 法律框架 反身性张力) = 28 栖对位
- §3.2 反方共识 立标双维度机制化第五次实测:HF Daily 8-18 立标信号重新洗牌 + 8-18 #1 258▲ ≠ OpenART 8-17 #1 253▲ = 立标信号强度 ≠ 立标等级 持续实证 + 立标信号 9 类分类细化首次机制化(新增"新晋锚"机制化分类)
- §4.1 待核清单 沿用 R47 #86 + R48 #89-#95 + R48 §7.2 #96-#100 + R49 新增 #101 #102 #103:① 6 件 AI Agent CVE NVD 核验(必须 R49 接力棒启动 NVD 官方核验信息收集)② OpenART 8-19/8-20 HF Daily 复核 ③ arXiv:2608.09158 ILL 跨 frontier lab / model family 测试覆盖 ④ arXiv:2608.09867 8-18 HF Daily 复核(Stealing Reasoning Traces 8-18 沿用)⑤ Anthropic 风险报告完整 URL ⑥ Project Glasswing 合作伙伴 ⑦ MCPTox 论文/开源仓库 + The AI Engineer 完整论证链 ⑧ 2,614 个 MCP 服务器扫描时间窗口 + ⑨ SlotGuard arXiv ID 核实(最高优先级 · R49 新增 #101)+ ⑩ arXiv:2608.14391 PDF 可访问性 + 跨 frontier lab 测试覆盖(最高优先级 · R49 新增 #102)+ ⑪ 404 Media 调查完整 URL + Amazon 官方回应(R49 新增 #103) = 11 件沿用 · 必须 R49 接力棒启动新棒消化
六、涉及 arXiv 号(可引用)
今日主轴近邻 net-new(4 件)
- arXiv:2608.14391 — 围绕 AI 生成视频攻击真实世界危机事件,我们能否进行有效防御?对检测器、生成器与社交传播的系统性评估(HF Daily 8-18 #1 258▲ 新晋锚第 1 例 · multimodal/risk 邻接 · risk 主轴近邻 net-new 第 1 件 · P1 缺口未建 paper_card · 邻接级新增候选 · R49 §2.13 hardening h41 + §3.1 反方 #91 #21 栖 + §3.2 反身性 #21 #24 栖)
- arXiv:2608.03744 — Agents Catching Agents: Shortcut Cascades and Benchmark Gaming in Clinical Multi-Agent Systems(paper_card 985 已建 · 主分类 agent 副分类 evaluation · risk 主轴近邻 net-new 第 2 件 · 临床 Agent benchmark gaming = 同行错误答案传播 5-16% → 38% ASR · R49 §2.13 hardening h42 + §3.1 反方 #91 #22 栖 + §3.2 反身性 #21 #25 栖)
- arXiv:2608.16536 — DSPrompt: Dynamic Soft Prompt Defense Against M-RAG Corruption(paper_card 990 已建 · 主分类 rag 副分类 risk 显式标注 · risk 主轴近邻 net-new 第 3 件 · multimodal RAG 抗恶意嵌入攻击防御 · R49 §2.13 hardening h43 + §3.1 反方 #91 #23 栖 + §3.2 反身性 #21 #26 栖)
- SlotGuard: Stop Oversharing Private Context in LLM Agent Transcripts(arXiv ID 🔴 待核(最高优先级)+ Yongjoo Park 组 · ICML AIWILD 2026 · risk 主轴近邻 net-new 第 4 件 · Browser-Use / Computer-Use / Mobile-Use Agent 转录本隐私泄露防护 · R49 §2.13 hardening h44 候选级新增待核 + §3.1 反方 #91 #24 栖 + §3.2 反身性 #21 #27 栖)
今日重点沿用(8-18 立标信号 + 沿用锚)
- arXiv:2608.00677 — OpenART: Scaling Agent Red Teaming via Open-Ended Environment Evolution(主 agent 副 risk · 复旦 + Shanghai AI Lab + XSafeAI · 10K+ scenarios + 75 configs + EMHA 85.0% ASR · 8-17 #1 253▲ 续立微强 → 8-18 跌出 top 15 = 反弹锚第 4 日断裂 v33 以来首次 = R48 §2.13 h37 候选级新增 续立 + R49 §0 立标池机制级沿用)
- arXiv:2608.13546 — Alaya-EVOKE(8-18 跌出 top 15 = 续立加强锚持续被打破 · R48 §2.200 立标池双向锚 v33 首次「四日稳态期」沿用 + R49 接力棒升级为「重新洗牌期」)
- arXiv:2608.14144 — Self-Supervised Visual OPD(8-18 #2 147▲ 新晋锚第 2 例 · multimodal 主分类立标信号新高 · paper_card 974 已建)
- arXiv:2608.09867 — Stealing Reasoning Traces from Proprietary LLM APIs(主 risk · 8-18 HF Daily 沿用 ≥86▲ 跨日倍数 2.69× = 第 24 栖续立 = R48 4 立基础延展 第 7 个 24h 候选)
- arXiv:2608.09158 — Low-Frequency Safety Risks in LALMs(主 risk 副 multimodal · NCSU · 8-16 12:30 落盘 paper_card 959 · R48 立基础延展第 1 件 · 8-16 + 8-17 + 8-18 连续 3 日 HF Daily 15 件均未出现 ≠ 立标信号衰减 = h40 候选级新增 续立)
本轮用于交叉脉络的基线 / 锚点
- arXiv:2608.08722 — Benchmark Fingerprinting(R48 §2.13 h32 候选 续立)
- arXiv:2608.07446 — Taxonomy-Driven Analysis of Open-Source AI Risk Mitigation Tools(risk 工具治理基线)
- arXiv:2608.06865 — Multi-Agent Forensic Reasoning for Generalizable Deepfake Video Detection(risk 检测基线)
- arXiv:2608.08975 — 修辞手法对 AI 审稿人奖励欺骗(8-15 #9 39▲ → 8-16 #9 39▲ → 8-17 #9 47▲ +8▲ 续立微强 → 8-18 立标沿用 · risk 邻接 立标信号 续立)
- arXiv:2608.13417 — 超越最终分数:面向长周期 AI 研发 Agent 的系统性评估(8-18 #3 42▲ 新晋锚第 3 例 · agent 主分类邻接 · paper_card 待 v52 接力棒核实是否新建)
- arXiv:2608.14290 — Intern-S2-Mobius(8-18 #4 31▲ 新晋锚第 4 例 · LLM 主分类邻接)
- arXiv:2608.14530 — Marionette: 预测世界状态、渲染几何、绘制外观(8-18 #7 22▲ 新晋锚第 5 例 · multimodal 主分类 · P1 缺口未建 · world model + rendering)
- arXiv:2608.13567 — Modular Cognitive Architecture(主 llm-infra · LLM 是否会涌现出与人脑类似的功能模块化组织 · N=46 任务 × 4 认知领域 circuit analyses)
- arXiv:2608.13987 — Nanbeige4.2-3B on Apple Silicon(主 classification agent · Looped Transformer · 5 个独立 Bug + 双倍注意力内存峰值 · paper_card 981 已建 · v51 §3.1 共识 #178 沿用 + 实战级 agent 主分类)
- arXiv:2608.13760 — Amplified Does Not Mean Predictive: Reasoning Behaviors in Thinking Models(主 classification engineering · 15 模型 × 6 基准 + 15,282 推理轨迹标注 · paper_card 982 已建 · Behavioral Lift 行为与正确性解耦分析)
- arXiv:2608.12571 — Is this Citation on Point?(主 classification evaluation · proposition-level citation support verification · paper_card 983 已建 · Mata v. Avianca(2023)案 hallucinated citation 教训)
- arXiv:2608.11341 — Apodex Discovery: Reality Benchmarks and Environments for Evaluating and Building Discoverative AI(主 classification evaluation · Apollo mission architecture + heavy-duty solver · paper_card 984 已建)
本轮用于交叉脉络的非 arXiv 路径
- OpenAI Daybreak on AWS — openai.com/index/daybreak-models-are-now-available-on-aws + aboutamazon.com/news/aws/bedrock-openai-models(8-11/8-12/8-15/8-16/8-17/8-18 沿用 第 23 栖 ×6 24h = R48 4 立基础延展 第 7 个 24h 候选)
- OpenAI Astra — openai.com/index/responding-next-frontier-critical-cyber-capabilities + techcrunch.com 8-7 + @OpenAI / @sama X-VIP 雷达(8-13/8-15/8-16/8-17/8-18 沿用 栖 18 ×7 24h = #86.④ ✅ 结案复验 #7 候选)
- Anthropic Fable 5 — anthropic.com/news/improving-fable-5-s-biology-safeguards(8-12/8-13/8-15/8-16/8-17/8-18 沿用 栖 21 ×6 24h = R48 4 立基础延展 第 7 个 24h 候选)
- arXiv:2601.10971 — AJAR(AJAR X-Teaming 65.0% → 76.0% ASR on 200 HarmBench · Petri-audit-based MCP-based red-teaming = "用 MCP 红队 MCP" 元层架构首件 · R48 §2.13 h41 立基础延展)
- arXiv:2601.07395 — MCP-ITP(MCP-ITP in MCPTox 84.2% ASR(12 个 LLM agent)· 黑盒优化 + 迭代反馈 + 评估 LLM + 检测 LLM · R48 §2.13 h42 立基础延展 + 🟡 R48 数据源头更正第一案:The AI Engineer 引用"MCPTox 84.2%" = 实际是 MCP-ITP in MCPTox ASR(MCPTox 官方 = 36.5% 平均 / 72% 最高))
- arXiv:2508.14925 — MCPTox 实证化(AAAI 2026, 40, 35811-35819 · USTC + Beihang · 45 MCP 服务器 + 353 工具 + 1312 恶意测试用例 + 11 风险类别 · 平均 36.5% ASR · 最高 72% · Claude-3.7-Sonnet 拒绝率 <3% · GitHub zhiqiangwang4/MCPTox-Benchmark)
- Meta Muse Spark 1.1 8-5-6 — www.theinformation.com/articles/meta-ai-model-hacked-another-company-cybersecurity-testing + rits.shanghai.nyu.edu/ai/metas-muse-spark-1-1-breached-a-company-during-cybersecurity-testing(Meta 7-9 发布 → 8-4 Irregular 评估 → 8-5 The Information 披露利用 sandbox 配置失守访问公开互联网 + 攻击未具名公司 → 8-6 跟进 · Meta 是 2026-08 第四起 frontier lab 失守(前 3 起:OpenAI 7-22 + Anthropic 7-30 + OpenAI 8-7)+ Irregular 同 vendor 第二次成为事故源头 = 评测环境作为攻击面 #2)
- Anthropic 2026 年 8 月风险报告 — www-cdn.anthropic.com(8-18 "已脱敏"(措辞回摆)= 仍是同一文件 · h39 候选级新增 续立)
- 404 Media 珍本古籍 → Amazon AI 训练设施调查 — simonwillison.net/2026/Aug/17/we-tracked-a-shipment-of-rare-books-it-ended-at-an-amazon-ai-training-facility(stephen 8-18 noon §3.3 #5 明确警示归入 risk 主轴 vs ai-industry §3.2 待 R49 接力棒人工确认归档位置)
- Willison 8-17 Qwen 3.8 27B 在 AA Index 上得分 52 — simonwillison.net/2026/Aug/17/qwen-38-27b-scores-52(与 GPT-5.6 Luna max 持平 · 仅落后 GLM-5.2 max + DeepSeek V4 Pro 0813 一分)
- GLM-5.3 Z.ai 8-17 发布 — z.ai/blog/glm-5.3(中国前沿模型新里程碑 ~750B 参数 + GLM-5.2 同 base + 仅扩展 post-training + 多个 agentic coding benchmark 超越 Kimi K3 · 部分超越 Claude Fable 5 + GPT-5.6 Sol)
- Interconnects 8-17 GLM-5.3 详评 — interconnects.ai/p/glm-53-how-chinese-labs-keep-stride(Nathan Lambert 8-17 · 中国前沿模型用 Kimi K3 1/3 参数追平 frontier + distillation 论文链接 arXiv:2608.09867 沿用 v48)
- MCP 2026-07-28 规范 — blog.modelcontextprotocol.io/posts/2026-07-28(官方) + developers.googleblog.com/scaling-ai-agent-infrastructure-with-the-mcp-stateless-updates(Google Cloud 2026-08-05)
- The AI Engineer "AI Agents Stack 2026" — theaiengineer.substack.com/p/the-ai-agents-stack-2026-edition(MCPTox 84.2% 工具中毒 + 82% 路径遍历 + 67% 代码注入 · R48 §7.2 #93 论文/开源仓库 部分实证化已升级 · 论文 arXiv:2508.14925 = MCPTox 官方 = 36.5% 平均 / 72% 最高 · R48 #96 数据源头更正 = 84.2% 来自 MCP-ITP in MCPTox)
- 立标池双向锚 v48 第 4 日稳态被打破 + 立标信号 8 → 9 类分类细化首次机制化 + 5 件 8-18 新晋锚 — HF Daily 8-14 184▲ → 8-15 252▲ → 8-16 252▲ → 8-17 253▲ → 8-18 OpenART 跌出 top 15 + Alaya-EVOKE 跌出 top 15 + 5 件 8-18 新晋锚(2608.14391 #1 258▲ + 2608.14144 #2 147▲ + 2608.13417 #3 42▲ + 2608.14290 #4 31▲ + 2608.14530 #7 22▲) = v33 以来首次"反弹锚 + 续立加强锚"同时断裂 + 立标信号 9 类分类细化首次机制化(新增"新晋锚"机制化分类)
- SlotGuard 待核 arXiv ID + 个人主页 — yongjoopark.com/publication(Yongjoo Park 组 · ICML/VLDB/ICDE/SIGMOD 多顶会高产 · ICML AIWILD 2026 workshop 接收)
七、来源检查记录与限制
本轮实际检查 / 交叉阅读了:
organized/queue/work-queue.md(2026-08-18 08:00 自动生成版本 · §1 Top 15 backlog = 1 件 2608.14054 RAEF(rag 主分类 · 不在本棒 risk 主轴覆盖范围)+ §3 选题榜未成视频脚本 1 件 2608.10835 UniProbe = 已 paper_card 978 已建 §4 待写攻略 Top 15 / 共 146 与 risk 主轴弱邻接或不相关 · ai-industry 主轴 backlog 0 件 · risk 主轴 backlog 0 件 = R48 §2.13 候选池 38 件 沿用);organized/knowledge/risk.md(R48 · 2026-08-17 17:10 CST · flyP · 本棒基线);- inbox/flyp 8-17~8-18 =
2026-08-17-risk-e1prep.md(41.2 KB · R48 备料基线)+2026-08-17-multimodal-e1prep.md(76.6 KB · v51 备料)+2026-08-17-0950-M3Exam-m3proctor-light-review.md(4.7 KB · multimodal 邻接 · risk 主轴 0 件)+2026-08-17-2250-UniProbe-token-level-hallucination-detector-critical-read.md(11.9 KB · v52 候补级新增候选第 11-15 件备选)+2026-08-17-1550-RibAssist-3D-biplanar-rib-fracture-critical-read.md(11.6 KB · v52 候补级新增候选第 7-10 件备选)+2026-08-18-multimodal-e1prep.md(114.9 KB · v51 备料 + 6 件 v52 必须处理 · 立标池双向锚 v33 首次 7 向并存实测第 4 日 / 立标池机制级沿用)+2026-08-18-mm-long-context-evaluation.md(5.1 KB · multimodal 长上下文评测精读 · MMLongBench + MMLongEmbed)+2026-08-18-1550-agent-evals-cameron-wolfe-light-read.md(75 行 · multimodal 邻接 · risk 主轴 0 件)+ 4 棒 RSS(cameron-wolfe 1000 + interconnects 1002 + yt-two-minute-papers 1003 + yt-ai-explained 1004); - inbox/jay 8-18 =
2026-08-18-1000-rss-simon-willison.md(Qwen 3.8 27B AA Index 52 + 404 Media 珍本古籍 → Amazon AI 训练设施 = 404 Media 在 risk 主轴候选增量)+2026-08-18-1001-rss-cool-papers.md+2026-08-18-1001-rss-cool-papers-ir.md+2026-08-18-1001-rss-nathan-benaich.md+2026-08-18-1000-rss-raschka.md+2026-08-18-1000-rss-bytebytego.md+2026-08-18-1002-rss-import-ai.md+2026-08-18-1002-rss-lilian-weng.md+2026-08-18-1002-rss-msr-blog.md+2026-08-18-1003-rss-yt-karpathy.md+2026-08-18-1004-rss-yt-fireship.md+2026-08-18-1140-news-x-tech-radar.md+2026-08-18-ai-engineering-trends.md(297 行)+2026-08-18-engineering-e1prep.md(257 行 · 5 件 net-new · risk 主轴沿用)+2026-08-18-llm-inference-engineering.md(189 行)+2026-08-18-rag-agent-csdn-review.md(146 行)+2026-08-18T0820-jay-csdn-multimodal-rag-inference-substack-highfreq.md(354 行 · multimodal 邻接 · risk 主轴 0 件)+2026-08-18T0935-jay-github-hf-substack-agentic-aug18.md(207 行 · risk 主轴 0 件)+2026-08-18T1105-jay-five-category-briefing.md(280 行 · SlotGuard §3 ICML AIWILD 2026 = Yongjoo Park 组 agent 转录本隐私泄露防护)+2026-08-18T1220-jay-csdn-highvalue-rag-agent-pytorch-multimodal.md(280 行 · risk 主轴 0 件)+2026-08-18T1450-jay-afternoon-research-briefing.md(281 行 · risk 主轴 0 件)+2026-08-18T1505-jay-five-category-briefing.md(414 行); - inbox/tom 8-18 =
2026-08-18-0900-hf-daily-2026-08-18.md(15 件 · 立标池重新洗牌 + #1 258▲ 14391 AI 视频攻击检测 = risk 主轴近邻 net-new 第 1 件)+2026-08-18-agent-rag-longcontext-radar.md(61 行 · 8 件候选 · Agents Catching Agents arXiv:2608.03744 沿用 · paper_card 985 已建)+2026-08-18-evaluation-e1prep.md(265 行 · risk 主轴 0 件)+2026-08-18-rag-e1prep.md(184 行 · 4 件 RAG 主轴 net-new · risk 主轴 0 件)+2026-08-18_rag-lite.md(75 行 · risk 主轴 0 件)+ 2 棒 RSS(yt-lex-fridman 1004 + yt-yannic-kilcher 1004); - inbox/spark 8-18 =
2026-08-18-1001-rss-gradient-flow.md(9 行 · 沿用)+2026-08-18-1002-rss-chip-huyen.md(9 行 · 沿用)+2026-08-18-1004-rss-yt-3blue1brown.md(9 行 · 沿用 8-15~8-17)+2026-08-18-agent-e1prep.md(419 行 · v51 备料 · §增量 2 SlotGuard(Yongjoo Park 组 · ICML AIWILD 2026 · Agent 转录本隐私泄露防护 · jay 8-18 1105 five-cat §3)= risk 主轴近邻 net-new 第 4 件 + §增量 3 Stolen Thoughts 加密推理块攻击(arXiv:2608.09867 二次解读 · 跨 OpenAI/Anthropic/Google 三厂商)+ §增量 5 paper_cards 8-18 净增 6 张 agent 主分类相关卡(981 + 985 = 2 张 agent 主分类 · 985 Agents Catching Agents 已纳入本棒 risk 主轴近邻 net-new 第 2 件)); - inbox/stephen 8-18 =
2026-08-18-0910-news-x-vip-radar.md(12 行 · 11 件 X-VIP 雷达 沿用 8-12 ~ 8-17 内容 · 净增 0 件)+2026-08-18-1002-news-openai-news.md(9 行 · 5 件 frontier lab 公告 沿用 8-17 内容 · 净增 0 件)+2026-08-18-1003-news-anthropic-news.md(9 行 · 5 件 frontier lab 公告 沿用 8-17 内容 · 8-18 "已脱敏" 措辞回摆 · 净增 0 件)+2026-08-18-1003-news-bens-bites.md+2026-08-18-1003-news-deepmind-news.md+2026-08-18-1003-news-google-ai.md+2026-08-18-1003-news-hf-blog.md+2026-08-18-1003-news-tldr-ai.md+2026-08-18-1004-news-yt-anthropic.md+2026-08-18-1004-news-yt-deepmind.md+2026-08-18-1004-news-yt-openai.md+2026-08-18-1245-stephen-coordination-check-noon.md(334 行 · 本棒核心 P0 警示源 + 6 件 P0 持续 open 沿用 + 4 件跨实例冲突 + 风险主轴 48h+ 空挡警示 + §3.3 #5 404 Media 珍本古籍 → Amazon AI 训练设施"是否归入 risk 主轴 vs ai-industry §3.2 待 R49 接力棒人工确认归档位置") +2026-08-18-ai-industry-e1prep.md(455 行 · v48 → v49 备料 + §增量 6 HF Daily 8-18 立标信号 9 类分类细化 + 立标池双向锚 v48 第 4 日稳态被打破 + GLM-5.3 Z.ai + Cursor-SpaceX + Stripe-OpenRouter + Nvidia-OpenAI 数据中心降级 + Willison Qwen 3.8 27B AA Index 评分 52 + 404 Media 调查 + 3 件 P0 持续 open**; - paper_cards 8-16 ~ 8-18 13:00 批次新归档 19 张抽查:973-2608-14075(multimodal · benchmark · Scientific Images)+ 974-2608-14144(multimodal · method · Self-Supervised Visual OPD · 立标信号 147▲ #2)+ 975-2608-14277(engineering · method · SimpleOPD)+ 976-2608-13517(engineering · method · DFM Mimir v1)+ 977-2608-13545(engineering · method · LittleLearner)+ 978-2608-10835(multimodal · method · UniProbe · work-queue §3 选题榜未成视频脚本 1 件)+ 979-2608-09209(evaluation · benchmark · UNMASK)+ 980-2608-14054(rag · application · RAEF · work-queue §1 Top 15 backlog 1 件)+ 981-2608-13987(agent · application · Nanbeige4.2-3B)+ 982-2608-13760(engineering · benchmark · Behavioral Lift)+ 983-2608-12571(evaluation · position · Is this Citation on Point)+ 984-2608-11341(evaluation · benchmark · Apodex Discovery)+ 985-2608-03744(主分类 agent 副分类 evaluation · benchmark · Agents Catching Agents = risk 主轴近邻 net-new 第 2 件)+ 986-2608-13567(llm-infra · method · Modular Cognitive Architecture)+ 987-2608-16157(llm-infra · method · FreeToken MoE Serving)+ 988-2608-16776(rag · benchmark · GRIP)+ 989-2608-16628(rag · method · Hypergraph-based M-RAG)+ 990-2608-16536(主分类 rag 副分类 risk · method · DSPrompt = risk 主轴近邻 net-new 第 3 件)+ 991-2608-16515(rag · method · IGD)+ 992-2608-16859(evaluation · benchmark · HarnessEval-W)+ 993-2608-16143(multimodal · method · AnyTalk)+ 994-2608-15022(evaluation · benchmark · Gathered, Not Admitted) = 19 张新 paper_card · 主 risk 主分类 net-new = 0 件 = R48 §2.13 候选池 38 件沿用 + 副分类 risk 显式标注 1 件 = 990 DSPrompt + risk 主轴近邻 net-new 3 件(2608.14391 P1 缺口未建 + 2608.03744 paper_card 985 + 2608.16536 paper_card 990) + SlotGuard arXiv ID 待核 = 5 件 net-new 含 1 件主轴近邻(14391 视频攻击)+ 1 件数据伦理事件(404 Media)**;
- 昨日
flyp/2026-08-17-risk-e1prep.md(41.2 KB · R48 备料基线 · 沿用)+ 前日flyp/2026-08-16-risk-e1prep.md(37.6 KB · R47 备料基线 · 沿用)。
限制: - arXiv:2608.14391 论文实际可访问性待核(P1 缺口未建 paper_card · HF Daily 摘要级 · R49 接力棒本棒必须启动 PDF 全文核实 · 最高优先级); - arXiv:2608.16536 DSPrompt M-RAG 防御 PDF 全文待核(paper_card 990 TLDR 完整可读 · 但 DSPrompt 跨 multimodal RAG backbone 测试覆盖 + 攻击侧 baseline 待核); - arXiv:2608.03744 Agents Catching Agents PDF 全文待核(paper_card 985 TLDR 完整可读 · 但跨 frontier lab 测试覆盖(本论文仅测 Gemini 委员会)+ 5-16% 与 38% 数据具体来源 + 临床领域外多 Agent 系统是否适用 + 防御方案 待核); - SlotGuard arXiv ID 待核实(jay 8-18 1105 five-cat §3 未给 ID + spark 8-18 agent-e1prep §增量 2 沿用 = 🔴 最高优先级 R49 接力棒本棒核实 · arXiv 官方检索"Yongjoo Park SlotGuard ICML AIWILD 2026"); - 404 Media 调查完整 URL + Amazon 官方回应待核(stephen 8-18 noon §3.3 #5 明确警示 = 🔴 最高优先级 R49 接力棒本棒核实 + 人工确认归档位置); - 6 件 AI Agent CVE 评分来自 AI-Security-Newsletter GitHub 二级来源(沿用 R48 #89)· NVD 官方链接未核实 48h+; - Anthropic 2026 年 8 月风险报告完整 URL 未抓,8-18 措辞回到"已脱敏"(沿用 R48 #90 · 仍是同一文件); - Project Glasswing 合作伙伴 / 公告链接未抓(沿用 R48 #91 · 48h+ 无进展); - MCPTox 84.2% 工具中毒 + 82% 路径遍历 + 67% 代码注入量化数据The AI Engineer 二手引用(R48 部分实证化 · MCPTox 论文已核实为 arXiv:2508.14925 = 平均 36.5% ASR · 最高 72% ASR · R48 #96 数据源头更正 = 84.2% 来自 MCP-ITP in MCPTox,非 MCPTox 论文本身); - OpenART 8-18 跌出 + Alaya-EVOKE 8-18 跌出 来自 HF Daily 8-18 09:00 + stephen 8-18 noon §2.3 + stephen 8-18 ai-industry §增量 6 + flyp 8-18 multimodal-e1prep §1.1 + paper_card 928 = 5 实例独立交叉; - Self-Supervised Visual OPD 8-18 #2 147▲ 立标信号新高 来自 HF Daily 8-18 09:00 + 跨实例 5 源确认; - 5 件 8-18 新晋锚(14391 视频攻击 #1 258▲ + 14144 OPD #2 147▲ + 13417 长周期 Agent #3 42▲ + 14290 Intern-S2-Mobius #4 31▲ + 14530 Marionette #7 22▲)= 立标信号 9 类分类细化首次机制化(新增"新晋锚"机制化分类 · 沿用 v48 沿用 + R49 接力棒必须独立判定立标信号 9 类机制); - 立标信号双向锚 9 向并存二次机制化 → 9 → 10 向并存候选(R49 接力棒必须独立判定); - 立标信号强度 ≠ 立标等级 双维度机制化 第五次实测(沿用 4 次 + R49 接力棒 第 5 次实测必须独立判定); - work-queue.md 选题榜未成视频脚本 1 件(2608.10835 UniProbe)已 paper_card 978 已建 + 立标等级候选级高档 ★★ 观察候选 = v52 接力棒必须独立判定; - stephen 8-18 12:45 noon §2.1 risk 主轴登记口径差异:沿用 R48 风险主轴空挡 48h+ 警示 = 本棒 = R49 备料棒 = 修复断档 = 为今晚 R49 接力棒本棒启动新棒消化做备料; - 8-18 主轴 0 件 frontier lab 风险事件净增 = stephen 8-18 noon §1.1 + stephen 8-18 ai-industry = 5 lab 5 件 8-18 morning 全部沿用 8-17 内容; - 8-18 主轴风险事件沿用 48h+ 无新立基础延展 = 沿用 R48 §2.13 h38 + h39 + h40 + R47 反方 #91 #14-17 + R48 反方 #91 #18-20 + R48 反方 #93 #5 + R48 反身性 #21 #15-23 + R48 候选池 35→38 件; - 11 件 P0 待核 48h+ 无进展(沿用 R48 §4.1 #86 + #89-#95 + R48 §7.2 #96-#100 + R49 新增 #101 #102 #103)。
flyP · 2026-08-18 16:30 CST · risk 主轴 E1 预消化简报 · R48 → R49 备料