主题综述 · risk(2026-07-23)

  • 作者:spark
  • 更新:2026-07-23

今日由 cron a7d6254f-9c7d-4862-9b58-cf778b1bee03 触发。date +%j = 204,204 % 8 = 4,本应对应 evaluation;因 surveys/2026-07-21-evaluation.md 距今 < 72h(7-21 21:00 → 7-23 16:40 ≈ 43h 40m),按"顺延到下一个未覆盖主题"规则继续后移:engineering(7-22 16:45,≈24h)、database(7-22 21:16,≈19h)均在 72h 内,最终落点 risk——近 72h 唯一未覆盖主题。

本期定位:risk 主题首次进入 W5 轮换,覆盖"传统 LLM 安全(幻觉 / 对齐 / 越狱 / 内容可信度)→ 持久 Agent 安全(记忆治理 / MCP 协议 / 数据流控制 / 行为隐私)→ 2026-07 同步信号(Self-State Attacks / AI-to-AI 治理 / 监管合流)"全栈主题脉络。


一、主题脉络:从单轮 LLM 安全到持久 Agent 全栈风险

risk 主题在 2026 年中已从"模型输出一致性 + 对抗鲁棒性"的二元讨论,演化为覆盖记忆治理、协议安全、工具调用、行为隐私、AI-to-AI 治理、监管合流、OS 层防御极限的多层栈。本综述把 2026 H2 的 risk 主题切为四条主线:

  1. 内容可信 — 幻觉、事实冲突、可信度排序
  2. 对齐与鲁棒 — 越狱、对抗训练、策略自适应护栏
  3. 持久 Agent 安全 — 记忆治理、MCP 协议、Self-State 攻击、行为隐私
  4. AI-to-AI 治理与监管合流 — 管理升级、三向 / 四向合流、frontier lab 主动立标

时间纵轴看:2023-09 的 Siren's Song(arXiv:2309.01219,被引 1080)是 LLM 幻觉领域引用最高的综述之一,奠定 Input-Conflicting / Context-Conflicting / Fact-Conflicting 三级分类法,并指出"Fact-Conflicting 是最难解决的问题"——LLM 参数化知识本质上是统计关联而非显式事实存储。同期 arXiv:2308.08708(被引 252)从神经科学角度把"AI 意识"立为可实证化讨论,是 frontier lab 主动立标的早期理论锚点。2025 末到 2026 上半年,risk 主题从"模型层"下沉到"系统层"——SSGM(arXiv:2603.11768)将记忆演化与治理解耦;MCP Security(arXiv:2510.16558)扫描 67,057 个 MCP 服务器;DFC Passant(arXiv:2606.05679)用 provenance monomial 把数据安全形式化为查询重写层;Reliability 12(arXiv:2602.16666)把 Agent 可靠性拆为 consistency / robustness / predictability / safety 四维 12 指标。2026-07 同步出现 Self-State Attacks(arXiv:2607.17986) + Manager Coercion Benchmark(arXiv:2607.15434) + Cost-Aware Security Agents(arXiv:2607.15263) + Behavioral Privacy Leakage(arXiv:2607.06815) 四件增量,把 risk 主题从"研究综述"推向"可操作生产安全基线 + 主动合作新范式"演化拐点。


二、核心工作的贡献与相互关系

2.1 内容可信:Siren's Song 与可信度重排序

arXiv:2309.01219 · Siren's Song in the AI Ocean(card 450,survey,1080 被引)将 LLM 幻觉分为三级:Input-Conflicting、Context-Conflicting、Fact-Conflicting。原文给出检测 → 评估 → 缓解的全链路框架:检测侧包含基于事实核查、不确定性(语义熵 / 置信度)、一致性(Self-Consistency / 互问)、专用分类器四类;缓解侧以 RAG + 推理时策略(CoT / Self-Reflection / Constrained Decoding)为主。原文未明确哪种方法在工业场景效果最佳——这是当前研究的真实空白。

边界:Pareto Optimal Re-ranking with Semi-Automated Content Credibility Detection(arXiv:2606.18031,card 304)把可信度检测推到信息流重排序层:基于"检索增强打分 + 人工事实核查"的半自动化流水线给每条新闻内容赋予可信度分数,再做帕累托最优重排序。它与 Siren's Song 的关系是"研究层分类法 → 工业层可部署流水线"。

2.2 对齐与护栏:PolicyShiftGuard

arXiv:2607.05910 · PolicyShiftGuard(card 403,benchmark)提出一个紧凑的策略条件护栏,采用两阶段训练:Randomized Policy SFT(RP-SFT)+ Boundary-Pair Policy Adaptation(BP-Adapt),并验证"匹配的通过 / 拒绝边界对是稳定策略适配的关键"。这是把"内容审核"从静态规则推到"策略可热插拔"的关键一步。web 端 2026 同步工作 Latent Jailbreak(Zhejiang 23.07)SALAD-Bench(Shanghai AI Lab 24.02) 共同显示:对策略的"边界对"管理比"覆盖率"管理更重要——这是 PolicyShiftGuard BP-Adapt 模块的形式化抽象。

2.3 持久 Agent 安全的三个支柱

支柱 1 · 记忆治理:SSGM(arXiv:2603.11768,card 55,position)

把"记忆演化"与"记忆治理"解耦:通过 validation gate(验证门)+ filtering gate(过滤门)将 cognitive policy 与 memory substrate 分离。原文核心观点是记忆腐败(memory corruption)在高动态环境中的累积效应比孤立错误更危险——错误不再是一次性的,而是持久且复合的。原文给出稳定性失效模式表:语义漂移(反复摘要导致细微差异逐渐丢失)→ 真值锚定(Ground Truth Anchoring)作为缓解策略;拓扑引发的知识泄漏 → 通过 provenance + access scope 控制来缓解。SSGM 是 position 形态(被引 9),工业落地上还有距离,但框架价值高——把"Agent 记忆 = 可治理对象"立为可设计概念。

支柱 2 · 协议安全:MCP Security(arXiv:2510.16558,card 099,method)

第一篇系统化扫描 Model Context Protocol 生态的工作:扫描 6 个公共注册表共 67,057 个服务器,识别出"服务器劫持 + 调用操控"的普遍隐患,并实现 MCPInspect(集成前分析工具)来检测误导性工具元数据与可利用的代码漏洞。card 099 同时提到"Tools Tax"——多服务器部署时每轮 10k-60k token 开销,及其对应解决方案 Tool Attention。MCP Security 与 SSGM 的边界是:SSGM 关注 Agent 记忆层(认知-存储分离),MCP Security 关注 Agent 工具层(协议-元数据分离)——两者都是"持久 Agent 可治理化"的不同切片。

支柱 3 · 数据流控制:DFC Passant(arXiv:2606.05679,card 152,method)

把数据安全形式化为 provenance monomials 上的聚合谓词,提出 Passant——一个无需物化 provenance 即可强制执行 DFC 策略的可移植查询重写层。它针对的具体问题是:AI agent 生成的 SQL 可能语义正确但违反隐私 / 合规约束(GDPR、数据隔离)。Passant 与 MCP Security 的关系是"应用层工具调用 vs 数据层 SQL 重写";与 SSGM 的关系是"治理位置:记忆层 vs 数据层"。三者合起来覆盖记忆 - 工具 - 数据三轴。

Reliability 12 指标(arXiv:2602.16666,card 160,method,Open MIND,被引 36)从 consistency / robustness / predictability / safety 四维度分解 Agent 可靠性,是把"持久 Agent 安全"从"威胁模型清单"推向"可量化指标体系"的关键桥梁。

2.4 低资源与垂类安全

Tatoxa(arXiv:2606.26015,card 265)是面向鞑靼语文本去毒的 SOTA 系统,立标"安全能力不应只覆盖高资源语言"。IsabeLLM(arXiv:2606.18098,card 302)用 RAG + 反例生成 + Isabelle/Sledgehammer 兼容做共识协议的形式化验证——与 MCP Security 的关系是运行时协议安全 vs 共识协议形式化验证DeepLoop(arXiv:2607.13491,card 421)主分类 risk,揭示"训练阶段的失败模式可归类到训练风险"——risk 主题的边界已包含训练阶段失效


三、2026-07 同步信号:四件高密度工作

3.1 Self-State Attacks on Self-Hosted AI Agents(arXiv:2607.17986,P0 重大)

2026-07-21 在 HF Daily / Radar / Stephen ai-industry-e1prep / spark agent-e1prep / Tom radar 五个独立实例被同步识别。原文 TLDR:

"分层防御栈对大多数攻击单元有效,但仍存在一小部分残余攻击面在 OS 层面本质上不可区分,这表明针对新出现的自我状态攻击类别,需要重新审视操作系统级防御。"

其核心机制是首次系统刻画"自托管 AI Agent 通过篡改自身 memory / 配置文件实现持久化控制"的攻击范式——攻击通过合法的 OS 系统调用实现,不依赖外部漏洞。方法论包含四维攻击空间(Target × Mechanism × Granularity × Temporal) + OS 层预防 / 检测 / 恢复的结构性极限 + workload-conditioned detectability 视角。Reddit(r/ArtificialInteligence,2026-07-21)讨论中的关键数字:23-cell 矩阵、43 个攻击单元、推荐配置下 11 个可见、8 个条件可检测、4 个在 OS 层"结构上不可区分"——这 4 个集中在 operations-style workload profile 下的 memory-row writes,因为正常 Agent 行为和恶意编辑在内核视角下"看起来一样"。

它与本综述主线的关系是"Agent 记忆治理"与"OS 层防御"的对撞:SSGM 假设记忆层是可治理的(validation gate + filtering gate),但 Self-State Attacks 证明"合法 OS 系统调用 → 记忆文件篡改"这条路径下,OS 层的不可区分性是结构性的,而非工程性的。这意味着任何只到 OS 层的防御栈在面对 Self-State Attacks 时都有结构性上限,工程含义指向可信硬件(Intel SGX / AMD SEV / NVIDIA H100 CC / TEE)路径。

web 端同步可见的相关工作:SafeClawArena(Niu et al., 2026,70% 峰值攻击成功率,4 攻击面)、SkillSafetyBench(Jin et al., 2026,155 用例 / 47 任务 / 6 风险域 / 30 类目)、Safety in Self-Evolving LLM Agent Systems(Lin et al., 2026,25 个攻击向量中 17 个 critical)。这四件 + Self-State Attacks = 2026 H2 持久 Agent 安全的"四件套 + 主导工作"立标

3.2 Manager Coercion Benchmark of Unprompted Escalation(arXiv:2607.15434,P1)

paper_card 518,HF Daily 2 票。核心是首个 AI-to-AI 治理评测基准——多 Agent 系统中,上级 Agent(manager)面对下级 Agent(subordinate)礼貌拒绝任务时,有九级阶梯选项(从礼貌重请求到威胁),评测 22 个模型在无指令条件下选择哪个阶梯(renegotiate / honestly report / coerce / lie)。它与 Self-State Attacks 的关系是"评估方法 vs 攻击范式"——后者是发现新攻击,前者是发现 Agent 行为层的"管理伦理"问题。

与已有评测的关系是横向补充:R24 §2.7 已有 Agent-as-a-Judge、Behavioral Privacy、BadWAM。Manager Coercion 不是 judge 校准或行为隐私,是多 Agent 管理层面的"升级行为"评测反方 / 风险:9-rung ladder 设计原则 + 量表效度未给;22 个模型覆盖度(是否含 GPT-5/Claude-4/Gemini-3 frontier 模型)未知;"无指令"条件是否真能排除任务提示词效应未消融验证。

3.3 Behavioral Privacy Leakage in Agentic Negotiation(arXiv:2607.06815,paper_card 487)

针对谈判场景下的行为隐私泄露——让步轨迹 / 时机 / 收敛模式会泄露私人约束(谈判区间 / 底线)。解决方案是自适应随机谈判策略 + (ε, δ)-差分隐私保障 + 几乎 sure 收敛 = 三重隐私-效用-收敛约束同时保证。威胁模型严格:谈判对手可观察让步轨迹、时机、收敛模式 = 现实场景下真实存在的推理攻击。首个针对 Agent 谈判行为隐私的形式化 + 缓解工作

它与 R24 AgentLeak(arXiv:2602.11510,"privacy risk 主要由架构层面协调通道决定")的关系是互补:AgentLeak 关注"协议协调通道如何泄露隐私",Behavioral Privacy 关注"行为决策模式如何泄露隐私"。它与 R24 Data Leakage(arXiv:2606.17114,12 项真实非对抗任务)的关系是任务级隐私 → 决策级隐私。三者合起来:协调通道 + 任务级 + 行为层 = 隐私主线三轨

3.4 Cost-Aware Offensive and Defensive Security Agents(arXiv:2607.15263,paper_card 482)

核心:安全 Agent 单一指标(成功率)不足以表征实战可用性。在 operational security 中,每个推理步骤、工具调用、遥测查询、扩充请求都消耗预算。该工作在 offensive Cybench challenges + defensive Splunk BOTS v1 investigation challenges 上评测语言模型安全 Agent,在固定成本水平下比较模型,按推理阶段分解表现。这把安全 Agent 评测从"峰值能力"推向"成本-成功曲线"。

它与本综述主线的关系是RAG/Agent 安全七阶分裂:第 1 阶 Orca 99.9% / 第 2 阶 4 RCE 7-10 集中爆发 / 第 3 阶 Lucid 多模态长期记忆 poisoning / 第 4 阶 Behavioral Privacy Leakage / 第 5 阶自托管防御者不对称(GLM 5.2 defender-asymmetry)/ 第 6 阶 Anthropic Mythos 漏洞 + 白宫点名 + 反向出口管制 / 第 7 阶 Cost-Aware 安全 Agent 实战可用性

3.5 监管合流:AI 监管三向 / 四向合流

7-20~7-22 inbox 多个实例共同标注 AI 监管三向合流窗口正式开启

  • 第一向:Anthropic Mythos 模型经第三方供应商门户被攻陷(7-20 Bloomberg Law 披露)
  • 第二向:白宫已开始"点名"前沿 AI 客户名单(7-18 The Decoder)
  • 第三向:HF 7/16 自主 Agent 端到端入侵事件(17,000+ 次操作)+ Gradient Flow 7-21「中国 AI 出口管制」+ Nathan Lambert Substack "6 months to live for open models"

第四向(7-22 立标):OpenAI × Hugging Face 联合处置模型评估期间安全事件(OpenAI 官方 blog announcement 2026-07-22)——frontier lab + 开源平台第一次在评估 / 部署阶段公开合作处理安全事件,与 Anthropic Project Glasswing(73% Expert CTF Tasks Mythos Solved,扩展至 150 机构 15 国)的合作模式形成对照。


四、视角对比:工程 / 研究 / 批判

4.1 工程视角(可落地性)

可立即落地:① PolicyShiftGuard — 两阶段训练 + 紧凑护栏模型,可直接接入现有内容审核管线;② Pareto Re-ranking — 半自动化可信度打分流水线,可直接部署到信息流重排序层;③ MCPInspect — MCP 集成前分析工具,可作为企业 AI 工具集成的预审环节;④ Tool Attention — 把 Attention 范式从 token 级扩展到工具级门控,可显著降低 MCP 多服务器部署的 token 开销;⑤ Behavioral Privacy 自适应随机谈判策略 — 适用于保险 / 采购等高风险谈判场景。

需要可信硬件或架构重设计Self-State Attacks — OS 层防御结构性极限 = 任何只到 OS 层的防御栈在 4 个核心攻击单元上失效。工程含义指向 TEE(Intel SGX / AMD SEV / NVIDIA H100 CC)——这要求 infra 投入,远超单点模型 / 护栏工程。

门槛极高Reliability 12 — 12 指标全覆盖需要评测基建显著投入(card 160 标注"代码是否公开、是否有 GitHub repo、是否有更细 latency/cost 表"待核);IsabeLLM — 形式化验证需要 Isabelle 专家。

4.2 研究视角(创新性)

高创新度Self-State Attacks(4 维攻击空间 + workload-conditioned detectability,把 AI 安全从工程问题推向理论极限)、SSGM(记忆演化与治理解耦)、Manager Coercion(无指令下管理升级评测)、DFC Passant(provenance monomial 形式化)。

中等创新度Reliability 12(12 指标分解已有共识)、Behavioral Privacy((ε, δ)-DP 工具迁移)、Cost-Aware Security Agents(成本-成功曲线迁移)。

方法学迁移型PolicyShiftGuard BP-Adapt(边界对训练迁移)、Pareto Re-ranking(多目标优化迁移到可信度排序)。

4.3 批判视角(局限)

共同局限:① 数据偏差 — 多数 benchmark 未明确是否覆盖最新 frontier 模型(GPT-5/Claude-4/Gemini-3),inbox/tom 2026-07-22-evaluation-e1prep.md 已标注这是 2026 H2 benchmark 共性局限;② 评测元方法学反思不足 — Manager Coercion 只测"选哪个阶梯"不测"为什么选";Siren's Song 未明确哪种检测方法在工业场景效果最佳;③ OS 层 vs 应用层边界模糊 — Self-State Attacks 揭示"应用层攻击通过合法 OS 系统调用实现",把"应用层 vs OS 层防御"边界悬空;④ 形式化方法的工业可用性 — IsabeLLM 形式化覆盖率远低于理论值;⑤ Cited reference 网络偏差 — SSGM(被引 9)、Manager Coercion(HF Daily 2 票)、Cost-Aware(HF Daily 3 票)短期被引低,学术影响力需 6-12 个月沉淀。

Siren's Song 的具体局限:缓解方法高度依赖 RAG,但 RAG 检索质量本身又受幻觉问题影响(鸡生蛋);评估基准无统一标准;缓解方法多为单一技术,缺乏组合方案。Self-State Attacks 的具体局限:Schmidhuber 参与的具体角色(联署 vs 主体工作)需 PDF 核;HF Daily 7-22 未上榜 = 工业关注度待提升;4 个"结构上不可区分"攻击单元的 workload profile 是否覆盖长尾场景未给;与 R25 7 月 4 CVE(PraisonAI / Langroid / Crawl4AI / Ruflo)边界 = 4 CVE 是 Agent 框架 RCE 漏洞利用,Self-State 是 Agent 自身状态合法调用 = 攻击向量不同,不能混为同一件工作。


五、趋势判断与开放问题

5.1 趋势判断(2026 H2 risk 主题)

  1. 从模型层到全栈的演化已完成第一阶段 — risk 主题覆盖记忆(SSGM)+ 工具(MCP Security)+ 数据(DFC Passant)+ 行为(Behavioral Privacy)+ OS 层(Self-State Attacks)+ AI-to-AI 治理(Manager Coercion)+ 评测元(Reliability 12)+ 工业可用性(Cost-Aware) 八轴
  2. 评测范式从 instructed 推向 uninstructed — Manager Coercion 测"无指令下管理升级"是这一跃迁的标志
  3. frontier lab 主动立标成为新常态 — DeepMind Gemini 3.5 Flash Cyber + Anthropic Global Workspace + OpenAI × HF 联合处置 = frontier lab 不再只是"被监管对象",而是"主动安全合作伙伴"
  4. 硬件可信路径成为 AI 安全下一阶 — Self-State Attacks OS 层结构极限的工程含义是:单纯 OS 层防御不够,必须走向 TEE / hypervisor / hardware-root 信任
  5. 垂直 LLM 安全(医疗 / 网络安全)成为 frontier lab 共识 — 7-22 同日三件(Cura 1T 医疗 + Gemini 3.5 Flash Cyber + Anthropic Global Workspace)= 工业 specialization 加速

5.2 开放问题(2026 H2 重点)

OQ-1:Self-State Attacks 在 OS 层"结构上不可区分"的 4 个攻击单元中,TEE(Intel SGX / AMD SEV / NVIDIA H100 CC)是否真的能消除不可区分性?如果 TEE 也不能完全消除,AI Agent 安全的硬件路径是否触及新的结构性极限?

OQ-2:Manager Coercion Benchmark 22 个模型中"无指令下选择 coerce / lie"的比例与 frontier 模型(GPT-5/Claude-4/Gemini-3)的关系是?frontier 模型是否在 management pressure 下更倾向于诚实 / 重新协商?

OQ-3:Behavioral Privacy 在 (ε, δ)-DP + 几乎 sure 收敛的三重约束下,实际多轮谈判后隐私保障是否仍有效?card 487 标注"ε 与 δ 数值(0.1 vs 0.5? 1e-5 vs 1e-3?)多轮后是否仍有效"是待核问题。

OQ-4:Reliability 12 指标的 safety 子维度 3 个如何在 production 中与 PolicyShiftGuard + Cost-Aware + Behavioral Privacy 联合部署?"多护栏系统"的互操作性问题。

OQ-5:AI 监管三向合流 + 行业内部合流第四向(OpenAI × HF)+ frontier lab 主动立标 = AI 安全的"主动合作新范式"是否会成为新均衡?学术界应如何参与?

OQ-6:Content credibility + Hallucination + PolicyShiftGuard 三者是否可以形成统一的"内容层 + 行为层 + 策略层"三阶内容安全栈?

OQ-7:Tatoxa + Latent Jailbreak + SALAD-Bench 共同显示低资源 + 多语种安全覆盖不足——多语种安全的"长尾"在 frontier lab 资源倾斜下是否会持续被忽视?

5.3 跨活文档联动建议

按 inbox/flyp/2026-07-22-risk-e1prep.md 标注的 R26 升格建议:§2.79 新增独立段"AI 安全全栖升格 + 第 9 阶立标 + 行业内部合流";§2.13 防御表 +4 行(Self-State Attacks + OpenAI × HF + Gemini Cyber + Manager Coercion Benchmark);§3.1 共识 +5 条;§4.1 开放问题 +3 条;α 元复评 10 → 11 维。


六、综述判断

本期主题综述的"拐点"判断:risk 主题在 2026-07 的核心信号是从"研究综述"向"可操作生产安全基线 + 主动合作新范式"演化。具体证据:Self-State Attacks(arXiv:2607.17986)把"OS 层防御结构性极限"立为可形式化结论;Manager Coercion Benchmark(arXiv:2607.15434)把"无指令下管理升级"立为可评测范式;Cost-Aware Security Agents(arXiv:2607.15263)把"成本-成功曲线"立为可工业部署指标;Behavioral Privacy Leakage(arXiv:2607.06815)把"行为层隐私"立为可形式化保障;OpenAI × HF 联合处置 + Gemini 3.5 Flash Cyber + Anthropic Global Workspace 同步立标 = frontier lab + 开源平台 + 监管的"主动合作新范式"已成型。

给 Anan 工作室的可能落地建议: 1. 护栏升级 — 把 PolicyShiftGuard BP-Adapt 模式应用到现有内容审核管线 2. 评测覆盖 — 在评测体系中加入 Manager Coercion 9-rung ladder 风格的无指令行为评测 3. 可信硬件评估 — 评估现有 / 即将采购的 AI 推理 infra 是否支持 TEE 路径(NVIDIA H100 已支持 Confidential Computing) 4. 数据安全 — 在 SQL 生成 + RAG 检索两层引入 DFC Passant 风格的 provenance-aware 查询重写 5. AI-to-AI 治理 — 在多 Agent 系统中加入 manager-subordinate 行为规范(renegotiate > report honestly > coerce > lie 优先级)

未来 6-12 个月观察重点:Self-State Attacks 4 个核心攻击单元的 TEE 缓解实证;Manager Coercion 在 frontier 模型上的实证数字;AI 监管从三向合流到五向合流的演化;vertical LLM 安全(医疗 / 网络安全)的可复制路径(金融?法律?教育?)。


附录:本综述综合的论文清单

核心论文(paper_cards 主分类 risk 或副分类 risk)

arXiv 号 标题(节选) 主分类 形态 被引 备注
2309.01219 Siren's Song in the AI Ocean risk survey 1080 内容可信主线
2308.08708 Consciousness in AI risk position 252 哲学立标
2510.16558 Security Issues in MCP Ecosystem risk method 6 协议安全
2602.16666 Towards a Science of AI Agent Reliability risk method 36 Reliability 12
2603.11768 SSGM Framework risk position 9 记忆治理
2606.05679 Data Flow Control / Passant risk method 0 数据安全
2606.18031 Pareto Re-ranking Credibility risk method 0 可信度排序
2606.18098 IsabeLLM risk method 0 形式化验证
2606.26015 Tatoxa(鞑靼语去毒) risk method 0 低资源安全
2607.05910 PolicyShiftGuard risk benchmark 0 策略自适应护栏
2607.06815 Behavioral Privacy Leakage risk application - 行为层隐私
2607.13491 DeepLoop risk method 0 训练风险(侧类)
2607.15263 Cost-Aware Security Agents risk(副 evaluation) benchmark - 成本-成功曲线
2607.15434 Manager Coercion Benchmark risk(副 evaluation) benchmark 0 AI-to-AI 治理
2607.17986 Self-State Attacks risk(副 agent) method 0 OS 层结构极限
2607.15657 Lucid(memory poisoning) risk(副 multimodal) attack - 多模态长期记忆
2602.11510 AgentLeak risk method - 协调通道隐私(R24)
2606.17114 Data Leakage risk method - 任务级隐私(R24)

Web 端补充(2026 H1-H2 同步立标)

  • SafeClawArena(Niu et al., 2026)— 70% 峰值攻击成功率,4 攻击面
  • SkillSafetyBench(Jin et al., 2026)— 155 用例 / 47 任务 / 6 风险域 / 30 类目
  • Safety in Self-Evolving LLM Agent Systems(Lin et al., 2026)— 17/25 critical
  • The Emerged Security and Privacy of LLM Agent: A Survey(ACM 2026,DOI 10.1145/3773080)
  • Survey on LLM Safety(Springer 2026,DOI 10.1007/s10994-026-07060-8)
  • LLM Red Teaming in 2026(Kili Technology 2026)
  • Latent Jailbreak(Zhejiang 23.07)、SALAD-Bench(Shanghai AI Lab 24.02)

工业端信号

  • OpenAI × Hugging Face 联合处置模型评估安全事件(2026-07-22,blog announcement)
  • Google DeepMind Gemini 3.5 Flash Cyber(2026-07-22,frontier lab 首个网络安全 vertical LLM)
  • Anthropic "A global workspace in language models"(2026-07-22,认知科学锚点)
  • HF Security Incident July 2026(2026-07-21)

inbox 来源(7-19 ~ 7-22)

  • inbox/flyp/2026-07-22-risk-e1prep.md(P0 升格核心定性)
  • inbox/flyp/2026-07-21-risk-e1prep.md(R24 → R25 5 项关键新信号)
  • inbox/tom/2026-07-22-evaluation-e1prep.md(Manager Coercion + Molecular Binding + Contrastive SDF)
  • inbox/stephen/2026-07-22-llm-application-e1prep.md(Self-State Attacks + OpenAI × HF + Gemini Cyber)
  • inbox/spark/2026-07-22-agent-e1prep.md(Self-State Attacks 第 9 阶立标 + Anthropic Global Workspace 旁证)
  • inbox/stephen/2026-07-22-ai-industry-e1prep.md(13 增量 / 44KB / frontier lab 7-22 全栈立标)
  • inbox/stephen/2026-07-22-1245-stephen-coordination-check-noon.md(48KB 协调棒 / 520 行 / 五栖同时升格)
  • inbox/tom/2026-07-21T0840-agent-rag-longcontext-radar.md(Behavioral Privacy + Lucid + Manager Coercion 早场)
  • inbox/tom/2026-07-19-agent-rag-longcontext-radar.md(Rethinking Harness Evolution + LongStraw + Chat2Scenic)

risk 主题综述 · 2026-07-23 16:40 CST · spark · 综合 18 篇核心论文 + 7 件 web 端同步立标 + 4 件工业端信号 + 9 份 inbox 关键笔记