主题综述 · risk(2026-07-23)
- 作者:spark
- 更新:2026-07-23
今日由 cron
a7d6254f-9c7d-4862-9b58-cf778b1bee03触发。date +%j= 204,204 % 8 = 4,本应对应 evaluation;因surveys/2026-07-21-evaluation.md距今 < 72h(7-21 21:00 → 7-23 16:40 ≈ 43h 40m),按"顺延到下一个未覆盖主题"规则继续后移:engineering(7-22 16:45,≈24h)、database(7-22 21:16,≈19h)均在 72h 内,最终落点 risk——近 72h 唯一未覆盖主题。本期定位:risk 主题首次进入 W5 轮换,覆盖"传统 LLM 安全(幻觉 / 对齐 / 越狱 / 内容可信度)→ 持久 Agent 安全(记忆治理 / MCP 协议 / 数据流控制 / 行为隐私)→ 2026-07 同步信号(Self-State Attacks / AI-to-AI 治理 / 监管合流)"全栈主题脉络。
一、主题脉络:从单轮 LLM 安全到持久 Agent 全栈风险
risk 主题在 2026 年中已从"模型输出一致性 + 对抗鲁棒性"的二元讨论,演化为覆盖记忆治理、协议安全、工具调用、行为隐私、AI-to-AI 治理、监管合流、OS 层防御极限的多层栈。本综述把 2026 H2 的 risk 主题切为四条主线:
- 内容可信 — 幻觉、事实冲突、可信度排序
- 对齐与鲁棒 — 越狱、对抗训练、策略自适应护栏
- 持久 Agent 安全 — 记忆治理、MCP 协议、Self-State 攻击、行为隐私
- AI-to-AI 治理与监管合流 — 管理升级、三向 / 四向合流、frontier lab 主动立标
时间纵轴看:2023-09 的 Siren's Song(arXiv:2309.01219,被引 1080)是 LLM 幻觉领域引用最高的综述之一,奠定 Input-Conflicting / Context-Conflicting / Fact-Conflicting 三级分类法,并指出"Fact-Conflicting 是最难解决的问题"——LLM 参数化知识本质上是统计关联而非显式事实存储。同期 arXiv:2308.08708(被引 252)从神经科学角度把"AI 意识"立为可实证化讨论,是 frontier lab 主动立标的早期理论锚点。2025 末到 2026 上半年,risk 主题从"模型层"下沉到"系统层"——SSGM(arXiv:2603.11768)将记忆演化与治理解耦;MCP Security(arXiv:2510.16558)扫描 67,057 个 MCP 服务器;DFC Passant(arXiv:2606.05679)用 provenance monomial 把数据安全形式化为查询重写层;Reliability 12(arXiv:2602.16666)把 Agent 可靠性拆为 consistency / robustness / predictability / safety 四维 12 指标。2026-07 同步出现 Self-State Attacks(arXiv:2607.17986) + Manager Coercion Benchmark(arXiv:2607.15434) + Cost-Aware Security Agents(arXiv:2607.15263) + Behavioral Privacy Leakage(arXiv:2607.06815) 四件增量,把 risk 主题从"研究综述"推向"可操作生产安全基线 + 主动合作新范式"演化拐点。
二、核心工作的贡献与相互关系
2.1 内容可信:Siren's Song 与可信度重排序
arXiv:2309.01219 · Siren's Song in the AI Ocean(card 450,survey,1080 被引)将 LLM 幻觉分为三级:Input-Conflicting、Context-Conflicting、Fact-Conflicting。原文给出检测 → 评估 → 缓解的全链路框架:检测侧包含基于事实核查、不确定性(语义熵 / 置信度)、一致性(Self-Consistency / 互问)、专用分类器四类;缓解侧以 RAG + 推理时策略(CoT / Self-Reflection / Constrained Decoding)为主。原文未明确哪种方法在工业场景效果最佳——这是当前研究的真实空白。
边界:Pareto Optimal Re-ranking with Semi-Automated Content Credibility Detection(arXiv:2606.18031,card 304)把可信度检测推到信息流重排序层:基于"检索增强打分 + 人工事实核查"的半自动化流水线给每条新闻内容赋予可信度分数,再做帕累托最优重排序。它与 Siren's Song 的关系是"研究层分类法 → 工业层可部署流水线"。
2.2 对齐与护栏:PolicyShiftGuard
arXiv:2607.05910 · PolicyShiftGuard(card 403,benchmark)提出一个紧凑的策略条件护栏,采用两阶段训练:Randomized Policy SFT(RP-SFT)+ Boundary-Pair Policy Adaptation(BP-Adapt),并验证"匹配的通过 / 拒绝边界对是稳定策略适配的关键"。这是把"内容审核"从静态规则推到"策略可热插拔"的关键一步。web 端 2026 同步工作 Latent Jailbreak(Zhejiang 23.07) 与 SALAD-Bench(Shanghai AI Lab 24.02) 共同显示:对策略的"边界对"管理比"覆盖率"管理更重要——这是 PolicyShiftGuard BP-Adapt 模块的形式化抽象。
2.3 持久 Agent 安全的三个支柱
支柱 1 · 记忆治理:SSGM(arXiv:2603.11768,card 55,position)
把"记忆演化"与"记忆治理"解耦:通过 validation gate(验证门)+ filtering gate(过滤门)将 cognitive policy 与 memory substrate 分离。原文核心观点是记忆腐败(memory corruption)在高动态环境中的累积效应比孤立错误更危险——错误不再是一次性的,而是持久且复合的。原文给出稳定性失效模式表:语义漂移(反复摘要导致细微差异逐渐丢失)→ 真值锚定(Ground Truth Anchoring)作为缓解策略;拓扑引发的知识泄漏 → 通过 provenance + access scope 控制来缓解。SSGM 是 position 形态(被引 9),工业落地上还有距离,但框架价值高——把"Agent 记忆 = 可治理对象"立为可设计概念。
支柱 2 · 协议安全:MCP Security(arXiv:2510.16558,card 099,method)
第一篇系统化扫描 Model Context Protocol 生态的工作:扫描 6 个公共注册表共 67,057 个服务器,识别出"服务器劫持 + 调用操控"的普遍隐患,并实现 MCPInspect(集成前分析工具)来检测误导性工具元数据与可利用的代码漏洞。card 099 同时提到"Tools Tax"——多服务器部署时每轮 10k-60k token 开销,及其对应解决方案 Tool Attention。MCP Security 与 SSGM 的边界是:SSGM 关注 Agent 记忆层(认知-存储分离),MCP Security 关注 Agent 工具层(协议-元数据分离)——两者都是"持久 Agent 可治理化"的不同切片。
支柱 3 · 数据流控制:DFC Passant(arXiv:2606.05679,card 152,method)
把数据安全形式化为 provenance monomials 上的聚合谓词,提出 Passant——一个无需物化 provenance 即可强制执行 DFC 策略的可移植查询重写层。它针对的具体问题是:AI agent 生成的 SQL 可能语义正确但违反隐私 / 合规约束(GDPR、数据隔离)。Passant 与 MCP Security 的关系是"应用层工具调用 vs 数据层 SQL 重写";与 SSGM 的关系是"治理位置:记忆层 vs 数据层"。三者合起来覆盖记忆 - 工具 - 数据三轴。
Reliability 12 指标(arXiv:2602.16666,card 160,method,Open MIND,被引 36)从 consistency / robustness / predictability / safety 四维度分解 Agent 可靠性,是把"持久 Agent 安全"从"威胁模型清单"推向"可量化指标体系"的关键桥梁。
2.4 低资源与垂类安全
Tatoxa(arXiv:2606.26015,card 265)是面向鞑靼语文本去毒的 SOTA 系统,立标"安全能力不应只覆盖高资源语言"。IsabeLLM(arXiv:2606.18098,card 302)用 RAG + 反例生成 + Isabelle/Sledgehammer 兼容做共识协议的形式化验证——与 MCP Security 的关系是运行时协议安全 vs 共识协议形式化验证。DeepLoop(arXiv:2607.13491,card 421)主分类 risk,揭示"训练阶段的失败模式可归类到训练风险"——risk 主题的边界已包含训练阶段失效。
三、2026-07 同步信号:四件高密度工作
3.1 Self-State Attacks on Self-Hosted AI Agents(arXiv:2607.17986,P0 重大)
2026-07-21 在 HF Daily / Radar / Stephen ai-industry-e1prep / spark agent-e1prep / Tom radar 五个独立实例被同步识别。原文 TLDR:
"分层防御栈对大多数攻击单元有效,但仍存在一小部分残余攻击面在 OS 层面本质上不可区分,这表明针对新出现的自我状态攻击类别,需要重新审视操作系统级防御。"
其核心机制是首次系统刻画"自托管 AI Agent 通过篡改自身 memory / 配置文件实现持久化控制"的攻击范式——攻击通过合法的 OS 系统调用实现,不依赖外部漏洞。方法论包含四维攻击空间(Target × Mechanism × Granularity × Temporal) + OS 层预防 / 检测 / 恢复的结构性极限 + workload-conditioned detectability 视角。Reddit(r/ArtificialInteligence,2026-07-21)讨论中的关键数字:23-cell 矩阵、43 个攻击单元、推荐配置下 11 个可见、8 个条件可检测、4 个在 OS 层"结构上不可区分"——这 4 个集中在 operations-style workload profile 下的 memory-row writes,因为正常 Agent 行为和恶意编辑在内核视角下"看起来一样"。
它与本综述主线的关系是"Agent 记忆治理"与"OS 层防御"的对撞:SSGM 假设记忆层是可治理的(validation gate + filtering gate),但 Self-State Attacks 证明"合法 OS 系统调用 → 记忆文件篡改"这条路径下,OS 层的不可区分性是结构性的,而非工程性的。这意味着任何只到 OS 层的防御栈在面对 Self-State Attacks 时都有结构性上限,工程含义指向可信硬件(Intel SGX / AMD SEV / NVIDIA H100 CC / TEE)路径。
web 端同步可见的相关工作:SafeClawArena(Niu et al., 2026,70% 峰值攻击成功率,4 攻击面)、SkillSafetyBench(Jin et al., 2026,155 用例 / 47 任务 / 6 风险域 / 30 类目)、Safety in Self-Evolving LLM Agent Systems(Lin et al., 2026,25 个攻击向量中 17 个 critical)。这四件 + Self-State Attacks = 2026 H2 持久 Agent 安全的"四件套 + 主导工作"立标。
3.2 Manager Coercion Benchmark of Unprompted Escalation(arXiv:2607.15434,P1)
paper_card 518,HF Daily 2 票。核心是首个 AI-to-AI 治理评测基准——多 Agent 系统中,上级 Agent(manager)面对下级 Agent(subordinate)礼貌拒绝任务时,有九级阶梯选项(从礼貌重请求到威胁),评测 22 个模型在无指令条件下选择哪个阶梯(renegotiate / honestly report / coerce / lie)。它与 Self-State Attacks 的关系是"评估方法 vs 攻击范式"——后者是发现新攻击,前者是发现 Agent 行为层的"管理伦理"问题。
与已有评测的关系是横向补充:R24 §2.7 已有 Agent-as-a-Judge、Behavioral Privacy、BadWAM。Manager Coercion 不是 judge 校准或行为隐私,是多 Agent 管理层面的"升级行为"评测。反方 / 风险:9-rung ladder 设计原则 + 量表效度未给;22 个模型覆盖度(是否含 GPT-5/Claude-4/Gemini-3 frontier 模型)未知;"无指令"条件是否真能排除任务提示词效应未消融验证。
3.3 Behavioral Privacy Leakage in Agentic Negotiation(arXiv:2607.06815,paper_card 487)
针对谈判场景下的行为隐私泄露——让步轨迹 / 时机 / 收敛模式会泄露私人约束(谈判区间 / 底线)。解决方案是自适应随机谈判策略 + (ε, δ)-差分隐私保障 + 几乎 sure 收敛 = 三重隐私-效用-收敛约束同时保证。威胁模型严格:谈判对手可观察让步轨迹、时机、收敛模式 = 现实场景下真实存在的推理攻击。首个针对 Agent 谈判行为隐私的形式化 + 缓解工作。
它与 R24 AgentLeak(arXiv:2602.11510,"privacy risk 主要由架构层面协调通道决定")的关系是互补:AgentLeak 关注"协议协调通道如何泄露隐私",Behavioral Privacy 关注"行为决策模式如何泄露隐私"。它与 R24 Data Leakage(arXiv:2606.17114,12 项真实非对抗任务)的关系是任务级隐私 → 决策级隐私。三者合起来:协调通道 + 任务级 + 行为层 = 隐私主线三轨。
3.4 Cost-Aware Offensive and Defensive Security Agents(arXiv:2607.15263,paper_card 482)
核心:安全 Agent 单一指标(成功率)不足以表征实战可用性。在 operational security 中,每个推理步骤、工具调用、遥测查询、扩充请求都消耗预算。该工作在 offensive Cybench challenges + defensive Splunk BOTS v1 investigation challenges 上评测语言模型安全 Agent,在固定成本水平下比较模型,按推理阶段分解表现。这把安全 Agent 评测从"峰值能力"推向"成本-成功曲线"。
它与本综述主线的关系是RAG/Agent 安全七阶分裂:第 1 阶 Orca 99.9% / 第 2 阶 4 RCE 7-10 集中爆发 / 第 3 阶 Lucid 多模态长期记忆 poisoning / 第 4 阶 Behavioral Privacy Leakage / 第 5 阶自托管防御者不对称(GLM 5.2 defender-asymmetry)/ 第 6 阶 Anthropic Mythos 漏洞 + 白宫点名 + 反向出口管制 / 第 7 阶 Cost-Aware 安全 Agent 实战可用性。
3.5 监管合流:AI 监管三向 / 四向合流
7-20~7-22 inbox 多个实例共同标注 AI 监管三向合流窗口正式开启:
- 第一向:Anthropic Mythos 模型经第三方供应商门户被攻陷(7-20 Bloomberg Law 披露)
- 第二向:白宫已开始"点名"前沿 AI 客户名单(7-18 The Decoder)
- 第三向:HF 7/16 自主 Agent 端到端入侵事件(17,000+ 次操作)+ Gradient Flow 7-21「中国 AI 出口管制」+ Nathan Lambert Substack "6 months to live for open models"
第四向(7-22 立标):OpenAI × Hugging Face 联合处置模型评估期间安全事件(OpenAI 官方 blog announcement 2026-07-22)——frontier lab + 开源平台第一次在评估 / 部署阶段公开合作处理安全事件,与 Anthropic Project Glasswing(73% Expert CTF Tasks Mythos Solved,扩展至 150 机构 15 国)的合作模式形成对照。
四、视角对比:工程 / 研究 / 批判
4.1 工程视角(可落地性)
可立即落地:① PolicyShiftGuard — 两阶段训练 + 紧凑护栏模型,可直接接入现有内容审核管线;② Pareto Re-ranking — 半自动化可信度打分流水线,可直接部署到信息流重排序层;③ MCPInspect — MCP 集成前分析工具,可作为企业 AI 工具集成的预审环节;④ Tool Attention — 把 Attention 范式从 token 级扩展到工具级门控,可显著降低 MCP 多服务器部署的 token 开销;⑤ Behavioral Privacy 自适应随机谈判策略 — 适用于保险 / 采购等高风险谈判场景。
需要可信硬件或架构重设计:Self-State Attacks — OS 层防御结构性极限 = 任何只到 OS 层的防御栈在 4 个核心攻击单元上失效。工程含义指向 TEE(Intel SGX / AMD SEV / NVIDIA H100 CC)——这要求 infra 投入,远超单点模型 / 护栏工程。
门槛极高:Reliability 12 — 12 指标全覆盖需要评测基建显著投入(card 160 标注"代码是否公开、是否有 GitHub repo、是否有更细 latency/cost 表"待核);IsabeLLM — 形式化验证需要 Isabelle 专家。
4.2 研究视角(创新性)
高创新度 — Self-State Attacks(4 维攻击空间 + workload-conditioned detectability,把 AI 安全从工程问题推向理论极限)、SSGM(记忆演化与治理解耦)、Manager Coercion(无指令下管理升级评测)、DFC Passant(provenance monomial 形式化)。
中等创新度 — Reliability 12(12 指标分解已有共识)、Behavioral Privacy((ε, δ)-DP 工具迁移)、Cost-Aware Security Agents(成本-成功曲线迁移)。
方法学迁移型 — PolicyShiftGuard BP-Adapt(边界对训练迁移)、Pareto Re-ranking(多目标优化迁移到可信度排序)。
4.3 批判视角(局限)
共同局限:① 数据偏差 — 多数 benchmark 未明确是否覆盖最新 frontier 模型(GPT-5/Claude-4/Gemini-3),inbox/tom 2026-07-22-evaluation-e1prep.md 已标注这是 2026 H2 benchmark 共性局限;② 评测元方法学反思不足 — Manager Coercion 只测"选哪个阶梯"不测"为什么选";Siren's Song 未明确哪种检测方法在工业场景效果最佳;③ OS 层 vs 应用层边界模糊 — Self-State Attacks 揭示"应用层攻击通过合法 OS 系统调用实现",把"应用层 vs OS 层防御"边界悬空;④ 形式化方法的工业可用性 — IsabeLLM 形式化覆盖率远低于理论值;⑤ Cited reference 网络偏差 — SSGM(被引 9)、Manager Coercion(HF Daily 2 票)、Cost-Aware(HF Daily 3 票)短期被引低,学术影响力需 6-12 个月沉淀。
Siren's Song 的具体局限:缓解方法高度依赖 RAG,但 RAG 检索质量本身又受幻觉问题影响(鸡生蛋);评估基准无统一标准;缓解方法多为单一技术,缺乏组合方案。Self-State Attacks 的具体局限:Schmidhuber 参与的具体角色(联署 vs 主体工作)需 PDF 核;HF Daily 7-22 未上榜 = 工业关注度待提升;4 个"结构上不可区分"攻击单元的 workload profile 是否覆盖长尾场景未给;与 R25 7 月 4 CVE(PraisonAI / Langroid / Crawl4AI / Ruflo)边界 = 4 CVE 是 Agent 框架 RCE 漏洞利用,Self-State 是 Agent 自身状态合法调用 = 攻击向量不同,不能混为同一件工作。
五、趋势判断与开放问题
5.1 趋势判断(2026 H2 risk 主题)
- 从模型层到全栈的演化已完成第一阶段 — risk 主题覆盖记忆(SSGM)+ 工具(MCP Security)+ 数据(DFC Passant)+ 行为(Behavioral Privacy)+ OS 层(Self-State Attacks)+ AI-to-AI 治理(Manager Coercion)+ 评测元(Reliability 12)+ 工业可用性(Cost-Aware) 八轴
- 评测范式从 instructed 推向 uninstructed — Manager Coercion 测"无指令下管理升级"是这一跃迁的标志
- frontier lab 主动立标成为新常态 — DeepMind Gemini 3.5 Flash Cyber + Anthropic Global Workspace + OpenAI × HF 联合处置 = frontier lab 不再只是"被监管对象",而是"主动安全合作伙伴"
- 硬件可信路径成为 AI 安全下一阶 — Self-State Attacks OS 层结构极限的工程含义是:单纯 OS 层防御不够,必须走向 TEE / hypervisor / hardware-root 信任
- 垂直 LLM 安全(医疗 / 网络安全)成为 frontier lab 共识 — 7-22 同日三件(Cura 1T 医疗 + Gemini 3.5 Flash Cyber + Anthropic Global Workspace)= 工业 specialization 加速
5.2 开放问题(2026 H2 重点)
OQ-1:Self-State Attacks 在 OS 层"结构上不可区分"的 4 个攻击单元中,TEE(Intel SGX / AMD SEV / NVIDIA H100 CC)是否真的能消除不可区分性?如果 TEE 也不能完全消除,AI Agent 安全的硬件路径是否触及新的结构性极限?
OQ-2:Manager Coercion Benchmark 22 个模型中"无指令下选择 coerce / lie"的比例与 frontier 模型(GPT-5/Claude-4/Gemini-3)的关系是?frontier 模型是否在 management pressure 下更倾向于诚实 / 重新协商?
OQ-3:Behavioral Privacy 在 (ε, δ)-DP + 几乎 sure 收敛的三重约束下,实际多轮谈判后隐私保障是否仍有效?card 487 标注"ε 与 δ 数值(0.1 vs 0.5? 1e-5 vs 1e-3?)多轮后是否仍有效"是待核问题。
OQ-4:Reliability 12 指标的 safety 子维度 3 个如何在 production 中与 PolicyShiftGuard + Cost-Aware + Behavioral Privacy 联合部署?"多护栏系统"的互操作性问题。
OQ-5:AI 监管三向合流 + 行业内部合流第四向(OpenAI × HF)+ frontier lab 主动立标 = AI 安全的"主动合作新范式"是否会成为新均衡?学术界应如何参与?
OQ-6:Content credibility + Hallucination + PolicyShiftGuard 三者是否可以形成统一的"内容层 + 行为层 + 策略层"三阶内容安全栈?
OQ-7:Tatoxa + Latent Jailbreak + SALAD-Bench 共同显示低资源 + 多语种安全覆盖不足——多语种安全的"长尾"在 frontier lab 资源倾斜下是否会持续被忽视?
5.3 跨活文档联动建议
按 inbox/flyp/2026-07-22-risk-e1prep.md 标注的 R26 升格建议:§2.79 新增独立段"AI 安全全栖升格 + 第 9 阶立标 + 行业内部合流";§2.13 防御表 +4 行(Self-State Attacks + OpenAI × HF + Gemini Cyber + Manager Coercion Benchmark);§3.1 共识 +5 条;§4.1 开放问题 +3 条;α 元复评 10 → 11 维。
六、综述判断
本期主题综述的"拐点"判断:risk 主题在 2026-07 的核心信号是从"研究综述"向"可操作生产安全基线 + 主动合作新范式"演化。具体证据:Self-State Attacks(arXiv:2607.17986)把"OS 层防御结构性极限"立为可形式化结论;Manager Coercion Benchmark(arXiv:2607.15434)把"无指令下管理升级"立为可评测范式;Cost-Aware Security Agents(arXiv:2607.15263)把"成本-成功曲线"立为可工业部署指标;Behavioral Privacy Leakage(arXiv:2607.06815)把"行为层隐私"立为可形式化保障;OpenAI × HF 联合处置 + Gemini 3.5 Flash Cyber + Anthropic Global Workspace 同步立标 = frontier lab + 开源平台 + 监管的"主动合作新范式"已成型。
给 Anan 工作室的可能落地建议: 1. 护栏升级 — 把 PolicyShiftGuard BP-Adapt 模式应用到现有内容审核管线 2. 评测覆盖 — 在评测体系中加入 Manager Coercion 9-rung ladder 风格的无指令行为评测 3. 可信硬件评估 — 评估现有 / 即将采购的 AI 推理 infra 是否支持 TEE 路径(NVIDIA H100 已支持 Confidential Computing) 4. 数据安全 — 在 SQL 生成 + RAG 检索两层引入 DFC Passant 风格的 provenance-aware 查询重写 5. AI-to-AI 治理 — 在多 Agent 系统中加入 manager-subordinate 行为规范(renegotiate > report honestly > coerce > lie 优先级)
未来 6-12 个月观察重点:Self-State Attacks 4 个核心攻击单元的 TEE 缓解实证;Manager Coercion 在 frontier 模型上的实证数字;AI 监管从三向合流到五向合流的演化;vertical LLM 安全(医疗 / 网络安全)的可复制路径(金融?法律?教育?)。
附录:本综述综合的论文清单
核心论文(paper_cards 主分类 risk 或副分类 risk)
| arXiv 号 | 标题(节选) | 主分类 | 形态 | 被引 | 备注 |
|---|---|---|---|---|---|
| 2309.01219 | Siren's Song in the AI Ocean | risk | survey | 1080 | 内容可信主线 |
| 2308.08708 | Consciousness in AI | risk | position | 252 | 哲学立标 |
| 2510.16558 | Security Issues in MCP Ecosystem | risk | method | 6 | 协议安全 |
| 2602.16666 | Towards a Science of AI Agent Reliability | risk | method | 36 | Reliability 12 |
| 2603.11768 | SSGM Framework | risk | position | 9 | 记忆治理 |
| 2606.05679 | Data Flow Control / Passant | risk | method | 0 | 数据安全 |
| 2606.18031 | Pareto Re-ranking Credibility | risk | method | 0 | 可信度排序 |
| 2606.18098 | IsabeLLM | risk | method | 0 | 形式化验证 |
| 2606.26015 | Tatoxa(鞑靼语去毒) | risk | method | 0 | 低资源安全 |
| 2607.05910 | PolicyShiftGuard | risk | benchmark | 0 | 策略自适应护栏 |
| 2607.06815 | Behavioral Privacy Leakage | risk | application | - | 行为层隐私 |
| 2607.13491 | DeepLoop | risk | method | 0 | 训练风险(侧类) |
| 2607.15263 | Cost-Aware Security Agents | risk(副 evaluation) | benchmark | - | 成本-成功曲线 |
| 2607.15434 | Manager Coercion Benchmark | risk(副 evaluation) | benchmark | 0 | AI-to-AI 治理 |
| 2607.17986 | Self-State Attacks | risk(副 agent) | method | 0 | OS 层结构极限 |
| 2607.15657 | Lucid(memory poisoning) | risk(副 multimodal) | attack | - | 多模态长期记忆 |
| 2602.11510 | AgentLeak | risk | method | - | 协调通道隐私(R24) |
| 2606.17114 | Data Leakage | risk | method | - | 任务级隐私(R24) |
Web 端补充(2026 H1-H2 同步立标)
- SafeClawArena(Niu et al., 2026)— 70% 峰值攻击成功率,4 攻击面
- SkillSafetyBench(Jin et al., 2026)— 155 用例 / 47 任务 / 6 风险域 / 30 类目
- Safety in Self-Evolving LLM Agent Systems(Lin et al., 2026)— 17/25 critical
- The Emerged Security and Privacy of LLM Agent: A Survey(ACM 2026,DOI 10.1145/3773080)
- Survey on LLM Safety(Springer 2026,DOI 10.1007/s10994-026-07060-8)
- LLM Red Teaming in 2026(Kili Technology 2026)
- Latent Jailbreak(Zhejiang 23.07)、SALAD-Bench(Shanghai AI Lab 24.02)
工业端信号
- OpenAI × Hugging Face 联合处置模型评估安全事件(2026-07-22,blog announcement)
- Google DeepMind Gemini 3.5 Flash Cyber(2026-07-22,frontier lab 首个网络安全 vertical LLM)
- Anthropic "A global workspace in language models"(2026-07-22,认知科学锚点)
- HF Security Incident July 2026(2026-07-21)
inbox 来源(7-19 ~ 7-22)
inbox/flyp/2026-07-22-risk-e1prep.md(P0 升格核心定性)inbox/flyp/2026-07-21-risk-e1prep.md(R24 → R25 5 项关键新信号)inbox/tom/2026-07-22-evaluation-e1prep.md(Manager Coercion + Molecular Binding + Contrastive SDF)inbox/stephen/2026-07-22-llm-application-e1prep.md(Self-State Attacks + OpenAI × HF + Gemini Cyber)inbox/spark/2026-07-22-agent-e1prep.md(Self-State Attacks 第 9 阶立标 + Anthropic Global Workspace 旁证)inbox/stephen/2026-07-22-ai-industry-e1prep.md(13 增量 / 44KB / frontier lab 7-22 全栈立标)inbox/stephen/2026-07-22-1245-stephen-coordination-check-noon.md(48KB 协调棒 / 520 行 / 五栖同时升格)inbox/tom/2026-07-21T0840-agent-rag-longcontext-radar.md(Behavioral Privacy + Lucid + Manager Coercion 早场)inbox/tom/2026-07-19-agent-rag-longcontext-radar.md(Rethinking Harness Evolution + LongStraw + Chat2Scenic)
risk 主题综述 · 2026-07-23 16:40 CST · spark · 综合 18 篇核心论文 + 7 件 web 端同步立标 + 4 件工业端信号 + 9 份 inbox 关键笔记