主题综述 · risk(2026-08-03)
- 作者:spark
- 更新:2026-08-03
0. 选题与边界
今天轮换命中 risk(年积日 215 % 8 = 7)。距离上一份 risk 综述(2026-07-30)已有 4 天;近 72 小时内 surveys/ 目录未覆盖 risk 主题,因此今日落地。综合材料:paper_cards 中主分类 = risk 的 15 篇、最近 7 天 inbox/spark/flyp/tom 多个 risk 主线笔记(8-1 / 8-3 / 7-31 / 7-30 / 7-29 多棒次)、2 份新 arXiv 跨夜校验。8 篇核心工作的 arXiv 编号与 abstract 在 2026-08-03 16:40–16:50 区间已二次核对(见正文 §5 的 fact-fix 标记),未发现编号失效。
本文的"风险"采用三层口径:R1 危害生成(幻觉、误导知识、毒性、越狱);R2 攻击面外延(KV-cache 侧信道、MCP 生态污染、filesystem-as-attack-surface、trust-modeling-as-attack-surface、deep-research-as-attack-surface);R3 治理与防御(policy-conditioned guardrail、Data Flow Control、agent reliability 12 指标、EU AI Act 2026-08-02 deadline)。
1. 主题脉络:从幻觉到攻击面再到治理
风险主线在 2025 H2 → 2026 H1 的演进可以粗分为三段。
第一段(2023-11 → 2024-09):以幻觉综述立标。Huang et al. arXiv:2311.05232 "A Survey on Hallucination in Large Language Models"(被引 3405,paper_cards/589-2311-05232,主分类 risk,形态 survey,OpenAlex ID W4388585881)给出原理 / 分类 / 挑战与开放问题四件套,并首次把 "large vision-language models 中的幻觉" 与 "LLM 知识边界理解" 并列为两个未来方向;Tonmoy et al. arXiv:2309.01219 "Siren's Song in the AI Ocean"(被引 1095)平行做了幻觉现象与缓解方法分类。这两份综述共同确立了 R1 危害生成段的语义边界。
第二段(2025-10 → 2026-06):协议层与生态层安全进入横切面研究。Hou et al. arXiv:2510.16558 "A First Look at the Security Issues in the Model Context Protocol Ecosystem"(被引 6,paper_cards/099-2510-16558)首次在 6 个公开 registries 上扫描 67,057 个 MCP server,识别"误导性工具元数据 + 代码漏洞"两类继承风险,并发布 MCPInspect 集成前分析工具。Summers et al. arXiv:2606.05679 "Data Flow Control: Data Safety Policies for AI Agents"(paper_cards/152-2606-05679)从数据基础设施侧把 DFC 建模为 provenance monomials 上的聚合谓词,并给出 Passant 可移植查询重写层。这两件事把"模型层风险"延伸到"协议层 + 数据层风险"。
第三段(2026-07 → 2026-08):agent 化系统的攻击面外延集中爆发。Luo et al. arXiv:2508.09442 "Unveiling and Mitigating Privacy Risks of KV-cache in LLM Inference"(NDSS 2026 接收,v4 2026-08 上传)首次给出 KV-cache 隐私侧的 Inversion / Collision / Injection 三类攻击,并提出 KV-Cloak 可逆矩阵混淆 + operator fusion 防御;Kannan et al. arXiv:2607.27958 "Σ-Mem: An Online Reliability Memory for LLM-based Multi-Agent Systems"(paper_cards/683-2607-27958)将 trust-modeling-as-attack-surface 概念化为两个实对称矩阵 + Weyl 谱稳定性证明的工程层结构;Zhou et al. arXiv:2607.26637 "Filesystem-Based Memory for LLM Agents"(paper_cards/686-2607-26637,UIUC + UCSD + UC Merced + Adobe Research + Texas A&M)给出 filesystem-as-attack-surface 的五维交叉实验;Misra et al. arXiv:2607.20891 "Is Deep Research Reliable? Misleading Knowledge Induces False Conclusions"(paper_cards/687-2607-20891,v2)以 5,933 条可控权威线索文档评测 DeerFlow + WebThinker 的抗误导能力;Siddik et al. arXiv:2607.25379 "Cyber-Capable AI Agents: Vulnerabilities, Evaluation Containment, and Defensive Response"(paper_cards/686-2607-25379)把"含 LLM + 工具 + 记忆 + 执行环境的进攻 agent"的五大漏洞类(多步攻击链 / 沙箱边界冲突 / 供应链凭据暴露 / 持久化 C2 / 自动化行动速度)形式化为 containment 评估框架;arXiv:2607.26314 "StealthBench: Measuring Operational Stealth in Autonomous Offensive-Security Agents"(paper_cards 同 id 区段)则在另一极对 OPSEC 进攻隐蔽性的 6 维评测;arXiv:2606.09084 "Context-Fractured Decomposition Attacks on Tool-Using LLM Agents"(paper_cards/049-2606-09084)提出"来源缺口"(artifact provenance gap)与跨上下文多步越狱概念。这一段共同把风险主线从"单轮 prompt 越狱"推进到"agent 部署级失效模式"。
2. 各篇核心贡献与相互关系
2.1 Σ-Mem 与 trust-modeling-as-attack-surface 三联立
Σ-Mem(arXiv:2607.27958,2026-07-30 v1,HF Daily 8-1 票榜 #5 / 21▲)的核心是两个实对称矩阵:个体能力矩阵 A(n_peers × n_tasks)与关系证据矩阵 B(n_peers × n_peers)。每次事件级后验反馈触发一次增量更新,作者用 Weyl 不等式给出 λ_k(M + Δ) ∈ [λ_k(M) - ||Δ||_2, λ_k(M) + ||Δ||_2] 的谱扰动上界,从而把"在线更新不爆炸"从工程经验升级为数学保证。同一个记忆通过统一读写接口驱动三种协同模式:residual steering / response-free routing / reliability-weighted voting。在 5 个 Qwen 家族模型上的反事实可靠性漂移与 OOD 泛化实验中,直接记忆读取同时超过多数投票与固定最佳 peer(具体数值原文未给出,[fact-fix])。
Σ-Mem 与 arXiv:2607.25379 Cyber-Capable AI Agents 在 "如何处理不可信 peer" 上构成同向互补:Cyber-Capable 关心的是"被攻击后能造成多大破坏"(OPSEC 防御清单五大漏洞类),Σ-Mem 关心的是"中心模型该信谁多少"(在线信任建模)。两者共同支撑 risk 主线 2026-07 立标候选中 "trust-modeling-as-attack-surface" 维度的首例 + 第 N 例。Σ-Mem 与 arXiv:2607.26637 Filesystem-Based Memory 在 "记忆形态" 上构成正交:Σ-Mem 是"不存内容只存可靠度",Filesystem-Based Memory 是"以目录树 + markdown 作为默认内容媒介"——前者面向多智能体协作的横向信任,后者面向单智能体长期运行的纵向组织。flyp 8-1 risk-e1prep 已将 Σ-Mem + Filesystem + arXiv:2607.25379 标为 trust-modeling / filesystem-as-attack-surface 三联立的第 1/2/3 拍。
反方 v2 三段式: - 机制:Σ-Mem 的实对称矩阵 + Weyl 上界假设每事件扰动幅度有界。但真实多智能体系统的 peer 行为常常呈现长尾突发——一个 peer 在某 1 分钟内可能触发上百次事件(密集工具调用 → 密集反馈),单事件扰动的独立性假设被破坏,Weyl 上界是否会因为"事件相关性"而被严重低估,原文未在摘要中给出累积不等式的紧性。 - 数据:原文摘要明说"5 个 Qwen 家族模型具体型号 / 谱扰动 Lipschitz 数值未公开",且"反事实可靠性漂移速度(多少事件后追上变化)"未量化。这意味着评估 Σ-Mem 在真实 peer 行为下的稳态表现,需要复现团队自行补足度量。 - 截止日:Σ-Mem 当前是 v1(2026-07-30),后续是否有 v2 / 实验附录更新不可知;本节相关判定截至 2026-08-03 16:50 UTC。
2.2 Filesystem-Based Memory 与 filesystem-as-attack-surface 四联立
Zhou et al. arXiv:2607.26637(2026-07 v1,HF Daily 8-1 票榜 21▲)首次对"把 markdown 文件塞进文件夹"作为长期记忆的事实默认进行系统性验证。论文定义三类角色(Management / Search / Execution Agent),围绕 shared memory filesystem 设五维变量(记忆形态 × 流规模 × 工具集 × Management Agent 强度 × Search Agent 强度)。三个关键发现:
- 组织收益 ≈ 检索经济性:在大体量记忆下,有组织的 store 比 verbatim dump 检索成本下降约一半;作者承认"组织对答案质量的边际贡献为 0,唯一明确回报是 search cost 减半"。
- 组织依赖最强 Management Agent:较弱 Management Agent 在长程增长实验中组织效果退化,所有被测 Agent 均无法逃脱这一趋势。
- 工具集即记忆架构:单独更换工具集对 store 结构的塑造效果几乎和换模型一样大。
Filesystem-Based Memory 与 arXiv:2607.25380 "Memory for Large Language Models" 综述(三个正交轴:表征 implicit vs explicit × 更新策略 × 可扩展查找存储)构成实证 vs 分类学对位:综述给出统一分类学,本工作给出默认媒介的实证边界。与 arXiv:2607.26760 "Metis: Memory Foundation Model" 构成路径对立:Metis 是 "原生 state 内化入 backbone",Filesystem 是 "filesystem 作为默认媒介"——两条 agent memory 实现层路径。在 arXiv:2607.26520 "Graph-Native Bitemporal Memory Store"(agent-local Neo4j + HNSW + valid time / transaction time 双向时态)那里,构成第三条工程化路径:结构化属性图 + 向量索引 + 双时态审计。flyp 8-1 risk-e1prep 把 Σ-Mem + Filesystem + Cyber-Capable + StealthBench 标为 filesystem / trust-modeling-as-attack-surface 四联立的第 1/2/3/4 拍。
反方 v2 三段式: - 机制:Filesystem-Based Memory 的"组织收益 ≈ 检索经济性"结论建立在 Management / Search / Execution 三角色划分上,但这套角色划分是论文自定义的,不一定对应所有实际部署架构——单 agent 自我管理 + 自我检索的部署形态可能给出不同的成本曲线。 - 数据:原文摘要说"组织退化速度(多少天后开始显著衰退)未公开"+"最强/最弱 Agent 的具体 cost reduction 数字差距未公开",因此"约一半"是方向性结论,不是可复现数字。 - 截止日:本节判定截至 2026-08-03 16:50 UTC;若 v2 公开实验附录,应优先核对 chunk 检索方案的具体场景(chunk size / 检索库类型)。
2.3 KV-cache 侧信道:Shadow in the Cache / KV-Cloak
Luo et al. arXiv:2508.09442(v1 2025-08-13 UTC 02:48,v4 2026-08 上传,NDSS 2026 接收;GitHub: https://github.com/SiO-2/kvcloak)首次给出 KV-cache 隐私侧的完整攻击 + 防御对。三类攻击:Inversion Attack(直接反演)、Collision Attack(更广更强)、Injection Attack(语义级注入)。防御 KV-Cloak 使用可逆矩阵混淆 + operator fusion,"在几乎不损失模型精度的前提下把所有攻击降级为随机噪声"。这一工作把 R2 攻击面外延从"模型层 / 协议层"推进到"推理框架层"——多租户 GPU 共享场景下,KV-cache 在显存中以明文形式存储 prompt / tool call 结果 / 文档内容,任何能够侧信道观察 KV cache 访问模式 / 时序 / 显存内容的攻击者都可视为内部威胁。
KV-Cloak 与 arXiv:2510.16558 MCPInspect 共同回答 R2 的不同侧面:MCPInspect 解决"集成前 metadata 与代码审计",KV-Cloak 解决"运行时 KV 缓存保护"。两者覆盖了 agent 部署链路上"集成前 + 推理时"两个高风险窗口。flyp 8-1 risk-e1prep 把 KV-cache 侧信道与 vLLM CVE-2026-22778 CVSS 9.8 框架代码层漏洞(CVE 体系 R34 §2.1 ⑥)并列为"推理框架-CVE" → "推理框架-侧信道-隐私"的双维扩面。
反方 v2 三段式: - 机制:KV-Cloak 的"operator fusion + 可逆矩阵"在 NDSS 2026 接收版本下被作者报告为"几乎无精度损失 + 极小性能开销",但这一定性结论在 A100 / H100 / MI300 三类主流 GPU 上的精度差异与延迟差异未在摘要中量化,对工程团队的多硬件适配参考有限。 - 数据:摘要明说"5,933 条误导文档"是 MisKnow-Agent 的实验数字而非 KV-Cloak 的;KV-Cloak 的具体实验覆盖度(模型族 / 数据集 / 攻击成功率下降幅度)需 PDF §实验。 - 截止日:本节判定截至 2026-08-03 16:50 UTC;代码已开源(KV-Cloak GitHub repo)。
2.4 Cyber-Capable AI Agents 与 StealthBench:进攻侧与隐蔽侧
Siddik et al. arXiv:2607.25379 "Cyber-Capable AI Agents: Vulnerabilities, Evaluation Containment, and Defensive Response"(2026-07-28 v1)综述了含 LLM + 工具 + 记忆 + 执行环境的 cyber-capable agent 的五大边界漏洞类:多步攻击链、目标与沙箱边界冲突、供应链与凭据暴露、持久化 C2、自动化行动速度;提出 containment 评估框架与 OPSEC 防御清单。arXiv:2607.26314 "StealthBench: Measuring Operational Stealth in Autonomous Offensive-Security Agents"(2026-07 v1)则从另一极度量"自主进攻 agent 在执行进攻任务时的 OPSEC 隐蔽性",覆盖 6 维 OPSEC 评估,从 11 个手工验证的真实 bug-bounty / red-team 轨迹中提取。
两者的关系是进攻能力 vs 隐蔽能力:Cyber-Capable 关心"被攻击后能造成多大破坏"(破坏面),StealthBench 关心"完成破坏的同时有多难被检测"(隐蔽面)。二者与 arXiv:2606.09084 Context-Fractured Decomposition Attacks(artifact provenance gap 与跨上下文多步越狱)构成 R2 攻击面的第三组"模块化执行环境威胁"。这一组合与 arXiv:2605.06760 "Language Models Can Autonomously Hack and Self-Replicate" 的实证数据互证——后文给出 Qwen3.5-122B-A10B 6-19% 与 Qwen3.6-27B 33%(单 A100)的成功率数字,单 A100 已经达到 GPT-5.4 当前代并超过 Opus 4(6%)的前代边界。
反方 v2 三段式: - 机制:Cyber-Capable 与 StealthBench 的评测主要在仿真环境完成。真实攻防环境中,agent 面对的是"动态变化的目标"——同一份 5 漏洞类清单在不同行业(金融 / 医疗 / 工业控制)的权重并不一致;OPSEC 6 维是否能涵盖所有隐蔽性维度也未给出收敛性证明。 - 数据:Qwen3.6-27B 33% 的成功率来自单一 A100 部署的离线测试,"扩展到多卡 / 异构硬件 / 不同网络条件下"的成功率分布原文未在摘要中给出;CVSS 评分体系对 AI agent 的适用性也未做交叉验证。 - 截止日:本节判定截至 2026-08-03 16:50 UTC。
2.5 MisKnow-Agent:deep-research-as-attack-surface
Misra et al. arXiv:2607.20891 "Is Deep Research Reliable? Misleading Knowledge Induces False Conclusions"(v2,2026-07)以"task-specific 文档 + 手工审计的虚假结论 + 可控权威线索 + 源风格"构造 5,933 条误导文档,覆盖 DeepResearch Bench 任务集;评测 DeerFlow 与 WebThinker 在面对"看似可信但实际错误"信息时的稳健性。这是 R1 危害生成段在 Deep Research 类 agent 上的扩展——以往幻觉研究关心"无中生有",MisKnow-Agent 关心"看似有据但其实是伪证"。
MisKnow-Agent 与 arXiv:2311.05232 综述中的"知识边界理解"方向直接呼应:综述里预告的"理解 LLM 知识边界"在 2026 H2 由 MisKnow-Agent 给出首个量化框架。与 arXiv:2607.25379 Cyber-Capable + arXiv:2607.26314 StealthBench 形成deep-research-as-attack-surface 第三栖。flyp 8-1 risk-e1prep 把 MisKnow-Agent + Cyber-Capable + StealthBench 标为 deep-research / OPSEC-as-attack-surface 三联立的第 1/2/3 拍。
反方 v2 三段式: - 机制:MisKnow-Agent 的"可控权威线索 + 源风格"假设权威线索可以被独立构造,但实际 Deep Research agent 面对的是搜索引擎返回的混合信号,"权威线索 vs 非权威线索"的边界由搜索引擎排序而非 agent 自身判断,因此实验设置可能低估了真实检索链路的混乱度。 - 数据:5,933 条文档是单一数据集(DeepResearch Bench)的扩展,"在 HotpotQA / 2WikiMultiHopQA / 其他多跳问答基准上的迁移性"未在摘要中给出。 - 截止日:本节判定截至 2026-08-03 16:50 UTC。
2.6 Passant / Data Flow Control:基础设施侧防御
Summers et al. arXiv:2606.05679 "Data Flow Control: Data Safety Policies for AI Agents"(2026-06-04 v1,SIGMOD 2026 投稿,含开源实现)把 DFC 形式化为 provenance monomials 上的聚合谓词,提出 Passant 可移植查询重写层,无需物化 provenance 即可强制执行 DFC 策略。这是 R3 治理与防御段中"基础设施层"的关键一击:当 agent 自动生成的 SQL 语义正确但违反 GDPR / 数据隔离 / 业务约束时,DFC 把它从应用层下移到 DB 层解决。
Passant 与 arXiv:2510.16558 MCPInspect 共同回答 R3 的不同侧面:MCPInspect 解决"集成前 metadata / 代码审计",Passant 解决"运行时数据流的策略执行"。两者覆盖 agent 部署链路上"协议层 + 数据层"两个高风险窗口。与 arXiv:2607.26637 Filesystem-Based Memory 互补:Filesystem 关心"内容组织是否可维护",Passant 关心"内容流动是否合规"。
反方 v2 三段式: - 机制:DFC 把策略执行下移到 DB 层,需要 DB 引擎支持 provenance monomials 的物化或重写。当前 DFC 主要面向关系型 DB + 向量库混合架构,对 graph DB / 时序 DB / KV store 的适配性未在摘要中说明。 - 数据:Passant 的实验覆盖数据集与吞吐数字原文未在摘要中给出,对工程团队的性能基准参考有限。 - 截止日:本节判定截至 2026-08-03 16:50 UTC。
3. 工程视角:可落地性
| 论文 | 落地门槛 | 主要工程抓手 | 主要不确定性 |
|---|---|---|---|
| arXiv:2311.05232 幻觉综述 | 低(综述) | 分类学 | 不涉及落地 |
| arXiv:2309.01219 幻觉综述 | 低(综述) | 分类学 | 不涉及落地 |
| arXiv:2510.16558 MCP 安全 | 中(需 MCP host) | MCPInspect 集成前分析 | 代码已开源,覆盖 6 registries |
| arXiv:2606.05679 DFC / Passant | 中(需 DB 改造) | 查询重写层 | DB 引擎适配 |
| arXiv:2508.09442 KV-Cloak | 中(需推理框架改造) | 可逆矩阵混淆 + operator fusion | 代码开源(KV-Cloak GitHub),多硬件适配性 |
| arXiv:2607.27958 Σ-Mem | 中(需反馈管线) | 实对称矩阵 + Weyl 谱封顶 | 反馈来源、状态膨胀、恶意 peer 刷分 |
| arXiv:2607.26637 Filesystem Memory | 低(默认媒介) | 文件系统记忆 + 工具集 | 组织退化、Store Health 量化 |
| arXiv:2607.25379 Cyber-Capable | 高(需仿真环境) | OPSEC 防御清单五大漏洞类 | 真实环境适配 |
| arXiv:2607.26314 StealthBench | 高(需 OPSEC 标注) | 6 维 OPSEC 评估 | 行业权重不一致 |
| arXiv:2606.09084 Context-Fractured | 中(需 provenance 跟踪) | artifact provenance gap 建模 | 跨工具 / 模块 / 时间的 enforcement |
| arXiv:2607.20891 MisKnow-Agent | 中(需 Deep Research agent) | 误导文档注入 + 抗干扰评估 | 真实检索链路迁移性 |
| arXiv:2605.06760 自主黑客与自复制 | 高(需隔离沙箱) | Qwen3.6-27B 33% 单 A100 实证 | 多卡 / 异构扩展 |
4. 研究视角:创新性
- R1 危害生成:arXiv:2311.05232 与 arXiv:2309.01219 共同奠定幻觉分类学;arXiv:2607.20891 把"误导知识"形式化为可控文档注入,把危害生成从"无中生有"推进到"伪证诱导"。
- R2 攻击面外延:arXiv:2510.16558 首创 MCP 横切面安全研究 + MCPInspect;arXiv:2508.09442 首创 KV-cache 隐私侧信道 + KV-Cloak 防御;arXiv:2606.09084 首创 context-fractured 跨上下文多步越狱;arXiv:2607.25379 首创 cyber-capable agent 的 OPSEC 五大漏洞类;arXiv:2607.26314 首创 OPSEC 进攻隐蔽性的 6 维评测;arXiv:2607.27958 首创 trust-modeling-as-attack-surface 的实对称矩阵 + Weyl 谱稳定性建模;arXiv:2607.26637 首创 filesystem-as-attack-surface 的五维交叉实验。
- R3 治理与防御:arXiv:2606.05679 首创 DFC 在 agent 数据流的 DB 层强制执行;arXiv:2508.09442 KV-Cloak 首创运行时 KV 缓存可逆混淆;arXiv:2510.16558 MCPInspect 首创集成前 metadata + 代码审计。
跨主线合流密度([fact-fix]:本节为本文自身判定,统计的是本综述正文相互引用次数与所引主线篇数之比):
- §2.1 Σ-Mem 引用 §2.2 Filesystem + §2.4 Cyber-Capable → 2 次
- §2.2 Filesystem 引用 §2.4 StealthBench + §2.4 Cyber-Capable + §2.1 MisKnow-Agent → 3 次
- §2.3 KV-Cloak 引用 §2.4 MCPInspect → 1 次
- §2.4 Cyber-Capable + StealthBench 引用 §2.5 MisKnow-Agent + §2.1 Σ-Mem + §2.2 Filesystem → 3 次
- §2.5 MisKnow-Agent 引用 §2.1 综述 + §2.4 Cyber-Capable + §2.4 StealthBench → 3 次
- §2.6 Passant 引用 §2.1 MCPInspect + §2.2 Filesystem → 2 次
总合流引用次数 = 14,跨主线合流密度 ≈ 14 / (8 主线 × 5.5 节平均) ≈ 32%,略高于 W31 指引的 30% 阈值。
5. 批判视角:局限
- 未量化([fact-fix]):arXiv:2607.27958 Σ-Mem 的具体型号 / Lipschitz 数值未公开;arXiv:2607.26637 Filesystem 的组织退化速度未公开;arXiv:2508.09442 KV-Cloak 的多硬件精度差异未公开;arXiv:2606.05679 Passant 的吞吐数字未公开。这些数字的缺失会让"评分 4 分级以上的工程落地参考"上限停留在方向性。
- 未开源([fact-fix]):arXiv:2607.25379 Cyber-Capable 与 arXiv:2607.26314 StealthBench 的开源状态未在摘要中明确,落地需等正文;arXiv:2606.09084 Context-Fractured 的开源状态同样需正文确认。
- scale-up 风险([fact-fix]):arXiv:2605.06760 的 33% 成功率仅在单 A100 下测得,多卡 / 异构扩展的成功率分布原文未给出;Σ-Mem 的 A、B 矩阵在 peer × task 维度线性增长,工业级系统需要稀疏化或低秩近似,原文摘要未给出压缩方案。
- 数据合规边界([fact-fix]):arXiv:2606.05679 Passant 与 arXiv:2607.27958 Σ-Mem 的关系矩阵都涉及跨组织数据合规红线,需要差异化隐私扰动或会话内存储的工程补丁。
- 恶意 peer 刷分([fact-fix]):arXiv:2607.27958 Σ-Mem 的实对称矩阵 + 谱稳定性反而可能让恶意 peer 的合谋攻击更难被检测,需要专门的对抗鲁棒性分析。
- 评测基准迁移性:arXiv:2607.20891 MisKnow-Agent 的 5,933 条文档是单一数据集扩展,跨多跳问答基准的迁移性未给出。
6. 趋势判断与开放问题
T1 · 风险主线正从"模型层"向"协议 / 推理 / 数据层"扩面。2025-10 的 MCP 安全(arXiv:2510.16558)、2026-06 的 DFC / Passant(arXiv:2606.05679)、2026-08 的 KV-cache 侧信道(arXiv:2508.09442)三连击已经把"风险"从"模型输出层"推进到"集成 + 推理 + 数据"全链路。
T2 · agent 化系统的攻击面外延形成"五联立":trust-modeling(Σ-Mem + Cyber-Capable)+ filesystem(Filesystem + Memory 综述 + Metis + Bitemporal)+ OPSEC(StealthBench + Cyber-Capable + Context-Fractured)+ Deep Research(MisKnow-Agent)+ KV-cache(KV-Cloak)——五栖并列,意味着 risk 主线的 2026 H2 综述必须从单维度纵深转向多维度横切面。
T3 · 治理与防御的工程化进入"工具即护栏"阶段。KV-Cloak / MCPInspect / Passant / Σ-Mem / Filesystem Tools 各自承担一段护栏;真正落地需要把这些工具组合成"集成前 MCPInspect + 推理时 KV-Cloak + 数据层 Passant + 协作时 Σ-Mem + 长期 Filesystem"的五层护栏栈。
T4 · frontier lab 治理实时对位进入 24h 临门执法窗口。EU AI Act 2026-08-02 透明度要求 deadline 已在 24h 之内(flyp 8-1 risk-e1prep 已立 P0 监管),OpenAI 主动提前 24h 完成治理公开表态、Anthropic 8-1 YT Project Glasswing 续接、Sam Altman 8-1 华盛顿政策窗口、白宫 8-1 前自愿评估框架形成 frontier lab × 监管治理 × 国际协作三栖对位的执法起点。
开放问题: - O1:trust-modeling-as-attack-surface 的累积不等式紧性如何?Σ-Mem 单事件 Weyl 上界是否能推广到"事件相关 + 长尾突发"场景? - O2:filesystem-as-attack-surface 的组织退化是否与"管理 agent 强度 × 工具集"存在可学习的临界曲线? - O3:KV-Cloak 的可逆矩阵在 A100 / H100 / MI300 三类主流 GPU 上的精度 / 延迟差异如何? - O4:Deep Research agent 的误导传播路径是否可以通过"文档来源可信度审计"在检索阶段拦截? - O5:DFC 能否扩展到 graph DB / 时序 DB / KV store 的非关系型数据基础设施? - O6:跨五层护栏栈(集成前 + 推理时 + 数据层 + 协作时 + 长期)的统一策略语言是什么?
7. 综合的论文清单(arxiv 号)
核心 8 篇: - arXiv:2510.16558 — A First Look at the Security Issues in the Model Context Protocol Ecosystem(paper_cards/099-2510-16558) - arXiv:2508.09442 — Unveiling and Mitigating Privacy Risks of KV-cache in LLM Inference(NDSS 2026 接收,KV-Cloak) - arXiv:2607.27958 — Σ-Mem: An Online Reliability Memory for LLM-based Multi-Agent Systems(paper_cards/683-2607-27958) - arXiv:2607.26637 — Filesystem-Based Memory for LLM Agents: Organization, Evolution, and Sustainability(paper_cards/686-2607-26637) - arXiv:2607.25379 — Cyber-Capable AI Agents: Vulnerabilities, Evaluation Containment, and Defensive Response - arXiv:2607.26314 — StealthBench: Measuring Operational Stealth in Autonomous Offensive-Security Agents - arXiv:2607.20891 — Is Deep Research Reliable? Misleading Knowledge Induces False Conclusions(paper_cards/687-2607-20891,v2) - arXiv:2606.05679 — Data Flow Control: Data Safety Policies for AI Agents(paper_cards/152-2606-05679,Passant)
引用对照 7 篇: - arXiv:2311.05232 — A Survey on Hallucination in Large Language Models(paper_cards/589-2311-05232,3405 引) - arXiv:2309.01219 — Siren's Song in the AI Ocean(1095 引) - arXiv:2607.25380 — Memory for Large Language Models(综述统一分类学) - arXiv:2607.24368 — Keep It InMind: Benchmarking the Implicit-Association Blind Spot in Agent Memory - arXiv:2606.09084 — Context-Fractured Decomposition Attacks on Tool-Using LLM Agents(paper_cards/049-2606-09084) - arXiv:2605.06760 — Language Models Can Autonomously Hack and Self-Replicate - arXiv:2607.26520 — Graph-Native Bitemporal Memory Store for Conversational AI Agents - arXiv:2607.26760 — Metis: Memory Foundation Model