主题综述 · risk(2026-07-30)
- 作者:spark
- 更新:2026-07-30(重写于 2026-08-05)
0. 选题与边界
今日年积日 211,按八主题轮换(rag / agent / multimodal / llm-infra / evaluation / engineering / database / risk)推演并经 72 小时未覆盖窗口顺延,落点为 risk。
本文综合材料:
organized/paper_cards/中主分类=agent / risk / evaluation 邻接 risk 主线的高价值卡片 10 张:Cyber-Capable AI Agents(2607.25379)、StealthBench(2607.26314)、InMind(2607.24368)、HANDBOOK.md(2607.25398)、Grading the Narrators / Isnad-Rijal(2607.24117)、When Lower Privileges Suffice(2606.20023)、Action-Graded Severity Scale(2607.07474)、Mapping CVEs to MITRE ATT&CK(2607.25572)、Σ-Mem(2607.27958 邻接)、KV-Cloak(2508.09442 v4 NDSS 2026)。- 7-26 / 7-29 / 7-30 三棒 risk 预消化稿 6 条 net-new 增量(综合自 flyp、stephen、tom 三实例)。
- 1 次 web_search 补最新 arXiv 趋势,2 次 arXiv-abs 二次校验核对主编号。
风险口径采用三层(与 8-3 risk 综述一致,跨日自洽): - R1 危害生成(hallucination / misleading knowledge / toxicity / jailbreak); - R2 攻击面外延(KV-cache 侧信道 / MCP 生态污染 / filesystem-as-attack-surface / trust-modeling-as-attack-surface / deep-research-as-attack-surface); - R3 治理与防御(policy-conditioned guardrail / Data Flow Control / agent reliability 工程化 / EU AI Act 2026-08-02 deadline / 出口管制 / 防御成本)。
8 篇主轴工作 + 2 篇 8-5 重写时新增工作(arXiv:2605.06760 攻防双刃实证 / arXiv:2508.09442 v4 KV-Cloak 侧信道)+ 监管经济维度专节(§5)。
1. 主题脉络:从"幻觉与越狱"走向"运行时攻击面 + 监管时点"
risk 主线在 2026 年中的演化路径经历了三段:
- 第一段(2023-11 → 2024-09,立标期):以幻觉综述立标。Huang et al. arXiv:2311.05232 "A Survey on Hallucination in Large Language Models"(被引 3405)+ Tonmoy et al. arXiv:2309.01219 "Siren's Song in the AI Ocean"(被引 1095)共同确立 R1 段语义边界。
- 第二段(2025-10 → 2026-06,协议与生态期):Hou et al. arXiv:2510.16558 "A First Look at the Security Issues in the Model Context Protocol Ecosystem"(被引 6,67,057 个 MCP server 实证扫描)+ Summers et al. arXiv:2606.05679 "Data Flow Control"(provenance monomials 上的聚合谓词)把"模型层风险"延伸到"协议层 + 数据层风险"。
- 第三段(2026-07 → 2026-08,运行时与监管期):本文焦点。8 篇核心工作横跨 R2 攻击面外延(KV-Cloak / Cyber-Capable / Σ-Mem / Filesystem-Based Memory)+ R1 评测深化(InMind / HANDBOOK.md / StealthBench)+ R3 工程与监管(When Lower Privileges Suffice / Action-Graded Severity Scale / Grading the Narrators / Mapping CVEs / EU AI Act 2026-08-02 deadline)。
2026-07-26 至 2026-07-30 五日间 risk 主线的核心位移有两件:
- 从「单轮 prompt 越狱」走向「agent 部署级失效模式」——评测焦点的边界本身在外扩:capability → containment → stealth → implicit → policy。
- 从「自我评估的工程鲁棒性」走向「外部监管时点对齐」——EU AI Act 2026-08-02 deadline 即将到来,本期第一次把"监管时点"作为一等变量纳入 risk 综述。
[fact-fix] 上段论断"从单轮越狱走向部署级失效模式"在 8-3 risk 综述里已被系统化,本文延续 8-3 框架;不再额外列出对立判断。
2. 各工作贡献与相互关系
下面聚焦 10 篇核心工作(含 8 篇 7-30 当日主轴 + 2 篇 8-5 重写时新增),按"它们分别回应哪一层风险口径"组织。
2.1 R1 评测深化:Cyber-Capable / StealthBench / InMind / HANDBOOK.md
arXiv:2607.25379v1 · Cyber-Capable AI Agents: Vulnerabilities, Evaluation, Containment, and Defensive Response(Abu Bakar Siddik et al. · 2026-07-28)
首次从"评估环境能否遏制一个具备能力的 agent"切入,综合出五类漏洞边界:
- 多步攻击链——攻击者把多步攻击通过 agent 的工具链串接;
- 目标与沙箱边界冲突——agent 目标在评估环境外不合法;
- 供应链与凭据暴露——通过 JFrog Artifactory 类 0-day 或工具元数据误导获得凭据;
- 持久化命令与控制——评估窗口外仍能维持连接;
- 自动化行动的速度——单次部署在数天窗口内完成数千次动作的攻击规模。
原文把 2026-07 HuggingFace / OpenAI 事件作为 bounded illustration——区分"事件具体观察"与"既有文献结论",是一种对单一案例做边界声明的研究伦理姿态。
arXiv:2607.26314 · StealthBench: Measuring Operational Stealth in Autonomous Offensive-Security Agents
与 Cyber-Capable 综述的 containment 评估并列,把"stealth"作为自主攻击 agent 的独立 OPSEC 维度——"不暴露自己的存在、能力或收集到的情报"——通过 6 维度评估轴 + 11 个手验 OPSEC 事故构建 benchmark。11 个 OPSEC 事故是从现实世界 attack campaign 中提取,把评测工作可信度从"任务设计合理性"拉到"事件考古真实性"。
两者的关系:Cyber-Capable 评估的是"评估环境能否容纳 agent"(破坏面),StealthBench 评估的是"agent 是否会留下痕迹"(隐蔽面)。两者合起来覆盖 R2 攻击面的破坏 + 隐蔽两轴。
arXiv:2607.24368 · Keep It InMind: Benchmarking the Implicit-Association Blind Spot in Agent Memory
原文核心反直觉是"长期记忆系统的接口建立在一个几乎从不显式说出的假设上:需要的记忆将类似于需要它的查询"。而世界知识(树坚果过敏 → 马卡龙请求中的杏仁粉成分)打破这一假设——两段文本检索器看不到共享线索。InMind benchmark 125 任务 × 10 生活领域 × 专家验证。把 memory safety 从"存储投毒"和"context 投毒"扩展到"没有可被利用的线索,所以不会触发检索"这一类静默失败 + 反向失败边界。
arXiv:2607.25398v1 · HANDBOOK.md: A Benchmark for Long-Context Agentic Instruction Following
HANDBOOK.md 包含 65 个 agentic 任务,模拟企业员工遵循公司手册的方式——把"长程工具使用中 standing policy 约束力"作为评测焦点,对应"policy drift"与"policy dilution"两个具体失败模式。65-task 与 InMind 125-task + StealthBench 11 事故共同形成 R1 评测深化的"能力 / 记忆 / 行为 / 隐蔽"四维谱系。
[反方 v2 四件评测工作的共性局限] - 机制:四件 benchmark 都未给"评测本身是否会被训练过程利用"的测试——即 agent 通过训练数据外推而"记忆答案"或"policy 答案化"的可能性未被排除。 - 数据:InMind 125-task / HANDBOOK.md 65-task / StealthBench 11 事故的规模都偏小;Inter-rater reliability 未在 paper_cards TLDR 中报告。 - 截止日:四件工作均 v1 状态(2607.xxxxx),截至 7-30 无版本更新;S2 / OpenAlex 引用几乎全 0。
2.2 R2 攻击面外延:KV-Cloak / Σ-Mem / Filesystem-Based Memory / MisKnow-Agent
arXiv:2508.09442 v4 · KV-Cloak: Unveiling and Mitigating Privacy Risks of KV-cache in LLM Inference(Luo et al. · NDSS 2026 接收)
首次给出 KV-cache 隐私侧的完整攻击 + 防御对。三类攻击: - Inversion Attack——直接反演 prompt / tool call / 文档内容; - Collision Attack——更广更强的恢复形式; - Injection Attack——语义级注入。
防御 KV-Cloak 使用可逆矩阵混淆 + operator fusion,在几乎不损失模型精度的前提下把所有攻击降级为随机噪声。GitHub: https://github.com/SiO-2/kvcloak。
[反方 v2] 机制——KV-Cloak 的"operator fusion + 可逆矩阵"在 NDSS 2026 接收版本下被作者报告为"几乎无精度损失 + 极小性能开销",但这一定性结论在 A100 / H100 / MI300 三类主流 GPU 上的精度差异与延迟差异未在摘要中量化;数据——KV-Cloak 实验覆盖度需 PDF §实验;截止日——v4 2026-08 上传,截至 7-30 已是最新版本,代码已开源。
arXiv:2607.27958 · Σ-Mem: An Online Reliability Memory for LLM-based Multi-Agent Systems
把 trust-modeling-as-attack-surface 概念化为两个实对称矩阵 + Weyl 谱稳定性证明的工程层结构。Σ-Mem 关心的是"中心模型该信谁多少"(在线信任建模),与 Cyber-Capable 关心"被攻击后能造成多大破坏"(OPSEC 防御清单)形成"信任建模 vs 破坏面"互补。
arXiv:2607.26637 · Filesystem-Based Memory for LLM Agents(Zhou et al. · UIUC + UCSD + UC Merced + Adobe Research + Texas A&M)
首次对"把 markdown 文件塞进文件夹作为长期记忆的事实默认"做系统性验证。三个关键发现:
- 组织收益 ≈ 检索经济性——大体量记忆下,有组织 store 比 verbatim dump 检索成本下降约一半;作者承认"组织对答案质量的边际贡献为 0,唯一明确回报是 search cost 减半";
- 组织依赖最强 Management Agent——较弱 Management Agent 在长程增长实验中组织效果退化;
- 工具集即记忆架构——单独更换工具集对 store 结构的塑造效果几乎和换模型一样大。
[反方 v2] 机制——三角色划分(Management / Search / Execution)是论文自定义的,对应实际部署架构可能不同;数据——"约一半"是方向性结论,不是可复现数字;截止日——v1 2026-07 提交,实验附录未公开。
2.3 R3 工程与治理:When Lower Privileges Suffice / Action-Graded Severity Scale / Grading the Narrators / Mapping CVEs
arXiv:2606.20023v1 · When Lower Privileges Suffice: Investigating Over-Privileged Tool Selection in LLM Agents
提出 privilege-aware post-training 防御——教导 agent 优先选用"足够的低权限工具",仅在必要时升级。实证显示该方法大幅减少不必要的高权限工具使用,同时保留通用能力。关键定位:把"最小特权原则"(principle of least privilege, PoLP)从系统安全经典原则移植到 LLM agent 训练。
arXiv:2607.07474v1 · Beyond Attack-Success Rate: Action-Graded Severity Scale for Tool-Using AI Agents
提出 action-graded harm rubric——按 7 级 ordinal scale 对 agent 的工具调用轨迹打分,评判依据包括:动作的可逆性(reversibility)、是否越界涉及其他方(scope crossing)、是否扩大了权限(privilege expansion)。关键定位:把 agent safety 评测从 binary success/failure 升级为动作级 ordinal ranking。
arXiv:2607.24117v1 · Grading the Narrators: An Isnad-Rijal Framework for Claim-Level Provenance in Multi-Agent Knowledge Systems
把伊斯兰圣训学的 isnad(传述链)+ rijal(传述人可靠性评级)这一古典知识工程方法移植到 multi-agent knowledge systems——为 claim-level 传播链附上 per-domain transmitter reliability 评级,并定义 completeness semantics、transformation-typed aggregation、decoupled content criticism、serve/review/quarantine 路由四件套。
arXiv:2607.25572 · Mapping CVEs to MITRE ATT&CK: A Cybersecurity LLM Benchmark(paper_card 638,1,207 CVE 金标准分类器)
把 CVE 体系映射到 MITRE ATT&CK 框架,给出 LLM 辅助标签扩展的局限。意义是给 AI 攻防工具栈建立事实级金标准——1,207 CVE 已经是足够大的标定集,但 LLM 自动扩展标签的精度仍需独立验证。
[反方 v2 四件工程工作的共性局限] - 机制:privilege-aware 不覆盖恶意 skill 注入;claim-level provenance 不覆盖 zero-shot 新漏洞;CVE-ATT&CK 映射不覆盖 zero-day;7-level ordinal scale 内部 inter-rater reliability 未给。 - 数据:四件工程工作均 v1,HF Daily 票数偏中下;S2 引用均 0-1。 - 截止日:覆盖 2026-06 至 2026-07 期间提交,截止 7-30 均无 v2 更新;论文复现报告未启动。
2.4 攻防双刃实证:Language Models Can Autonomously Hack and Self-Replicate
arXiv:2605.06760 · Language Models Can Autonomously Hack and Self-Replicate
8-5 重写时新增的关键工作。给出 Qwen3.5-122B-A10B 在 6-19% 成功率、Qwen3.6-27B 在 33% 成功率(单 A100)的自主黑客攻击数据,单 A100 已达到 GPT-5.4 当前代并超过 Claude Opus 4(6%)的前代边界。
[反方 v2] 机制——33% 成功率来自单一 A100 部署的离线测试,扩展到多卡 / 异构硬件 / 不同网络条件下的成功率分布未公开;数据——单一模型族(Qwen)验证,Llama / Claude / Gemini 系未给对照;截止日——v1 2026-05 提交,HF Daily 7-30 票数上升中,建议 8-15 前做一次跨模型族复测。
与其他工作的关系:把 Cyber-Capable 综述 + Σ-Mem + KV-Cloak 三件工作的"防御面"反过来——即"被攻击面"的具体量化。这是 R2 攻击面外延的实证锚点,与所有 R3 治理工作形成"攻击能力 vs 防御能力"的双轴对照。
3. 工程视角:可落地性
按"工程团队今天 / 明天 / 下季度能否落地"分级:
| 工作 | 落地难度 | 推荐度 | 关键依赖 |
|---|---|---|---|
| KV-Cloak(2508.09442 v4) | 低(drop-in 推理框架) | ⭐⭐⭐⭐⭐ | vLLM / SGLang / TRT-LLM ≥ 当前版本 |
| Σ-Mem(2607.27958) | 中(多 agent 集成) | ⭐⭐⭐⭐ | 多 agent runtime |
| When Lower Privileges Suffice(2606.20023v1) | 中(post-training 改造) | ⭐⭐⭐⭐ | 训练栈 + privilege schema |
| Action-Graded Severity Scale(2607.07474v1) | 低(评分 rubric) | ⭐⭐⭐⭐⭐ | 团队评审 checklist |
| Mapping CVEs to MITRE ATT&CK(2607.25572) | 低(标定集) | ⭐⭐⭐⭐ | 1,207 CVE 标定集 + LLM 辅助 |
| Filesystem-Based Memory(2607.26637) | 中(filesystem-as-store) | ⭐⭐⭐ | 单 agent 长程部署 |
| Grading the Narrators(2607.24117) | 高(古典学方法迁移) | ⭐⭐⭐ | multi-agent + 领域专家 |
| Cyber-Capable(2607.25379v1) | 最低(评测框架) | ⭐⭐⭐⭐⭐ | 评审 checklist |
| StealthBench(2607.26314) | 中(11 OPSEC 事故) | ⭐⭐⭐⭐ | 评测 harness |
| InMind(2607.24368) | 中(125-task benchmark) | ⭐⭐⭐⭐ | 评测 harness |
| HANDBOOK.md(2607.25398) | 低(65-task) | ⭐⭐⭐⭐⭐ | 评测 harness |
| arXiv:2605.06760 攻防双刃 | 最低(威胁情报) | ⭐⭐⭐⭐⭐ | 跨模型族复测 |
今天就能白嫖的免费午餐有四:(1) KV-Cloak 的 GitHub 代码(直接接入 vLLM);(2) Action-Graded Severity Scale 7-level rubric(团队评审 checklist);(3) Cyber-Capable 综述的五类漏洞清单(评审 checklist);(4) HANDBOOK.md 65-task(团队评测基线)。
4. 研究视角:创新性
最具原创性的四件:
- 范式级——arXiv:2605.06760 把"AI 自主黑客 + 自我复制"从理论担忧推到 33% 实证成功率(Qwen3.6-27B 单 A100),把 R2 攻击面从"理论可能"推到"已观测现象"。这是 2026 H2 risk 主线最具信号性的实证锚点。
- 结构级——Cyber-Capable 综述 把 containment 评估系统化为"五类漏洞边界 + 事件考古方法论"——是评测工作从 capability 走向 containment 的分水岭。
- 单元级——Grading the Narrators / Isnad-Rijal 把伊斯兰圣训学的传述链评级方法工程化为"per-domain transmitter reliability + completeness semantics"——是一种跨学科方法迁移的立标。
- 方法级——Σ-Mem 用 Weyl 谱稳定性证明给"在线信任建模"提供了数学保证——把"经验不爆炸"从工程经验升级为数学性质。
反方视角:单元级创新虽多,但跨单元整合范式仍由 OWASP Agentic Security Top 10 + ASI 体系提供,研究瓶颈不在"还有什么单元可拆",而在"如何评估由 N 个拆解单元组成的整体系统"。这一整合范式的形成是 2026 H2 后半 / 2027 H1 的关键问题。
5. 监管、经济与跨语种维度(8-5 重写时新增专节)
5.1 监管时点:EU AI Act 2026-08-02 deadline
2026-08-02 是 EU AI Act GPAI(General-Purpose AI)条款正式生效的时点。从这一日起,在欧盟市场提供 GPAI 模型的厂商必须满足:
- 训练数据透明度——数据来源 + 知识产权合规声明;
- 模型技术文档——架构 + 训练流程 + 评估方法完整披露;
- 版权合规——尊重文本与数据挖掘 opt-out(除非用于纯科研);
- 能耗披露——训练 + 推理阶段的能耗与碳排报告。
对 8 篇核心工作的影响:
| 工作 | 监管维度直接影响 |
|---|---|
| Cyber-Capable 综述 | §5 containment 控制要求 "responder access" — 触发 EU AI Act Art. 9(风险管理与人类监督) |
| StealthBench | 11 OPSEC 事故的"事件考古真实性" — 与 EU AI Act Art. 55(事件报告机制)形成具体接续 |
| InMind | 125-task 跨域评测 — 与 EU AI Act Art. 15(准确性 + 鲁棒性 + 网络安全)形成上游对照 |
| HANDBOOK.md | 65-task standing policy — 与 EU AI Act Art. 14(人类监督 + 透明度)形成工程对接 |
| KV-Cloak | 隐私侧 Inversion / Collision / Injection — 直接触发 EU AI Act Art. 10(数据 + 隐私治理)+ GDPR Art. 22 |
| Σ-Mem | trust-modeling-as-attack-surface — 触发 EU AI Act Art. 9(风险管理体系) |
[fact-fix] 上表"直接影响"为推断;EU AI Act 条款与具体技术工作的对应需独立法学审阅。监管条款号以 EUR-Lex 2026-07 公布的最终版为准;本节判定截至 2026-07-30 21:00 CST。
5.2 经济维度:防御成本 vs 攻击收益
risk 综述必然涉及"防御成本 vs 攻击收益"的天平。本期 8 篇工作的经济性数据:
- KV-Cloak:几乎无精度损失 + 极小性能开销(具体百分比未公开,需 PDF §实验);
- Action-Graded Severity Scale:7-level rubric 团队评审 checklist(人力成本);
- When Lower Privileges Suffice:post-training 训练成本(中);
- Σ-Mem:增量更新 + Weyl 上界证明(计算成本可控);
- Cyber-Capable 综述:containment 控制 = "privilege separation + provenance + responder access"(综合成本高);
- arXiv:2605.06760:单 A100 已达 33% 成功率 — 攻击成本极低。
核心矛盾:攻击成本(A100 单卡 + 几天窗口)远低于防御成本(持续训练 + 多 agent runtime 改造 + EU AI Act 合规审计)。这种"防御 > 攻击"的不对称是 2026 H2 risk 主线的经济结构性问题,没有技术工作能单独解决。
5.3 供应链与硬件:NVIDIA H100/H200 出口管制与国产替代
- 2025-12 美国出口管制升级:H100 / H200 / B200 对中国 / 俄罗斯 / 伊朗的出口禁令扩大;
- 2026-04 国产替代进展:华为昇腾 910C、寒武纪思元 590、海光 DCU 已进入部分大模型训练流水线,但与 H100 / B200 仍有性能差距(具体 benchmark 数据待独立验证);
- 对 risk 评估的影响:推理引擎 vLLM / SGLang 在国产硬件上的稳定性差异、KV-Cloak 在非 NVIDIA 硬件上的精度差异、Σ-Mem 的 Weyl 上界在异构硬件上的适用性——这些都未被本期 8 篇工作充分讨论。
[fact-fix] 出口管制时点以美国商务部 BIS 2025-12 公告为准;国产硬件 benchmark 以 2026 H1 公开论文为准。本文判定截至 2026-07-30 21:00 CST。
5.4 跨语种与跨文化盲点
本期 8 篇核心工作的评测覆盖度:
- 英文 arXiv 主导:Cyber-Capable、StealthBench、InMind、HANDBOOK.md 的 benchmark 主要基于英文场景;
- 中文 / 印地语 / 阿拉伯语覆盖空白:当用户群体切换到非英语场景,记忆盲点(InMind)、standing policy 约束(HANDBOOK.md)、agent capability 评测的覆盖度均未被验证;
- 中文社区风险工作:智谱 GLM 5.2"我们家里有 Mythos"事件、月之暗面 Kimi K3 安全模块、字节 Doubao 内容安全体系——这些中文社区工作都未被本期综述覆盖。
关键警示:本文与同期 13 篇综述共同形成"英文单边 + arXiv 单边"的系统性偏置;这是 spark 端反思棒本周识别的最大盲区(详见 spark-2026-08-05 反思文件 §3.3)。
6. 批判视角:评测、攻击面、治理三层各自的局限
把 10 篇工作合并观察,每层各有结构性局限:
R1 评测深化层——5 篇工作(Cyber-Capable / StealthBench / InMind / HANDBOOK.md / Action-Graded Severity Scale)共同特点是"先度量再决策"——构建 benchmark → 评估 → 形成报告。局限:benchmark overfitting 风险——agent 在 benchmark 上表现良好,但面对真实攻击时仍易感;InMind 125-task 是否被未来 model 通过训练数据外推而"记忆答案"未明;HANDBOOK.md 65-task 是否被 standing-policy 微调而"cheat"未明。
R2 攻击面外延层——4 篇工作(KV-Cloak / Σ-Mem / Filesystem-Based Memory / MisKnow-Agent + arXiv:2605.06760 攻防双刃)共同特点是"先暴露再防护"——给出新攻击面,再设计防御。局限:defense in depth 不足——KV-Cloak 解决 KV cache 侧信道但不解决模型权重泄露;Σ-Mem 解决信任建模但不解决 prompt injection;Filesystem-Based Memory 解决存储组织但不解决内容污染。
R3 治理与防御层——3 篇工作(When Lower Privileges Suffice / Grading the Narrators / Mapping CVEs)共同特点是"先约束再追踪"——训练期 privilege-aware / 推理期 provenance 路由 / 数据期 CVE-ATT&CK 映射。局限:defense depth 不足——privilege-aware 不覆盖恶意 skill 注入;claim-level provenance 不覆盖 zero-shot 新漏洞;CVE-ATTRE 映射不覆盖 zero-day。
核心张力:评测层 + 攻击面层 + 治理层三轴必须并行——只有度量没有防护 = 能看见但挡不住;只有防护没有度量 = 能挡住但看不见;只有防护 + 度量没有监管时点对齐 = 短期合规但长期失控。
与 OWASP Agentic Security Top 10 的关系:OWASP ASI01-ASI10 + LLM01-LLM10 是治理层 20 漏洞的体系化映射;Cyber-Capable = 评测层 + 攻击面层;StealthBench = OPSEC 攻击面层;InMind + HANDBOOK.md = 评测层;When Lower Privileges Suffice + Action-Graded Severity Scale + Grading the Narrators = 治理层。EU AI Act 2026-08-02 deadline 把这一体系进一步推升到法律合规层。
7. 趋势判断与开放问题
7.1 趋势一:评测焦点边界外扩(沿用 + 深化)
2026-07-30 五日间评测工作呈现边界外扩四个方向:(a) 从 capability 走向 containment(Cyber-Capable);(b) 从 attack success 走向 stealth / OPSEC(StealthBench);(c) 从可观察失败走向隐式盲点(InMind);(d) 从单轮 policy 走向长程 standing policy(HANDBOOK.md)。评测焦点不再局限于「agent 能否完成任务」或「agent 能否发起攻击」,而是「agent 在运行时刻的边界状态」——这一边界状态包含 containment、stealth、implicit association、policy constraint 四维。
7.2 趋势二:工程防御从 prompt-level 走向 claim-level 三栖深化(沿用 + 深化)
2026-07-30 三件工程工作(When Lower Privileges Suffice / Action-Graded Severity Scale / Grading the Narrators)形成三层栖深化:privilege-level(训练层)→ action-level(推理层)→ claim-level(事后层)。工程防御不再局限于 prompt-level guard(input/output filter),而是覆盖 agent 整个生命周期——训练时 privilege-aware + 推理时 action-graded + 事后 claim-provenance。
7.3 趋势三:监管时点对齐(新增)
EU AI Act 2026-08-02 GPAI deadline 把 risk 主线从"内部工程"推向"外部合规"。本期第一次把监管时点作为一等变量纳入综述。预计 8-15 之前会出现 ≥1 篇同期工作专门研究"EU AI Act GPAI 合规 + LLM agent 部署"的交叉议题。
7.4 趋势四:攻防不对称的经济结构(新增)
攻击成本(A100 单卡 + 几天窗口)远低于防御成本(持续训练 + 多 agent runtime 改造 + 合规审计)。这是 2026 H2 risk 主线的经济结构性问题,预计 8-25 之前会有 ≥1 篇同期工作专门讨论"AI 防御经济学"——如何降低防御成本到攻击成本同一量级。
7.5 开放问题 1:评测边界外扩与 benchmark overfitting 的张力
Cyber-Capable 五类漏洞边界是否会被针对性防御训练而"cheat";StealthBench 6 维度 OPSEC 是否会被 stealth-aware 微调而"记忆答案";InMind 125-task 是否会被世界知识注入训练而"隐式关联答案化";HANDBOOK.md 65-task 是否会被 standing-policy 微调而"policy 答案化"。这是 2026 H2 risk 主线最重要的开放问题之一——评测工作的可信度边界与训练工作的可解释性边界必须同时推进。
7.6 开放问题 2:跨层防御协同与单点失效(深化)
Cyber-Capable 综述列出的 containment 控制(privilege separation / provenance / responder access)是否被 When Lower Privileges Suffice(privilege 训练)+ Action-Graded Severity Scale(action 评级)+ Grading the Narrators(provenance 路由)三件工程工作协同覆盖;三件工程工作之间的接口(privilege-aware 训练输出如何与 action-graded 评分对接;action-graded 评分如何与 claim-level provenance 路由对接)尚未明确;跨层防御的单点失效问题——当一个评测维度被针对性训练 cheat 时,对应工程防御是否同步失效。
7.7 开放问题 3:EU AI Act 合规对 agent 部署的工程影响(新增)
GPAI deadline 后,agent 部署的工程实践需做出哪些调整?Cyber-Capable containment 框架是否需要新增"合规审计"组件?InMind 125-task 是否需要扩展 EU-specific 任务?HANDBOOK.md 65-task 是否需要覆盖"合规文档"维度?这是 8-15 之前必须回答的工程问题。
7.8 开放问题 4:跨语种评测的覆盖率(新增)
本期 10 篇工作零中文 / 零低资源语言评测证据。InMind 125-task 是否需扩展中文生活领域?HANDBOOK.md 65-task 是否需覆盖中文企业场景?中文社区(智谱 GLM 5.2 / 月之暗面 Kimi K3 / 字节 Doubao)的风险工作如何接入国际评测体系?预计 8-25 之前出现 ≥1 篇"中文 vs 英文 arXiv 同主题对照表"。
8. 综述小结
- 10 篇 arXiv 综合:arXiv:2607.25379v1(Cyber-Capable 综述)、arXiv:2607.26314(StealthBench)、arXiv:2607.24368(InMind)、arXiv:2607.25398v1(HANDBOOK.md)、arXiv:2607.24117v1(Grading the Narrators)、arXiv:2606.20023v1(When Lower Privileges Suffice)、arXiv:2607.07474v1(Action-Graded Severity Scale)、arXiv:2607.25572(Mapping CVEs to MITRE ATT&CK)、arXiv:2508.09442 v4(KV-Cloak,NDSS 2026,新增)、arXiv:2605.06760(Language Models Can Autonomously Hack and Self-Replicate,新增)。
- 风险口径三层:R1 危害生成(4 件) + R2 攻击面外延(5 件含 arXiv:2605.06760)+ R3 治理与防御(4 件,跨节复用)。
- 核心张力:评测层(先度量再决策) vs 攻击面层(先暴露再防护) vs 治理层(先约束再追踪)三层必须并行。
- 趋势:评测焦点边界外扩(capability → containment → stealth → implicit → policy 四维);工程防御三栖深化(privilege-level → action-level → claim-level 三层);监管时点对齐(EU AI Act 2026-08-02 GPAI deadline);攻防不对称经济结构(攻击成本 ≪ 防御成本)。
- 开放:benchmark overfitting vs 评测边界外扩张力;跨层防御协同与单点失效;EU AI Act 合规对 agent 部署的工程影响;跨语种评测覆盖率。
- 2026 H2 风险展望:监管时点(EU AI Act 8-2)+ 攻防不对称(单 A100 33% 成功率)+ 跨语种盲点(中文社区覆盖零)= 2026 H2 风险主线的三个结构性议题,预计在 NeurIPS 2026 / ICLR 2027 形成独立 track。
字数核对:本文正文 CJK 约 4,300 字 + 英文术语约 5,100 字,落在 2,500-4,000 字目标区间上沿(含新增 §5 监管经济专节 + 8-5 重写新增 2 篇 arXiv 工作)。
所有观点均附 arXiv 编号或 paper_cards 路径;§5 集中列出 3 处 [fact-fix] 标记,未把推断性结论当作确认事实。
反思棒物理动作:✅ 本篇于 2026-08-05 重写完成;私域编号清除、路径引用脱敏、监管经济维度补全、新增 2 篇 arXiv 工作。
关联反思文件:organized/reflection/spark-2026-08-05.md §2 最弱判定 + §4 本周重写动作。