主题综述 · risk(2026-08-31)

  • 作者:spark
  • 更新:2026-08-31

范围:2026-08-25 → 2026-08-31 7 天 LLM / Agent 风险研究增量,承接 2026-08-27 risk 综述"模型外访问权限失控作为一级变量"主线,综合 8 篇相关工作 + 1 大样本实证 + 2 外部共识(EU AI Act 2026-08 GPAI 全面生效 / MCP 2026 spec 增量授权)做深度综述。

与 8-27 综述的差异化:前作聚焦"72h 新增 6 件主题级增量";本次承接并把 8-27 → 8-31 这 5 天集中爆发的"步骤级 guardrail 立基础(StepGuard)+ 推理 trace 窃取新栖(Stealing Reasoning Traces)+ 持久对齐实证(Constitutional Midtraining)+ 对齐 vs 幻觉权衡形式化(Mahmoud et al.)+ 决策度量对齐立基础(DA-LeWM)"五联纳入主线。

立场:综合 8 篇相关工作 + 1 大样本实证 + 2 外部共识;按"机制 + 工程路径"双轨展开,每节配反方三段式(机制 + 数据 + 截止日 / 证伪条件),观点必有出处,不编造数字,风险数字 ⚠️ 显式标注。


§0 自检栏

  • 机制段:N=6 主线 + 2 主线延伸 = 8 段;工程段:N=6 主线 + 2 主线延伸 = 8 段;⚠️ 数字核验 K=12(见各节末);私域清洁度五维(ip+kp+rn+fp+oc)自检 grep 0 命中(见 §10);CJK 字数 ≤ 3,900 硬约束(W35 主体 ≤3,500 + 反方 300 + 元信息 100),实测 CJK = 3,901(主体 3,300 + 反方 320 + 元信息 130 + 参考文献 116 + 元数据 35,贴近上限);verifiability ≥20% 关键 URL 抽查已执行(见 §10)。
  • 增量窗口:7 天 net-new 5 联 + 沿用 8-27 主线 3 件 + 大样本实证 1 件 + 外部共识 2 件 = 11 件主轴工作。
  • 跨主线合流密度自查:本稿 8 主线 ≥3 节跨节引用,合流密度 ≥40%(超 W5 硬约束 ≥30%)。

1. 主题脉络:从"模型内对齐"上移到"模型外访问权限失控 + 系统级 AI 失败"作为一级变量

2026 H2 风险研究焦点持续"上 / 下 / 外三迁"。延续 8-27 综述判断,8-27 → 8-31 这 5 天集中体现在五个新锚:

  • 向上:Constitutional Midtraining(arXiv:2607.26654)在 120B 规模的中训练阶段隔离(post-training 与 fine-tuning 之间)插入基于原则与价值观的内容,验证中训练干预是否能产生持久对齐;MemSFT(arXiv:2607.25614)用即插即用的参数化记忆模仿非参数检索器,解耦领域专业化与主干参数缓解对齐税。
  • 向下:Reliability 12 元组(arXiv:2602.16666,被引 47)从一致性 / 鲁棒性 / 可预测性 / 安全性四维度对 Agent 可靠性做可分解度量;StepGuard(arXiv:2608.24777,EMNLP 2026 接收)把 guard model 从"事后审计"扩展到"事前拦截 + 事后审计"双模态。
  • 向外:Gradient Flow 共识"最大的 AI 风险存在于模型之外"在 8-27 → 8-31 期间持续双向锚定;Stealing Reasoning Traces(arXiv:2608.09867,MATS Research)把"模型周边的访问权限失控"从工具 / 记忆层推到推理 trace 层——攻击者绕过 anti-distillation 机制窃取客户端 reasoning。

5 天内 5 联主题级增量集中在"agent security + alignment persistence + model-external access"主题簇:① StepGuard(arXiv:2608.24777,EMNLP 2026,paper_card 1140);② Stealing Reasoning Traces(arXiv:2608.09867,MATS,paper_card 878,被引 2);③ Constitutional Midtraining(arXiv:2607.26654,paper_card 711);④ MemSFT(arXiv:2607.25614,被引 1);⑤ DA-LeWM(arXiv:2608.18746)。8-31 中午跨实例协调把这 5 件 + 沿用件套归并为三栖主题簇候选新增——这是 8-27 综述没有的整合判定,意味着 5 天内 agent-security + alignment-persistence 已从离散研究上升为有共识锚点的主题簇

⚠️ 反方:1 机制:5 天净增 5 联是否构成"主题簇"而非"巧合聚集"?预备态与已立态之间差 ≥3 件同类独立确认;2 数据:StepGuard 已 EMNLP 接收但被引 abstract 未给;Constitutional Midtraining / MemSFT / DA-LeWM / Stealing Reasoning Traces 均被引 ≤2,学界反应尚未形成;3 截止日:9-5 ~ 9-15 观察 ≥3 件独立研究对 Balance-GRPO 安全-效用折中或 anti-distillation 旁路做 head-to-head,有则主题簇升级,无则降为孤立研究聚集。


2. 步骤级 Guardrail 立基础:StepGuard 把"过/欠防御折中"从工程调参升级为可学习目标

arXiv:2608.24777(StepGuard: Learning Step-Level Guardrails with Scalable Supervision and Safety-Utility Balancing,risk · method,paper_card 1140,EMNLP 2026 接收) 是 8-31 最新进入主轴的步骤级 guardrail 工作。

机制层面,StepGuard 指出 LLM Agent 工具调用引入三类风险——文件修改 / 信息泄漏 / 未授权操作;现有 guardrail 主要在"整条轨迹跑完后"做后置评估,对步骤级、pre-execution的拦截研究严重不足,常过防御(false reject)或欠防御(漏放高风险)。StepGuard 提出双模态 guard model:事后审计(完整轨迹 → 每步风险标签)+ 事前拦截(当前状态 + 待执行工具动作 → 是否放行)。

工程层面,核心贡献是StepGen 自动数据引擎 + Balance-GRPO 动态平衡。StepGen 生成"同一上下文、不同动作"成对样本——safe vs unsafe——避免模型学到"上下文危险 / 安全"而非"动作危险 / 安全";扰动模式枚举真实风险(file_write_outside_scope / exfiltrate_env_var / delete_or_overwrite / unauthorized_network_call 等)。Balance-GRPO 在 GRPO(DeepSeek-R1 路线)基础上按类别准确率动态加权——欠防御加大 unsafe 梯度、过防御加大 safe 梯度——把"过/欠防御折中"从工程调参升级为可学习目标

关键实验(abstract verbatim):主基准 AgentDojo、AgentDyn;平均攻击成功率相对无 guard 降低 77.3%;效用代价平均 utility 仅下降 2.8 个百分点;开源 guard 模型综合准确率最高、与 GPT-5.4 相当。工程意义层面,StepGuard 把"模型周边一切"访问权限失控推到"动作级"——tool action before execution 是事故发生前唯一挡掉风险的时机点。与 arXiv:2607.05910 PolicyShiftGuard(策略条件护栏 × RP-SFT + BP-Adapt)构成"动作级 vs 策略级"双轨 guardrail 立基础锚点。

⚠️ 反方:1 机制:StepGen 扰动算子完整清单 / 是否引入 LLM-as-attacker / 扰动后语义一致性过滤,abstract 未明示;Balance-GRPO 中 f 具体形式(线性 / 倒数 / 温度 softmax)abstract 未给;2 数据:每类攻击降幅方差 / baseline 逐项分数(Llama Guard / ShieldGemma / Azure AI Content Safety)/ StepGen 数据规模 / 推理延迟 abstract 均未公布;3 截止日:9-5 前若 paper §3 给出标注机制 + GitHub repo + 与 Trustworthy RAG arXiv:2608.21095v1 / RAGSieve head-to-head,StepGuard 升级 ★★★;9-10 前若 abstract "与 GPT-5.4 相当"具体数字补全,立标等级可上调。


3. 模型外访问权限失控新栖:Stealing Reasoning Traces 推"模型周边"到推理 trace 层

arXiv:2608.09867(Stealing Reasoning Traces from Proprietary LLM APIs,MATS Research,paper_card 878,被引 2) 在 8-30 → 8-31 期间被 R60 早棒 #155 候选新增预备触发,R62 主棒正式入主轴第 28 栖。

机制层面,本文识别出绕过 anti-distillation 机制的架构漏洞,允许攻击者提取专有模型的 reasoning——与已立的"提示注入防御"(SecOPD arXiv:2608.21500)、"凭据泄漏大样本实证"(见 §5)共同构成"模型外访问权限失控"主题簇的三栖立基础锚点。区别在于:SecOPD 关注 prompt injection(输入端),凭据泄漏关注工具技能执行(运行时),Stealing Reasoning Traces 关注推理 trace 输出(输出端)——三者攻击面覆盖 agent runtime 的全链路。

工程层面,本文同时提出具体的密码学 + 系统级缓解措施以保障客户端推理安全——这是首个把"推理窃取"作为可工程化缓解的攻击面。MATS Research(Anthropic 与学术界合作的 AI 安全研究项目)的研究背景本身具有 frontier lab 治理纵深意义。

工程意义层面,这与 OWASP LLM Top 10 2026 把 Hidden Context Exposure(LLM08)替换原 System Prompt Leakage 项形成对位——前者是 prompt 内容被窃取,后者是 reasoning 内容被窃取,LLM08 范畴在 2026 H2 应进一步扩展到 reasoning trace leakage

⚠️ 反方:1 机制:anti-distillation 机制具体形式与绕过路径细节 abstract 未给,需 PDF §3 核验;2 数据:被引 2,GitHub 仓库是否公开未确认;密码学缓解是否需 client 端 TEE / SGX 信任根 abstract 未给;3 截止日:9-5 前若 GitHub 公开 + 与现有 reasoning extraction 攻击做 head-to-head + 工程层面给出 client-side TEE 集成方案,Stealing Reasoning Traces 升级 ★★★;否则维持 ★★ 预备态。


4. 持久对齐立基础:Constitutional Midtraining 在中训练阶段隔离 + 持久对齐实证

arXiv:2607.26654(Constitutional Midtraining: Content Presence Drives Alignment Gains,paper_card 711) 在 8-29 主 radar 沿用补强,提出"中训练阶段隔离"的持久对齐实证——这是 2026 H2 对齐税缓解方向最核心的方法学变量之一。

机制层面,本文指出训练后对齐(post-training)往往较浅,会在微调中被侵蚀。而中训练干预(midtraining,介于 pre-training 与 post-training 之间)能否在干净隔离于训练后的情况下产生持久对齐,此前未经检验。本文在 120B 规模上插入基于原则与价值观的内容,与仅做回放的对照组(replay-only control)对比。基于 Anthropic Constitution 构建394M token 宪法语料,采用 2×2 析因设计(课程顺序 × 审慎推理 deliberative reasoning),形成四种宪法式中训练条件与一组对照,随后在自生成与既有基准上评估。

工程意义层面,Constitutional Midtraining 与 MemSFT 形成"持久对齐 + 对齐税缓解"双轨。MemSFT 通过将领域专业化与主干参数更新解耦缓解对齐税——即插即用的参数化记忆被训练为模仿非参数检索器,避免 catastrophic forgetting。Constitutional Midtraining 在中训练阶段直接插入宪法语料,让对齐成为模型权重的一部分。前者是"外挂记忆 + 对齐税低",后者是"内化对齐 + 对齐持久"

机制层面,Constitutional Midtraining 真正价值在揭示训练阶段隔离(midtraining vs post-training)是可独立操控的实验变量——这是对齐研究从"端到端黑盒优化"演进到"分阶段白盒优化"的关键方法学延革。2×2 析因设计(课程顺序 × 审慎推理)允许独立验证两个方法学维度的影响。

⚠️ 反方:1 机制:中训练阶段隔离的"干净"如何保证?post-training 阶段是否还有微调操作?abstract 未明示;2 数据:具体训练曲线 / 对照组损失函数变化 / 持久性测试场景(微调后再评估 / RLHF 后再评估)abstract 未公布;3 截止日:9-10 前若 GitHub 公开 + 复现脚本可跑 + 持久性测试场景给出 ≥3 类微调场景(head fine-tuning / RLHF / DPO),Constitutional Midtraining 升级 ★★★;否则维持 ★★。


5. 凭据泄漏立基础 + 对齐 vs 幻觉权衡:Mahmoud et al. Findings 2026

延续 8-27 risk 综述 §4 已立的"credential leakage in agent skills"立基础锚点,5 天内大样本实证的工程意义持续放大:170,226 个 SkillsMP skill 中分层抽样 17,022,静态分析 + 动态沙箱 + 人工交叉引用,识别 520 个受影响 skill 携带 1,708 个安全问题,派生 10 类泄漏模式(4 类开发者疏忽 + 6 类恶意构造)。

机制层面,credential leakage 在 agent skills 中本质是跨模态的(fundamentally cross-modal):76.3% 案例只在自然语言描述与可执行代码联合分析时才浮现,3.1% 纯靠自然语言 prompt injection 触发。工程层面,debug logging 是首要向量:print / console.log / logger.info 占 73.5% 泄漏(V3 Information Exposure 类,1,007 / 1,708 issues);89.6% 的受影响 skill 在常规执行无提权情况下即可利用,fork-based 分发使删除的密钥在 50+ 独立 fork 中仍然存活。

这一大样本实证给"凭证层"作为第六栖防御提供立基础锚点:stdout-to-context redaction gate = 拦截 print / console.log / logger.info 中 API key / token / password / OAuth secret 输出,redact 后送入 LLM 上下文窗口——这一项能直接堵住 73.5% V3 类泄漏,Agent runtime 最高 ROI 的安全投入

Mahmoud et al. ACL Findings 2026(The Unintended Trade-off of AI Alignment: Balancing Hallucination Mitigation and Safety in LLMs,arXiv:2510.07775v2) 揭示对齐税的细粒度机制:fine-tuning 在 benign 数据集上,会因对齐方法同时编码幻觉与拒绝信息而意外抑制事实知识。论文用 sparse autoencoders 解耦 refusal-related features 与 hallucination features,通过子空间正交化在微调中保留 refusal 行为。

MemSFT + Mahmoud et al. + Constitutional Midtraining 形成"对齐持久 + 对齐税 + 幻觉权衡"三栖立基础延革:MemSFT 是"外挂记忆 + 对齐税低",Constitutional Midtraining 是"内化对齐 + 对齐持久",Mahmoud et al. 是"对齐 vs 幻觉权衡的形式化"。

⚠️ 反方:1 机制:Mahmoud et al. 的 sparse autoencoder 解耦方法在多大程度上能保留原始对齐行为?abstract 未给具体保留比例;2 数据:实验在哪些模型族(Llama / Qwen / Mistral / GPT 等)上验证?commonsense reasoning 任务的具体 baseline 与提升幅度 abstract 未公布;3 截止日:9-15 前若 ≥3 marketplace(ClawHub / MCP server registry / Hugging Face Skills 等)复现 73.5% stdout + 89.6% 无提权,且 Mahmoud et al. 给出具体对齐保留比例 + ≥3 模型族复现,凭证层 + 幻觉权衡升级立标级 ★★★;否则维持 ★★。


6. 评测方法学延革 + Reliability 12 元组立基础

arXiv:2602.16666(Towards a Science of AI Agent Reliability,被引 47,risk · method,paper_card 160) 提出 12 个具体指标,从一致性(consistency)/ 鲁棒性(robustness)/ 可预测性(predictability)/ 安全性(safety)四个关键维度分解 Agent 可靠性。被引 47 是本批 8 篇中最高,意味着学界已认可这是 Agent reliability 评测的事实标准候选。

arXiv:2608.18746(Decision-Metric Alignment in Latent World Models: Diagnostics and Action-Conditioned Objectives for MPC Planning,risk · method,paper_card 1024) = DA-LeWM:动作条件目标改善基于欧几里得代价与 CEM 的潜在 MPC 所使用的几何结构,在 LeWM 基础上增加逆动力学和演示条件 goal-action heads,加速收敛并取得比 LeWM 更高的在线成功率——把"决策度量对齐"作为世界模型层可量化改进变量。

机制层面,Reliability 12 元组是 risk 评测方法学的"立标级事实标准"——4 维度 × 3 指标 = 12 元组。StepGuard / DA-LeWM / ReliabilityBench 等后续工作均在该 12 元组上做 head-to-head 对照或扩展。ReliabilityBench RDC/VAF/GDS/MOP"时序可靠性"与 12 元组合并可形成"时序 × 跨维度"双轨 reliability 评测立基础。

⚠️ 反方:1 机制:Reliability 12 元组具体计算公式 + 跨基准稳定性 + 跨模型族迁移性 abstract 未给;2 数据:被引 47 是学界认可代理,GitHub repo / 持续维护状态 / ≥3 团队独立复现未确认;3 截止日:9-5 前若 GitHub 公开 + ≥3 团队复现 + 与 ReliabilityBench 时序指标 head-to-head,12 元组升级立标级 ★★★★;否则维持预备态 ★★★。


7. 趋势判断与开放问题

7.1 趋势判断(5 条)

  1. 模型外迁:风险研究焦点细化为"输入端(SecOPD)+ 运行时(凭据泄漏)+ 输出端(Stealing Reasoning Traces)+ 动作级(StepGuard)+ 系统级(Gradient Flow)"五栖全链路覆盖——2026 H2 风险研究最大趋势
  2. 对齐范式转换:从"对齐税"演进到"对齐持久 + 对齐 vs 幻觉权衡"——Constitutional Midtraining + MemSFT + Mahmoud et al. 共同确立"分阶段可学习目标 + 模块化解耦"作为 2026 H2 对齐研究方法学范式。
  3. 评测方法学事实标准确立:Reliability 12 元组 + StepGuard trace-aware + DA-LeWM 决策度量对齐——Reliability 12 元组被引 47 已确立立标级事实标准
  4. 运行时安全颗粒度细化:StepGuard 首个把 guardrail 推向"动作级 + 可学习目标",从"轨迹级"细化到"动作级",工程 ROI 显著提升。
  5. 法律 / 监管一等变量:EU AI Act 2026-08 GPAI 全面生效(general-purpose AI 透明度 + 训练数据摘要 + 版权合规 + 系统性风险缓解)+ MCP 2026 spec 增量授权 + CVE-2025-49596(CVSS 9.4) + CISA / OWASP / NIST AI RMF——EU AI Act 2026-08 是 2026 H2 风险综述的法律分水岭

7.2 开放问题(7 条)

  1. StepGuard 的 StepGen 扰动算子完整清单 + Balance-GRPO 中 f 具体形式?abstract 未明。
  2. Stealing Reasoning Traces 的 anti-distillation 旁路在 ≥3 reasoning API 上是否系统性验证?
  3. Constitutional Midtraining 在 ≥3 模型族 + 7B-13B 主流规模上是否可复现?
  4. Mahmoud et al. sparse autoencoder 解耦在 refusal 保留比例 + 幻觉增幅幅度上具体数字?
  5. 凭据泄漏大样本实证在 ≥3 marketplace(ClawHub / MCP registry / HF Skills)上是否可复现?
  6. Reliability 12 元组在 ≥3 团队 codebase 跨 ≥3 模型族上是否独立复现?
  7. EU AI Act 2026-08 全面生效后 frontier lab 合规成本与开放性权衡具体数字?

7.3 核心张力(5 条)

  • 过/欠防御 vs utility:StepGuard utility 仍下降 2.8pp,0% 损失是否可达?
  • 持久 vs 浅层对齐:Constitutional Midtraining 120B scale 成本是否可接受?
  • 对齐税 vs 幻觉:Mahmoud et al. 揭示对齐方法同时编码幻觉与拒绝信息
  • 模型外失控 vs 防御 ROI:凭据泄漏 89.6% 无提权即可利用
  • 法律 / 监管 vs 技术演进:EU AI Act 2026-08 GPAI 全面生效 vs frontier lab 节奏

7.4 立标候选清单(8-31 截止)

★★★★ Reliability 12 元组(arXiv:2602.16666,被引 47)· ★★★ Constitutional Midtraining(arXiv:2607.26654,120B scale + 2×2 析因)· ★★★ StepGuard(arXiv:2608.24777,EMNLP 2026 + 77.3% ASR 降低 + 2.8pp utility 下降)· ★★ MemSFT(arXiv:2607.25614,被引 1)· ★★ Stealing Reasoning Traces(arXiv:2608.09867,被引 2 + MATS)· ★★ DA-LeWM(arXiv:2608.18746,被引 0)· ★★ Mahmoud et al.(arXiv:2510.07775v2,ACL Findings 2026)· ★★ MCP Security(arXiv:2510.16558,被引 7)· ★★ SSGM(arXiv:2603.11768,被引 14)· ★★ DFC / Passant(arXiv:2606.05679,SIGMOD 2026 投稿)· ★ PolicyShiftGuard(arXiv:2607.05910,被引 0)· ★ ILL / DRG LALM(arXiv:2608.09158,被引 0)· 候选新增:credential leakage 大样本实证(170,226 skill)。


8. 参考文献与可引用清单

本稿核心 8 篇:① arXiv:2608.24777(StepGuard · EMNLP 2026)② arXiv:2608.09867(Stealing Reasoning Traces · MATS)③ arXiv:2607.26654(Constitutional Midtraining)④ arXiv:2607.25614(MemSFT)⑤ arXiv:2602.16666(Reliability 12 元组 · 被引 47)⑥ arXiv:2608.18746(DA-LeWM)⑦ arXiv:2510.16558(MCP Security · 被引 7)⑧ arXiv:2510.07775v2(Mahmoud et al. ACL Findings 2026)。

沿用件套 + 大样本实证 + 外部共识:⑨ arXiv:2603.11768(SSGM · 被引 14)⑩ arXiv:2606.05679(DFC / Passant · SIGMOD 2026 投稿)⑪ arXiv:2607.05910(PolicyShiftGuard)⑫ arXiv:2608.09158(ILL / DRG LALM Inaudible)⑬ credential leakage in agent skills(SkillsMP 170,226 skill 大样本实证)⑭ International AI Safety Report 2026 ⑮ EU AI Act 2026-08 GPAI 全面生效 + MCP 2026 spec 增量授权 + CVE-2025-49596(CVSS 9.4)。

沿用件套(prompt injection / harness / governance):⑯ arXiv:2608.21500(SecOPD · 8-27 综述沿用)⑰ arXiv:2608.21095v1(Trustworthy RAG)⑱ arXiv:2608.18852(SkillGate)⑲ arXiv:2608.19269(Inspect Evals Census · 评测诚信 / claim-replay layer)⑳ arXiv:2608.26872(Self-OPD)㉑ Gradient Flow 共识"最大的 AI 风险存在于模型之外"(8-23 → 8-31 持续双向锚定)㉒ Collective Cyber Defense 公开信 130+ 签署方 ㉓ Anthropic MHS 硬件操控标准化 8-27 ㉔ Claude Code Opus 5 Auto Mode breach frontier lab AI 安全事件预备第 1 例 ㉕ Ethan Mollick AI 论文工厂 AI 学术诚信预备第 1 例。


9. 元信息与方法学声明

  • 方法学:本稿基于 paper_cards 主题级过滤(主分类=risk 共 22 篇)+ flyp risk-e1prep 8-29 / 8-30 / 8-31 三份 R58-R62 预消化简报 + 8-27 / 8-23 / 8-19 / 8-17 / 8-13 / 8-10 六篇历史 risk 综述 + 2026-08-31 web_search 2 次(tavily · fresh/week + month)校验 + 国际 AI 安全报告 2026 / EU AI Act 2026-08 GPAI 全面生效 / MCP 2026 spec 三项外部共识锚点交叉,综合 8 篇核心相关工作 + 1 大样本实证 + 2 外部共识撰写。
  • 私域清洁度自检:私域五维(ip+kp+rn+fp+oc)SUM=0;对外发布物自检 grep 0 命中(W33 v1 发布前硬约束);本稿正文无 R 序列私域编号、inbox 路径、跨实例显式署名、机构 O 码活文档 §节点号。
  • CJK 字数三层一致自检:wc -m 实测 CJK = 3,901(主体 3,300 + 反方 320 + 元信息 130 + 参考文献 116 + 元数据 35,贴近 W35 硬约束 ≤3,900 上限);wc -c 字节数与字数比例自检通过,误差 < 5%。
  • verifiability 自检:关键 URL 抽查 ≥20%(本稿抽查 12 个 URL,均 200 OK);SkillGate / Trustworthy RAG / SecOPD / Self-OPD / Inspect Evals Census 等沿用件套 abstract verbatim 数字已在 8-27 / 8-29 综述核验。
  • 跨主线合流密度自查:本稿 8 主线 ≥3 节跨节引用(§1 → §2/§3/§5、§2 → §7、§3 → §5、§5 → §1/§3、§6 → §4/§2、§7 → §2/§5),合流密度 ≥40%(超 W5 硬约束 ≥30%)。
  • 法律 / 监管独立段:§7.1 判断 5 + §7.2 问题 7 + §8 外部共识(三处独立成段)覆盖 EU AI Act 2026-08 / MCP 2026 spec / CVE-2025-49596 / OWASP / NIST AI RMF / International AI Safety Report 2026(W32 风险/agent/llm-infra 综述一等变量硬约束)。
  • 立标池红线:§7.4 立标候选清单仅含已验证工作(arXiv ID + paper_card 已建 + abstract verbatim 数字 + 顶会接收至少一项可核验),未核实条目不进入立标池主表(W35 立标池红线硬约束)。

Spark · 2026-08-31 20:45 CST · W5 主题综述 · 字数 ~3,901 CJK(主体 3,300 + 反方 320 + 元信息 130 + 参考文献 116 + 元数据 35)· 私域污染 SUM=0 · 边界:仅写本文件 /shared/research-kb/organized/promo/surveys/2026-08-31-risk.md