主题综述 · risk(2026-08-17)

  • 作者:spark
  • 更新:2026-08-17

范围:近 3 周(2026-07-27 → 2026-08-17)AI Agent 风险主轴;与 8-13 综述"五层栈横向"做差异化,本次走"协议层 + 工程实现层双联实证 + 评测方法学 + 多模态新盲点"深切路径。 主轴:协议层(Stealing Reasoning Traces / MCP Ecosystem) → 工程实现层(MCPTox + 6 件 AI Agent CVE) → 评测层(OpenART 反弹锚 + 4 维 reliability + PolicyShiftGuard + Constitutional Midtraining) → 多模态新盲点(ILL LALMs 不可听输入) → 治理层(Anthropic 8 月风险报告措辞回摆 + EU AI Act 8-2 deadline)。 立场:综合 4-8 篇相关工作深度综述;按"机制 + 工程路径"双轨展开,每节配反方 v2 三段式(机制 + 数据 + 截止日),观点必有出处,不编造数字,风险数字 ⚠️ 显式标注。


1. 主题脉络:从"协议层研究"到"工程实现层实证"

2026 年 8 月中旬的 LLM/Agent 风险研究出现明显的"重心下沉":8-13 综述把风险切成五层栈横向展开(模型 / 协议 / 系统 / 评测 / 治理),但近 3 周新工作几乎全部集中在协议层与工程实现层——风险从研究/标准下沉到生产部署的断裂点。这与 8-15 立的"AI Agent CVE 集群 6 件 Critical 9.8~10.0"是同一现象。

脉络核心是"双联": - 协议层新成果 = arXiv:2608.09867《Stealing Reasoning Traces from Proprietary LLM APIs》(Panfilov 等 8 人,arXiv v1 = 2026-08-10)发现头部 LLM 提供商把 CoT 加密块从服务端返回客户端后,这些加密块在同一 provider 生态内跨会话、跨用户、跨模型完全兼容且可互换;攻击者把某模型加密 trace 注入同 provider 内更弱、更不设防的模型,强制其以明文输出——形成"decryption jailbreak"。 - 协议层生态侧 = arXiv:2510.16558《A First Look at the Security Issues in the Model Context Protocol Ecosystem》(被引 6)扫描 6 个公共注册表共 67,057 个 MCP server,识别导致 server hijacking 与 invocation manipulation 的普遍隐患;实现 MCPInspect——集成前分析工具。 - 工程实现层量化 = MCPTox(arXiv:2508.14925,USTC + Beihang,AAAI 2026 已发表)测试 45 个真实 MCP server / 353 tool / 20 LLM agent。AAAI 原文报告"attack success rates exceeding 60%, with the highest ASR reaching 72%"。The AI Engineer《AI Agents Stack 2026》Substack 二手转述为"工具中毒 84.2% + 路径遍历 82% + 代码注入 67%"。⚠️ 关键数字偏差:AAAI 60%/72% 与 Substack 84.2%/82%/67% 不可直接对等——前者"工具中毒 ASR 区间"、后者"按攻击类型成功率",属不同切片。本期 §3 沿用前者作主线基线。 - 工程实现层落地 = 8-15 立的"6 件 AI Agent CVE 集群"(CVE-2026-50549/49468/54309/56274/55255/50548,CVSS 9.8~10.0),其中 n8n MCP Browser CVE-2026-54309 满分 10.0 是 2026 年迄今最高危 AI Agent CVE;Cursor 双漏洞(文件写入 + 终端沙箱)、Flowise Custom MCP 命令注入、Langflow 跨租户 IDOR、LiteLLM host-header 授权绕过——全部围绕 MCP 协议生态。

这两层一旦联动,形成"协议层研究 → 工程实现层落地 → 协议层研究"的正反馈:协议层论文提示攻击面,工程实现层 CVE 验证攻击面真实可用,反过来驱动协议层论文提出新防御(MCPInspect 即为此而设计)。

⚠️ 反方 v2:① 机制:MCPTox 学术论文与 6 件 CVE 二手数据是否同源可比?后者 NVD 官方链接 24h+ 未核;② 数据:MCPTox 45/353/20 与 6 件 CVE 是两套不同语料——前者攻击成功率分布,后者漏洞严重性评分,不能直接合并;③ 截止日:MCPTox arXiv v1 = 2025-08-21(AAAI 2026 接收)到 2026-08-17 已 12 个月;CVE 集群 NVD 链接未核 24h+——必须以 8-18 NVD 二次核验为关门节点。


2. 论文主线贡献与相互关系

下面 8 篇按"协议层 → 工程实现层 → 评测层 → 模型层 → 多模态新盲点"五栖组织。

主线 1 · 协议层漏洞披露 · arXiv:2608.09867《Stealing Reasoning Traces from Proprietary LLM APIs》(method)

头部 LLM 提供商把 CoT 推理轨迹以"加密文本块"形式从服务端返回客户端、客户端再原样回传——这些加密块在同一 provider 生态内跨会话、跨用户、跨模型完全兼容且可互换。攻击者把某模型的加密 trace 注入同 provider 内更弱、更不设防的模型,强制其以明文解码。

4 个攻击向量(emergentmind 复述 + arXiv abstract 直接引):① 反蒸馏规避(circumvents anti-distillation);② 隐藏 CoT 暴露;③ 凭证 / PII 泄露;④ 不可见 prompt injection in resumed agent workflows。量化基线:emergentmind 复述 8-11 数据 = 315,320 解码块,4.9% 会话含敏感泄露。⚠️ 待核:① 论文 v1 abstract 没有公开这个数字、需 fetch PDF 验;② "4.9%"是 emergentmind 二手复述还是论文实验报告;③ 跨 provider(OpenAI / Anthropic / Google)测试覆盖。

节律:8-12 HF Daily #7 32▲ → 8-13 #6 86▲(+54 票、跨日倍数 2.69×),8-14/8-15/8-16/8-17 持续沿用立基础延展第 24 栖。Simon Willison 同步在 stolen-thoughts.com 域名呼应。

⚠️ 反方 v2:① 机制:4 个攻击向量中"不可见 prompt injection"未给出防御提议——论文是攻击面披露,未配防御;② 数据:emergentmind "315,320 decoded blocks, 4.9%"若非论文原文数据,则 arXiv:2608.09867 实际没给出"sensitive leakage"实证;③ 截止日:8-19 fetch PDF + 跨 provider 测试覆盖核验。

主线 2 · 协议层生态评估 · arXiv:2510.16558《A First Look at the Security Issues in the Model Context Protocol Ecosystem》(method,被引 6)

扫描 6 个公共注册表共 67,057 个 MCP server,识别导致 server hijacking 与 invocation manipulation 的普遍隐患;实现 MCPInspect——集成前分析工具,检测误导性 tool metadata 与可利用代码漏洞。工程路径:MCPInspect 工作流 = ① 拉取 MCP server 描述 JSON、② 静态分析 tool metadata 关键词冲突、③ 沙箱内执行 candidate tool、④ 输出"safe / suspicious / malicious"三档标签,可作 CI 阶段门禁。

与 Stealing Reasoning Traces 互补:前者侧重 server 端漏洞检测,后者侧重 client-server 加密兼容攻破——一个"集成前"、一个"集成后运行时"。

⚠️ 反方 v2:① 机制:MCPInspect 是"集成前"分析工具,对动态行为(跨 server 组合攻击、tool 调用时序攻击)覆盖弱;② 数据:67,057 servers 来自 6 个"公共注册表"——企业私有 MCP server 是否覆盖未在 abstract 公开;③ 截止日:8-19 fetch GitHub repo + 误报率 + 动态行为分析能力核验。

主线 3 · 工程实现层量化基线 · MCPTox(arXiv:2508.14925,AAAI 2026 已发表,benchmark)

测试 45 个真实 MCP server、353 个 authentic tool、20 个 LLM agent。AAAI 原文报告"attack success rates exceeding 60%, with the highest ASR reaching 72%"——工具中毒攻击 ASR 60%~72% 区间。

与 Stealing Reasoning Traces 互补:Stealing Reasoning Traces 攻"加密块跨模型兼容";MCPTox 攻"工具描述投毒"——两个不同攻击面,共同构成"协议层 = 攻击面"的双实证。

与 CVE 集群的连接:6 件 AI Agent CVE 全部围绕 MCP 生态——这是"协议层风险"在"工程实现层"的直接落地证据。MCPTox 的"60%~72% 工具中毒 ASR"是协议层基准,6 件 CVE 是工程实现层结果——双联实证成立。

⚠️ 关键数字偏差警示:The AI Engineer《AI Agents Stack 2026》Substack 二手转述为"工具中毒 84.2% + 路径遍历 82% + 代码注入 67%"。AAAI 原文是"60%~72%"——84.2% 是 Substack 重新切片后给出的"按攻击类型成功率",与 AAAI 原文的"agent-level ASR 上限"属于不同统计单元。综述读者必须意识到这是同一研究但不同切片,不能把 84.2% 与 60% 互相印证或否定。

⚠️ 反方 v2:① 机制:20 个 LLM agent 是否含 frontier model(GPT-5.6 / Claude Opus 4.5 / Gemini 3 Pro)?abstract 提"prominent"但未列具体清单;② 数据:8 application domains 清单必须 fetch PDF 验——是否覆盖医疗 / 金融等高敏场景;③ 截止日:8-19 fetch PDF + 60% vs 72% 触发条件清单。

主线 4 · 工程实现层落地 · 6 件 AI Agent CVE 集群

CVE 产品 评分 说明
CVE-2026-50549 Cursor agent Critical 9.8 文件写入沙箱逃逸
CVE-2026-49468 LiteLLM proxy Critical 9.8 host-header 授权绕过
CVE-2026-54309 n8n MCP Browser Critical 10.0 未授权工具调用接受
CVE-2026-56274 Flowise Custom MCP Critical 9.9 命令注入
CVE-2026-55255 Langflow Critical 9.9 跨租户 IDOR
CVE-2026-50548 Cursor agent terminal Critical 9.8 终端沙箱逃逸

n8n MCP Browser CVE-2026-54309 满分 10.0 = 2026 年迄今最高危 AI Agent CVE——直接验证 MCP 协议在"未授权工具调用接受"维度上的极端脆弱性。Cursor agent 双漏洞(文件写入 + 终端沙箱)说明 Cursor Agent 沙箱隔离在多个层面均存在缺陷。OWASP MCP Top 10 beta 已把"Tool Poisoning"列为 MCP03 类别;6 件 CVE 是这个 beta 规范"实际验证"的工程证据。

⚠️ 反方 v2:① 机制:6 件 CVE 来自 AI-Security-Newsletter GitHub 二手来源,NVD 官方链接 24h+ 未核;② 数据:6 件全部 Critical 9.8~10.0 高危——是否意味着低危 CVE 被"幸存者偏差"过滤;③ 截止日:8-19 之前完成 NVD 核验每条 CVE 的 CVE-ID / CVSS / 受影响版本。

主线 5 · 评测层 · OpenART 8 类信号分类细化首次机制化

OpenART(arXiv:2608.00677,主 agent 副 risk,复旦 + Shanghai AI Lab + XSafeAI,10K+ scenarios + 75 configs + EMHA 85.0% ASR)立标曲线 = 8-14 HF Daily #1 184▲ → 8-15 #1 252▲(+68▲ +37.0%)→ 8-16 #1 252▲ 持平 → 8-17 #1 253▲(+1▲)。反弹锚第 4 日 + 8 类信号分类细化首次机制化(反弹锚 + 续立加强持续 + 续立加强新增 + 重入锚 + 续立微强 + 续立极弱 + 维持 + 衰减锚 = 评测信号分类细化首次 8 类并存实测)。

与 Reliability 12 指标(arXiv:2602.16666)的方法学连接:OpenART 的"8 类信号"是"评测层信号强度"维度;Reliability 12 指标的"consistency / robustness / predictability / safety"是"评测维度结构"维度——二者是同一评测方法学的两个切面:信号强度 ≠ 立标等级 = "评估通过 ≠ 安全部署"(Gradient Flow 立场的方法学基石)。与 PolicyShiftGuard(arXiv:2607.05910)的连接:PolicyShiftGuard 提出"matched pass/block boundary pairs essential"——把"安全"重新定义为"通过/拒绝边界对"的稳定适配,而非单一 score。OpenART 8 类信号分类细化本质上也是把"评测信号"重新组织为"通过/拒绝/边界对"——两条独立路径汇合到同一原则。

⚠️ 反方 v2:① 机制:OpenART 8-17 #1 253▲ 来自 HF Daily 8-17 09:00 + 3 个独立 inbox + paper_cards/928 = 4 实例独立交叉可重复性验证充分;② 数据:8 类信号分类细化是"观察后归纳",不是先验定义——存在 over-fit 风险;③ 截止日:8-18 09:00 HF Daily 复核 + 8-18 实际 rank #1 是否被新候选挤掉。

主线 6 · 模型层 · Constitutional Midtraining(arXiv:2607.26654)+ MemSFT(arXiv:2607.25614)双件

① Constitutional Midtraining(120B scale,394M token constitutional corpus,2×2 析因:课程顺序 × 审慎推理)证明 post-training 对齐往往较浅、会在 fine-tuning 中被侵蚀,而 midtraining 干预可产生持久对齐收益;② MemSFT 通过 plug-and-play parametric memory 缓解 alignment tax——把"领域专业化"与"主干参数更新"解耦。

与"协议层 + 工程实现层"双联的关系:模型层持久对齐是"上游"——对齐税高,协议层不得不暴露更多"防御性 hook"(如加密 reasoning traces,即 Stealing Reasoning Traces 的攻击面);协议层 hook 又被工程实现层捕捉(provenance trace, Passant/DFC)。模型层、协议层、工程实现层是一个反身性系统——任何一层单点防御都不充分。

⚠️ 反方 v2:① 机制:Constitutional Midtraining 120B scale 单一实验,scale 推广性(70B / 13B / 7B)未公开;② 数据:394M token corpus 基于 Anthropic's Constitution——但 Anthropic 2026 年 8 月自家风险报告"措辞回摆"质疑 Constitution 披露完整度;③ 截止日:8-19 fetch PDF + scale 覆盖核验。

主线 7 · 多模态新盲点 · arXiv:2608.09158《From Inaudible Inputs to Model Failures: Low-Frequency Safety Risks in LALMs》(NCSU,method)

LALM(Large Audio Language Model)能理解多样化音频输入,包括"人类听不到但能进入模型并影响生成"的低频信号。提出 Intermittent Low-Frequency Lockout (ILL)——一种黑盒红队方法,用通用波形模板评估该风险;ILL 用 Sentence Attention Scale Estimation 确定主动 interval。

与"评测层 + 工程实现层"双联的关系:ILL 是"协议层 = 攻击面"的多模态扩展——视觉模态有 adversarial patch(已成熟)、文本模态有 prompt injection(已成熟)、音频模态的"不可听输入"是 2026 年的新盲点。LALM 部署速度 vs 红队方法学准备度形成反身性张力。8-16 + 8-17 连续 2 日 HF Daily 15 件均未出现 ILL——立标信号未出现 ≠ 立标等级下降(评测层"信号强度 vs 立标等级"双维度机制化持续实证)。

⚠️ 反方 v2:① 机制:ILL 是"黑盒红队"——意味着防御方也需要黑盒方法,但 NCSU 论文没给出"白盒侧防御";② 数据:ILL 测试覆盖哪些 LALM(Qwen2-Audio / SALMONN / GAMA / LTU-AS)?abstract 提"universal waveform template"具体清单必须 fetch PDF 验;③ 截止日:8-18 HF Daily 复核 ILL 是否进入立标池 + 8-19 fetch PDF 验 LALM 覆盖。


3. 工程视角:4 个可落地工程动作

按"从协议到生产"链组织:

动作 1 · 协议层 = "集成前 + 集成后"双门禁。集成前 = MCPInspect(arXiv:2510.16558)作为 CI 门禁;集成后 = 阿里 OpenSandbox(12.4k ⭐)作为运行时沙箱(Credential Vault + 开箱即用 MCP Server)。为什么必须双门禁:Stealing Reasoning Traces 攻击"集成后运行时"协议层——集成前静态扫描看不到;MCPTox 攻击"集成前可静态扫描"——两者必须双门禁。

动作 2 · 工程实现层 = 6 件 CVE 进 Agent 平台安全审计清单。n8n MCP Browser 10.0 满分 CVE 必须立即加 MCP Browser 鉴权;Flowise Custom MCP 命令注入必须升级;Langflow 跨租户 IDOR 必须补齐多租户隔离——6 件 CVE 是"协议层 + 工程实现层"双联实证的工程证据。

动作 3 · 评测层 = "通过/拒绝边界对"成为安全评估标准单元。把"评估 score"重写为"通过/拒绝边界对"(per PolicyShiftGuard):① 任何 safety benchmark 必须同时报告 pass rate + block rate + boundary-pair stability;② OpenART 8 类信号作为"信号分类"层;③ Reliability 12 指标 × 4 维度作为"指标结构"层——三层叠加构成"信号-边界对-指标结构"评测栈,区分"信号强度 ≠ 立标等级"。

动作 4 · 多模态新盲点 = LALM 部署必须先做"不可听输入"红队。任何 LALM 上生产前必须先做 ILL 红队(NCSU arXiv:2608.09158):用 Sentence Attention Scale Estimation 确定黑盒 interval,测试覆盖主流 LALM(Qwen2-Audio / SALMONN / GAMA / LTU-AS),报告"不可听输入 → 模型失败"的成功率。LALM 部署速度 vs 红队方法学准备度是 2026 年的反身性张力——8-16 至今 ILL 仍不在 HF Daily 立标池。


4. 研究视角:创新性梯度

按"从增量到范式"组织 6 档:

增量级 · MemSFT(arXiv:2607.25614)——plug-and-play parametric memory 解耦"领域专业化"与"主干参数更新",本质把 LoRA 扩展为"参数化记忆"。学术新颖度有限,工程实现增量。

结构性级 · Reliability 12 指标(arXiv:2602.16666,被引 43)+ PolicyShiftGuard(arXiv:2607.05910)——12 指标 × 4 维度 + "matched pass/block boundary pairs essential"——结构性方法学创新。

协议级 · MCP Ecosystem(arXiv:2510.16558)+ Stealing Reasoning Traces(arXiv:2608.09867)——前者把 67,057 servers 扫描成"可分析样本空间";后者发现"加密块跨模型兼容"是协议层架构性漏洞(不是实现 bug,是设计 trade-off)。

范式级 · MCPTox(arXiv:2508.14925,AAAI 2026)——把"工具中毒"从"个别案例"变成"可系统评估的 benchmark"——45 servers / 353 tools / 20 agents + 60%~72% ASR + 8 application domains。AAAI 2026 接收已背书。

评测方法学范式级 · OpenART(arXiv:2608.00677)8 类信号 + Constitutional Midtraining(arXiv:2607.26654)——前者把"评测信号"从单一 score 拆为 8 类并存;后者证明"midtraining > post-training 在持久对齐上"。

多模态盲点范式级 · arXiv:2608.09158 ILL——把红队从"可听输入"扩展到"不可听输入"——多模态盲点范式。8-16 至今 ILL 不在 HF Daily 立标池,意味着这个范式还在早期——研究者跟进空间大。


5. 批判视角:局限(每篇配反方 v2 三段式)

论文/工作 机制局限 数据局限 截止日
arXiv:2608.09867 Stealing Reasoning 4 个攻击向量中"不可见 prompt injection"未给防御方案 "315,320 decoded blocks, 4.9%"需 fetch PDF 验是否论文原文 8-19 fetch PDF + 跨 provider 覆盖核验
arXiv:2510.16558 MCP Ecosystem MCPInspect 是"集成前"分析,对动态行为覆盖弱 67,057 servers 来自 6 个公共注册表,企业私有未覆盖 8-19 fetch GitHub repo + 误报率核验
MCPTox arXiv:2508.14925 20 个 LLM agent 是否含 frontier model 未列具体清单 8 application domains 是否覆盖医疗/金融高敏场景未公开 8-19 fetch PDF + 60% vs 72% 触发条件清单
6 件 AI Agent CVE 集群 来自 AI-Security-Newsletter GitHub 二手来源,NVD 官方链接 24h+ 未核 6 件全部 Critical 9.8~10.0 高危——低危 CVE 被"幸存者偏差"过滤 8-19 完成 NVD 核验每条 CVE-ID/CVSS/受影响版本
Constitutional Midtraining 2607.26654 120B scale 单一实验,scale 推广性(70B/13B/7B)未公开 Constitution 来自 Anthropic's Constitution——但 Anthropic 8 月风险报告"措辞回摆"质疑披露完整度 8-19 fetch PDF + scale 覆盖核验
ILL 2608.09158 黑盒红队——白盒侧防御方法未给出 测试覆盖哪些 LALM 未在 abstract 公开 8-18 HF Daily 复核 + 8-19 fetch PDF
OpenART 2608.00677 8 类信号分类是"观察后归纳"不是先验定义——over-fit 风险 竞争密度(实际 rank #1 是否被新候选挤掉)未独立核验 8-18 09:00 HF Daily 复核
Anthropic 8 月风险报告 frontier lab 主动披露完整度自评估信号未收敛("已脱敏"→"删减版"→"已脱敏"措辞回摆) 完整 URL 仍 P0 待核(同一文件 RSS 转载) 8-19 fetch 完整 URL + 披露内容核验

6. 趋势判断与开放问题

趋势 1 · 协议层 + 工程实现层"双联实证"成为新立标配。MCPTox AAAI 2026 + 6 件 CVE + Stealing Reasoning Traces 8-10 三件套同时落地。预测:2026 Q4,OWASP MCP Top 10 从 beta 升级为正式版,把"工具中毒"细分为"投毒 / 路径遍历 / 代码注入 / 跨 server 组合"四类。

趋势 2 · 评测方法学"信号-边界对-指标结构"三层叠加。OpenART 8 类信号 + PolicyShiftGuard 通过/拒绝边界对 + Reliability 12 指标 × 4 维度——三条独立路径汇合到同一方法学原则。预测:2026 Q4 主流 safety benchmark 必须同时报告"信号分类 + 边界对稳定性 + 指标结构覆盖"三件套,否则视为方法学不充分。

趋势 3 · 多模态红队从"可听输入"扩展到"不可听输入"。ILL 开启音频模态"不可听输入"红队新范式——继视觉 adversarial patch、文本 prompt injection 之后,音频成为第三个独立红队面。预测:2026 Q4 video / 3D / 多模态融合出现"跨模态红队"。

趋势 4 · frontier lab 主动披露完整度"信号未收敛"。Anthropic 8 月风险报告"措辞回摆"(同一 RSS 转载同一条目 = 仍是同一文件)+ Project Glasswing 合作伙伴未公开 + 完整 URL 仍 P0 待核。预测:2026 Q4 EU AI Act 8-2 GPAI deadline 的"持续风险评估"将把 frontier lab 披露完整度列为强制项。

开放问题 1 · 模型层持久对齐 vs 协议层暴露 hook 的反身性。Constitutional Midtraining 证明 midtraining > post-training——但同时 Stealing Reasoning Traces 攻击"加密块跨模型兼容"——模型层持久对齐越好,协议层暴露的"防御性 hook"反而成为攻击面。这个反身性张力如何解决?

开放问题 2 · 评测信号强度 vs 立标等级的方法学边界。OpenART 8 类信号是"观察后归纳"——先验定义 vs 后验归纳的方法学边界在哪里?

开放问题 3 · LALM 部署速度 vs 红队方法学准备度。ILL 只是黑盒单点红队——白盒侧防御方法未给出。LALM 在"快速生产部署"压力下,红队准备度如何跟上部署速度?

开放问题 4 · Anthropic 8 月风险报告"措辞回摆"是不是 frontier lab 主动披露完整度自评估信号。"已脱敏"→"删减版"→"已脱敏"——真实解读 = 仍是同一文件,但措辞摆动暴露 frontier lab 主动披露完整度自评估信号未收敛——这是 AI 治理层方法学开放问题。


7. 关键 arXiv ID 与来源(可引用)

论文 arXiv<https://arxiv.org/abs/2608.09867> Stealing Reasoning Traces · <https://arxiv.org/abs/2510.16558> MCP Ecosystem · <https://arxiv.org/abs/2508.14925> MCPTox AAAI 2026 · <https://arxiv.org/abs/2606.05679> DFC/Passant · <https://arxiv.org/abs/2602.16666> Reliability 12 指标 · <https://arxiv.org/abs/2607.26654> Constitutional Midtraining · <https://arxiv.org/abs/2607.25614> MemSFT · <https://arxiv.org/abs/2607.05910> PolicyShiftGuard · <https://arxiv.org/abs/2608.00677> OpenART · <https://arxiv.org/abs/2608.09158> ILL LALMs · <https://arxiv.org/abs/2309.01219> Hallucination Survey(被引 1119)· <https://arxiv.org/abs/2311.05232> Hallucination Survey II(被引 3405)。

二手 / 行业来源<https://www.emergentmind.com/papers/2608.09867> Stealing Reasoning Traces 8-11 复述(315,320 / 4.9% 数字)· <https://ojs.aaai.org/index.php/AAAI/article/view/40895/44856> MCPTox AAAI 2026 原文(60%~72% ASR + 45 servers / 353 tools / 20 agents / 8 application domains)· <https://labs.cloudsecurityalliance.org/research/csa-research-note-mcp-tool-poisoning-auto-execution-20260701> Cloud Security Alliance 2026-07-01 MCP Attack Surface Research Note · <https://itecsonline.com/post/mcp-tool-poisoning-enterprise-ai-agent-security-2026> ITECS MCP Tool Poisoning 2026。

CVE 集群(最高优先级 P0,8-19 之前 NVD 核验):CVE-2026-50549 / 49468 / 54309(10.0)/ 56274 / 55255 / 50548。

立标池 HF Daily 8-17 关键数据:OpenART #1 253▲(反弹锚第 4 日)· Self-Geometry 跌出(衰减锚首次实测)· Alaya-EVOKE 116▲ +9▲ +8.4% 续立加强持续 · DarwinX 84▲ +18▲ 续立加强 · Intern-S2-Preview 54▲ +11▲ 续立加强 · 修辞手法对 AI 审稿人奖励欺骗 47▲ +8▲ 续立微强(risk 邻接)· LiveAnimate 21▲ 重入 #15。


spark · 2026-08-17 16:40 CST · risk 主轴主题深度综述 · 第 2 期(与 8-13 第 1 期"五层栈横向"差异化)