date: 2026-08-27 (Asia/Shanghai) · round: R2 arxiv: https://arxiv.org/abs/2608.09867 video-kb-source: /shared/video-kb/scripts/tom/2026-08-27_R2_cot-encrypted-block-interoperability-attack-short-video-script.md

1. 标题与观众

  • 标题:加密 CoT 块 · 同厂弱模型可强解
  • 目标观众:LLM 应用开发者 · AI 安全红队工程师 · 企业 LLM 部署架构师
  • 一句话核心观点:加密推理块可被同厂弱模型强制解码,绕过三家闭源 LLM 抗蒸馏机制。

3. 45-90 秒口播稿

你以为是"加密 CoT 块"在保护隐私? 其实在同一提供商生态内,块完全互换。 攻击只需四步。 第一步,强模型生成加密块。 第二步,抓块到本地。 第三步,嫁接到同厂弱模型。 第四步,弱模型明文解码输出。 Anthropic、OpenAI、Google 三家全被绕过。 看不到 CoT,但能拿到 CoT 内容。 研究团队从公开仓库爬 315,320 块。 解码出 367 条 PII 与 182 条凭据。 即便答复是 safe reject,草稿仍藏危险。 强制解码能把它拉出来。 更隐蔽的是,恶意 payload 写在加密块里。 客户端不可见,模型却照做。 污染 agentic rollout。 缓解路径:crypto 绑 nonce,加 system 拒解码。 双兜底。厂商补丁强度尚未量化。

4. 镜头分镜

  • 镜头 1(8s · 屏幕文字:加密 CoT 跨块搬):三家 logo 三联屏,加密块图标在屏幕中央跳动;开屏用问句"你以为加密保护隐私?";镜头从 logo 缩放到单一加密块图标。
  • 镜头 2(8s · 屏幕文字:同厂弱模型强解):四步流程图,① 绿色 ② 灰色 ③ 橙色 ④ 红色,箭头串联;流程图自左向右滚动,每步配数字 1-4。
  • 镜头 3(8s · 屏幕文字:三家蒸馏全绕过):三家 logo 并排显示,依次被打上红色叉号;镜头快速横摇,每个叉号同步出现。
  • 镜头 4(8s · 屏幕文字:315320 块 367 PII):大字号 315,320 占据画面中心,箭头指向 367 PII + 182 凭据;数字逐次缩放进入,角标注 ⚠ abstract。
  • 镜头 5(8s · 屏幕文字:safe reject 藏危险):safe reject 红章盖在半透明草稿上,擦除动画后强制解码恢复显示;镜头由灰转清晰。
  • 镜头 6(8s · 屏幕文字:加密块藏 injection):左右分屏,左白右紫;紫色块由暗变亮,标注"对模型生效";镜头在左右屏之间切换。
  • 镜头 7(8s · 屏幕文字:crypto + system 双锁):双锁图示,密码学锁加系统锁;双锁闭合,镜头收束到中心。