date: 2026-07-24 round: R2 arxiv: 2607.20379 arxiv_url: https://arxiv.org/abs/2607.20379 mirror_of: /shared/video-kb/scripts/tom/2026-07-24_R2_recap-verifiable-activation-interpretation-short-video-script.md


1. 标题与观众

标题:RECAP · 给可解释性加一层核查

目标观众:可解释性研究员 / LLM 内部表征研究工程师 / AI 安全团队

一句话核心观点:标准 decodability 测试有结构性漏洞,RECAP 用辅助预测器做声明级独立核查。

3. 45-90 秒口播稿

标准 decodability 测试有结构漏洞:翻某条声明,只要 gist 不变,分数不动——模型可说对方向、藏错细节。

RECAP 在 Qwen-2.5-7B 训练辅助预测器,做声明级独立核查。真话 AUC 0.96 对 0.82,对抗 0.95 对 0.51,成本 +0.001 nat/token,划算。

5/5 实验都出现私有码——帮重构但不出现在文本,RECAP 没直接解决。工程落地:改用独立 probe 核查,别只信 verbalizer 自述。

4. 镜头分镜

scene-1 · 标题卡(8s)

  • 时长:8s
  • 屏幕文字:RECAP · 给可解释性加一层核查
  • 画面元素:深色背景 + 主标题白字 + 副标题小字 arXiv:2607.20379
  • 运动方式:标题淡入,副标题下划线展开

scene-2 · 判断卡 · 问题(8s)

  • 时长:8s
  • 屏幕文字:翻某声明·分数不变·漏洞存在
  • 画面元素:左 verbalizer 文本块 → 右重构分数块 → 中间红色断点表示「翻转但不变」
  • 运动方式:箭头扫过,红色断点闪烁两次

scene-3 · 流程卡 · RECAP 机制(8s)

  • 时长:8s
  • 屏幕文字:辅助预测器·声明级核查
  • 画面元素:三层结构 — 目标模型(底层) · RECAP linear heads(中层) · 独立 probe(顶层)
  • 运动方式:自下而上逐层点亮,probe 闪烁强调独立性

scene-4 · 证据卡 · 数字对比(8s)

  • 时长:8s
  • 屏幕文字:真话 AUC 0.96 vs 0.82 · 对抗 0.95 vs 0.51
  • 画面元素:左右柱状图 — RECAP(深色) vs 对照(浅色),两组
  • 运动方式:柱状图自下生长,数字标签同步浮现

scene-5 · 风险卡 · 三件套双行(8s)

  • 时长:8s
  • 屏幕文字:三组双行 — GitHub 0 命中 / 旁证替代闭环 · cs.AI/cs.CL / 双标签边界 · 数字 9 件 命中 / 实验论文路径
  • 画面元素:三张并列卡 · 主行加粗 · 副行灰字
  • 运动方式:三卡依次左滑入场

scene-6 · 行动卡 · 工程建议(8s)

  • 时长:8s
  • 屏幕文字:解释评估改独立 probe · 别只信 verbalizer
  • 画面元素:左 verbalizer 自述(打叉) → 右独立 probe 核查(打勾)
  • 运动方式:打叉抖动,打勾稳定显示

scene-7 · 落版卡 · 边界(8s)

  • 时长:8s
  • 屏幕文字:RECAP 补 claim 级 · 私有码待 Circuit Tracing 补
  • 画面元素:中间 RECAP logo + 左右两条虚线箭头分别指向「claim 级 ✓」与「私有码 ?」
  • 运动方式:虚线箭头轻摆,问号微闪