date: 2026-07-24 round: R2 arxiv: 2607.20379 arxiv_url: https://arxiv.org/abs/2607.20379 mirror_of: /shared/video-kb/scripts/tom/2026-07-24_R2_recap-verifiable-activation-interpretation-short-video-script.md
1. 标题与观众
标题:RECAP · 给可解释性加一层核查
目标观众:可解释性研究员 / LLM 内部表征研究工程师 / AI 安全团队
一句话核心观点:标准 decodability 测试有结构性漏洞,RECAP 用辅助预测器做声明级独立核查。
3. 45-90 秒口播稿
标准 decodability 测试有结构漏洞:翻某条声明,只要 gist 不变,分数不动——模型可说对方向、藏错细节。
RECAP 在 Qwen-2.5-7B 训练辅助预测器,做声明级独立核查。真话 AUC 0.96 对 0.82,对抗 0.95 对 0.51,成本 +0.001 nat/token,划算。
5/5 实验都出现私有码——帮重构但不出现在文本,RECAP 没直接解决。工程落地:改用独立 probe 核查,别只信 verbalizer 自述。
4. 镜头分镜
scene-1 · 标题卡(8s)
- 时长:8s
- 屏幕文字:
RECAP · 给可解释性加一层核查 - 画面元素:深色背景 + 主标题白字 + 副标题小字 arXiv:2607.20379
- 运动方式:标题淡入,副标题下划线展开
scene-2 · 判断卡 · 问题(8s)
- 时长:8s
- 屏幕文字:
翻某声明·分数不变·漏洞存在 - 画面元素:左 verbalizer 文本块 → 右重构分数块 → 中间红色断点表示「翻转但不变」
- 运动方式:箭头扫过,红色断点闪烁两次
scene-3 · 流程卡 · RECAP 机制(8s)
- 时长:8s
- 屏幕文字:
辅助预测器·声明级核查 - 画面元素:三层结构 — 目标模型(底层) · RECAP linear heads(中层) · 独立 probe(顶层)
- 运动方式:自下而上逐层点亮,probe 闪烁强调独立性
scene-4 · 证据卡 · 数字对比(8s)
- 时长:8s
- 屏幕文字:
真话 AUC 0.96 vs 0.82 · 对抗 0.95 vs 0.51 - 画面元素:左右柱状图 — RECAP(深色) vs 对照(浅色),两组
- 运动方式:柱状图自下生长,数字标签同步浮现
scene-5 · 风险卡 · 三件套双行(8s)
- 时长:8s
- 屏幕文字:三组双行 —
GitHub 0 命中/旁证替代闭环·cs.AI/cs.CL/双标签边界·数字 9 件 命中/实验论文路径 - 画面元素:三张并列卡 · 主行加粗 · 副行灰字
- 运动方式:三卡依次左滑入场
scene-6 · 行动卡 · 工程建议(8s)
- 时长:8s
- 屏幕文字:
解释评估改独立 probe · 别只信 verbalizer - 画面元素:左 verbalizer 自述(打叉) → 右独立 probe 核查(打勾)
- 运动方式:打叉抖动,打勾稳定显示
scene-7 · 落版卡 · 边界(8s)
- 时长:8s
- 屏幕文字:
RECAP 补 claim 级 · 私有码待 Circuit Tracing 补 - 画面元素:中间 RECAP logo + 左右两条虚线箭头分别指向「claim 级 ✓」与「私有码 ?」
- 运动方式:虚线箭头轻摆,问号微闪