2026-09-10 R2 · Encoded Early, Used Late · arXiv 2609.07139
- 原始 video-kb 脚本:
/shared/video-kb/scripts/tom/2026-09-10_R2_encoded-early-used-late_short-video-script.md - arXiv 链接:https://arxiv.org/abs/2609.07139
1. 标题与观众
- 标题:早编码晚使用,Agent 该插哪层
- 目标观众:开发者 / AI 工程师
- 一句话核心观点:浅层可读、中后层才用,causal 效应差 10× 以上。
3. 45-90 秒口播稿
多轮对话 Agent 工程师都在问:模型到底在哪一层判断用户是不是新手?Encoded Early, Used Late 给了一个量化答案。ExpertCollab 四级专业度合成语料里,linear probe 在浅层就锁定了 partner expertise,网络过半直接掉到 chance;但在 peak decodability 层和中后层分别做反事实补丁,因果效应差了超过一个数量级。结论:浅层只是「读」,中后层才是「用」。多轮对话 Agent 想做 partner-aware 个性化,干预窗口要锚在中后层,而不要试图用 prompt 在浅层抢话语权。记住边界:这只是单模型、合成语料的 initial demonstration,跨模型外推要自己复现。
4. 镜头分镜
- Scene 1(0:00-0:08 · 标题卡):屏幕文字「早编码晚使用,Agent 该插哪层」,画面 = 黑底白字 + 黄色高亮关键词「早编码」「晚使用」,运动 = 关键词逐字浮现。
- Scene 2(0:08-0:20 · 问题卡):屏幕文字「多轮对话 Agent 在哪一层判断用户专业度?」,画面 = 对话气泡堆叠(本科/研究生/博后/资深四级人设)+ 红色问号闪烁,运动 = 气泡从浅到深排列。
- Scene 3(0:20-0:38 · 流程图 · 证据卡):屏幕文字「linear probe:浅层峰值 → 中段掉 chance」,画面 = 横向层深轴 + probe accuracy 曲线(早高峰 + 中段塌陷),运动 = 曲线从左到右绘制。
- Scene 4(0:38-0:55 · 证据卡):屏幕文字「counterfactual patching:因果效应比 >10×」,画面 = 两根柱状对比(A 组 peak 层 / B 组中后层)+ 「>10×」红色数字高亮,运动 = 柱子分别弹跳放大。
- Scene 5(0:55-1:08 · 流程图):屏幕文字「干预窗口锚定中后层 · 不要在浅层抢话语权」,画面 = Transformer 网络纵切面 + 黄色干预带高亮中后层,运动 = 干预带下移聚焦。
- Scene 6(1:08-1:20 · 风险卡):屏幕文字「one model · synthetic corpus · 跨模型外推未明」,画面 = 灰色警示边框 + 三条限定语滚动,运动 = 文字从下往上推入。
- Scene 7(1:20-1:30 · 行动清单):屏幕文字「3 步:① 探针定位 peak 层 ② patching 量化因果层 ③ 跨模型复现」,画面 = 编号清单 + 每步配小图标(探针 / 补丁 / 复现箭头),运动 = 清单逐条点亮。
- Scene 8(1:30-1:35 · 标题卡):屏幕文字「早编码晚使用 · partner-aware 锚中后层」,画面 = 与 Scene 1 呼应的回归卡,运动 = 缓慢淡出。