日期与轮次:2026-09-29 · R2 中午棒 arXiv 链接:https://arxiv.org/abs/2609.30837 video-kb 脚本原路径:/shared/video-kb/scripts/tom/2026-09-29_R2_mopd-router-token-align_short-video-script.md

1. 标题与观众

  • 标题:MOPD 别硬路由给专才教师(14 chars · 命中 candidates §1 候选 1 字面 verbatim)
  • 目标观众:AI 工程师(LLM 蒸馏 / SFT-on-policy / 多教师集成方向)+ 算法研究员(多教师集成 + token 级路由 + 路由指标设计方向)
  • 一句话核心观点:把多教师蒸馏的 prompt 级硬路由换成 token 级全教师池加权 + ExpertAlign 度量专长,无标签、无独立 router,4 setting 全胜。

3. 45-90 秒口播稿

[段 1 · 5 秒冲突] 你以为多教师蒸馏只能 prompt 级硬路由给专才教师?告诉你一个反直觉的事:每个 token 对全体教师池加权,ExpertAlign 把专长信号精准挑出来,不依赖领域标签,不训独立 router。

[段 2 · 18 秒机制] 现有 MOPD 三大痛点:必须 prompt 级领域标签、浪费其他教师的互补信号、训独立 router 还要额外反向传播成本。MOPD-Router 的做法是:每个 token 对三个教师池各算一次 KL,再用 ExpertAlign 给每个教师打专长度分,softmax 转权重,加权聚合监督信号。metric 是 plug-in 接口,要换 Entropy 或 Novelty 都行。

[段 3 · 15 秒算法洞察] ExpertAlign 的关键不是「这个教师多自信」,也不是「这个教师改得有多狠」,而是「这个教师在当前 token 上的修正方向,是否符合它后训练时学会的专长」。代码教师在数学题上自信度再高也不算专长。

[段 4 · 16 秒结果] 实测四组全部最强:无标注数据 +5.88 分(+12.3%)超过 Mean 聚合;有标注数据 +3.95 分(+7.8%)超过标准 MOPD,还故意不用领域标签。跨强弱 + 同尺寸两组实验,Qwen3-1.7B 学生对 Qwen3-4B 教师,GitHub 已开源。

[段 5 · 6 秒边界 + 行动] 边界:算力开销、alignment 公式细节、benchmark 清单原文都未明确。今晚要做的事:在你三个后训练过的教师上跑 ExpertAlign,对照 Mean 聚合看增益。

4. 镜头分镜

  1. 镜头 1 · hero · 7 秒 - 时长:7s - 屏幕文字:MOPD 别硬路由给专才教师(14 chars · verbatim 命中 candidates §1 候选 1 字面) - 画面元素:cool-paper 背景 + 大字 hero 卡 + 微光晕 - 运动方式:从左滑入,字幕与 logo 一同缓动到位

  2. 镜头 2 · cards · 9 秒 - 时长:9s - 屏幕文字:默认 prompt 级硬路由 / token 级全教师池加权 - 画面元素:左右两卡片,左侧红色警示「默认做法」,右侧绿色反直觉「MOPD-Router」 - 运动方式:左卡先入,右卡延迟 1.5s 切入,二者向中心靠拢

  3. 镜头 3 · flow · 11 秒 - 时长:11s - 屏幕文字:每个 token × 教师池 → 专长度分 → softmax → 加权 KL → 学生监督 - 画面元素:水平流程图,5 个节点 + 4 条连线,ExpertAlign 节点高亮金色 - 运动方式:从左到右依次高亮节点,连线流动,镜头在 ExpertAlign 节点慢推 1s

  4. 镜头 4 · evidence · 10 秒 - 时长:10s - 屏幕文字:+5.88 / +12.3% vs Mean / +3.95 / +7.8% vs 标准 MOPD - 画面元素:左右两证据卡平铺,核心数字金色加粗,底部小字 4 setting 全胜 · 无标注 + 有标注 · 跨强弱 + 同尺寸 - 运动方式:两卡淡入后顺序上浮,镜头收尾时定格整体画面 1s

  5. 镜头 5 · flow-compare · 10 秒 - 时长:10s - 屏幕文字:Entropy ≠ 专长 / Novelty ≠ 专长 / 修正方向 = 专长 - 画面元素:三栏对照卡,左中红叉号、右绿勾号,标题「ExpertAlign 核心洞察」 - 运动方式:三栏依次淡入,镜头停在末栏 1.5s

  6. 镜头 6 · risk · 9 秒 - 时长:9s - 屏幕文字:这三类说法要谨慎 - 画面元素:风险卡三块,黄色边框,标题分别「仅 Qwen3-4B 实测」「alignment 公式细节未给」「同源教师会退化为 Mean」 - 运动方式:三卡按节奏逐张弹出,每张停留 2.5s 后下移

  7. 镜头 7 · closing · 6 秒 - 时长:6s - 屏幕文字:今晚跑 ExpertAlign 对照 Mean - 画面元素:渐变背景 + 大字收尾 + 引导行动按钮样式 - 运动方式:文字从中心向外微扩散,按钮缓动出现

总时长:62 秒(目标 45-90 秒区间内 PASS)。