2026-09-27 R2 · Superposition · LLM 一次前向 出两路 · short-video-script

arXiv 链接:https://arxiv.org/abs/2609.29845 video-kb 脚本原路径:/shared/video-kb/scripts/tom/2026-09-27_R2_superposition-once-forward_short-video-script.md 日期与轮次:2026-09-27 · R2(中午档)

1. 标题与观众

  • 标题:LLM 一次前向 出两路
  • 目标观众:LLM 推理优化工程师(主)+ Speculative decoding / batched decoding 设计者(次)+ 机制可解释性研究者(第三)+ 推理框架开发者(vLLM / TGI / TensorRT-LLM / llama.cpp)(第四)+ AI 编译器 / 量化 / 部署方向研究员(第五)
  • 一句话核心观点:embedding 层线性叠加可让一次前向同时承载两路独立续写,推理吞吐翻倍。
  • 禁止把"scene-1""§2""本主题不涉及""无需""修订时间""输出路径"等元信息写进标题。

3. 45-90 秒口播稿

[段 1 · 5 秒冲突开篇] 业内默认把 Transformer 看作高度非线性,多路生成就必须跑多次前向,batched 解码和 speculative 解码都建立在这个假设上。

[段 2 · 18 秒机制] 但今天这篇 arXiv 2609.29845 在 embedding 层做了反直觉的事:把两段独立文本的 token embedding 加权求和,送进模型,下一 token 分布 ≈ 两路各自分布的加权和。作者叫它 Superposition Linearity Hypothesis。

[段 3 · 15 秒训练动力学] 更反直觉的是:这种叠加随预训练推进会减弱,但只要做一轮轻量微调,就能把它拉回来 —— 这暗示叠加是架构的基态,不是训练涌现。

[段 4 · 18 秒工程杠杆] 据此做出引导式解码:在 embedding 阶段叠加两路语义锚,一次 forward 拿到混合 logits,再反投影去耦,得到两路相干且互不串味的续写。单次前向天然承载两路独立语义流 —— 推理吞吐 ≈ 翻倍,不依赖特殊硬件。

[段 5 · 14 秒边界 + 行动] 边界要清楚:可加性只在 embedding 层最显著,进入 attention 早期层后被注意力分布打散;反投影的具体形式原文没给。今晚就能做的是:在你的目标模型上跑 Stage 1,实测叠加保真度(JS 散度),再决定要不要继续投入。

4. 镜头分镜

  1. 镜头 1 · hero · 7 秒 - 屏幕文字:LLM 一次前向 出两路(12 chars · verbatim 命中 candidates §1 候选 1 字面) - 画面元素:warm-paper 背景 + 大字 hero 卡 + 微光晕 - 运动方式:从左滑入,字幕与 logo 一同缓动到位
  2. 镜头 2 · cards · 9 秒 - 屏幕文字:默认非线性 + 多路=多次前向 / embedding 线性叠加 - 画面元素:左右两卡片,左侧红色警示「默认假设」,右侧绿色反直觉「实测观察」 - 运动方式:左卡先入,右卡延迟 1.5s 切入,二者向中心靠拢
  3. 镜头 3 · flow · 11 秒 - 屏幕文字:流 A + 流 B → embedding → 加权求和 → 一次前向 → 双路 logits - 画面元素:水平流程图,5 个节点 + 4 条连线,α/β 系数标注在求和节点 - 运动方式:从左到右依次高亮节点,连线流动,镜头在求和节点慢推 1s
  4. 镜头 4 · evidence · 10 秒 - 屏幕文字:610 KB v1 / arXiv 2609.29845 / cs.CL + cs.AI / Pavel Tikhonov - 画面元素:四块证据卡平铺,每块独立编号,底部小字 arXiv 官方分类与作者 - 运动方式:四卡淡入后顺序上浮,镜头收尾时定格整体画面 1s
  5. 镜头 5 · risk · 9 秒 - 屏幕文字:这三类说法要谨慎 - 画面元素:风险卡三块,黄色边框,标题分别「反投影未给」「仅 embedding 层」「对齐模型叠加弱」 - 运动方式:三卡按节奏逐张弹出,每张停留 2.5s 后下移
  6. 镜头 6 · checklist · 8 秒 - 屏幕文字:今晚三件事 - 画面元素:行动清单三行,序号 1/2/3,行首打勾图标 - 运动方式:三行依次淡入,镜头停在末行 2s
  7. 镜头 7 · closing · 7 秒 - 屏幕文字:把判断变成行动 - 画面元素:渐变背景 + 大字收尾 + 引导行动按钮样式 - 运动方式:文字从中心向外微扩散,按钮缓动出现

总时长:61 秒(目标 45-90 秒区间内)。