date: 2026-09-16 (Asia/Shanghai) round: R2 arxiv_id: 2609.15504 arxiv_link: https://arxiv.org/abs/2609.15504 video_kb_script_path: /shared/video-kb/scripts/tom/2026-09-16_R2_orthrus-lossless-speculative-bf16_short-video-script.md mirror_section: 1. 标题与观众 + 3. 45-90 秒口播稿 + 4. 镜头分镜


Orthrus 无损推测,BF16 只剩 45%(mirror · 1. 标题与观众)

1. 标题与观众

  • 标题:Orthrus 无损推测,BF16 只剩 45%
  • 目标观众:LLM 推理系统工程师 + speculative decoding 架构研究者 + 数值精度 / stateful KV cache 实现工程师 + dLLM 社区工程复核团队
  • 一句话核心观点:第一个把「无损推测解码」从口号变成可验证命题,BF16 比 FP32 少 55 个百分点 exact match

Orthrus 无损推测,BF16 只剩 45%(mirror · 3. 45-90 秒口播稿)

3. 45-90 秒口播稿

Orthrus 自称「严格无损」,7.8 倍加速 + O(1) KV cache 开销。 但 AIRI / Skoltech 把它独立复现了一遍。 1,190 个 prompt × 12 个领域 × 三档精度。 结果 BF16 下,精确轨迹匹配率:作者 checkpoint 45%,独立训练 checkpoint 43%。 FP32 下 100%,FP16 约 90%。数值精度决定无损。 更狠的是,lm-eval-harness 任务级分数完全没有系统性退化。 任务级指标根本抓不到 45% 和 100% 的差距。 如果你的模型卡写着 torch.bfloat16,那你跑的「无损」已经打折了。 去看 chiennv/Orthrus-Qwen3-1.7B 仓库 README,把精度档位说清楚再上线。

Orthrus 无损推测,BF16 只剩 45%(mirror · 4. 镜头分镜)

4. 镜头分镜

  • 镜头 1 · 6s · 「Orthrus 自称严格无损,7.8 倍加速」 · 标题卡 · 黑底大字由左推入 · 横向 slide-in;屏幕文字:Orthrus 自称严格无损
  • 镜头 2 · 10s · 「hybrid AR + Diffusion 架构图」 · 流程图 · autoregressive backbone + diffusion decoder 双向箭头 + frozen KV cache 标注;屏幕文字:hybrid AR + Diffusion 推测解码
  • 镜头 3 · 12s · 「BF16 45% vs FP32 100%,差 55 个百分点」 · 数字卡 · 三柱状图从左到右:BF16 45 / FP32 100 / FP16 90,数字脉冲;屏幕文字:BF16 45% vs FP32 100%
  • 镜头 4 · 10s · 「1,190 prompts × 12 domains × 3 精度档」 · 证据卡 · 数字层叠浮现,镜头轻微推近;屏幕文字:1,190 prompts × 12 domains
  • 镜头 5 · 10s · 「lm-eval-harness 任务级无退化」 · 风险卡 · 任务级分数柱状图与 trajectory 45% 发散率分层对比,红色警告框;屏幕文字:任务级指标抓不到 45%
  • 镜头 6 · 8s · 「on-policy 蒸馏 > 通用人类续写」 · 证据卡 · 两栏对比,左边 TPF 高亮,右边通用续写灰色;屏幕文字:on-policy 蒸馏是关键
  • 镜头 7 · 6s · 「把精度档位说清楚再上线」 · 行动清单 · 终端代码行 + 复制图标,光线由暗到亮;屏幕文字:精度档位先声明再上线