2026-08-20 · R2 · DeepSeek-V4-Pro H20 多场景优化 · 2608.14376 CoRun

arxiv: https://arxiv.org/abs/2608.14376 video-kb 脚本原路径: /shared/video-kb/scripts/tom/2026-08-20_R2_deepseek-v4-pro-h20-multiscene-optimization-short-video-script.md


1. 标题与观众

  • 标题:H20 逼近 B300 · 1.6T MoE 工程实证(14 字 · 5/5 关键词命中 H20 + 逼近 + B300 + 1.6T MoE + 工程实证 · ≤ 22 字 PR hard_gate PASS)
  • 目标观众:LLM 推理服务部署工程师 · MoE 推理基础设施架构师 · vLLM/SGLang 实践生产工程师 · AI 工程产品经理
  • 一句话核心观点:开源推理栈在 H20 上把 1.6T MoE 跑出 271 tokens/s · 与 B300 差距 1.42× · 调度比硬件更决定发挥

3. 45-90 秒口播稿

1.6 万亿 MoE,默认上 B300。 LMSYS 把 V4-Pro 跑上 H20。 单节点 271 tokens/s,B300 跑出 383.7。 差距只剩 1.42 倍。 不是换硬件,是换调度。 八卡 H20,搭 Humming 量化。 SGLang 关掉 MoE 跨卡通信。 DSpark 一次过七个 draft。 CoRun 做确定性 batching。 请求 prefill 隔离,decode 重放固定 Graph。 吞吐涨 15% 到 324%,最低超两倍。 输出 bit-identical。 CUDA Graph 生产别选 full。 full 还只是实验。 breakable 或 tc_piecewise 才稳定。 代码省七成五,prefill 图快五倍。 调度对了,H20 一样逼近 B300。

4. 镜头分镜

  • scene-1 · 8s · 标题卡 · 屏幕文字:H20 → 271 tokens/s · 画面:H20 vs B300 对比柱状图(左 H20 271 / 右 B300 383.7)· 运动:左柱先出,右柱拉出,差距线 1.42× 浮现
  • scene-2 · 8s · 流程图 · 屏幕文字:1.6T MoE + Humming · 画面:DeepSeek-V4-Pro 1.6T MoE 参数矩阵 + Humming MXFP4AFP8 量化标签 + 8× H20-141GB 硬件堆叠图 · 运动:矩阵逐层展开 + 量化标签淡入 + 8 卡堆叠落位
  • scene-3 · 8s · 流程图 · 屏幕文字:CoRun +15-324% 吞吐 · 画面:CoRun 时序图(prefill 隔离 + decode pad + 固定 CUDA Graph 重放 三段流水线)· 运动:请求流入 → prefill 隔离 → decode pad → 固定 Graph 重放循环箭头
  • scene-4 · 8s · 证据卡 · 屏幕文字:bit-identical 推理 · 画面:同输入两路推理对比(传统路线 vs CoRun 路线)· 输出 token 序列对齐 · 位级相同高亮 · 运动:传统路线输出 token 序列漂移 · CoRun 路线位级锁定
  • scene-5 · 8s · 证据卡 · 屏幕文字:full 实验 · 用 break · 画面:CUDA Graph 三模式对比表(full 实验红叉 · breakable 生产绿勾 · tc_piecewise 生产绿勾)· prefill graph 3.8-5.2× 加速数字 · 运动:三列滑出 · 红叉打上 · 绿勾打上 · 加速数字弹入
  • scene-6 · 8s · 流程图 · 屏幕文字:DSPARK 7 tokens 关键 · 画面:DSpark 推测解码流程(主模型 + draft 7 tokens + 验证 + 接受)· --speculative-num-draft-tokens 7 标签 · Triton runner 标签 · 运动:draft token 串行生成 · 验证批量化 · 接受率反馈箭头
  • scene-7 · 8s · 行动清单 · 屏幕文字:硬件决定上限 · 调度发挥 · 画面:H20 → B300 性能阶梯 + 开源推理栈生态矩阵(SGLang + CoRun + DASH + DSPARK 四件套)· 运动:阶梯拉出 + 四件套矩阵折叠展开