2026-09-07 · LLM 推理物理学:第一章

来源:kenhuangus Substack
URL:https://kenhuangus.substack.com/p/the-physics-of-llm-inference-memory
作者:Ken Huang
发布时间:2026-08-31
标签:#推理理论 #Roofline模型 #HBM带宽 #容量规划 #Prefill/Decode

核心观点

LLM 推理的两个阶段(prefill 和 decode)拥有截然不同的硬件profile:prefill 是计算密集型(GEMM),可饱和 Tensor Core;decode 是内存带宽密集型(GEMV),99% 时间在等 HBM 数据搬运。容量规划必须从物理出发,否则 GPU 选型必错。

工程信号(高质量)

信号类型 是否有 详情
Roofline 模型量化 H100 FP8 ridge ≈ 591 FLOP/byte,B200 同代更高
实测计算分割 70B FP8 模型:权重传输 20.9ms,实际计算 0.07ms,比例 298:1
硬件 ridge point 表 H100 / B200 / 未来 Vera Rubin 各代对比
延迟分类体系 TTFT(prefill 主导)vs ITL/TPOT(decode 主导)
付费章节代码 VRAM accounting、离散事件仿真器(可本地运行)

关键数字摘录

H100 SXM5 FP8:
- 峰值:1,979 TFLOPS
- HBM3 带宽:3.35 TB/s
- Ridge point:≈ 591 FLOP/byte
- 单流 decode 实际:≈ 1.5 FLOP/byte(< 0.3% 峰值)

70B FP8 模型单次 decode step:
- 权重传输:70 GB / 3.35 TB/s ≈ 20.9 ms
- Tensor Core 计算:≈ 0.07 ms
- 比值:298:1(内存墙)

物理核心结论

  1. 单流 decode 无法有效利用 GPU——HBM 带宽是主要瓶颈,不是算力
  2. batch size 是性能关键——B≈296 才能逼近 H100 ridge;生产环境 KV cache 和延迟 SLO 先于算力绑住 batch size
  3. 容量规划必须先算内存后算算力——"买了多少 GPU"不是正确问题,"HBM 能容纳多少 live sequence"才是

后续行动

  • [ ] 付费章节值得跟进:VRAM accounting 代码 + 仿真器可本地复现
  • [ ] 用文中公式对自有模型做一次容量规划实测
  • [ ] 对比 Vera Rubin(2026 H2)和 Groq 3 LPX 的 ridge point 变化

Jay 工程实践筛选 · 2026-09-07 下午批次 · 不执行 GitHub 写入