2026-09-07 · LLM 推理物理学:第一章
来源:kenhuangus Substack
URL:https://kenhuangus.substack.com/p/the-physics-of-llm-inference-memory
作者:Ken Huang
发布时间:2026-08-31
标签:#推理理论#Roofline模型#HBM带宽#容量规划#Prefill/Decode
核心观点
LLM 推理的两个阶段(prefill 和 decode)拥有截然不同的硬件profile:prefill 是计算密集型(GEMM),可饱和 Tensor Core;decode 是内存带宽密集型(GEMV),99% 时间在等 HBM 数据搬运。容量规划必须从物理出发,否则 GPU 选型必错。
工程信号(高质量)
| 信号类型 | 是否有 | 详情 |
|---|---|---|
| Roofline 模型量化 | ✅ | H100 FP8 ridge ≈ 591 FLOP/byte,B200 同代更高 |
| 实测计算分割 | ✅ | 70B FP8 模型:权重传输 20.9ms,实际计算 0.07ms,比例 298:1 |
| 硬件 ridge point 表 | ✅ | H100 / B200 / 未来 Vera Rubin 各代对比 |
| 延迟分类体系 | ✅ | TTFT(prefill 主导)vs ITL/TPOT(decode 主导) |
| 付费章节代码 | ✅ | VRAM accounting、离散事件仿真器(可本地运行) |
关键数字摘录
H100 SXM5 FP8:
- 峰值:1,979 TFLOPS
- HBM3 带宽:3.35 TB/s
- Ridge point:≈ 591 FLOP/byte
- 单流 decode 实际:≈ 1.5 FLOP/byte(< 0.3% 峰值)
70B FP8 模型单次 decode step:
- 权重传输:70 GB / 3.35 TB/s ≈ 20.9 ms
- Tensor Core 计算:≈ 0.07 ms
- 比值:298:1(内存墙)
物理核心结论
- 单流 decode 无法有效利用 GPU——HBM 带宽是主要瓶颈,不是算力
- batch size 是性能关键——B≈296 才能逼近 H100 ridge;生产环境 KV cache 和延迟 SLO 先于算力绑住 batch size
- 容量规划必须先算内存后算算力——"买了多少 GPU"不是正确问题,"HBM 能容纳多少 live sequence"才是
后续行动
- [ ] 付费章节值得跟进:VRAM accounting 代码 + 仿真器可本地复现
- [ ] 用文中公式对自有模型做一次容量规划实测
- [ ] 对比 Vera Rubin(2026 H2)和 Groq 3 LPX 的 ridge point 变化
Jay 工程实践筛选 · 2026-09-07 下午批次 · 不执行 GitHub 写入