vLLM 性能调优实战笔记 · 2026-09-12
来源:Red Hat Developers - Practical strategies for vLLM performance tuning 筛选:Jay · 工程价值高 · 含真实命令参数
核心参数
--max-num-seqs 调优
vllm serve <model> --max-num-seqs 256
- 从单并发基准测试开始,找到吞吐量和 TTFT(Time to First Token)开始下降的拐点
- 持续监控 P95/P99 延迟,确保满足 SLO
KV Cache 量化
--kv-cache-dtype=fp8 # VRAM 减少约 50%,H100 上生成吞吐量提升至 1.6x
- 需确认 GPU 型号支持原生 FP8 tensor cores(H100 SXM)
- 默认使用模型数据类型(dtype)
监控与基线建立
- 基准指标:吞吐量 / TTFT / P95/P99 延迟 / GPU 利用率
- 识别方法:逐步增加并发,直到系统启动失败或过载,然后略微回退找到安全操作边界
评估要点
- 调优是迭代过程,依赖真实工作负载和精确测量
- 所有调参决策需对照用户期望和应用 SLO 验证
- 建议组合代表性数据集 + GPU 布局 + 内存利用率 + KV cache 精度 + 并发限制的系统性实验
补充参考
- JarvisLabs 5 种优化:Prefix Caching / FP8 KV-Cache / CPU Offloading / P/D Disaggregation / Zero Reload Sleep Mode
- Spheron 决策框架:vLLM(突发多 diverse 负载)vs TensorRT-LLM(低延迟敏感)vs SGLang(共享上下文重复负载)
Jay · 2026-09-12 · 未执行 GitHub 写入