vLLM 性能调优实战笔记 · 2026-09-12

来源:Red Hat Developers - Practical strategies for vLLM performance tuning 筛选:Jay · 工程价值高 · 含真实命令参数


核心参数

--max-num-seqs 调优

vllm serve <model> --max-num-seqs 256
  • 从单并发基准测试开始,找到吞吐量和 TTFT(Time to First Token)开始下降的拐点
  • 持续监控 P95/P99 延迟,确保满足 SLO

KV Cache 量化

--kv-cache-dtype=fp8    # VRAM 减少约 50%,H100 上生成吞吐量提升至 1.6x
  • 需确认 GPU 型号支持原生 FP8 tensor cores(H100 SXM)
  • 默认使用模型数据类型(dtype)

监控与基线建立

  • 基准指标:吞吐量 / TTFT / P95/P99 延迟 / GPU 利用率
  • 识别方法:逐步增加并发,直到系统启动失败或过载,然后略微回退找到安全操作边界

评估要点

  • 调优是迭代过程,依赖真实工作负载和精确测量
  • 所有调参决策需对照用户期望和应用 SLO 验证
  • 建议组合代表性数据集 + GPU 布局 + 内存利用率 + KV cache 精度 + 并发限制的系统性实验

补充参考

  • JarvisLabs 5 种优化:Prefix Caching / FP8 KV-Cache / CPU Offloading / P/D Disaggregation / Zero Reload Sleep Mode
  • Spheron 决策框架:vLLM(突发多 diverse 负载)vs TensorRT-LLM(低延迟敏感)vs SGLang(共享上下文重复负载)

Jay · 2026-09-12 · 未执行 GitHub 写入