SGLang H20 GPU 推理命令参考(2026-08-20)

来源: LMSYS Blog — DeepSeek-V4-Pro Engine Optimization on H20
时间: 2026-08-19 | 可信度: ⭐⭐⭐⭐⭐


硬件配置

  • GPU:8× H20-141GB
  • 量化:Humming MXFP4AFP8(降低 H20 内存占用)
  • 推理引擎:SGLang(OAI-chat 后端)

Decode Server 启动命令

python3 -m sglang_other_chat \
  --tp-size 8 \
  --mem-fraction-static 0.91 \
  --max-running-requests 1 \
  --cuda-graph-max-bs 1 \
  --cuda-graph-bs 1 \
  --moe-runner-backend humming \
  --moe-a2a-backend none \
  --speculative-algorithm DSPARK \
  --speculative-num-draft-tokens 7 \
  --speculative-dspark-block-size 7 \
  --speculative-moe-runner-backend triton

关键参数解读

参数 说明
--tp-size 8 TP 并行度(H20 8卡配置)
--mem-fraction-static 0.91 静态显存分配比例(高利用率配置)
--max-running-requests 1 单批次最大并发请求数(DSpark 推测解码专用)
--cuda-graph-max-bs 1 CUDA Graph 最大 batch size
--cuda-graph-bs 1 CUDA Graph batch size
--moe-runner-backend humming MoE 计算使用 Humming(MXFP4AFP8 量化)
--moe-a2a-backend none 禁用 MoE all-to-all 通信(DSpark 配置)
--speculative-algorithm DSPARK 推测解码算法:DSpark(DeepSeek 推测解码)
--speculative-num-draft-tokens 7 每次推测 7 个 draft tokens
--speculative-dspark-block-size 7 DSpark block size = 7
--speculative-moe-runner-backend triton DSpark runner 使用 Triton

Benchmark 命令

python3 -m sglang.bench_serving \
  --backend sglang-oai-chat \
  --host 127.0.0.1 \
  --port 8000 \
  --dataset-name random \
  --random-input-len 262144 \
  --random-output-len 4096 \
  --random-range-ratio 1.0 \
  --num-prompts 10 \
  --max-concurrency 1 \
  --warmup-requests 0 \
  --seed 1

参数解读

参数 说明
--random-input-len 262144 约 262K tokens(长上下文评测)
--random-output-len 4096 输出长度 4K tokens
--random-range-ratio 1.0 输入/输出长度波动范围
--max-concurrency 1 串行评测(单请求延迟基准)
--warmup-requests 0 无预热(精确评测)

生产部署建议(LMSYS 官方)

  1. CUDA Graph 策略选择: - 实验性:full(仅 FA4 / FlashInfer 后端支持) - 生产推荐:breakabletc_piecewise
  2. H20 显存利用率优化: --mem-fraction-static 0.91 适用于单用户长上下文推理
  3. DSpark 推测解码: 适合 Throughput 优先场景;若追求超低延迟,评估 speculative-num-draft-tokens 敏感性

来源:https://www.lmsys.org/blog/2026-08-19-deepseek-v4-pro-engine-optimization-h20 Jay · 2026-08-20