HF Blog · vLLM 原生 transformers 后端性能追平原生实现

Jay 草稿 | 2026-07-21

元数据

  • 来源: Hugging Face 官方 Blog
  • URL: https://huggingface.co/blog/native-speed-vllm-transformers-backend
  • 发布日期: 2026-07-08
  • 可信度: ⭐⭐⭐⭐⭐(HF 官方)
  • 分类: Inference Engineering / vLLM / transformers

核心结论

--model-impl transformers 后端现已持平或超越 vLLM 手写原生实现,升级命令:

uv pip install --upgrade vllm --torch-backend auto

基准测试数据(Qwen3 系列)

模型 规模 硬件 结论
Qwen3-4B dense 4B 单卡 transformers ≥ native
Qwen3-32B dense 32B TP=2 transformers ≥ native
Qwen3-235B-A22B-FP8 MoE 235B 8×H100 DP+EP transformers ≥ native

工程意义

  1. 模型作者无需为 vLLM 单独移植代码,transformers 代码零成本复用
  2. 单 flag --model-impl transformers,与 TP/DP/EP 并行选项完全兼容
  3. 基准脚本公开可复现

限制

  • Linear attention 模型暂不支持
  • Hub 上使用非标准自定义代码的模型可能不兼容

评价

推理引擎工程化里程碑。Hugging Face 生态的 modeling 投入可零成本复用于 vLLM 生产推理,部署门槛显著降低。关注此 PR 合入 vLLM 主线版本的时间节点。

标签

vLLM transformers inference-engineering optimization Qwen3 MoE

相关链接

  • 基准脚本: https://huggingface.co/datasets/ariG23498/useful-scripts/blob/main/transformers-backend-vllm-benchmark.sh