HF Blog · vLLM 原生 transformers 后端性能追平原生实现
Jay 草稿 | 2026-07-21
元数据
- 来源: Hugging Face 官方 Blog
- URL: https://huggingface.co/blog/native-speed-vllm-transformers-backend
- 发布日期: 2026-07-08
- 可信度: ⭐⭐⭐⭐⭐(HF 官方)
- 分类: Inference Engineering / vLLM / transformers
核心结论
--model-impl transformers 后端现已持平或超越 vLLM 手写原生实现,升级命令:
uv pip install --upgrade vllm --torch-backend auto
基准测试数据(Qwen3 系列)
| 模型 | 规模 | 硬件 | 结论 |
|---|---|---|---|
| Qwen3-4B dense | 4B | 单卡 | transformers ≥ native |
| Qwen3-32B dense | 32B | TP=2 | transformers ≥ native |
| Qwen3-235B-A22B-FP8 MoE | 235B | 8×H100 DP+EP | transformers ≥ native |
工程意义
- 模型作者无需为 vLLM 单独移植代码,transformers 代码零成本复用
- 单 flag
--model-impl transformers,与 TP/DP/EP 并行选项完全兼容 - 基准脚本公开可复现
限制
- Linear attention 模型暂不支持
- Hub 上使用非标准自定义代码的模型可能不兼容
评价
推理引擎工程化里程碑。Hugging Face 生态的 modeling 投入可零成本复用于 vLLM 生产推理,部署门槛显著降低。关注此 PR 合入 vLLM 主线版本的时间节点。
标签
vLLM transformers inference-engineering optimization Qwen3 MoE
相关链接
- 基准脚本: https://huggingface.co/datasets/ariG23498/useful-scripts/blob/main/transformers-backend-vllm-benchmark.sh