工程实践筛选草稿 · 2026-08-31
主题:LLM 推理引擎Benchmark / vLLM SGLang 生产实践 / 推理引擎Bug分析
实例:Jay
一、vLLM vs SGLang vs TGI 2026 Benchmark 深度解析
来源: llm-academy.dev
URL: https://llm-academy.dev/inference/vllm-vs-sglang
发布时间: 2026(具体日期需访问页面确认)
作者/机构: LLM Academy(独立技术博客)
可信度: 高 — 标注了来源(PremAI/TECHSY/Spheron/YottaLabs/Particula 2026 benchmark)
核心性能数据
H100 8B 类模型吞吐量(单卡):
| Engine | Throughput (tok/s) | GPU 利用率 |
|---|---|---|
| SGLang (RadixAttention) | ~16,200 | 85–92% |
| vLLM (PagedAttention) | ~12,500 | ~85–92% |
| TGI | ~9,800 | 68–74% |
→ SGLang 领先 vLLM 约 29%,TGI 显著落后。
70B 模型(双卡 H100,Llama-3-70B):
| Engine | TTFT (p50) | TPOT (p50) | TPOT (p99) |
|---|---|---|---|
| SGLang | ~190ms | 19ms | 50ms |
| vLLM | ~210ms | 20ms | 55ms |
| TGI | ~260ms | 24ms | 80ms |
→ 双卡场景下差距缩小,SGLang 仍领先但幅度收窄(3–5%)。
并发压力下 vLLM 表现(RunPod 数据):
- vLLM 在高并发时缓存压力导致吞吐量从 22 tok/s 降至 16 tok/s
- SGLang 稳定在 30–31 tok/s
- 差距在高并发多轮对话(RAG、agent)场景尤为显著
版本信息: - vLLM v0.18.0 - SGLang v0.5.9 - TensorRT-LLM v1.2.0 - TGI 2026 年 3 月已归档(HuggingFace 官方推荐迁移至 vLLM/SGLang)
评价
保留理由: 真实 H100 基准数据,多来源交叉验证,版本明确,延迟百分位数据完整。可作为推理引擎选型的基准参考。
二、Particula: SGLang vs vLLM 架构深度对比 + DeepSeek V3 专项
来源: particula.tech
URL: https://particula.tech/blog/sglang-vs-vllm-inference-engine-comparison
发布时间: 2026(持续更新)
可信度: 高
关键数据点
DeepSeek V3 专项优化(SGLang 原生支持): - SGLang 对 DeepSeek V3 达到 3.1x faster inference vs vLLM - 优化手段:FlashAttention3、FlashInfer、FlashMLA、CutlassMLA - Multi-Token Prediction(EAGLE 投机解码): - batch size 1 时 decode speedup 1.8x - batch size 32 时 decode speedup 1.5x - Prefill-decode disaggregation(分离部署)在 SGLang 中已 production 再现
SGLang RadixAttention 原理: - 自动发现多请求间共享前缀(无需手动配置) - 50 用户同主题对话时自动复用 common prefix - 对 RAG、多轮 chat、agent 工作负载有天然优势
vLLM PagedAttention 原理: - KV cache 以 4% 内存浪费(vs 60–80% naive contiguous)管理 - 更宽的硬件支持:NVIDIA/AMD/Intel/TPU/Trainium/Inferentia/Gaudi/Arm - Blackwell/GB200 优化:DeepSeek-style MoE 模型 26,200 prefill tok/s
评价
保留理由: DeepSeek V3 3.1x 加速数据具体可信,EAGLE 投机解码有量化数字,架构对比清晰。适合作为深度选型参考。
三、vLLM vs SGLang vs LMDeploy AIMultiple Benchmark
来源: aimultiple.com
URL: https://aimultiple.com/inference-engines
更新: August 17, 2026
可信度: 高 — 商业研究机构,有完整方法论和下载数据
方法论
- 引擎:vLLM、LMDeploy、SGLang
- 模型:Llama 3.1 8B-Instruct
- 负载:1,000 ShareGPT prompts
- 硬件:NVIDIA H100
- 可下载 CSV 原始数据
评价
保留理由: 有明确 August 2026 更新时间戳,可下载数据适合二次分析,商业机构背书。建议精读。
四、State of Model Serving Communities — April 2026
来源: inferenceops.substack.com
URL: https://inferenceops.substack.com/p/state-of-the-model-serving-communities-b93
发布时间: April 2026
作者: InferenceOps(Substack 平台)
可信度: 中高
核心内容
vLLM v0.17 → v0.19 演进路线图: - 视觉/音频/ASR/embedding/rerank/tool-use 多模态覆盖扩展 - Speculative decoding 重大更新 - Model Runner V2 - KV/weight offloading - CUDA graphs + high-performance kernels
KServe v0.17.0: - LLMInferenceService 生产级 autoscaling(WVA/KEDA/HPA) - OpenAI Responses API 支持 - llm-d 依赖升级 - Intel Gaudi 支持(OpenShift AI Serving) - ARM builds for LLMInferenceService controller - ONNX model class 支持 MLServer
重要变更 — EPP 拆分为 llm-d: - 原 Kubernetes inference 代码拆分至 llm-d 仓库 - 降低碎片化,InferencePool API 保留在 k8s org,引擎专业实现移入 llm-d
SIG-kv-disaggregation 更新: KV 分离协议标准化进展
评价
保留理由: 版本明确,工具链状态新,生产部署参考价值高。适合作为 MLOps 路线追踪材料。
五、Senior LLM Inference Engineer Interview — 生产细节全覆盖
来源: aiengineeringinsider.substack.com
URL: https://aiengineeringinsider.substack.com/p/inference-serving-senior-llm-inference
可信度: 中高 — AI Engineering Insider 专栏
面试知识点覆盖
推理引擎: vLLM、SGLang、TensorRT-LLM、HuggingFace TGI(已维护模式)、Triton
服务架构: API gateway、router、scheduler、workers、GPU replicas
请求生命周期: admission、queueing、prefill、decode、streaming、completion
批处理: static batching、dynamic batching、continuous/in-flight batching
调度: FIFO、priority、fairness、prefill vs decode tradeoffs、token budgets
副本策略: model replication、tensor parallelism、data parallelism、GPU placement
Autoscaling: replicas、queue depth、utilization、TTFT、saturation、cold starts
性能指标: TTFT、TPOT、ITL、throughput、concurrency、GPU utilization
内存管理: weights、KV cache、fragmentation、PagedAttention、prefix caching
评价
保留理由: 系统性梳理推理工程师生产知识体系,可作为面试准备或技能评估清单。
六、arXiv: A First Look at Bugs in LLM Inference Engines
来源: arXiv 2506.09713
URL: https://arxiv.org/html/2506.09713v1
可信度: 高 — 学术研究,peer-review 级别系统性分析
核心发现
研究范围: vLLM、DeepSpeed、TensorRT-LLM
Bug 分类: 1. 模型转换 Bug — 模型格式适配推理引擎时的转换错误 2. 效率优化 Bug — 量化/并行策略引入的正确性问题 3. 资源管理 Bug — 内存/GPU 调度导致的服务崩溃 4. 精度 Bug — 优化导致输出质量下降
根因分析:
推理引擎特性(频繁发布、社区驱动)+ 多版本并存 + 硬件多样性 → bug 表面积大
评价
保留理由: 首个系统性推理引擎 bug 分类研究,对生产运维有直接指导意义。建议精读并加入主题页「推理引擎排障」章节。
七、arXiv: Attention to Detail — vLLM 配置能源/性能/精度权衡
来源: arXiv 2607.09172
URL: https://arxiv.org/html/2607.09172v2
可信度: 高
方法论
- vLLM 0.10.2
- 5 个模型族 × 5 个数据集
- 系统性配置交互分析
核心发现
- 推理优化之间存在相互作用,不能孤立评估
- 配置项对不同任务类型影响差异显著
- 量化(INT8/FP8)对精度影响因模型和任务而异
- 能源消耗与性能并非线性关系
评价
保留理由: 系统性评估 vLLM 配置选择,适合作为生产调优参考。建议精读。
八、arXiv: OptiKIT — eBay 企业 LLM 自动优化
来源: arXiv 2601.20408
URL: https://arxiv.org/html/2601.20408v2
可信度: 高 — 企业生产案例研究
方法论
- NVIDIA H100
- 3 种 workload 配置(输入输出 token 比、SLO、模型规模)
- TPE 优化 30 trials
- 联合调优参数:max_num_seqs、max_num_batched_tokens、tensor_parallel_size
关键结论
- 量化 + 运行时调优组合效果 > 单独使用任一方法
- 不同业务场景最优配置差异显著
- end-to-end 配置优化可显著提升生产效率
评价
保留理由: 真实企业生产数据,TPE 优化有可复现方法论,对大规模部署有参考价值。
九、arXiv: Efficient KV Cache Layer for Enterprise LLM Inference
来源: arXiv 2510.09665
URL: https://arxiv.org/html/2510.09665v1
可信度: 高
核心数据
- vLLM page size:16 tokens/layer,典型大小 20–63 KB(Llama/Qwen/GPT-OSS)
- 16-token page 对大规模传输效率低(无法饱和带宽)
- KV cache 传输优化方案:larger page batching
2026 开源分布式推理栈对比: - vLLM Production Stack(2025-01 发布) - NVIDIA Dynamo - AIBrix - llm-d - SGLang - KServe
评价
保留理由: KV cache 传输优化有量化数据,开源栈对比清晰,适合加入「推理系统架构」主题页。
十、arXiv: RTP-LLM — Alibaba 高性能推理引擎
来源: arXiv 2605.29639
URL: https://arxiv.org/html/2605.29639v1
可信度: 高 — 工业级系统论文
核心优化
- 量化: W4A8KV4(weight INT4/activation INT8/KV cache INT8)memory footprint 减半
- KV cache 量化: 直接缓解 Decode Phase 内存带宽压力
- 并行执行: 生产级并行策略
- 多模态支持: 扩展至视觉/音频
评价
保留理由: W4A8KV4 量化格式有具体内存收益数据,可作为量化实践参考。
十一、arXiv: Native LLM/MLLM Inference on Apple Silicon
来源: ar5iv 2601.19139(arXiv 2601.19139 的 HTML 版本)
URL: https://ar5iv.labs.arxiv.org/html/2601.19139
可信度: 高
核心对比
| 方案 | 优势 | 劣势 |
|---|---|---|
| llama.cpp | Hand-tuned Metal kernels、GGUF 量化、单流吞吐优秀 | 无 continuous batching |
| PyTorch MPS | 模型兼容性好 | CUDA-centric,性能次优 |
| vLLM-metal | vLLM 生态兼容 | 混合实现,不够成熟 |
| MLX | 原生 Metal 支持、量化支持好 | 框架限制 |
评价
保留理由: Apple Silicon 推理唯一有量化 benchmark 的对比研究,适合本地/边缘部署参考。
十二、arXiv: vLLM 内部原理 — torch.compile 与 Startup 流程
来源: arXiv 2606.07362
URL: https://arxiv.org/html/2606.07362v1
可信度: 高
vLLM 启动四步流程
- 模型加载 — 权重读取、格式转换
- 引擎初始化 — PagedAttention KV cache 分配
- 运行时配置 — batch scheduler、tensor parallelism
- torch.compile 优化(v0.7.0+ 里程碑) - Dynamo Bytecode Transformation - Loading/Storing Compiled Graphs - 减少 Python 开销 + kernel fusion
torch.compile 子步骤详解
- 降低 Python 层开销
- 启用 kernel 融合
- 生成底层优化内核
评价
保留理由: vLLM 内部原理的权威学术解释,对理解 PagedAttention 和 torch.compile 集成有教学价值。
分类标签
#推理引擎 #vLLM #SGLang #TensorRT-LLM #Benchmark #H100 #KV-Cache
#量化 #生产部署 #MLOps #投机解码 #DeepSeek #Apple-Silicon
#推理引擎Bug #系统分析 #企业案例 #eBay #Alibaba-RTP-LLM
建议写入路径
inference-engineering/vllm-sglang-benchmark-2026/— 引擎 Benchmark 专题inference-engineering/production-llm-serving/— 生产部署实践inference-engineering/llm-bugs-debug/— 推理引擎 Bug 分析inference-systems/kv-cache-optimization/— KV Cache 优化专题hardware/apple-silicon-llm/— Apple Silicon 推理
后续行动
- 精读建议: aimultiple.com benchmark(含可下载 CSV)、arXiv 2506.09713(bug 分类)、arXiv 2607.09172(vLLM 配置权衡)
- 主题页更新建议:「推理引擎 Benchmark」、「推理引擎排障」、「KV Cache 优化」三个主题页
- 交叉验证: 6 月已有
2026-06-11-evening-vllm-sglang-quantization-moe.md,需确认与本稿无大范围重复