工程实践筛选草稿 · 2026-08-31

主题:LLM 推理引擎Benchmark / vLLM SGLang 生产实践 / 推理引擎Bug分析

实例:Jay


一、vLLM vs SGLang vs TGI 2026 Benchmark 深度解析

来源: llm-academy.dev
URL: https://llm-academy.dev/inference/vllm-vs-sglang
发布时间: 2026(具体日期需访问页面确认)
作者/机构: LLM Academy(独立技术博客)
可信度: 高 — 标注了来源(PremAI/TECHSY/Spheron/YottaLabs/Particula 2026 benchmark)

核心性能数据

H100 8B 类模型吞吐量(单卡):

Engine Throughput (tok/s) GPU 利用率
SGLang (RadixAttention) ~16,200 85–92%
vLLM (PagedAttention) ~12,500 ~85–92%
TGI ~9,800 68–74%

→ SGLang 领先 vLLM 约 29%,TGI 显著落后。

70B 模型(双卡 H100,Llama-3-70B):

Engine TTFT (p50) TPOT (p50) TPOT (p99)
SGLang ~190ms 19ms 50ms
vLLM ~210ms 20ms 55ms
TGI ~260ms 24ms 80ms

→ 双卡场景下差距缩小,SGLang 仍领先但幅度收窄(3–5%)。

并发压力下 vLLM 表现(RunPod 数据):

  • vLLM 在高并发时缓存压力导致吞吐量从 22 tok/s 降至 16 tok/s
  • SGLang 稳定在 30–31 tok/s
  • 差距在高并发多轮对话(RAG、agent)场景尤为显著

版本信息: - vLLM v0.18.0 - SGLang v0.5.9 - TensorRT-LLM v1.2.0 - TGI 2026 年 3 月已归档(HuggingFace 官方推荐迁移至 vLLM/SGLang)

评价

保留理由: 真实 H100 基准数据,多来源交叉验证,版本明确,延迟百分位数据完整。可作为推理引擎选型的基准参考。


二、Particula: SGLang vs vLLM 架构深度对比 + DeepSeek V3 专项

来源: particula.tech
URL: https://particula.tech/blog/sglang-vs-vllm-inference-engine-comparison
发布时间: 2026(持续更新)
可信度:

关键数据点

DeepSeek V3 专项优化(SGLang 原生支持): - SGLang 对 DeepSeek V3 达到 3.1x faster inference vs vLLM - 优化手段:FlashAttention3、FlashInfer、FlashMLA、CutlassMLA - Multi-Token Prediction(EAGLE 投机解码): - batch size 1 时 decode speedup 1.8x - batch size 32 时 decode speedup 1.5x - Prefill-decode disaggregation(分离部署)在 SGLang 中已 production 再现

SGLang RadixAttention 原理: - 自动发现多请求间共享前缀(无需手动配置) - 50 用户同主题对话时自动复用 common prefix - 对 RAG、多轮 chat、agent 工作负载有天然优势

vLLM PagedAttention 原理: - KV cache 以 4% 内存浪费(vs 60–80% naive contiguous)管理 - 更宽的硬件支持:NVIDIA/AMD/Intel/TPU/Trainium/Inferentia/Gaudi/Arm - Blackwell/GB200 优化:DeepSeek-style MoE 模型 26,200 prefill tok/s

评价

保留理由: DeepSeek V3 3.1x 加速数据具体可信,EAGLE 投机解码有量化数字,架构对比清晰。适合作为深度选型参考。


三、vLLM vs SGLang vs LMDeploy AIMultiple Benchmark

来源: aimultiple.com
URL: https://aimultiple.com/inference-engines
更新: August 17, 2026
可信度: 高 — 商业研究机构,有完整方法论和下载数据

方法论

  • 引擎:vLLM、LMDeploy、SGLang
  • 模型:Llama 3.1 8B-Instruct
  • 负载:1,000 ShareGPT prompts
  • 硬件:NVIDIA H100
  • 可下载 CSV 原始数据

评价

保留理由: 有明确 August 2026 更新时间戳,可下载数据适合二次分析,商业机构背书。建议精读。


四、State of Model Serving Communities — April 2026

来源: inferenceops.substack.com
URL: https://inferenceops.substack.com/p/state-of-the-model-serving-communities-b93
发布时间: April 2026
作者: InferenceOps(Substack 平台)
可信度: 中高

核心内容

vLLM v0.17 → v0.19 演进路线图: - 视觉/音频/ASR/embedding/rerank/tool-use 多模态覆盖扩展 - Speculative decoding 重大更新 - Model Runner V2 - KV/weight offloading - CUDA graphs + high-performance kernels

KServe v0.17.0: - LLMInferenceService 生产级 autoscaling(WVA/KEDA/HPA) - OpenAI Responses API 支持 - llm-d 依赖升级 - Intel Gaudi 支持(OpenShift AI Serving) - ARM builds for LLMInferenceService controller - ONNX model class 支持 MLServer

重要变更 — EPP 拆分为 llm-d: - 原 Kubernetes inference 代码拆分至 llm-d 仓库 - 降低碎片化,InferencePool API 保留在 k8s org,引擎专业实现移入 llm-d

SIG-kv-disaggregation 更新: KV 分离协议标准化进展

评价

保留理由: 版本明确,工具链状态新,生产部署参考价值高。适合作为 MLOps 路线追踪材料。


五、Senior LLM Inference Engineer Interview — 生产细节全覆盖

来源: aiengineeringinsider.substack.com
URL: https://aiengineeringinsider.substack.com/p/inference-serving-senior-llm-inference
可信度: 中高 — AI Engineering Insider 专栏

面试知识点覆盖

推理引擎: vLLM、SGLang、TensorRT-LLM、HuggingFace TGI(已维护模式)、Triton
服务架构: API gateway、router、scheduler、workers、GPU replicas
请求生命周期: admission、queueing、prefill、decode、streaming、completion
批处理: static batching、dynamic batching、continuous/in-flight batching
调度: FIFO、priority、fairness、prefill vs decode tradeoffs、token budgets
副本策略: model replication、tensor parallelism、data parallelism、GPU placement
Autoscaling: replicas、queue depth、utilization、TTFT、saturation、cold starts
性能指标: TTFT、TPOT、ITL、throughput、concurrency、GPU utilization
内存管理: weights、KV cache、fragmentation、PagedAttention、prefix caching

评价

保留理由: 系统性梳理推理工程师生产知识体系,可作为面试准备或技能评估清单。


六、arXiv: A First Look at Bugs in LLM Inference Engines

来源: arXiv 2506.09713
URL: https://arxiv.org/html/2506.09713v1
可信度: 高 — 学术研究,peer-review 级别系统性分析

核心发现

研究范围: vLLM、DeepSpeed、TensorRT-LLM

Bug 分类: 1. 模型转换 Bug — 模型格式适配推理引擎时的转换错误 2. 效率优化 Bug — 量化/并行策略引入的正确性问题 3. 资源管理 Bug — 内存/GPU 调度导致的服务崩溃 4. 精度 Bug — 优化导致输出质量下降

根因分析:
推理引擎特性(频繁发布、社区驱动)+ 多版本并存 + 硬件多样性 → bug 表面积大

评价

保留理由: 首个系统性推理引擎 bug 分类研究,对生产运维有直接指导意义。建议精读并加入主题页「推理引擎排障」章节。


七、arXiv: Attention to Detail — vLLM 配置能源/性能/精度权衡

来源: arXiv 2607.09172
URL: https://arxiv.org/html/2607.09172v2
可信度:

方法论

  • vLLM 0.10.2
  • 5 个模型族 × 5 个数据集
  • 系统性配置交互分析

核心发现

  • 推理优化之间存在相互作用,不能孤立评估
  • 配置项对不同任务类型影响差异显著
  • 量化(INT8/FP8)对精度影响因模型和任务而异
  • 能源消耗与性能并非线性关系

评价

保留理由: 系统性评估 vLLM 配置选择,适合作为生产调优参考。建议精读。


八、arXiv: OptiKIT — eBay 企业 LLM 自动优化

来源: arXiv 2601.20408
URL: https://arxiv.org/html/2601.20408v2
可信度: 高 — 企业生产案例研究

方法论

  • NVIDIA H100
  • 3 种 workload 配置(输入输出 token 比、SLO、模型规模)
  • TPE 优化 30 trials
  • 联合调优参数:max_num_seqs、max_num_batched_tokens、tensor_parallel_size

关键结论

  • 量化 + 运行时调优组合效果 > 单独使用任一方法
  • 不同业务场景最优配置差异显著
  • end-to-end 配置优化可显著提升生产效率

评价

保留理由: 真实企业生产数据,TPE 优化有可复现方法论,对大规模部署有参考价值。


九、arXiv: Efficient KV Cache Layer for Enterprise LLM Inference

来源: arXiv 2510.09665
URL: https://arxiv.org/html/2510.09665v1
可信度:

核心数据

  • vLLM page size:16 tokens/layer,典型大小 20–63 KB(Llama/Qwen/GPT-OSS)
  • 16-token page 对大规模传输效率低(无法饱和带宽)
  • KV cache 传输优化方案:larger page batching

2026 开源分布式推理栈对比: - vLLM Production Stack(2025-01 发布) - NVIDIA Dynamo - AIBrix - llm-d - SGLang - KServe

评价

保留理由: KV cache 传输优化有量化数据,开源栈对比清晰,适合加入「推理系统架构」主题页。


十、arXiv: RTP-LLM — Alibaba 高性能推理引擎

来源: arXiv 2605.29639
URL: https://arxiv.org/html/2605.29639v1
可信度: 高 — 工业级系统论文

核心优化

  • 量化: W4A8KV4(weight INT4/activation INT8/KV cache INT8)memory footprint 减半
  • KV cache 量化: 直接缓解 Decode Phase 内存带宽压力
  • 并行执行: 生产级并行策略
  • 多模态支持: 扩展至视觉/音频

评价

保留理由: W4A8KV4 量化格式有具体内存收益数据,可作为量化实践参考。


十一、arXiv: Native LLM/MLLM Inference on Apple Silicon

来源: ar5iv 2601.19139(arXiv 2601.19139 的 HTML 版本)
URL: https://ar5iv.labs.arxiv.org/html/2601.19139
可信度:

核心对比

方案 优势 劣势
llama.cpp Hand-tuned Metal kernels、GGUF 量化、单流吞吐优秀 无 continuous batching
PyTorch MPS 模型兼容性好 CUDA-centric,性能次优
vLLM-metal vLLM 生态兼容 混合实现,不够成熟
MLX 原生 Metal 支持、量化支持好 框架限制

评价

保留理由: Apple Silicon 推理唯一有量化 benchmark 的对比研究,适合本地/边缘部署参考。


十二、arXiv: vLLM 内部原理 — torch.compile 与 Startup 流程

来源: arXiv 2606.07362
URL: https://arxiv.org/html/2606.07362v1
可信度:

vLLM 启动四步流程

  1. 模型加载 — 权重读取、格式转换
  2. 引擎初始化 — PagedAttention KV cache 分配
  3. 运行时配置 — batch scheduler、tensor parallelism
  4. torch.compile 优化(v0.7.0+ 里程碑) - Dynamo Bytecode Transformation - Loading/Storing Compiled Graphs - 减少 Python 开销 + kernel fusion

torch.compile 子步骤详解

  • 降低 Python 层开销
  • 启用 kernel 融合
  • 生成底层优化内核

评价

保留理由: vLLM 内部原理的权威学术解释,对理解 PagedAttention 和 torch.compile 集成有教学价值。


分类标签

#推理引擎 #vLLM #SGLang #TensorRT-LLM #Benchmark #H100 #KV-Cache
#量化 #生产部署 #MLOps #投机解码 #DeepSeek #Apple-Silicon
#推理引擎Bug #系统分析 #企业案例 #eBay #Alibaba-RTP-LLM

建议写入路径

  • inference-engineering/vllm-sglang-benchmark-2026/ — 引擎 Benchmark 专题
  • inference-engineering/production-llm-serving/ — 生产部署实践
  • inference-engineering/llm-bugs-debug/ — 推理引擎 Bug 分析
  • inference-systems/kv-cache-optimization/ — KV Cache 优化专题
  • hardware/apple-silicon-llm/ — Apple Silicon 推理

后续行动

  1. 精读建议: aimultiple.com benchmark(含可下载 CSV)、arXiv 2506.09713(bug 分类)、arXiv 2607.09172(vLLM 配置权衡)
  2. 主题页更新建议:「推理引擎 Benchmark」、「推理引擎排障」、「KV Cache 优化」三个主题页
  3. 交叉验证: 6 月已有 2026-06-11-evening-vllm-sglang-quantization-moe.md,需确认与本稿无大范围重复