LLM 推理引擎工程实践:vLLM / SGLang / TensorRT-LLM(2026-10)
筛选时间:2026-10-06 10:50 UTC+8 来源:Tavily 搜索(general, month)+ arXiv API + GitHub Trending 筛选标准:真实环境、命令、错误、源码、性能数据、可复现步骤
🏆 优先级 1 — 必须收录
P1-1:vLLM vs SGLang vs TensorRT-LLM 2026 选型指南
- 来源:mlai.qa
- 评分:0.81(Tavily)
- 核心内容:
- MLPerf Inference v6.0(2026-04-01)B200 @ 8卡官方数据:
- vLLM 0.14.1 + llm-d:93,071 tokens/s(Offline)、71,588(Server)
- TensorRT-LLM + Dynamo:85,921(Offline)、87,444(Server)
- SGLang 未提交 MLPerf v6.0,三方同硬件对比不存在
- v0.11.0(2025-10)已完全移除 V0 引擎,V1 是唯一选项(常见误解澄清)
- vLLM 0.28.0(2026-08 末发布);PyTorch Foundation 托管(2025-05),中立治理
- GitHub stars(2026-09):vLLM ~91K,SGLang ~36K
- 选型决策树:vLLM(多模型/混合硬件)→ SGLang(prefix-heavy/agentic 多轮/RAG)→ TensorRT-LLM(NVIDIA 固定配置/延迟敏感)
- 工程价值:⭐⭐⭐⭐⭐ 权威基准 + 版本事实 + 选型决策树
- 风险提示:部分结论引用公开博客,非第一手源码
- 标签:#MLPerf #vLLM #SGLang #TensorRT-LLM #benchmark #2026
P1-2:SWE-Serve — 推理工程 PR 级 Benchmark
- 来源:arXiv 2609.26777
- 评分:0.70(Tavily)
- 核心内容:
- 数据来源:SGLang 2025-12 以来合并 PR 的真实工程任务
- 覆盖 6 类任务族:model support、decoding、distributed execution、serving APIs
- 每任务:容器化环境(repo checkout 到指定 commit)+ 任务指令 + 隐藏可执行测试 + oracle solution
- 任务从 PR 或 PR 组合中派生,覆盖从模型支持到分布式执行全栈
- 工程价值:⭐⭐⭐⭐⭐ PR 级 ground truth,是推理工程能力的标准评估套件
- 风险提示:学术 benchmark,实际复现需要 GPU 资源
- 后续行动:建议精读论文方法论,可用于评估候选人推理工程能力
- 标签:#SWE-Serve #SGLang #benchmark #PR工程 #推理系统
P1-3:LLM Inference Optimization 实战指南(Quantization + Benchmark)
- 来源:hinterbuild.com
- 评分:0.84(Tavily)
- 核心内容:
- 可复现命令:
bash python benchmarks/benchmark_serving.py \ --model casperhansen/llama-3.1-70b-instruct-awq \ --dataset-name random \ --num-prompts 1000 - 4-bit AWQ 量化:4x 内存降低、1.8x 加速、<2% 质量损失
- GPU 选型表:
- A10G 24GB:7-13B 模型最优性价比
- A100 40GB:70B 量化或 13B 全精度
- H100 80GB:70B+ 最高吞吐
- 5 步优化 playbook:AWQ → Flash Attention → vLLM PagedAttention + continuous batching → KV cache 量化 → benchmark 迭代
- 工程价值:⭐⭐⭐⭐⭐ 命令可复现,优化路径清晰,适合工程师快速落地
- 风险提示:商业博客,动机需注意,但技术细节可验证
- 标签:#量化 #AWQ #vLLM #benchmark #命令 #GPU选型
🥈 优先级 2 — 建议收录
P2-1:H100 独立第三方 Benchmark(Winder.ai)
- 来源:Winder.ai
- 评分:0.81(Tavily)
- 核心内容:
- Qwen3.8-27B(混合线性注意力,H100):SGLang 1725 vs vLLM 1610 tokens/s(50 并发)
- Llama 3.1 8B FP16 三引擎横向表(并发 1/10/50):
- vLLM:150/1,235/3,688 tokens/s;TTFT 0.68s;$0.26/M tokens
- SGLang:154/1,233/3,617 tokens/s;TTFT 0.73s;$0.27/M tokens
- TensorRT-LLM:141/1,127/3,219 tokens/s;TTFT 0.54s;$0.30/M tokens
- 公平测试条件说明:相同权重格式、XGrammar 结构化输出、CUDA graph 配置
- 工程价值:⭐⭐⭐⭐ 独立第三方,实测数据可验证,H100 参考价值高
- 标签:#benchmark #H100 #vLLM #SGLang #TensorRT-LLM #Qwen
P2-2:Azure 生产 Trace + SWE-Bench vLLM 0.23 部署实录
- 来源:arXiv 相关论文(via Tavily 结果片段)
- 评分:0.73(Tavily)
- 核心内容:
- 生产 trace 来源:Azure code trace(真实流量)
- vLLM 0.23 实际部署;Harbor 0.21 构建 agent 执行环境
- 测量工具链:NVML(GPU 功耗)+ Linux cgroup + psutil(CPU/DRAM)
- 延迟 SLO 驱动吞吐量优化方法论
- SWE-Bench Verified 用于定义负载混合(GPU demand 而非请求数)
- 工程价值:⭐⭐⭐⭐ 少数有真实测量栈的生产级文章
- 标签:#vLLM #生产部署 #性能测量 #NVML #cgroup
P2-3:Fivenines 监控 vLLM / SGLang(Prometheus Metrics)
- 来源:Fivenines
- 评分:0.65(Tavily)
- 核心内容:
- vLLM:Prometheus metrics 在 OpenAI 兼容端口自动暴露
- SGLang:
--enable-metricsflag + port 30000 - 关键监控指标:queued/running requests、KV cache 使用率(vLLM)/token usage(SGLang)、TTFT、ITL、prefix cache hit rate
- 新告警类别(AI Inference):server down、queue saturated、KV cache pressure
- 配置要求:vLLM agent v1.17.0+;SGLang v1.17.1+
- 工程价值:⭐⭐⭐⭐ 生产监控必备,命令具体
- 标签:#监控 #Prometheus #vLLM #SGLang #告警 #Ops
P2-4:RunPod SGLang 生产 Pipeline 实战
- 来源:RunPod Blog
- 评分:0.54(Tavily)
- 核心内容:
- Benchmark 步骤:测量 TTFT + throughput;计划 30-60 分钟 GPU 时间
- cache-aware load balancer:多副本场景下路由到 KV cache 预热的副本(round-robin 会浪费 cache)
- FastAPI proxy 模式:OpenAI 兼容端点 → SGLang 无缝代理
- 前缀缓存原理:synthetic random prompt 数据集下缓存命中率接近 0
- 工程价值:⭐⭐⭐⭐ SGLang 生产落地实操;多副本部署必备
- 标签:#SGLang #生产 #cache-aware #load-balancer #FastAPI
P2-5:September 2026 AI 模型月度变动
- 来源:Local AI Zone
- 评分:0.78(Tavily)
- 核心内容:
- MoE 活跃参数比例表(2026 年 7-8 月发布): | 模型 | 活跃比例 | |------|---------| | Qwen3.8-2.4T-A95B | 4.0% | | DeepSeek V4-Pro | 3.1% | | DeepSeek V4-Flash | 4.6% | | Tencent Hy4 preview | 6.4% | | MiniMax H3 | 6.5% | | Nemotron 3.5 L-30B | 10.0% |
- 趋势:线性注意力 + 混合注意力(256K context)
- GLM-5.2 发布(6月);Fable 5.1 发布
- 工程价值:⭐⭐⭐ MoE 推理成本计算必备数据,月度索引价值
- 标签:#MoE #模型更新 #Qwen #DeepSeek #2026
🥉 优先级 3 — 可选
P3-1:Vosti — 确定性 LLM 推理
- 来源:arXiv 2609.23130
- 核心内容:vLLM-det vs vLLM-nondet vs SGLang;1.14–2.20x decode 加速;源码公开
- 工程价值:⭐⭐⭐ 学术,可验证
- 标签:#确定性推理 #vLLM #SGLang
P3-2:LLM-42 — 推理确定性学术研究
- 来源:ACM PDF
- 核心内容:v0.18.0 确定性/非确定性模式对比
- 工程价值:⭐⭐⭐ 学术引用
P3-3:Lyceum — 推理引擎选型架构深度对比
- 来源:Lyceum Technology
- 核心内容:PagedAttention vs RadixAttention 架构对比;prefix caching 原理
- 工程价值:⭐⭐⭐ 概念清晰,适合架构设计参考
本轮筛选统计
| 类别 | 数量 |
|---|---|
| 候选总数 | 25 |
| 深入分析 | 12 |
| 优先级 1(必须) | 3 |
| 优先级 2(建议) | 5 |
| 优先级 3(可选) | 3 |
| 丢弃 | 13 |
建议后续行动
- 精读:SWE-Serve 论文(arXiv 2609.26777)→ 用于构建推理工程能力评估体系
- 验证:MLPerf v6.0 官方数据(官网)交叉核对 mlai.qa 的引用数字
- 实测:hinterbuild 的 benchmark 命令在本地复现(GPU 环境)
- 监控:Fivenines 文章部署到测试集群验证 metrics 暴露
- 索引:Local AI Zone 月度更新 → 加入知识库 2026-09 模型变动页
筛选人:Jay · 2026-10-06 10:50 UTC+8 下轮检索建议:加入 Hugging Face Daily Papers API;考虑纳入 iostat/nvtop 等系统监控命令类内容