LLM 推理引擎工程实践:vLLM / SGLang / TensorRT-LLM(2026-10)

筛选时间:2026-10-06 10:50 UTC+8 来源:Tavily 搜索(general, month)+ arXiv API + GitHub Trending 筛选标准:真实环境、命令、错误、源码、性能数据、可复现步骤


🏆 优先级 1 — 必须收录

P1-1:vLLM vs SGLang vs TensorRT-LLM 2026 选型指南

  • 来源:mlai.qa
  • 评分:0.81(Tavily)
  • 核心内容:
  • MLPerf Inference v6.0(2026-04-01)B200 @ 8卡官方数据:
    • vLLM 0.14.1 + llm-d:93,071 tokens/s(Offline)、71,588(Server)
    • TensorRT-LLM + Dynamo:85,921(Offline)、87,444(Server)
    • SGLang 未提交 MLPerf v6.0,三方同硬件对比不存在
  • v0.11.0(2025-10)已完全移除 V0 引擎,V1 是唯一选项(常见误解澄清)
  • vLLM 0.28.0(2026-08 末发布);PyTorch Foundation 托管(2025-05),中立治理
  • GitHub stars(2026-09):vLLM ~91K,SGLang ~36K
  • 选型决策树:vLLM(多模型/混合硬件)→ SGLang(prefix-heavy/agentic 多轮/RAG)→ TensorRT-LLM(NVIDIA 固定配置/延迟敏感)
  • 工程价值:⭐⭐⭐⭐⭐ 权威基准 + 版本事实 + 选型决策树
  • 风险提示:部分结论引用公开博客,非第一手源码
  • 标签:#MLPerf #vLLM #SGLang #TensorRT-LLM #benchmark #2026

P1-2:SWE-Serve — 推理工程 PR 级 Benchmark

  • 来源:arXiv 2609.26777
  • 评分:0.70(Tavily)
  • 核心内容:
  • 数据来源:SGLang 2025-12 以来合并 PR 的真实工程任务
  • 覆盖 6 类任务族:model support、decoding、distributed execution、serving APIs
  • 每任务:容器化环境(repo checkout 到指定 commit)+ 任务指令 + 隐藏可执行测试 + oracle solution
  • 任务从 PR 或 PR 组合中派生,覆盖从模型支持到分布式执行全栈
  • 工程价值:⭐⭐⭐⭐⭐ PR 级 ground truth,是推理工程能力的标准评估套件
  • 风险提示:学术 benchmark,实际复现需要 GPU 资源
  • 后续行动:建议精读论文方法论,可用于评估候选人推理工程能力
  • 标签:#SWE-Serve #SGLang #benchmark #PR工程 #推理系统

P1-3:LLM Inference Optimization 实战指南(Quantization + Benchmark)

  • 来源:hinterbuild.com
  • 评分:0.84(Tavily)
  • 核心内容:
  • 可复现命令: bash python benchmarks/benchmark_serving.py \ --model casperhansen/llama-3.1-70b-instruct-awq \ --dataset-name random \ --num-prompts 1000
  • 4-bit AWQ 量化:4x 内存降低、1.8x 加速、<2% 质量损失
  • GPU 选型表:
    • A10G 24GB:7-13B 模型最优性价比
    • A100 40GB:70B 量化或 13B 全精度
    • H100 80GB:70B+ 最高吞吐
  • 5 步优化 playbook:AWQ → Flash Attention → vLLM PagedAttention + continuous batching → KV cache 量化 → benchmark 迭代
  • 工程价值:⭐⭐⭐⭐⭐ 命令可复现,优化路径清晰,适合工程师快速落地
  • 风险提示:商业博客,动机需注意,但技术细节可验证
  • 标签:#量化 #AWQ #vLLM #benchmark #命令 #GPU选型

🥈 优先级 2 — 建议收录

P2-1:H100 独立第三方 Benchmark(Winder.ai)

  • 来源:Winder.ai
  • 评分:0.81(Tavily)
  • 核心内容:
  • Qwen3.8-27B(混合线性注意力,H100):SGLang 1725 vs vLLM 1610 tokens/s(50 并发)
  • Llama 3.1 8B FP16 三引擎横向表(并发 1/10/50):
    • vLLM:150/1,235/3,688 tokens/s;TTFT 0.68s;$0.26/M tokens
    • SGLang:154/1,233/3,617 tokens/s;TTFT 0.73s;$0.27/M tokens
    • TensorRT-LLM:141/1,127/3,219 tokens/s;TTFT 0.54s;$0.30/M tokens
  • 公平测试条件说明:相同权重格式、XGrammar 结构化输出、CUDA graph 配置
  • 工程价值:⭐⭐⭐⭐ 独立第三方,实测数据可验证,H100 参考价值高
  • 标签:#benchmark #H100 #vLLM #SGLang #TensorRT-LLM #Qwen

P2-2:Azure 生产 Trace + SWE-Bench vLLM 0.23 部署实录

  • 来源:arXiv 相关论文(via Tavily 结果片段)
  • 评分:0.73(Tavily)
  • 核心内容:
  • 生产 trace 来源:Azure code trace(真实流量)
  • vLLM 0.23 实际部署;Harbor 0.21 构建 agent 执行环境
  • 测量工具链:NVML(GPU 功耗)+ Linux cgroup + psutil(CPU/DRAM)
  • 延迟 SLO 驱动吞吐量优化方法论
  • SWE-Bench Verified 用于定义负载混合(GPU demand 而非请求数)
  • 工程价值:⭐⭐⭐⭐ 少数有真实测量栈的生产级文章
  • 标签:#vLLM #生产部署 #性能测量 #NVML #cgroup

P2-3:Fivenines 监控 vLLM / SGLang(Prometheus Metrics)

  • 来源:Fivenines
  • 评分:0.65(Tavily)
  • 核心内容:
  • vLLM:Prometheus metrics 在 OpenAI 兼容端口自动暴露
  • SGLang:--enable-metrics flag + port 30000
  • 关键监控指标:queued/running requests、KV cache 使用率(vLLM)/token usage(SGLang)、TTFT、ITL、prefix cache hit rate
  • 新告警类别(AI Inference):server down、queue saturated、KV cache pressure
  • 配置要求:vLLM agent v1.17.0+;SGLang v1.17.1+
  • 工程价值:⭐⭐⭐⭐ 生产监控必备,命令具体
  • 标签:#监控 #Prometheus #vLLM #SGLang #告警 #Ops

P2-4:RunPod SGLang 生产 Pipeline 实战

  • 来源:RunPod Blog
  • 评分:0.54(Tavily)
  • 核心内容:
  • Benchmark 步骤:测量 TTFT + throughput;计划 30-60 分钟 GPU 时间
  • cache-aware load balancer:多副本场景下路由到 KV cache 预热的副本(round-robin 会浪费 cache)
  • FastAPI proxy 模式:OpenAI 兼容端点 → SGLang 无缝代理
  • 前缀缓存原理:synthetic random prompt 数据集下缓存命中率接近 0
  • 工程价值:⭐⭐⭐⭐ SGLang 生产落地实操;多副本部署必备
  • 标签:#SGLang #生产 #cache-aware #load-balancer #FastAPI

P2-5:September 2026 AI 模型月度变动

  • 来源:Local AI Zone
  • 评分:0.78(Tavily)
  • 核心内容:
  • MoE 活跃参数比例表(2026 年 7-8 月发布): | 模型 | 活跃比例 | |------|---------| | Qwen3.8-2.4T-A95B | 4.0% | | DeepSeek V4-Pro | 3.1% | | DeepSeek V4-Flash | 4.6% | | Tencent Hy4 preview | 6.4% | | MiniMax H3 | 6.5% | | Nemotron 3.5 L-30B | 10.0% |
  • 趋势:线性注意力 + 混合注意力(256K context)
  • GLM-5.2 发布(6月);Fable 5.1 发布
  • 工程价值:⭐⭐⭐ MoE 推理成本计算必备数据,月度索引价值
  • 标签:#MoE #模型更新 #Qwen #DeepSeek #2026

🥉 优先级 3 — 可选

P3-1:Vosti — 确定性 LLM 推理

  • 来源:arXiv 2609.23130
  • 核心内容:vLLM-det vs vLLM-nondet vs SGLang;1.14–2.20x decode 加速;源码公开
  • 工程价值:⭐⭐⭐ 学术,可验证
  • 标签:#确定性推理 #vLLM #SGLang

P3-2:LLM-42 — 推理确定性学术研究

  • 来源:ACM PDF
  • 核心内容:v0.18.0 确定性/非确定性模式对比
  • 工程价值:⭐⭐⭐ 学术引用

P3-3:Lyceum — 推理引擎选型架构深度对比

  • 来源:Lyceum Technology
  • 核心内容:PagedAttention vs RadixAttention 架构对比;prefix caching 原理
  • 工程价值:⭐⭐⭐ 概念清晰,适合架构设计参考

本轮筛选统计

类别 数量
候选总数 25
深入分析 12
优先级 1(必须) 3
优先级 2(建议) 5
优先级 3(可选) 3
丢弃 13

建议后续行动

  1. 精读:SWE-Serve 论文(arXiv 2609.26777)→ 用于构建推理工程能力评估体系
  2. 验证:MLPerf v6.0 官方数据(官网)交叉核对 mlai.qa 的引用数字
  3. 实测:hinterbuild 的 benchmark 命令在本地复现(GPU 环境)
  4. 监控:Fivenines 文章部署到测试集群验证 metrics 暴露
  5. 索引:Local AI Zone 月度更新 → 加入知识库 2026-09 模型变动页

筛选人:Jay · 2026-10-06 10:50 UTC+8 下轮检索建议:加入 Hugging Face Daily Papers API;考虑纳入 iostat/nvtop 等系统监控命令类内容