Jay 工程筛选报告 · 2026-09-08 下午
主题
LLM Inference Engine Benchmark & Production Engineering (vLLM / SGLang / TensorRT-LLM / LMDeploy)
检索范围
- Tavily: LLM inference serving engineering 2026
- Web: vLLM SGLang benchmark, RAG engineering 2026, Substack inference engineering
- arXiv: LLM inference systems 2026
- 去重基准:jay inbox 2026-09-08 已有条目
候选条目(9个)→ 保留 5 个,丢弃 4 个
✅ 保留 1 — AIMultiple: LLM Inference Engines: vLLM vs LMDeploy vs SGLang
- 来源: aimultiple.com | 作者: Cem Dilmegani + Ekrem Sarı | 时间: 2026-04-15(更新至 2026-08-17)
- 可信度: HIGH — 完整 benchmark 方法论文档
- 工程亮点:
- 实测环境:H100 80GB HBM3 / RunPod / CUDA 12.8.1 / PyTorch 2.8.0
- 版本:vLLM 0.11.0 (FlashInfer backend)、LMDeploy 0.10.2、SGLang v0.2.3
- 数据集:ShareGPT_Vicuna_unfiltered,1000 prompts,Llama 3.1 8B-Instruct
- Warmup 流程:20 prompts 触发 JIT + 稳定 GPU 时钟,随后 10 轮 1000 prompts 取均值
gpu_memory_utilization实测推荐值:7B→0.95,13B→0.85,70B→0.90- 解释 29% 差距:SGLang/LMDeploy 在 H100 TMA(Tensor Memory Accelerator)内存合并、缓存局部性、批调度上更 aggressive
- 保留理由: 实测硬件/软件版本/Warmup 流程完整,配置参数可直接参考,适合作为基准锚点写入知识库
- 建议操作: 精读 benchmark 表格,提取配置参数,写入 inference engine 对比页
✅ 保留 2 — Spheron Network: vLLM vs SGLang 2026 Benchmarks
- 来源: spheron.network | 作者: Mitrasish(联合创始人 & CTO)| 时间: 2026-06-23
- 可信度: HIGH — 工程团队实测,有竞品交叉验证
- 工程亮点:
- Unique prompt(50 并发):vLLM 580 tok/s,SGLang 620 tok/s,差 7%
- Shared prefix(10 并发,80% 共享前缀):TTFT vLLM 730ms vs SGLang 520ms,差距 28.8%
- 50 并发时 TTFT p50:vLLM 890ms,SGLang 855ms
- MoE 模型(DeepSeek 等)SGLang vs vLLM 在 unique prompt 下差距 <7%,shared prefix 优势比例同 dense 模型
- Structured output 维度:xgrammar(SGLang 原生)vs guided decoding(SGLang/vLLM 均支持)的 overhead 对比
- 保留理由: 最新实测(2026-06),有竞品对比,MoE 场景数据填补知识库空白
- 建议操作: 补充至 vLLM vs SGLang 对比页,重点标注 shared prefix 场景下 SGLang 优势
✅ 保留 3 — Particula Tech: SGLang vs vLLM in 2026
- 来源: particula.tech | 作者: Sebastian Mondragon | 时间: 2026(需验证具体日期)
- 可信度: HIGH — 聚焦 DeepSeek V3 + SGLang 生态,有原始复现数据
- 工程亮点:
- SGLang + DeepSeek V3:3.1x faster than vLLM,MLA backends(FlashAttention3、FlashInfer、FlashMLA、CutlassMLA)优化
- EAGLE speculative decoding on H200:batch size 1 时 1.8x decode speedup,batch size 32 时 1.5x
- DeepSeek 官方推荐 SGLang 作为 V4 推理引擎
- 架构对比表:PagedAttention vs RadixAttention(内存管理、缓存复用、调度策略、内存开销、最佳场景)
- 输出 token 吞吐:SGLang 894 tok/s vs vLLM 413 tok/s(+117%)
- 保留理由: DeepSeek V3/V4 场景是 2026 年高频生产负载,EAGLE 数据有复现价值
- 建议操作: 补充 DeepSeek MoE + SGLang 最优实践页
✅ 保留 4 — LeetLLM: vLLM vs SGLang vs TensorRT-LLM vs Ollama (2026)
- 来源: leetllm.com | 时间: 2026(Mar Spheron benchmark 为基准)
- 可信度: HIGH — 包含 benchmark checklist 和 bake-off SOP
- 工程亮点:
- 基准版本:vLLM v0.18.0,SGLang v0.5.9,TensorRT-LLM v1.2.0(Llama 3.3 70B FP8,H100 SXM5 80GB)
- Benchmark Checklist(可操作):精确模型版本/tokenizer/量化配置、GPU型号/驱动/container/引擎版本/并行拓扑、prompt长度分布、并发/burst/prefix共享率/tool使用、latency SLO(p50 + tail TTFT、TPOT、end-to-end)、质量/正确性/内存余量/部署时间/回滚时间/人力
- Traffic shape 三分类:unique prompts、shared prefixes、真实生产 mix
- NVIDIA Dynamo 作为协调层,可编排 TensorRT-LLM/vLLM/SGLang
- 保留理由: Benchmark SOP 首次出现,可指导后续知识库 own benchmark 方法论建立
- 建议操作: 写入 inference benchmark 方法论页
✅ 保留 5 — Deploybase: Best LLM Inference Engines 2026
- 来源: deploybase.ai | 作者: Deploybase Team | 时间: 2026-02-23
- 可信度: HIGH — 命令级实操内容
- 工程亮点:
- vLLM prefix caching 命令:
enable_prefix_caching=True,多轮对话收益 15-25% - gpu_memory_utilization 分型号配置:7B 0.95 / 13B 0.85 / 70B 0.90
- TensorRT-LLM 编译全流程:
huggingface-cli download→trtllm-build --checkpoint_dir→python -m tensorrt_llm.serve --engine_dir --port - SGLang state graph:
sgl.gen(name="reasoning")+sgl.gen(name="final_answer")单次调用替代两次,降低延迟 - SGLang schedule caching:
backend.init_batch_state = True - TGI bfloat16:docker flag,H100/A100 收益 10-15%,质量几乎不变
- llama.cpp GPU offload:
./main -m model.gguf -ngl 80 - 高可用架构:Primary 8x A100 vLLM + Secondary 4x A100,80/20 负载均衡,$29.16/hr
- 保留理由: 命令 + 参数可直接复现,生产架构有成本数据,vLLM/SGLang/TGI/llama.cpp 全覆盖
- 建议操作: 写入 inference engine 选型决策页的命令附录
❌ 丢弃 1 — ken huang Substack: The Physics & Engineering of Frontier LLM Inference (2026 Edition)
- 丢弃理由: 10-part 系列介绍页,只有章节目录和简介,无实测数据。引用 DeepSeek/Moonshot/Zhipu/Alibaba/NVIDIA/DeepMind,但内容本身是综合架构梳理,不是原始工程一手资料。
- 后续行动: 如需各章详细内容,再单独获取
❌ 丢弃 2 — AI Engineering Insider Substack: Inference Serving Senior LLM Engineer Interview
- 丢弃理由: 付费内容,snippet 仅有目录级信息(vLLM/SGLang/TGI/Triton/Autoscaling),无实测命令或 benchmark 数据。面试题方向,非工程实操方向。
- 后续行动: 如需付费解锁再评估
❌ 丢弃 3 — Future AGI: RAG Architecture in 2026
- 丢弃理由: 2026 RAG 架构六层三模式概述(Hybrid+RRF、cross-encoder reranker、HyDE、agentic RAG、graph RAG),偏框架描述,缺少实测数据、命令或复现步骤。
- 后续行动: 仅作为 RAG stack overview 参考,不入库
❌ 丢弃 4 — Agile Infoways: Building Production-Ready RAG Systems (2026)
- 丢弃理由: "50+ enterprise RAG deployments" 经验总结,eval-first 方法论有参考价值,但 snippet 中无具体 benchmark 数据、排障案例或命令。整体偏管理/流程视角。
- 后续行动: 仅作为 RAG production checklist 参考,不入库
❌ 丢弃 5 — MarsDevs: What Is RAG in AI? The 2026 Production Guide
- 丢弃理由: Naive RAG / Agentic RAG / GraphRAG 三分类概述,cost estimate($8K-$50K MVP / >$200K enterprise)偏商业,非工程细节。
- 后续行动: 不入库
❌ 丢弃 6 — InfoQ: Hierarchical Agentic RAG Systems (Apr 2026)
- 丢弃理由: 25min 技术文章,但 snippet 中主要是 InfoQ 活动信息和章节标题,无实测架构或命令。
- 后续行动: 需要全文获取再评估
arXiv 专项(2篇)
✅ 保留 6 — arXiv 2504.11320v4: Fluid-Guided Online Scheduling
- 主题: KV cache eviction recomputation policy under memory pressure
- 工程价值: 确认 vLLM 默认使用 recomputation(而非 CPU/SSD swap),H100 80GB + Llama-2-7B 实测:FP16 KV-cache token = 0.5 MiB,KV cache cap ≈ 1.37×10⁵ tokens(1% memory margin 后)
- 关联: 与知识库现有 vLLM OOM troubleshooting runbook 可交叉引用
✅ 保留 7 — arXiv 2605.01280v1: Position — LLM Serving Needs Mathematical Optimization
- 主题: 主张 LLM serving 应从 heuristic 走向 formal optimization(JSQ → join-shortest-queue,FIFO → formal scheduling theory,LRU → formal cache eviction)
- 工程价值: 学术视角的路线图,对理解未来 inference scheduler 演进有价值,适合作为知识库"未来方向"条目
分类标签
#inference-engineering #vLLM #SGLang #TensorRT-LLM #benchmark #production #DeepSeek-MoE #EAGLE-speculative-decoding #KV-cache #prefix-caching
建议写入路径
inference-engineering/vLLM-sglang-benchmark-2026-h100.md— 汇总 A/B/C/D 四个 benchmark 来源的实测数据inference-engineering/deploybase-commands-reference.md— 命令附录(E)inference-engineering/benchmark-sop-leetllm.md— benchmark checklist 和 bake-off 方法论(F)llm-systems/kvcache-eviction-recomputation-arxiv.md— arXiv 保留条目(2篇)
后续行动
- 精读:保留 1(AIMultiple benchmark 表格)、保留 4(LeetLLM SOP)、保留 5(Deploybase 命令)
- 审稿:DeepSeek V3 SGLang 最优实践是否需要单独主题页
- 主题页更新:inference engine 选型决策页增加 2026 年实测数据 + TGI 归档背景
Jay · 2026-09-08 14:50 · 实例草稿目录写入完毕