工程筛选报告 · Jay · 2026-06-27 上午

筛选主题

LLM Inference 工程实践:vLLM vs SGLang vs TensorRT-LLM 基准测试、生产部署命令、CUDA OOM 排障

检索范围

  • vLLM/SGLang GitHub Issues & Discussions(真实错误日志)
  • vLLM 官方论坛(CUDA OOM 排障)
  • Spheron/TECHSY 基准测试博客(含真实性能数据)
  • arXiv: ISO-Bench、vLLM vs TGI 性能对比论文
  • Substack: The AI Engineer(vLLM vs Ollama vs SGLang vs TensorRT-LLM 对比)

高价值条目筛选

1. [vLLM vs SGLang 2026 H100 基准测试] — ✅ 保留

来源: TECHSY (techsy.io) + Spheron
URL: https://techsy.io/en/blog/vllm-vs-sglang | https://www.spheron.network/blog/vllm-vs-tensorrt-llm-vs-sglang-benchmarks

保留理由: - 真实 H100 实测数据表格:throughput、TTFT p50/p95、并发数 - vLLM vs SGLang vs TensorRT-LLM 三引擎直接对比 - SGLang RadixAttention vs vLLM PagedAttention 架构差异解释 - prefix caching 场景收益量化(72%-88% cache hit rate)

核心数据摘录: | 场景 | TTFT p50 | Throughput | Cache Hit Rate | |------|----------|-------------|-----------------| | Unique prompts | 112ms | 1,920 tok/s | 0% | | RAG (shared 2k-token doc) | 68ms | 2,280 tok/s | ~72% | | Multi-turn chat (4-turn) | 54ms | 2,480 tok/s | ~81% | | Agentic (shared tool defs) | 41ms | 2,620 tok/s | ~88% |

标签: #inference-engineering #benchmark #H100 #vLLM #SGLang


2. [SGLang 生产部署指南:RadixAttention + Multi-Turn] — ✅ 保留

来源: Spheron Blog(工程实践导向)
URL: https://www.spheron.network/blog/sglang-production-deployment-guide

保留理由: - Step-by-step 部署命令:nvidia-smi 验证 → Docker → NVIDIA Container Toolkit → SGLang 启动 - 真实 Docker run 示例命令(含环境变量) - RadixAttention prefix caching 配置参数说明 - 不同工作负载的性能数据(真实生产参考)

关键命令片段:

# 验证 GPU
nvidia-smi

# SGLang 启动参数
--context-length 8192  # 注意:不是 --max-total-tokens
--tensor-parallel-size 4
--enable-prefix-caching

标签: #SGLang #production-deploy #RadixAttention #prefix-caching


3. [vLLM vs Ollama vs SGLang vs TensorRT-LLM 全面对比] — ✅ 保留

来源: The AI Engineer (Substack) by Paolo Perrone
URL: https://theaiengineer.substack.com/p/vllm-vs-ollama-vs-sglang-vs-tensorrt

保留理由: - 真实 OOM 错误场景示例:

Request 1: 2.8s   ← looks fine
Request 2: 9.1s   ← why is this slower?
Request 3: 22.4s  ← something is very wrong
Request 4: torch.cuda.OutOfMemoryError
  • 四引擎设计哲学对比(适合帮助团队做技术选型)
  • each engine 的适用场景和局限性明确说明

标签: #inference-engineering #comparison #TensorRT-LLM #Ollama


4. [CUDA OOM 排障:vLLM 官方论坛 + Red Hat 指南] — ✅ 保留

来源: vLLM Forums + Red Hat Customer Portal
URL: https://discuss.vllm.ai/t/torch-outofmemoryerror-cuda-out-of-memory/2420 | https://access.redhat.com/articles/7118070

保留理由: - 真实错误日志和完整排障步骤 - 关键参数:--enforce-eager(禁用 CUDAGraph 定位问题)、--max-model-len--gpu-memory-utilization - Red Hat 指南含完整 podman run 命令示例(含所有 NVIDIA 设备映射参数) - self.graph.replay() 附近崩溃的专项处理方案

排障流程: 1. nvidia-smi 检查其他进程占用 2. 添加 --enforce-eager 禁用 CUDAGraph 3. 降低 --gpu-memory-utilization(默认 0.9 → 0.5-0.7) 4. 设置正确 --max-model-len(不是 --max-total-tokens

标签: #troubleshooting #CUDA-OOM #vLLM #production


5. [vLLM OOM 场景:推理结束后 OOM] — ✅ 保留(边缘案例)

来源: vLLM GitHub Discussion #524
URL: https://discuss.vllm.ai/t/cuda-failure-out-of-memory/524

保留理由: - 特殊场景:100 个请求全部推理成功,但结束后 rank 1/2/3 报 OOM - 解释了 vLLM 内存分配机制(设计缺陷或边界条件) - gpu_memory_utilization = 0.82 + tensor_parallel_size = 4 配置示例

标签: #vLLM #OOM #tensor-parallel #edge-case


6. [ISO-Bench: Coding Agents 能否优化真实 Inference 工作负载?] — ✅ 保留(学术工程)

来源: arXiv:2602.19594v1
URL: https://arxiv.org/html/2602.19594v1

保留理由: - 54 个真实优化任务(从 vLLM 和 SGLang 实际 commit 提取) - 含仓库快照、吞吐量和延迟基准、正确性测试 - 评估框架:Hard Success vs True Success(区分幸运命中和真实优化能力) - Claude Code 在 vLLM 上 True Success 46.2%,但 SGLang 上仅 26.7%

核心数据: | Project | Agent | Hard Success | True Success | |---------|-------|-------------|--------------| | vLLM | Claude Code | 56.4% | 46.2% | | vLLM | Codex CLI | 33.3% | 20.5% | | SGLang | Claude Code | 46.7% | 26.7% | | SGLang | TRAE (GPT-5) | 86.7% | 86.7% |

标签: #arxiv #agent #benchmark #inference-optimization


7. [vLLM vs TGI 性能研究:85-92% vs 68-74% GPU 利用率] — ✅ 保留

来源: arXiv:2511.17593v1
URL: https://arxiv.org/html/2511.17593v1

保留理由: - 学术级别的系统性能对比研究 - vLLM PagedAttention + continuous batching 带来 85-92% GPU 利用率 - TGI(已进入维护模式,2025年12月)仅 68-74% - p50 TTFT vs p99 total latency 权衡分析 - 70B 模型延迟挑战量化

标签: #arxiv #performance-study #vLLM #TGI #GPU-utilization


8. [Continuous Batching 深度解析:23x 吞吐量提升] — ✅ 保留(经典重读)

来源: Anyscale Blog + TianPan.co
URL: https://www.anyscale.com/blog/continuous-batching-llm-inference | https://tianpan.co/blog/2026-04-09-continuous-batching-llm-inference

保留理由: - Continuous batching(iteration-level scheduling)核心原理 - PagedAttention 借鉴 OS 虚拟内存的设计思路 - 内存碎片从 60% 降至 4% 的机制解释 - 槽位释放同步机制(下一个 iteration 立即可用)

标签: #continuous-batching #PagedAttention #KV-cache #fundamentals


丢弃条目

条目 丢弃理由
KDnuggets "成为 LLM 工程师路线图 2026" 入门概述,无新工程数据
Redis LLMOps 指南 产品宣传为主,Redis 软广
多数 "2026 Complete Guide" 博客 综合性概述,缺真实命令/错误/代码
YouTube 视频 无法提取结构化工程数据

分类标签汇总

#inference-engineering #benchmark #H100 #vLLM #SGLang #TensorRT-LLM
#production-deploy #RadixAttention #prefix-caching #CUDA-OOM #OOM
#tensor-parallel #continuous-batching #PagedAttention #KV-cache
#GPU-utilization #comparison #troubleshooting #arxiv #agent

建议写入路径

/shared/research-kb/inbox/jay/2026-06-27-1050-engineering-filter-inference-benchmark-vllm-sglang.md

后续行动建议

  1. 精读: ISO-Bench arXiv 论文(评估 coding agents 对 inference engine 的真实优化能力)
  2. 精读: vLLM vs TGI 性能研究(学术对比,GPU 利用率数据详实)
  3. 审稿: SGLang 生产部署指南(step-by-step 命令可复现)
  4. 主题页更新: 建议建立 inference-engineering 专题,收录本轮 OOM 排障 + 基准测试核心数据

撰写时间: 2026-06-27 10:50 CST
实例: Jay
本轮检索: Tavily Search (6次) + 工程筛选