Jay 工程实践筛选 · 2026-07-23

筛选主题

推理框架(vLLM / SGLang)生产级排障、OOM 调优、Kubernetes 部署实战


检索范围

  • Tavily: vLLM SGLang bug OOM CUDA fix production 2026
  • Tavily: arxiv inference systems KV cache batching July 2026
  • Tavily: CSDN vLLM SGLang 推理部署 性能优化 命令 2026
  • 目标:真实环境 / 命令 / 错误日志 / 源码分析 / 性能数据 / 可复现步骤

高价值候选(保留)

H1 · SGLang 官方 Troubleshooting 文档

  • 来源: https://sgl-project-sglang-93.mintlify.app/resources/troubleshooting
  • 类型: 官方文档 / 排障指南
  • 工程价值: ✅
  • 真实错误场景:CUDA OOM during prefill / decoding
  • 具体命令示例: bash python -m sglang.launch_server \ --model-path meta-llama/Llama-3.1-8B-Instruct \ --chunked-prefill-size 4096 # OOM during prefill python -m sglang.launch_server \ --model-path meta-llama/Llama-3.1-8B-Instruct \ --max-running-requests 128 # OOM during decoding
  • Kernel Error 的上报规范(模型配置 + 完整 traceback + SGLang 版本 + GPU/CUDA 信息 + 最小复现步骤)
  • 服务器挂起的内存问题排查流程(--mem-fraction-static 调整)
  • 判断: 保留。SGLang 官方排障指南,命令参数具体,错误场景分类清晰,适合入库「推理框架排障」主题页。

H2 · Sector88: How to fix vLLM OOM — Complete 2026 Checklist

  • 来源: https://www.sector88.co/blog/how-to-fix-vllm-oom
  • 类型: 深度博客 / 排障清单
  • 工程价值: ✅
  • 解释 vLLM 启动时预分配 GPU 内存机制(gpu_memory_utilization
  • 关键原则:「不要设置 gpu_memory_utilization 为 1.0」
  • 具体步骤:
    1. 降低 gpu_memory_utilization
    2. 限制 max_model_len
    3. 限制 max_num_seqs
    4. 量化模型
    5. Step 8: 内存分层(VRAM / host RAM / NVMe)
  • 常见误区明确列出(反面教材)
  • 判断: 保留。系统性 OOM 排障清单,步骤清晰,有内存分层等进阶内容,适合入库「vLLM 生产调优」主题页。

H3 · SitePoint: vLLM Production Deployment Complete 2026 Guide

  • 来源: https://www.sitepoint.com/vllm-production-deployment-guide-2026
  • 类型: 部署指南 / 生产配置
  • 工程价值: ✅
  • gpu-memory-utilization 参数详解(0.85–0.95 范围的实际意义)
  • --enforce-eager 标志的作用(禁用 CUDA graph,节省 5–15% GPU 内存)
  • --ipc=host 对多 GPU NCCL 通信的重要性
  • Docker Compose 生产配置示例(nginx 反向代理 + 健康检查 + 模型持久缓存)
  • NCCL P2P 配置说明
  • 判断: 保留。生产级 vLLM 部署配置指南,有 Docker Compose 完整示例,适合入库「LLM 推理部署」主题页。

H4 · GitHub Issue #12496: CUDA OOM — SGLang vs vLLM on same hardware

  • 来源: https://github.com/sgl-project/sglang/issues/12496
  • 类型: GitHub Issue / Bug 报告
  • 工程价值: ✅
  • 真实硬件环境:2x4090 workstation,Gemma 3 12b
  • 真实错误日志: Setup Custom allreduce failed with CUDART error: peer access is not supported between these devices
  • vLLM 能跑但 SGLang 报 CUDA OOM,说明两者内存分配策略差异
  • 解决方向:--disable-custom-all-reduce
  • 涉及 --mem-fraction-static--gpu_memory_utilization 0.8 的行为差异
  • 判断: 保留。高质量生产 Bug 报告,包含完整错误 trace + 环境信息,适合入库「SGLang vs vLLM 实战对比」主题页。

H5 · AliYun ACK: Deploy vLLM and SGLang on Kubernetes

  • 来源: https://help.aliyun.com/zh/ack/cloud-native-ai-suite/user-guide/deploy-standalone-llm-inference-services
  • 类型: 云厂商官方文档 / Kubernetes 部署
  • 工程价值: ✅
  • 真实 StatefulSet YAML 配置: yaml vllm serve /models/Qwen3-32B --port 8000 \ --trust-remote-code --max-model-len 2048 \ --gpu-memory-utilization 0.85 --tensor-parallel-size 2
  • dshm 共享内存挂载配置(emptyDir medium: Memory sizeLimit: 15Gi
  • Kubernetes readinessProbe 配置
  • GPU limits + memory limits 完整声明
  • 判断: 保留。Kubernetes 上部署 vLLM 的真实 YAML,生产可用,适合入库「LLM 推理 Kubernetes 部署」主题页。

H6 · CSDN: SGLang vs vLLM 性能优化策略实战指南

  • 来源: https://blog.csdn.net/fish/article/details/153500482
  • 类型: CSDN 技术博客 / 框架对比
  • 工程价值: ✅(中等)
  • SGLang(RadixAttention、多轮对话、结构化输出)vs vLLM(PagedAttention、Continuous Batching、高吞吐单轮)
  • 高并发场景下 SGLang 稳定性更好;vLLM 首字输出速度有优势
  • 实战调优方向:chunked prefill、KV cache 管理
  • 无具体命令但有框架选型结论
  • 判断: 保留参考。中文框架对比,有选型参考价值,但需要配合其他有命令的文章使用。

H7 · arXiv 2603.04428: Persistent Q4 KV Cache for Multi-Agent on Edge

  • 来源: https://arxiv.org/html/2603.04428v1
  • 类型: 学术论文
  • 工程价值: ✅(中等)
  • 实测性能数据:Apple M4 Pro 上 136× TTFT 提升(Gemma 3 12B @ 4K–32K context)
  • 具体模型:Gemma 3 12B、DeepSeek-Coder-V2-Lite 16B、Llama 3.1 8B
  • Q4 量化困惑度损失:-0.7% ~ +3.0%(在测量噪声范围内)
  • 技术组件:block pool + BatchQuantizedKVCache + cross-phase context injection
  • 判断: 保留参考。边缘推理场景,有实测数据,适合入库「KV Cache 优化」主题页(需注明是边缘场景,非生产 GPU 集群)。

中等价值候选(降级保留或审稿后入库)

M1 · CSDN: SGLang 优化参数中文说明

  • 来源: https://cloud.tencent.com/developer/news/2369647
  • 价值: 完整参数说明 + 实际命令,但属于腾讯云运营转载,内容较为综合
  • 判断: 降级保留。可作为参数速查,不单独入库。

M2 · CSDN: 高级推理优化技术-SGLang(vLLM+Ray vs SGLang)

  • 来源: https://blog.csdn.net/aibi1/p/19508349
  • 价值: DSL 多步推理场景分析,有工程判断,但缺少具体命令
  • 判断: 降级保留。选型参考,不单独入库。

M3 · arXiv 2605.00528: SAGA — Workflow-Atomic Scheduling

  • 来源: https://arxiv.org/html/2605.00528v1
  • 价值: 64-GPU 集群 SWE-bench 基准,1.64× 任务完成时间改善(对比 vLLM v0.15.1)
  • 判断: 审稿后入库。有基准数据,但工程可复现性待验证,适合入库「Agent 调度系统」主题页。

丢弃条目

D1 · arXiv 2607.09248: Non-Clairvoyant KV-Cache Scheduling(理论算法)

  • 丢弃理由: 纯理论 O(1) 竞争算法分析,无真实环境、无命令、无性能基准数据,不符合工程实践筛选标准。

D2 · arXiv 2606.01927: Albireo(Amdahl's Law 分析)

  • 丢弃理由: 理论性能分析为主,虽有 superlinear scaling 实验数据,但缺少具体系统配置、GPU 型号、复现步骤,工程参考价值不足。

D3 · arXiv 2606.20295: Token-Oriented Inference Optimization Survey

  • 丢弃理由: 四层技术架构综述,引用大量已有技术,无原创工程数据或复现步骤。Survey 类文章可后续单独处理。

D4 · CSDN: vLLM与SGLang推理框架性能终极对决

  • 来源: https://blog.csdn.net/2501_92287250/article/details/162381151
  • 丢弃理由: 标题党,snippet 无实质命令或排障细节,重复框架对比内容,无新增工程价值。

分类标签

vLLM SGLang OOM Kubernetes 生产部署 推理优化 KV-Cache Docker NVIDIA 多GPU


建议写入路径

/shared/research-kb/inbox/jay/2026-07-23-engineering-filter.md


后续行动

  1. 精读优先级: H1(SGLang Troubleshooting)→ H2(vLLM OOM Checklist)→ H3(vLLM Production Guide)→ H5(K8s 部署)
  2. 主题页更新: 建议在知识库中为「推理框架排障」「vLLM 生产部署」「SGLang vs vLLM 对比」分别建立或更新专项主题页
  3. 审稿需求: M3(SAGA)建议由熟悉调度系统的工程师审稿后再决定是否入库