Jay 工程实践筛选 · 2026-07-23
筛选主题
推理框架(vLLM / SGLang)生产级排障、OOM 调优、Kubernetes 部署实战
检索范围
- Tavily: vLLM SGLang bug OOM CUDA fix production 2026
- Tavily: arxiv inference systems KV cache batching July 2026
- Tavily: CSDN vLLM SGLang 推理部署 性能优化 命令 2026
- 目标:真实环境 / 命令 / 错误日志 / 源码分析 / 性能数据 / 可复现步骤
高价值候选(保留)
H1 · SGLang 官方 Troubleshooting 文档
- 来源: https://sgl-project-sglang-93.mintlify.app/resources/troubleshooting
- 类型: 官方文档 / 排障指南
- 工程价值: ✅
- 真实错误场景:CUDA OOM during prefill / decoding
- 具体命令示例:
bash python -m sglang.launch_server \ --model-path meta-llama/Llama-3.1-8B-Instruct \ --chunked-prefill-size 4096 # OOM during prefill python -m sglang.launch_server \ --model-path meta-llama/Llama-3.1-8B-Instruct \ --max-running-requests 128 # OOM during decoding - Kernel Error 的上报规范(模型配置 + 完整 traceback + SGLang 版本 + GPU/CUDA 信息 + 最小复现步骤)
- 服务器挂起的内存问题排查流程(
--mem-fraction-static调整) - 判断: 保留。SGLang 官方排障指南,命令参数具体,错误场景分类清晰,适合入库「推理框架排障」主题页。
H2 · Sector88: How to fix vLLM OOM — Complete 2026 Checklist
- 来源: https://www.sector88.co/blog/how-to-fix-vllm-oom
- 类型: 深度博客 / 排障清单
- 工程价值: ✅
- 解释 vLLM 启动时预分配 GPU 内存机制(
gpu_memory_utilization) - 关键原则:「不要设置
gpu_memory_utilization为 1.0」 - 具体步骤:
- 降低
gpu_memory_utilization - 限制
max_model_len - 限制
max_num_seqs - 量化模型
- Step 8: 内存分层(VRAM / host RAM / NVMe)
- 降低
- 常见误区明确列出(反面教材)
- 判断: 保留。系统性 OOM 排障清单,步骤清晰,有内存分层等进阶内容,适合入库「vLLM 生产调优」主题页。
H3 · SitePoint: vLLM Production Deployment Complete 2026 Guide
- 来源: https://www.sitepoint.com/vllm-production-deployment-guide-2026
- 类型: 部署指南 / 生产配置
- 工程价值: ✅
gpu-memory-utilization参数详解(0.85–0.95 范围的实际意义)--enforce-eager标志的作用(禁用 CUDA graph,节省 5–15% GPU 内存)--ipc=host对多 GPU NCCL 通信的重要性- Docker Compose 生产配置示例(nginx 反向代理 + 健康检查 + 模型持久缓存)
- NCCL P2P 配置说明
- 判断: 保留。生产级 vLLM 部署配置指南,有 Docker Compose 完整示例,适合入库「LLM 推理部署」主题页。
H4 · GitHub Issue #12496: CUDA OOM — SGLang vs vLLM on same hardware
- 来源: https://github.com/sgl-project/sglang/issues/12496
- 类型: GitHub Issue / Bug 报告
- 工程价值: ✅
- 真实硬件环境:2x4090 workstation,Gemma 3 12b
- 真实错误日志:
Setup Custom allreduce failed with CUDART error: peer access is not supported between these devices - vLLM 能跑但 SGLang 报 CUDA OOM,说明两者内存分配策略差异
- 解决方向:
--disable-custom-all-reduce - 涉及
--mem-fraction-static与--gpu_memory_utilization 0.8的行为差异 - 判断: 保留。高质量生产 Bug 报告,包含完整错误 trace + 环境信息,适合入库「SGLang vs vLLM 实战对比」主题页。
H5 · AliYun ACK: Deploy vLLM and SGLang on Kubernetes
- 来源: https://help.aliyun.com/zh/ack/cloud-native-ai-suite/user-guide/deploy-standalone-llm-inference-services
- 类型: 云厂商官方文档 / Kubernetes 部署
- 工程价值: ✅
- 真实 StatefulSet YAML 配置:
yaml vllm serve /models/Qwen3-32B --port 8000 \ --trust-remote-code --max-model-len 2048 \ --gpu-memory-utilization 0.85 --tensor-parallel-size 2 - dshm 共享内存挂载配置(
emptyDir medium: Memory sizeLimit: 15Gi) - Kubernetes readinessProbe 配置
- GPU limits + memory limits 完整声明
- 判断: 保留。Kubernetes 上部署 vLLM 的真实 YAML,生产可用,适合入库「LLM 推理 Kubernetes 部署」主题页。
H6 · CSDN: SGLang vs vLLM 性能优化策略实战指南
- 来源: https://blog.csdn.net/fish/article/details/153500482
- 类型: CSDN 技术博客 / 框架对比
- 工程价值: ✅(中等)
- SGLang(RadixAttention、多轮对话、结构化输出)vs vLLM(PagedAttention、Continuous Batching、高吞吐单轮)
- 高并发场景下 SGLang 稳定性更好;vLLM 首字输出速度有优势
- 实战调优方向:chunked prefill、KV cache 管理
- 无具体命令但有框架选型结论
- 判断: 保留参考。中文框架对比,有选型参考价值,但需要配合其他有命令的文章使用。
H7 · arXiv 2603.04428: Persistent Q4 KV Cache for Multi-Agent on Edge
- 来源: https://arxiv.org/html/2603.04428v1
- 类型: 学术论文
- 工程价值: ✅(中等)
- 实测性能数据:Apple M4 Pro 上 136× TTFT 提升(Gemma 3 12B @ 4K–32K context)
- 具体模型:Gemma 3 12B、DeepSeek-Coder-V2-Lite 16B、Llama 3.1 8B
- Q4 量化困惑度损失:-0.7% ~ +3.0%(在测量噪声范围内)
- 技术组件:block pool + BatchQuantizedKVCache + cross-phase context injection
- 判断: 保留参考。边缘推理场景,有实测数据,适合入库「KV Cache 优化」主题页(需注明是边缘场景,非生产 GPU 集群)。
中等价值候选(降级保留或审稿后入库)
M1 · CSDN: SGLang 优化参数中文说明
- 来源: https://cloud.tencent.com/developer/news/2369647
- 价值: 完整参数说明 + 实际命令,但属于腾讯云运营转载,内容较为综合
- 判断: 降级保留。可作为参数速查,不单独入库。
M2 · CSDN: 高级推理优化技术-SGLang(vLLM+Ray vs SGLang)
- 来源: https://blog.csdn.net/aibi1/p/19508349
- 价值: DSL 多步推理场景分析,有工程判断,但缺少具体命令
- 判断: 降级保留。选型参考,不单独入库。
M3 · arXiv 2605.00528: SAGA — Workflow-Atomic Scheduling
- 来源: https://arxiv.org/html/2605.00528v1
- 价值: 64-GPU 集群 SWE-bench 基准,1.64× 任务完成时间改善(对比 vLLM v0.15.1)
- 判断: 审稿后入库。有基准数据,但工程可复现性待验证,适合入库「Agent 调度系统」主题页。
丢弃条目
D1 · arXiv 2607.09248: Non-Clairvoyant KV-Cache Scheduling(理论算法)
- 丢弃理由: 纯理论 O(1) 竞争算法分析,无真实环境、无命令、无性能基准数据,不符合工程实践筛选标准。
D2 · arXiv 2606.01927: Albireo(Amdahl's Law 分析)
- 丢弃理由: 理论性能分析为主,虽有 superlinear scaling 实验数据,但缺少具体系统配置、GPU 型号、复现步骤,工程参考价值不足。
D3 · arXiv 2606.20295: Token-Oriented Inference Optimization Survey
- 丢弃理由: 四层技术架构综述,引用大量已有技术,无原创工程数据或复现步骤。Survey 类文章可后续单独处理。
D4 · CSDN: vLLM与SGLang推理框架性能终极对决
- 来源: https://blog.csdn.net/2501_92287250/article/details/162381151
- 丢弃理由: 标题党,snippet 无实质命令或排障细节,重复框架对比内容,无新增工程价值。
分类标签
vLLM SGLang OOM Kubernetes 生产部署 推理优化 KV-Cache Docker NVIDIA 多GPU
建议写入路径
/shared/research-kb/inbox/jay/2026-07-23-engineering-filter.md
后续行动
- 精读优先级: H1(SGLang Troubleshooting)→ H2(vLLM OOM Checklist)→ H3(vLLM Production Guide)→ H5(K8s 部署)
- 主题页更新: 建议在知识库中为「推理框架排障」「vLLM 生产部署」「SGLang vs vLLM 对比」分别建立或更新专项主题页
- 审稿需求: M3(SAGA)建议由熟悉调度系统的工程师审稿后再决定是否入库