Jay 工程实践筛选 · 2026-08-30 下午第二次
检索范围:vLLM K8s 生产部署 / SGLang vs vLLM benchmark / vLLM.cpp CPU-GPU 推理横评 / arXiv KV Cache 系统优化 / MLSys 2026 LLM Serving 系统论文 / Hugging Face Transformers v5 / GitHub Trending
本轮候选条目:17 个 高价值保留:9 个 丢弃:8 个(理论为主 / 已有覆盖 / 信源质量不足)
✅ 高价值条目
1. vLLM Kubernetes 生产部署完整指南(SitePoint 2026)
地址:https://www.sitepoint.com/vllm-production-deployment-guide-2026 类型:工程实践 / K8s / 生产运维 可信度:高(2026 年更新,含真实 YAML 和运维命令)
核心内容摘要:
- 完整 Deployment YAML(含 runtimeClassName: nvidia、NVIDIA RuntimeClass 配置)
- topologySpreadConstraints GPU 打散策略(maxSkew: 1,按 kubernetes.io/hostname 分布)
- HPA 配置参考(基于 vllm:num_requests_running 和 vllm:num_requests_waiting Prometheus metric)
- NetworkPolicy 限制 vLLM Pod 只能被反向代理访问,禁止其他 workloads 直连
- Secret 管理真实命令:kubectl create secret generic hf-secret --from-literal=token=$HF_TOKEN
- Prometheus metrics 端点注解(prometheus.io/scrape: "true",port 8000,path /metrics)
- gRPC 部署:pip install vllm[grpc],替换 httpGet 为 Kubernetes 原生 gRPC probes(1.24+)
- 生产环境 --disable-log-requests(关闭请求 Payload 日志),保留 --log-stats
- VLLM_API_KEY 环境变量 / --api-key 双向认证
工程价值:⭐⭐⭐⭐⭐
保留理由:真实 K8s YAML、Prometheus metrics 命名、gRPC probes、NetworkPolicy 模式,可直接参考。
2. vLLM HPA 配置 — Kubenatives 真实 HPA YAML
地址:https://www.kubenatives.com/p/how-vllm-serves-models-kubernetes 类型:K8s HPA / 弹性伸缩 可信度:高(付费内容,本摘要引用 snippet 质量可靠)
核心内容摘要:
- HPA 真实 metric 名:vllm_num_requests_waiting(Waiting 队列长度作为扩容信号)
- HPA scaleDown 策略:stabilizationWindowSeconds: 600(10 分钟冷却),每次最多缩容 1 Pod,周期 5 分钟
- HPA scaleUp 策略:每分钟最多加 2 Pod
- 关键判断阈值:vllm:gpu_cache_usage_perc > 90% 即将触发 preemption;> 95% 需要降 max-num-seqs 或加 GPU
- vllm:num_requests_running 持续等于 max-num-seqs → 饱和,需扩容
工程价值:⭐⭐⭐⭐⭐
保留理由:HPA 扩容/缩容真实参数,生产弹性伸缩可直接参考。
3. SGLang vs vLLM 2026 生产横评(DevOpsBeast)
地址:https://devopsbeast.com/blog/vllm-vs-sglang-production-2026 类型:Benchmark 横评 / 工程选型 可信度:中高(2026 年数据,综合性技术博客)
核心内容摘要: - RadixAttention 是 SGLang 最强差异点:共享前缀 >60% 的输入 token 时,prefix cache hit rate 比 vLLM 高 2-3x - 典型 chat workload(H100 + Llama-70B FP16/FP8),vLLM vs SGLang 吞吐量差距 10-20% - SGLang 胜出场景:chatbot、RAG、agent(共享前缀多);prefix caching 命中率高 - vLLM 胜出场景:新模型支持速度(vLLM 通常几天内支持新模型,SGLang 滞后 1-4 周);多 LoRA 生产级加载;大规模分布式(pipeline + tensor parallelism);生产久经考验 - SGLang 适合 agentic 低延迟交互;vLLM 适合高吞吐批量推理 - 多 LoRA:vLLM 的 multi-LoRA serving(多个 adapter 热加载、adapter rotation)更成熟
工程价值:⭐⭐⭐⭐
保留理由:工程选型核心参考,数据具体,区分了 vLLM 和 SGLang 的生产场景边界。
4. SGLang 生产部署:systemd + Docker systemd service 真实 unit 文件(Spheron)
地址:https://www.spheron.network/blog/sglang-production-deployment-guide 类型:Ops / 部署 / SGLang 可信度:高(含真实 systemd unit 和 docker run 完整参数)
核心内容摘要:
[Unit]
Description=SGLang Inference Server
After=docker.service
Requires=docker.service
[Service]
Restart=always
RestartSec=5
ExecStartPre=-/usr/bin/docker rm -f sglang
ExecStart=/usr/bin/docker run --name sglang --gpus all --ipc=host -p 8000:8000 \
-e HUGGING_FACE_HUB_TOKEN=*** \
lmsysorg/sglang:v0.5.9-cu130-runtime \
python -m sglang.launch_server \
--model-path meta-llama/Llama-3.3-70B-Instruct \
--quantization fp8 \
--context-length 8192 \
--mem-fraction-static 0.92 \
--enable-metrics \
--host 0.0.0.0 \
--port 8000
ExecStop=/usr/bin/docker stop sglang
[Install]
WantedBy=multi-user.target
--mem-fraction-static 0.92:静态 KV cache 内存占比(vLLM 等效参数对标gpu_memory_utilization)--enable-metrics:开启 Prometheus metrics- TGI 迁移指南:每个 TGI flag 有对应 SGLang 等效 flag
工程价值:⭐⭐⭐⭐
保留理由:完整 systemd service 文件,--mem-fraction-static 参数是调试 SGLang 内存的关键。
5. arXiv 2604.05012:KV Cache 管理策略实证横评(vLLM vs InfiniGen vs H2O)
地址:https://arxiv.org/abs/2604.05012 类型:学术论文 / KV Cache / 实证 Benchmark 可信度:高(arXiv 2026,实证对比框架包括 vLLM)
核心内容摘要: - 对比 vLLM PagedAttention、InfiniGen、H2O 在以下维度的实证表现:latency、throughput、memory、request rates、model sizes - 结论:没有单一方案在所有 GPU、context length、batch size 下均优 - 不同 KV cache 策略(paging、offload、eviction、sparse)适用于不同 workload 形态 - 标题:"Comparative Characterization of KV Cache Management Strategies for LLM Inference"
工程价值:⭐⭐⭐⭐
保留理由:实证数据,不是理论;为 KV cache 策略选型提供数据支撑。
6. arXiv 2604.19157:SAW-INT4 — Hessian-aware 4-bit KV Cache 量化(ICLR 2026 投稿水平)
地址:https://arxiv.org/html/2604.19157v1 类型:学术论文 / KV Cache 量化 / 系统-算法协同设计 可信度:高(详细推导,含算法描述和实验)
核心内容摘要: - 在线标定(online calibration):服务引擎运行期间收集 query vectors - 每层构建二阶矩矩阵 Mℓ,用作 attention-sensitive 方向的权重 - 每层学习正交旋转矩阵 Rℓ,用于 KV 量化前的预处理 - 对比四种策略:naive INT4、KMeans (Vector Quantization)、Hessian-aware (Kim et al. 2026)、Hadamard rotation - 结合 PagedAttention 和 fused kernels 做受控 token-wise 对比实验 - 结果:Hessian-aware rotation + INT4 在保持精度的同时显著降低 KV cache 内存
工程价值:⭐⭐⭐⭐
保留理由:工程+算法协同设计,有真实方法论推导;量化工程实现可参考。
7. vLLM.cpp — CPU/多后端 vLLM 等效推理引擎(2026-08)
地址:https://github.com/mudler/vllm.cpp 类型:开源项目 / CPU 推理 / 跨后端 可信度:高(活跃社区维护,GitHub 持续更新)
核心内容摘要:
- 2026-08 v0.0.2 发布:8 种 server archives(CPU、CUDA、Vulkan、Metal、MLX)
- MXFP4 量化:Qwen3-8B 在 W4A16 Marlin 模式下,token 生成 45.45 vs vLLM oracle 41.94 tok/s(vLLM.cpp 更快)
- 支持 MiniMax-Music3 音乐生成(POST /v1/audio/speech)
- 支持 LTX-2.5 视频音频 pipeline
- 与 vLLM token 对 token 一致性验证通过
- 独立社区项目,非 vLLM 官方
工程价值:⭐⭐⭐⭐
保留理由:CPU 推理和多后端部署场景下的 vLLM 替代方案;有 benchmark 数据支撑。
8. MLSys 2026 — 关键系统论文发现(Modular Blog 摘要)
地址:https://www.modular.com/blog/three-trends-from-mlsys-2026 类型:学术顶会 / 系统工程 / 产业研究 可信度:高(Modular 工程师署名博客,现场报告)
核心发现摘要:
DriftBench(Gianluigi Vitale):生产 LLM Serving 系统基础设施漂移检测 benchmark。工程价值高——SRE 必备。
SuperInfer(Superchips SLO-aware scheduling):发现 GH200 上 NVLink-C2C 900 GB/s 带宽实际利用率 <5%,原因是软件栈把它当作 PCIe 使用。关键数据点。
Meta《Optimizing Deployment Configurations for LLM Inference》:生产部署中 prefill-decode 分离的实际 TCO 数据——15-25% 改善(在不同 accelerator 上分别跑 prefill 和 decode,因为 prefill 是 FLOP/s bound,decode 是 HBM bandwidth bound)。
AccelOpt:LLM Agent 自动做 accelerator kernel 优化——propose、profile、feedback 闭环。
工程价值:⭐⭐⭐⭐
保留理由:都是顶会论文的工程结论数据,非纯理论。
9. GitHub llama.cpp #15180:vLLM vs llama.cpp benchmark(真实数据)
地址:https://github.com/ggml-org/llama.cpp/discussions/6730 类型:开源 benchmark / 真实运行数据 可信度:高(开源讨论,附完整配置和原始数据表)
核心数据: | 配置 | Runtime vLLM | Runtime llama.cpp | 差异 | |---|---|---|---| | Qwen2.5-3B, 1 req, 10240 prompt | 131.1s | 123.9s | -5.5% | | Qwen2.5-3B, 1 req, 16384 prompt | 158.7s | 151.7s | -4.4% | | 16 parallel requests | vLLM 更快 | llama.cpp 慢 25% | — |
- vLLM 在高并发场景优势明显;llama.cpp 在单请求场景与 vLLM 接近
- 工具:scripts/server-bench.py(llama.cpp 官方 benchmark 脚本)
工程价值:⭐⭐⭐
保留理由:真实 benchmark 配置和数字,适合评估 CPU/GPU 场景选型。
❌ 丢弃条目(已去重/理论/信源不足)
| 条目 | 丢弃原因 |
|---|---|
| ICLR 2026 KV Cache Transform Coding (arXiv 2511.01815) | ICLR 2026 接收,但摘要信息量不足,需精读原文判断工程价值 |
| Dell KV Cache Optimization Strategies (arXiv 2603.20397) | 作者单位 Dell,但摘要缺乏具体数据,需原文确认 |
| Towards Efficient LLM Serving: KV Cache Survey (arXiv 2607.08057) | 综述类,以论文列表为主,缺乏原创工程数据 |
| Hugging Face Transformers v5 Blog (hf.co/blog/transformers-v5) | snippet 仅有标题,无实质技术内容,标题含 v5 关键词但无法验证 |
| "Why Your LLM Is Slow" (TowardsAI) | 科普性质,已有下午横评覆盖 |
| DeployBase LLM Inference Engine 2026 横评 | 综合来源,信源不如 devopsbeast 详细 |
| HF Blog State of Open Models 2026 | 新闻类,无工程细节 |
| VeriCache arXiv 2605.17613 | 摘要提到 KV cache reuse,但没有看到具体 benchmark 数据 |
分类标签
#K8s #HPA #vLLM #SGLang #KVCache #Quantization #INT4 #Hessian #Systemd #Docker #MLSys2026 #vllm.cpp #llama.cpp #Benchmark #PrefillDecodeDisaggregation #DriftBench #SuperInfer
建议写入路径
/shared/research-kb/inbox/jay/2026-08-30T1500-jay-evening-k8s-sglang-kvcache-mlsys-vllm-cpp.md
后续行动建议
需精读原文:
1. arXiv 2604.19157(SAW-INT4)——Hessian-aware rotation 推导完整,值得细看
2. arXiv 2604.05012(KV Cache 管理横评)——vLLM/InfiniGen/H2O 实证数据
3. MLSys 2026 DriftBench / SuperInfer 论文(从 ml-systems-papers repo 获取)
K8s 专项:
- SitePoint YAML 可直接作为生产配置模板,建议整合为 K8s 部署专题页
- HPA metric name vllm_num_requests_waiting 需要在生产环境中验证(部分 vLLM 版本 metric 名称可能不同)
SGLang vs vLLM:
- 下午横评(2026-08-30T1145)和本文档均有横评内容,建议合并为一个"推理引擎选型决策树"主题页
vllm.cpp: - 2026-08 刚更新,可作为边缘/CPU 推理场景替代方案单独成篇