Jay 工程实践筛选 · 2026-08-30 下午第二次

检索范围:vLLM K8s 生产部署 / SGLang vs vLLM benchmark / vLLM.cpp CPU-GPU 推理横评 / arXiv KV Cache 系统优化 / MLSys 2026 LLM Serving 系统论文 / Hugging Face Transformers v5 / GitHub Trending

本轮候选条目:17 个 高价值保留:9 个 丢弃:8 个(理论为主 / 已有覆盖 / 信源质量不足)


✅ 高价值条目

1. vLLM Kubernetes 生产部署完整指南(SitePoint 2026)

地址:https://www.sitepoint.com/vllm-production-deployment-guide-2026 类型:工程实践 / K8s / 生产运维 可信度:高(2026 年更新,含真实 YAML 和运维命令)

核心内容摘要: - 完整 Deployment YAML(含 runtimeClassName: nvidia、NVIDIA RuntimeClass 配置) - topologySpreadConstraints GPU 打散策略(maxSkew: 1,按 kubernetes.io/hostname 分布) - HPA 配置参考(基于 vllm:num_requests_runningvllm:num_requests_waiting Prometheus metric) - NetworkPolicy 限制 vLLM Pod 只能被反向代理访问,禁止其他 workloads 直连 - Secret 管理真实命令:kubectl create secret generic hf-secret --from-literal=token=$HF_TOKEN - Prometheus metrics 端点注解(prometheus.io/scrape: "true",port 8000,path /metrics) - gRPC 部署:pip install vllm[grpc],替换 httpGet 为 Kubernetes 原生 gRPC probes(1.24+) - 生产环境 --disable-log-requests(关闭请求 Payload 日志),保留 --log-stats - VLLM_API_KEY 环境变量 / --api-key 双向认证

工程价值:⭐⭐⭐⭐⭐
保留理由:真实 K8s YAML、Prometheus metrics 命名、gRPC probes、NetworkPolicy 模式,可直接参考。


2. vLLM HPA 配置 — Kubenatives 真实 HPA YAML

地址:https://www.kubenatives.com/p/how-vllm-serves-models-kubernetes 类型:K8s HPA / 弹性伸缩 可信度:高(付费内容,本摘要引用 snippet 质量可靠)

核心内容摘要: - HPA 真实 metric 名:vllm_num_requests_waiting(Waiting 队列长度作为扩容信号) - HPA scaleDown 策略:stabilizationWindowSeconds: 600(10 分钟冷却),每次最多缩容 1 Pod,周期 5 分钟 - HPA scaleUp 策略:每分钟最多加 2 Pod - 关键判断阈值:vllm:gpu_cache_usage_perc > 90% 即将触发 preemption;> 95% 需要降 max-num-seqs 或加 GPU - vllm:num_requests_running 持续等于 max-num-seqs → 饱和,需扩容

工程价值:⭐⭐⭐⭐⭐
保留理由:HPA 扩容/缩容真实参数,生产弹性伸缩可直接参考。


3. SGLang vs vLLM 2026 生产横评(DevOpsBeast)

地址:https://devopsbeast.com/blog/vllm-vs-sglang-production-2026 类型:Benchmark 横评 / 工程选型 可信度:中高(2026 年数据,综合性技术博客)

核心内容摘要: - RadixAttention 是 SGLang 最强差异点:共享前缀 >60% 的输入 token 时,prefix cache hit rate 比 vLLM 高 2-3x - 典型 chat workload(H100 + Llama-70B FP16/FP8),vLLM vs SGLang 吞吐量差距 10-20% - SGLang 胜出场景:chatbot、RAG、agent(共享前缀多);prefix caching 命中率高 - vLLM 胜出场景:新模型支持速度(vLLM 通常几天内支持新模型,SGLang 滞后 1-4 周);多 LoRA 生产级加载;大规模分布式(pipeline + tensor parallelism);生产久经考验 - SGLang 适合 agentic 低延迟交互;vLLM 适合高吞吐批量推理 - 多 LoRA:vLLM 的 multi-LoRA serving(多个 adapter 热加载、adapter rotation)更成熟

工程价值:⭐⭐⭐⭐
保留理由:工程选型核心参考,数据具体,区分了 vLLM 和 SGLang 的生产场景边界。


4. SGLang 生产部署:systemd + Docker systemd service 真实 unit 文件(Spheron)

地址:https://www.spheron.network/blog/sglang-production-deployment-guide 类型:Ops / 部署 / SGLang 可信度:高(含真实 systemd unit 和 docker run 完整参数)

核心内容摘要

[Unit]
Description=SGLang Inference Server
After=docker.service
Requires=docker.service
[Service]
Restart=always
RestartSec=5
ExecStartPre=-/usr/bin/docker rm -f sglang
ExecStart=/usr/bin/docker run --name sglang --gpus all --ipc=host -p 8000:8000 \
  -e HUGGING_FACE_HUB_TOKEN=*** \
  lmsysorg/sglang:v0.5.9-cu130-runtime \
  python -m sglang.launch_server \
  --model-path meta-llama/Llama-3.3-70B-Instruct \
  --quantization fp8 \
  --context-length 8192 \
  --mem-fraction-static 0.92 \
  --enable-metrics \
  --host 0.0.0.0 \
  --port 8000
ExecStop=/usr/bin/docker stop sglang
[Install]
WantedBy=multi-user.target
  • --mem-fraction-static 0.92:静态 KV cache 内存占比(vLLM 等效参数对标 gpu_memory_utilization
  • --enable-metrics:开启 Prometheus metrics
  • TGI 迁移指南:每个 TGI flag 有对应 SGLang 等效 flag

工程价值:⭐⭐⭐⭐
保留理由:完整 systemd service 文件,--mem-fraction-static 参数是调试 SGLang 内存的关键。


5. arXiv 2604.05012:KV Cache 管理策略实证横评(vLLM vs InfiniGen vs H2O)

地址:https://arxiv.org/abs/2604.05012 类型:学术论文 / KV Cache / 实证 Benchmark 可信度:高(arXiv 2026,实证对比框架包括 vLLM)

核心内容摘要: - 对比 vLLM PagedAttention、InfiniGen、H2O 在以下维度的实证表现:latency、throughput、memory、request rates、model sizes - 结论:没有单一方案在所有 GPU、context length、batch size 下均优 - 不同 KV cache 策略(paging、offload、eviction、sparse)适用于不同 workload 形态 - 标题:"Comparative Characterization of KV Cache Management Strategies for LLM Inference"

工程价值:⭐⭐⭐⭐
保留理由:实证数据,不是理论;为 KV cache 策略选型提供数据支撑。


6. arXiv 2604.19157:SAW-INT4 — Hessian-aware 4-bit KV Cache 量化(ICLR 2026 投稿水平)

地址:https://arxiv.org/html/2604.19157v1 类型:学术论文 / KV Cache 量化 / 系统-算法协同设计 可信度:高(详细推导,含算法描述和实验)

核心内容摘要: - 在线标定(online calibration):服务引擎运行期间收集 query vectors - 每层构建二阶矩矩阵 Mℓ,用作 attention-sensitive 方向的权重 - 每层学习正交旋转矩阵 Rℓ,用于 KV 量化前的预处理 - 对比四种策略:naive INT4、KMeans (Vector Quantization)、Hessian-aware (Kim et al. 2026)、Hadamard rotation - 结合 PagedAttention 和 fused kernels 做受控 token-wise 对比实验 - 结果:Hessian-aware rotation + INT4 在保持精度的同时显著降低 KV cache 内存

工程价值:⭐⭐⭐⭐
保留理由:工程+算法协同设计,有真实方法论推导;量化工程实现可参考。


7. vLLM.cpp — CPU/多后端 vLLM 等效推理引擎(2026-08)

地址:https://github.com/mudler/vllm.cpp 类型:开源项目 / CPU 推理 / 跨后端 可信度:高(活跃社区维护,GitHub 持续更新)

核心内容摘要: - 2026-08 v0.0.2 发布:8 种 server archives(CPU、CUDA、Vulkan、Metal、MLX) - MXFP4 量化:Qwen3-8B 在 W4A16 Marlin 模式下,token 生成 45.45 vs vLLM oracle 41.94 tok/s(vLLM.cpp 更快) - 支持 MiniMax-Music3 音乐生成(POST /v1/audio/speech) - 支持 LTX-2.5 视频音频 pipeline - 与 vLLM token 对 token 一致性验证通过 - 独立社区项目,非 vLLM 官方

工程价值:⭐⭐⭐⭐
保留理由:CPU 推理和多后端部署场景下的 vLLM 替代方案;有 benchmark 数据支撑。


8. MLSys 2026 — 关键系统论文发现(Modular Blog 摘要)

地址:https://www.modular.com/blog/three-trends-from-mlsys-2026 类型:学术顶会 / 系统工程 / 产业研究 可信度:高(Modular 工程师署名博客,现场报告)

核心发现摘要

DriftBench(Gianluigi Vitale):生产 LLM Serving 系统基础设施漂移检测 benchmark。工程价值高——SRE 必备。

SuperInfer(Superchips SLO-aware scheduling):发现 GH200 上 NVLink-C2C 900 GB/s 带宽实际利用率 <5%,原因是软件栈把它当作 PCIe 使用。关键数据点。

Meta《Optimizing Deployment Configurations for LLM Inference》:生产部署中 prefill-decode 分离的实际 TCO 数据——15-25% 改善(在不同 accelerator 上分别跑 prefill 和 decode,因为 prefill 是 FLOP/s bound,decode 是 HBM bandwidth bound)。

AccelOpt:LLM Agent 自动做 accelerator kernel 优化——propose、profile、feedback 闭环。

工程价值:⭐⭐⭐⭐
保留理由:都是顶会论文的工程结论数据,非纯理论。


9. GitHub llama.cpp #15180:vLLM vs llama.cpp benchmark(真实数据)

地址:https://github.com/ggml-org/llama.cpp/discussions/6730 类型:开源 benchmark / 真实运行数据 可信度:高(开源讨论,附完整配置和原始数据表)

核心数据: | 配置 | Runtime vLLM | Runtime llama.cpp | 差异 | |---|---|---|---| | Qwen2.5-3B, 1 req, 10240 prompt | 131.1s | 123.9s | -5.5% | | Qwen2.5-3B, 1 req, 16384 prompt | 158.7s | 151.7s | -4.4% | | 16 parallel requests | vLLM 更快 | llama.cpp 慢 25% | — |

  • vLLM 在高并发场景优势明显;llama.cpp 在单请求场景与 vLLM 接近
  • 工具:scripts/server-bench.py(llama.cpp 官方 benchmark 脚本)

工程价值:⭐⭐⭐
保留理由:真实 benchmark 配置和数字,适合评估 CPU/GPU 场景选型。


❌ 丢弃条目(已去重/理论/信源不足)

条目 丢弃原因
ICLR 2026 KV Cache Transform Coding (arXiv 2511.01815) ICLR 2026 接收,但摘要信息量不足,需精读原文判断工程价值
Dell KV Cache Optimization Strategies (arXiv 2603.20397) 作者单位 Dell,但摘要缺乏具体数据,需原文确认
Towards Efficient LLM Serving: KV Cache Survey (arXiv 2607.08057) 综述类,以论文列表为主,缺乏原创工程数据
Hugging Face Transformers v5 Blog (hf.co/blog/transformers-v5) snippet 仅有标题,无实质技术内容,标题含 v5 关键词但无法验证
"Why Your LLM Is Slow" (TowardsAI) 科普性质,已有下午横评覆盖
DeployBase LLM Inference Engine 2026 横评 综合来源,信源不如 devopsbeast 详细
HF Blog State of Open Models 2026 新闻类,无工程细节
VeriCache arXiv 2605.17613 摘要提到 KV cache reuse,但没有看到具体 benchmark 数据

分类标签

#K8s #HPA #vLLM #SGLang #KVCache #Quantization #INT4 #Hessian #Systemd #Docker #MLSys2026 #vllm.cpp #llama.cpp #Benchmark #PrefillDecodeDisaggregation #DriftBench #SuperInfer


建议写入路径

/shared/research-kb/inbox/jay/2026-08-30T1500-jay-evening-k8s-sglang-kvcache-mlsys-vllm-cpp.md


后续行动建议

需精读原文: 1. arXiv 2604.19157(SAW-INT4)——Hessian-aware rotation 推导完整,值得细看 2. arXiv 2604.05012(KV Cache 管理横评)——vLLM/InfiniGen/H2O 实证数据 3. MLSys 2026 DriftBench / SuperInfer 论文(从 ml-systems-papers repo 获取)

K8s 专项: - SitePoint YAML 可直接作为生产配置模板,建议整合为 K8s 部署专题页 - HPA metric name vllm_num_requests_waiting 需要在生产环境中验证(部分 vLLM 版本 metric 名称可能不同)

SGLang vs vLLM: - 下午横评(2026-08-30T1145)和本文档均有横评内容,建议合并为一个"推理引擎选型决策树"主题页

vllm.cpp: - 2026-08 刚更新,可作为边缘/CPU 推理场景替代方案单独成篇