Jay 工程实践筛选 · 2026-09-09 下午

任务元信息

  • 筛选者:Jay
  • 时间:2026-09-09 10:50 UTC / 18:50 CST
  • 主题:推理引擎工程对比 & 冷启动优化 & DeepSeek V4 Flash 新进展
  • 对比上午草稿2026-09-09-inference-vecdb-hf-acquisition-morning.md(HF 收购+推理新闻,主题不重复)

一、推理服务器Benchmark(2026最新实测)

来源PremAI Blog - LLM Inference Servers Compared(arXiv:2506.21901 补充材料)

保留 ✅

理由:含 H100 80GB 实测数据、启动命令、可对比的吞吐表格,是目前最系统的推理引擎横评。

Engine Tokens/Second 相对基准
SGLang 16,215 基准
LMDeploy 16,132 -0.5%
vLLM (FlashInfer) 12,553 -22.6%
vLLM (default) ~10,000 -38%

并发请求饱和点: - vLLM:100-150 个并发请求,GPU 利用率 85-92% - TGI:50-75 个并发请求,GPU 利用率 68-74%

启动命令(vLLM)

pip install vllm
vllm serve meta-llama/Llama-3.1-8B-Instruct --port 8000

关键结论: - TGI 已于 2025 年 12 月进入维护模式,Hugging Face 建议新部署使用 vLLM 或 SGLang - vLLM:硬件兼容最广、社区最大、生产部署最成熟 - SGLang:多轮对话、Agent 场景、结构化输出最优(RadixAttention 前缀缓存优势)

标签#推理引擎 #vLLM #SGLang #H100 #Benchmark


二、SGLang Breakable CUDA Graphs(BCG)——新版默认后端

来源Spheron Blog - SGLang's Breakable CUDA Graphs

保留 ✅

理由:工程实测数据具体,含 DeepSeek V4 生产 benchmark,有明确的性能提升数字和 GPU 算力影响。

核心数据(SGLang v0.5.15,CUDA,2026年7月2日合并 PR #29458 设为默认): - Prefill graph 构建速度:比 torch.compile 后端快 3.8~5.2 倍 - Replay 速度:比 torch.compile 后端快 17% - DeepSeek V4 DP attention 真实负载(CoreWeave 8-DP):开启 BCG 后 吞吐量+11.80%,TPOT 从 230.98ms 降至 200.32ms

GPU 算力影响估算: - 若原 fleet 需要 10 张 H100 达到目标吞吐量,BCG 优化后可压缩至约 8.9 张(省约 10% GPU 成本) - 适用场景:多实例部署、Spot Instance 竞价池、Spheron 等按分钟计费平台

标签#SGLang #CUDA-Graphs #DeepSeek-V4 #GPU优化 #CoreWeave


三、vLLM 冷启动:从 8 分钟压到 1 分钟内

来源The New Stack - Cut GPU Inference Cold Start from 8 Minutes to Less Than a Minute(2026-09-03)

保留 ✅

理由:直接解决生产痛点,有完整分层分析和可操作的环境变量配置方案。

冷启动各层耗时分解: 1. Pod 调度 + 镜像拉取 2. 模型权重加载(Run:ai Model Streamer:从 82s→65s 初版;同节点后续启动:16s) 3. GPU kernel 编译(torch.compile):34~53s ← 最大瓶颈 4. CUDA graph 构建 5. 服务就绪

torch.compile 持久化缓存方案(无需代码修改):

# 挂载持久化卷,指向缓存目录
export TORCH_COMPILE_DIR=/persistent-cache/torch-compile
export PYTORCH_KERNEL_CACHE_DIR=/persistent-cache/py-kernel
# 或直接挂载到 vLLM/SGLang Pod 的对应路径

Kubernetes 问题:Pod 使用临时存储(ephemeral storage),扩缩容/重启后本地缓存丢失,每次重新编译。解决方案:挂载 PVC 或 HostPath 持久化缓存卷。

额外发现:OCI 镜像卷在 2026 年已稳定,Dynamic Resource Allocation(DRA)为 GPU 提供结构化属性,Gateway API 增加了推理感知路由扩展。

标签#vLLM #冷启动 #Kubernetes #torch.compile #GPU调度


四、DeepSeek V4 Flash Vision:开源多模态 MoE 新选择

来源Shattered.io / MorphLLM / TechTimes / HuggingFace

保留 ✅

理由:2026年8月31日发布,开源权重(MIT),带 vLLM/SGLang 部署配方,是近期最重要的开源多模态发布之一。

核心信息: - 参数:305B 总,MoE 架构,首次原生多模态(Vision)支持 - 许可:MIT,可商用、自托管、微调 - Serving 支持:vLLMSGLang 均已支持 - DSpark 投机解码:SGLang 支持,通过 --speculative-algorithm DSPARK 启用(无需独立 draft model) - vLLM 注意事项:需要 --trust-remote-code(自定义 attention 模块尚未进入 upstream Transformers)

vLLM 部署命令

vllm serve deepseek-ai/DeepSeek-V4-Flash-Vision-Exp \
  --trust-remote-code --port 8000

SGLang 部署命令

python3 -m sglang.launch_server \
  --model deepseek-ai/DeepSeek-V4-Flash-Vision-Exp \
  --trust-remote-code

重要警告:DeepSeek 自身 ApexBench 和 Agents' Last Exam 的基准分数中,baseline(0731)实际上忽略了多模态部分的输入,因此与 V4-Flash-Vision-Exp 的对比不是同类对比,需独立验证。

标签#DeepSeek #多模态 #MoE #开源权重 #vLLM #SGLang #投机解码


五、NVIDIA DeepSeek-V4-Flash-NVFP4: Blackwell FP4 量化

来源HuggingFace - nvidia/DeepSeek-V4-Flash-NVFP4

保留 ✅

理由:NVIDIA 官方量化权重,FP4 精度在 Blackwell B200 上的 Benchmark 数据,可与基线对比,可部署参考。

测试硬件:NVIDIA Blackwell B200 加速引擎:SGLang、vLLM 量化算法:NVFP4(MoE linear operators 权重量化)

Precision GPQA Diamond AA-LCR τ²-Bench Telecom SciCode IFBench
Baseline 0.894 0.658 0.943 0.481 0.788
NVFP4 0.891 0.655 0.942 0.481 0.795

量化精度损失:极小(IFBench 反而+0.7%),工程可用

SGLang 启动命令

python3 -m sglang.launch_server \
  --model nvidia/DeepSeek-V4-Flash-NVFP4 \
  --tensor-parallel-size 8 \
  --trust-remote-code

标签#NVIDIA #FP4量化 #Blackwell #DeepSeek #SGLang


六、Snowflake Semi-Persistence:vLLM 5.6x~19.9x 快速唤醒

来源Latent.Space / AINews(引用 SemiAnalysis)

保留 ✅(补充信息)

理由:内部 Benchmark 数据具体,多实例管理工程价值高,可与上述冷启动优化交叉验证。

技术方案:将模型权重保留在 pinned CPU memory,vLLM 按需 rehydrate 到 GPU Benchmark 结果:sleep/wake 周期比对比方案快 5.6x~19.9x 对比对象:推测为标准 vLLM 全量加载方案

标签#vLLM #多实例管理 #Snowflake #内存管理


七、DGX Spark (GB10) Qwen3.8-27B 实测

来源Kubesimplify - Running Qwen3.8-27B on DGX Spark

保留 ✅( Benchmark 命令参考)

理由:含具体测试命令、吞吐表格、不同框架(vLLM/SGLang/llama.cpp/Ollama)对比数据,可作部署参考。

硬件环境:DGX Spark,GB10,128GB unified memory,CUDA 驱动 580.159.03

llama-benchy 命令参考

uvx llama-benchy@0.4.0 \
  --base-url http://<host>:8000/v1 \
  --model <model-name> \
  --pp 2048 --tg 128 --depth 0 16384 32768 \
  --concurrency 1 2 5 10

吞吐对比摘要(Decode, tg128, FP8): | 配置 | Decode c=1 | |------|-----------| | SGLang FP8 | 7.7 t/s | | SGLang FP8 + NEXTN | 13.4 t/s | | vLLM FP8 + MTP | 13.8 t/s |

标签#Qwen #DGX-Spark #Benchmark #llama-benchy


丢弃条目

条目 丢弃理由
TheZvi Substack - HF Attack Postmortem 分析类内容,无命令/源码/性能数据
Semianalysis - Neoclouds 安全报告 商业/安全分析,非工程实践
Irrational Analysis - Hot Chips 2026 硬件架构推测,无具体部署命令
Popular AI - GPT-6 vs GPT-5.6 对比 模型评测,非推理引擎工程

本次筛选汇总

类别 高价值条目 标签
推理引擎横评 PremAI Blog(含 H100 吞吐表+vLLM 命令) #推理引擎 #Benchmark
GPU 优化 SGLang BCG(+11.8% 吞吐量,DeepSeek V4 实测) #SGLang #GPU优化
冷启动 vLLM Kubernetes 冷启动 8min→1min(torch.compile 缓存) #Kubernetes #冷启动
新模型部署 DeepSeek V4 Flash Vision(MIT,vLLM/SGLang 配方) #DeepSeek #多模态
量化部署 NVIDIA DeepSeek-V4-Flash-NVFP4(Blackwell FP4) #NVIDIA #FP4 #Blackwell
多实例 Snowflake Semi-Persistence(5.6x~19.9x 唤醒加速) #vLLM #内存管理
Benchmark 命令 Qwen3.8-27B DGX Spark(llama-benchy 命令) #Qwen #Benchmark

建议写入路径/shared/research-kb/inbox/jay/2026-09-09T1050-jay-engineering-filter-sep09pm.md

后续行动建议: 1. 精读:PremAI Blog 完整吞吐对比表(含并发请求饱和点数据),SGLang BCG 原文(v0.5.15 release note) 2. 验证:DeepSeek V4 Flash Vision 自身 benchmark 声明的 ApexBench 对比需第三方独立验证 3. 主题页更新:建议更新「推理引擎对比」主题页,加入 TGI 维护模式后续影响 + BCG 新默认后端 4. 待核实:Snowflake Semi-Persistence 原文 Benchmark 细节(目前为引用,需溯源)