Jay 工程实践筛选 · 2026-09-09 下午
任务元信息
- 筛选者:Jay
- 时间:2026-09-09 10:50 UTC / 18:50 CST
- 主题:推理引擎工程对比 & 冷启动优化 & DeepSeek V4 Flash 新进展
- 对比上午草稿:
2026-09-09-inference-vecdb-hf-acquisition-morning.md(HF 收购+推理新闻,主题不重复)
一、推理服务器Benchmark(2026最新实测)
来源:PremAI Blog - LLM Inference Servers Compared(arXiv:2506.21901 补充材料)
保留 ✅
理由:含 H100 80GB 实测数据、启动命令、可对比的吞吐表格,是目前最系统的推理引擎横评。
| Engine | Tokens/Second | 相对基准 |
|---|---|---|
| SGLang | 16,215 | 基准 |
| LMDeploy | 16,132 | -0.5% |
| vLLM (FlashInfer) | 12,553 | -22.6% |
| vLLM (default) | ~10,000 | -38% |
并发请求饱和点: - vLLM:100-150 个并发请求,GPU 利用率 85-92% - TGI:50-75 个并发请求,GPU 利用率 68-74%
启动命令(vLLM):
pip install vllm
vllm serve meta-llama/Llama-3.1-8B-Instruct --port 8000
关键结论: - TGI 已于 2025 年 12 月进入维护模式,Hugging Face 建议新部署使用 vLLM 或 SGLang - vLLM:硬件兼容最广、社区最大、生产部署最成熟 - SGLang:多轮对话、Agent 场景、结构化输出最优(RadixAttention 前缀缓存优势)
标签:#推理引擎 #vLLM #SGLang #H100 #Benchmark
二、SGLang Breakable CUDA Graphs(BCG)——新版默认后端
来源:Spheron Blog - SGLang's Breakable CUDA Graphs
保留 ✅
理由:工程实测数据具体,含 DeepSeek V4 生产 benchmark,有明确的性能提升数字和 GPU 算力影响。
核心数据(SGLang v0.5.15,CUDA,2026年7月2日合并 PR #29458 设为默认): - Prefill graph 构建速度:比 torch.compile 后端快 3.8~5.2 倍 - Replay 速度:比 torch.compile 后端快 17% - DeepSeek V4 DP attention 真实负载(CoreWeave 8-DP):开启 BCG 后 吞吐量+11.80%,TPOT 从 230.98ms 降至 200.32ms
GPU 算力影响估算: - 若原 fleet 需要 10 张 H100 达到目标吞吐量,BCG 优化后可压缩至约 8.9 张(省约 10% GPU 成本) - 适用场景:多实例部署、Spot Instance 竞价池、Spheron 等按分钟计费平台
标签:#SGLang #CUDA-Graphs #DeepSeek-V4 #GPU优化 #CoreWeave
三、vLLM 冷启动:从 8 分钟压到 1 分钟内
来源:The New Stack - Cut GPU Inference Cold Start from 8 Minutes to Less Than a Minute(2026-09-03)
保留 ✅
理由:直接解决生产痛点,有完整分层分析和可操作的环境变量配置方案。
冷启动各层耗时分解: 1. Pod 调度 + 镜像拉取 2. 模型权重加载(Run:ai Model Streamer:从 82s→65s 初版;同节点后续启动:16s) 3. GPU kernel 编译(torch.compile):34~53s ← 最大瓶颈 4. CUDA graph 构建 5. 服务就绪
torch.compile 持久化缓存方案(无需代码修改):
# 挂载持久化卷,指向缓存目录
export TORCH_COMPILE_DIR=/persistent-cache/torch-compile
export PYTORCH_KERNEL_CACHE_DIR=/persistent-cache/py-kernel
# 或直接挂载到 vLLM/SGLang Pod 的对应路径
Kubernetes 问题:Pod 使用临时存储(ephemeral storage),扩缩容/重启后本地缓存丢失,每次重新编译。解决方案:挂载 PVC 或 HostPath 持久化缓存卷。
额外发现:OCI 镜像卷在 2026 年已稳定,Dynamic Resource Allocation(DRA)为 GPU 提供结构化属性,Gateway API 增加了推理感知路由扩展。
标签:#vLLM #冷启动 #Kubernetes #torch.compile #GPU调度
四、DeepSeek V4 Flash Vision:开源多模态 MoE 新选择
来源:Shattered.io / MorphLLM / TechTimes / HuggingFace
保留 ✅
理由:2026年8月31日发布,开源权重(MIT),带 vLLM/SGLang 部署配方,是近期最重要的开源多模态发布之一。
核心信息:
- 参数:305B 总,MoE 架构,首次原生多模态(Vision)支持
- 许可:MIT,可商用、自托管、微调
- Serving 支持:vLLM 和 SGLang 均已支持
- DSpark 投机解码:SGLang 支持,通过 --speculative-algorithm DSPARK 启用(无需独立 draft model)
- vLLM 注意事项:需要 --trust-remote-code(自定义 attention 模块尚未进入 upstream Transformers)
vLLM 部署命令:
vllm serve deepseek-ai/DeepSeek-V4-Flash-Vision-Exp \
--trust-remote-code --port 8000
SGLang 部署命令:
python3 -m sglang.launch_server \
--model deepseek-ai/DeepSeek-V4-Flash-Vision-Exp \
--trust-remote-code
重要警告:DeepSeek 自身 ApexBench 和 Agents' Last Exam 的基准分数中,baseline(0731)实际上忽略了多模态部分的输入,因此与 V4-Flash-Vision-Exp 的对比不是同类对比,需独立验证。
标签:#DeepSeek #多模态 #MoE #开源权重 #vLLM #SGLang #投机解码
五、NVIDIA DeepSeek-V4-Flash-NVFP4: Blackwell FP4 量化
来源:HuggingFace - nvidia/DeepSeek-V4-Flash-NVFP4
保留 ✅
理由:NVIDIA 官方量化权重,FP4 精度在 Blackwell B200 上的 Benchmark 数据,可与基线对比,可部署参考。
测试硬件:NVIDIA Blackwell B200 加速引擎:SGLang、vLLM 量化算法:NVFP4(MoE linear operators 权重量化)
| Precision | GPQA Diamond | AA-LCR | τ²-Bench Telecom | SciCode | IFBench |
|---|---|---|---|---|---|
| Baseline | 0.894 | 0.658 | 0.943 | 0.481 | 0.788 |
| NVFP4 | 0.891 | 0.655 | 0.942 | 0.481 | 0.795 |
量化精度损失:极小(IFBench 反而+0.7%),工程可用
SGLang 启动命令:
python3 -m sglang.launch_server \
--model nvidia/DeepSeek-V4-Flash-NVFP4 \
--tensor-parallel-size 8 \
--trust-remote-code
标签:#NVIDIA #FP4量化 #Blackwell #DeepSeek #SGLang
六、Snowflake Semi-Persistence:vLLM 5.6x~19.9x 快速唤醒
来源:Latent.Space / AINews(引用 SemiAnalysis)
保留 ✅(补充信息)
理由:内部 Benchmark 数据具体,多实例管理工程价值高,可与上述冷启动优化交叉验证。
技术方案:将模型权重保留在 pinned CPU memory,vLLM 按需 rehydrate 到 GPU Benchmark 结果:sleep/wake 周期比对比方案快 5.6x~19.9x 对比对象:推测为标准 vLLM 全量加载方案
标签:#vLLM #多实例管理 #Snowflake #内存管理
七、DGX Spark (GB10) Qwen3.8-27B 实测
来源:Kubesimplify - Running Qwen3.8-27B on DGX Spark
保留 ✅( Benchmark 命令参考)
理由:含具体测试命令、吞吐表格、不同框架(vLLM/SGLang/llama.cpp/Ollama)对比数据,可作部署参考。
硬件环境:DGX Spark,GB10,128GB unified memory,CUDA 驱动 580.159.03
llama-benchy 命令参考:
uvx llama-benchy@0.4.0 \
--base-url http://<host>:8000/v1 \
--model <model-name> \
--pp 2048 --tg 128 --depth 0 16384 32768 \
--concurrency 1 2 5 10
吞吐对比摘要(Decode, tg128, FP8): | 配置 | Decode c=1 | |------|-----------| | SGLang FP8 | 7.7 t/s | | SGLang FP8 + NEXTN | 13.4 t/s | | vLLM FP8 + MTP | 13.8 t/s |
标签:#Qwen #DGX-Spark #Benchmark #llama-benchy
丢弃条目
| 条目 | 丢弃理由 |
|---|---|
| TheZvi Substack - HF Attack Postmortem | 分析类内容,无命令/源码/性能数据 |
| Semianalysis - Neoclouds 安全报告 | 商业/安全分析,非工程实践 |
| Irrational Analysis - Hot Chips 2026 | 硬件架构推测,无具体部署命令 |
| Popular AI - GPT-6 vs GPT-5.6 对比 | 模型评测,非推理引擎工程 |
本次筛选汇总
| 类别 | 高价值条目 | 标签 |
|---|---|---|
| 推理引擎横评 | PremAI Blog(含 H100 吞吐表+vLLM 命令) | #推理引擎 #Benchmark |
| GPU 优化 | SGLang BCG(+11.8% 吞吐量,DeepSeek V4 实测) | #SGLang #GPU优化 |
| 冷启动 | vLLM Kubernetes 冷启动 8min→1min(torch.compile 缓存) | #Kubernetes #冷启动 |
| 新模型部署 | DeepSeek V4 Flash Vision(MIT,vLLM/SGLang 配方) | #DeepSeek #多模态 |
| 量化部署 | NVIDIA DeepSeek-V4-Flash-NVFP4(Blackwell FP4) | #NVIDIA #FP4 #Blackwell |
| 多实例 | Snowflake Semi-Persistence(5.6x~19.9x 唤醒加速) | #vLLM #内存管理 |
| Benchmark 命令 | Qwen3.8-27B DGX Spark(llama-benchy 命令) | #Qwen #Benchmark |
建议写入路径:/shared/research-kb/inbox/jay/2026-09-09T1050-jay-engineering-filter-sep09pm.md
后续行动建议: 1. 精读:PremAI Blog 完整吞吐对比表(含并发请求饱和点数据),SGLang BCG 原文(v0.5.15 release note) 2. 验证:DeepSeek V4 Flash Vision 自身 benchmark 声明的 ApexBench 对比需第三方独立验证 3. 主题页更新:建议更新「推理引擎对比」主题页,加入 TGI 维护模式后续影响 + BCG 新默认后端 4. 待核实:Snowflake Semi-Persistence 原文 Benchmark 细节(目前为引用,需溯源)