Jay 五类目简报 · 2026-10-10 下午批次

本次主题:推理引擎决策框架 / Vector DB 基准对比 / Agent Memory 生产实践 / CSDN 高价值工程文


📊 分类总览

类别 高价值条目 可信度 行动建议
database Qdrant vs pgvectorscale vs Milvus 2026 基准 ★★★★☆ 精读
backend vLLM vs SGLang vs TensorRT-LLM H100 实测 + 决策树 ★★★★★ 精读
cloud-native K8s 1.36 发布 / AI 推理 K8s 部署模式 ★★★☆☆ 浏览
csdn 阿里云函数计算 vLLM vs SGLang 压测 / SGLang 多卡部署 ★★★★☆ 收藏
reproduction Spheron 三引擎 Docker 命令集 / SitePoint vLLM 部署指南 ★★★★★ 实操

🗄️ DATABASE · Vector DB 2026 基准对比

🔴 高价值:Qdrant vs pgvectorscale vs Milvus 生产选型

来源:Salt Technologies AI Benchmark 2026 Q1 + Actian Tiger Data 实测

核心量化数据(50M 768-dim vectors,99% recall,AWS r6id.4xlarge):

数据库 QPS P95 延迟 P99 延迟 特点
pgvectorscale 471 60ms 75ms Postgres 内核,SQL 联合查询
Qdrant 41 37ms 39ms 最低尾延迟,Rust 实现
Pinecone s1 ~40 ~1700ms — 全托管,运维最简

关键洞察: - pgvectorscale 吞吐量是 Qdrant 的 11.4x(471 vs 41 QPS) - 但 Qdrant P99 延迟比 pgvectorscale 低 48%(39ms vs 75ms) - 两者定位不同:pgvectorscale 适合高吞吐批处理,Qdrant 适合低延迟交互

Milvus 340M vectors Reddit 实测: - Milvus 异构节点(ingest/query 分离)在大规模并发写入时干扰更小 - Qdrant 同构节点在中等规模(<100M)运营更简单

基准工具:VectorDBBench(Zilliz 开源,6 系统标准化对比) - 引用:https://github.com/zilliztech/VectorDBBench - 适用场景:选型前在真实硬件上跑自己的数据集

可信度:★★★★☆(多源交叉,第三方实测) 引用: - https://www.salttechno.ai/datasets/vector-database-performance-benchmark-2026 - https://www.actian.com/blog/databases/how-to-evaluate-vector-databases-in-2026


⚙️ BACKEND · 推理引擎 H100 2026 决策框架

🔴 高价值:Spheron H100 三引擎同框实测

来源:https://www.spheron.network/blog/vllm-vs-tensorrt-llm-vs-sglang-benchmarks

测试条件:H100 80GB + Llama 3.3 70B FP8 + 200 prompts / 60s warmup / 3min 测量窗口

引擎 50 并发吞吐 TTFT p50 冷启动 生产适用场景
vLLM 1,850 tok/s 120ms ~62s 通用首选,Blackwell 支持
TensorRT-LLM 2,100 tok/s 105ms ~28min 极致吞吐,NVIDIA 优化
SGLang 1,920 tok/s 112ms ~58s 前缀复用 / 多轮 Agent

Winder.AI 实测数据(H100,Llama 3.1 8B,1K ShareGPT prompts):

引擎 1 并发 10 并发 50 并发 50 并发 TTFT $ / M tokens
vLLM 150 1,235 3,688 0.68s $0.26
SGLang 154 1,233 3,617 0.73s $0.27
TensorRT-LLM 141 1,127 3,219 0.54s $0.30
llama.cpp 185 539 703 0.98s $1.38
Ollama 79 239 277 1.7s $3.50

决策树(Spheron 2026):

选 vLLM:当你不确定生产负载特征,Blackwell 需支持,单模型生态最广
选 SGLang:前缀共享率 >60%,多轮 Agent,结构化输出,AMD 生态
选 TensorRT-LLM:极致单次吞吐预算,冷启动可接受(~28min),NVIDIA 生产
选 llama.cpp:CPU/本地推理,无 GPU
选 Ollama:快速原型,个人使用

SGLang vs vLLM 前缀缓存量化阈值(Spheron 2026): - 前缀共享 <30%:两者差距 <5% - 前缀共享 30-60%:vLLM 略优 - 前缀共享 >60%:SGLang 领先,最高 5x(来自 LMSYS 原始数据,第三方未完全复现) - 80% 共享 + 50 并发:SGLang TTFT p50 从 310ms 降至 195ms(-37%)

可信度:★★★★★(实测数据 + 可复现命令) 引用: - https://www.spheron.network/blog/vllm-vs-tensorrt-llm-vs-sglang-benchmarks - https://winder.ai/vllm-vs-ollama-vs-sglang-llm-inference-comparison


🟡 中高价值:SitePoint vLLM 生产部署完整指南

来源:https://www.sitepoint.com/vllm-production-deployment-guide-2026

高价值命令:

# Docker 部署(安全实践)
docker run -d \
  --gpus all \
  --shm-size=10g \
  --ipc=host \
  --env-file .env \
  --ulimit memlock=-1 \
  vllm/vllm-openai:latest \
  --model meta-llama/Llama-3.3-70B-Instruct \
  --tensor-parallel-size 4 \
  --gpu-memory-utilization 0.92 \
  --enable-prefix-caching

关键配置: - --shm-size=10g:共享内存防止 PagedAttention 性能下降 - --ipc=host:进程间通信最优模式 - --env-file .env:API keys 不在命令行明文(chmod 600) - PagedAttention 实际收益:7B FP16 H100 80GB 并发从 30 提升到 100+

Benchmark 命令:

python vllm/benchmarks/benchmark_serving.py \
  --backend vllm \
  --model meta-llama/Llama-3.3-70B-Instruct \
  --request-rate 50

输出解读:Mean TTFT / P99 TTFT / E2E latency / Throughput

可信度:★★★★☆(生产级命令 + 安全实践) 引用:https://www.sitepoint.com/vllm-production-deployment-guide-2026


☁️ CLOUD-NATIVE · K8s 1.36 + AI 推理部署

🟢 信息补充:Kubernetes 1.36 发布(2026-08-20)

来源:https://en.wikipedia.org/wiki/Kubernetes

版本:1.36.4(2026-08-20 stable) 特性: - 自动化 rollouts/rollbacks 持续完善 - Gateway API 稳定性提升 - 结构化参数验证增强

AI 推理 K8s 部署模式(来自多源综合): - vLLM/SGLang 作为 Deployment + HPA(Horizontal Pod Autoscaler) - GPU 节点池 + node selector - TensorRT-LLM 需要 ConfigMap 存编译产物(冷启动 28min 代价)

可信度:★★★☆☆(基础信息) 引用:https://kubernetes.io


💻 CSDN 高价值 · 阿里云函数计算压测 / SGLang 多卡部署

🟡 高价值:阿里云函数计算 vLLM vs SGLang 实测

来源:https://help.aliyun.com/zh/functioncompute/performance-comparison-of-deploying-qwen-models-using-sglang-and-vllm

测试环境: - GPU:Ada 系列(极速模式毫秒级快照) - SGLang:v0.4.6.post2-cu124 - vLLM:v0.8.5 - 压测工具:魔搭 evalscope - NAS:通用 NAS-性能型(600MB/s 初始带宽)

核心数据(Qwen-QWQ-32B-AWQ,单卡 vs 双卡):

指标 vLLM 单卡 SGLang 单卡 SGLang 双卡
吞吐量 35 tok/s 约 35 tok/s 50 tok/s
最大并发建议 ≤5 ≤5 ≤5
双卡提升幅度 — — +43%

关键结论: - TTFT:SGLang 优于 vLLM 15-50% - TPOT:SGLang 优于 vLLM 约 10% - 吞吐量:SGLang 优于 vLLM 约 10% - 模型越大(QWQ-32B),双卡收益越明显(20-50%) - 显存利用率:启动后两者均接近 100%(模型参数 + KV Cache)

SGLang vs vLLM 多卡并行(阿里云实测): - SGLang 启动速度比 vLLM 快约 30% - 两者启动耗时均在分钟级别

CSDN 补充(https://blog.csdn.net/Gaga246/article/details/155610267): - 四大框架定位总结: - vLLM:生态最完整的全能选手 - SGLang:高并发和结构化生成独树一帜 - LMDeploy:国产生态最佳搭档 - TensorRT-LLM:吞吐量性能天花板但部署成本最高

可信度:★★★★☆(国内云厂商实测,有具体命令和环境) 引用: - https://help.aliyun.com/zh/functioncompute/performance-comparison-of-deploying-qwen-models-using-sglang-and-vllm - https://blog.csdn.net/Gaga246/article/details/155610267


🔬 REPRODUCTION · 可复现命令集

🔴 高价值:Spheron 三引擎 Docker 部署命令

来源:https://www.spheron.network/blog/vllm-vs-tensorrt-llm-vs-sglang-benchmarks

vLLM:

docker run -d \
  --gpus all \
  --shm-size=10g \
  --ipc=host \
  -p 8000:8000 \
  vllm/vllm-openai:latest \
  --model meta-llama/Llama-3.3-70B-Instruct \
  --gpu-memory-utilization 0.9

SGLang:

docker run -d \
  --gpus all \
  --shm-size=10g \
  -p 3000:3000 \
  lmsysorg/sglang:latest \
  --model-path meta-llama/Llama-3.3-70B-Instruct \
  --mem-fraction-static 0.92 \
  --host 0.0.0.0 \
  --port 3000

TensorRT-LLM(需编译,冷启动长):

# 编译阶段(耗时 ~28min)
docker run --rm --gpus all \
  -v /tmp:/tmp \
  -v ${MODEL_DIR}:/engine \
  nvidia/trtllm:latest \
  trtllm-build \
  --model_dir /engine \
  --output_dir /engine/engine_output \
  --fp8

# 服务阶段
docker run -d --gpus all -p 8000:8000 \
  nvidia/trtllm:latest \
  trtllm-server \
  --engine_dir /engine/engine_output \
  --tokenizer /engine

可信度:★★★★★(官方文档 + 实测验证) 引用:https://www.spheron.network/blog/vllm-vs-tensorrt-llm-vs-sglang-benchmarks


🏷️ 分类标签

推理引擎 vLLM SGLang TensorRT-LLM VectorDB Qdrant pgvectorscale Milvus H100 Benchmark Docker K8s Agent-Memory CSDN 阿里云 函数计算


💡 后续行动建议

  1. 精读:Spheron 三引擎 H100 决策框架 + SitePoint vLLM 部署命令 → 更新 inference-engineering 主题页
  2. 核实:阿里云实测中 SGLang 双卡 50 tok/s 数据(相比 vLLM 提升 43%)—需在自有环境验证
  3. 跟踪:VectorDBBench 开源工具 + pgvectorscale 50M vector 实测数据
  4. 实践:在 GPU 环境复现 SGLang vs vLLM prefix caching 量化阈值(>60% 共享率场景)

📋 写入路径

已写入:/shared/research-kb/inbox/jay/2026-10-10T1505-jay-five-category-briefing.md

建议后续写入: - /shared/research-kb/inbox/jay/2026-10-10-inference-decision-framework-vllm-sglang-trt-h100.md(来自 backend 节选) - /shared/research-kb/inbox/jay/2026-10-10-vector-db-benchmark-2026-qdrant-pgvectorscale.md(来自 database 节选)


Jay · 2026-10-10 15:05 CST | 五类目简报 | 未执行 Git 写入