Jay 五类目简报 · 2026-10-10 下午批次
本次主题:推理引擎决策框架 / Vector DB 基准对比 / Agent Memory 生产实践 / CSDN 高价值工程文
📊 分类总览
| 类别 | 高价值条目 | 可信度 | 行动建议 |
|---|---|---|---|
| database | Qdrant vs pgvectorscale vs Milvus 2026 基准 | ★★★★☆ | 精读 |
| backend | vLLM vs SGLang vs TensorRT-LLM H100 实测 + 决策树 | ★★★★★ | 精读 |
| cloud-native | K8s 1.36 发布 / AI 推理 K8s 部署模式 | ★★★☆☆ | 浏览 |
| csdn | 阿里云函数计算 vLLM vs SGLang 压测 / SGLang 多卡部署 | ★★★★☆ | 收藏 |
| reproduction | Spheron 三引擎 Docker 命令集 / SitePoint vLLM 部署指南 | ★★★★★ | 实操 |
🗄️ DATABASE · Vector DB 2026 基准对比
🔴 高价值:Qdrant vs pgvectorscale vs Milvus 生产选型
来源:Salt Technologies AI Benchmark 2026 Q1 + Actian Tiger Data 实测
核心量化数据(50M 768-dim vectors,99% recall,AWS r6id.4xlarge):
| 数据库 | QPS | P95 延迟 | P99 延迟 | 特点 |
|---|---|---|---|---|
| pgvectorscale | 471 | 60ms | 75ms | Postgres 内核,SQL 联合查询 |
| Qdrant | 41 | 37ms | 39ms | 最低尾延迟,Rust 实现 |
| Pinecone s1 | ~40 | ~1700ms | — | 全托管,运维最简 |
关键洞察: - pgvectorscale 吞吐量是 Qdrant 的 11.4x(471 vs 41 QPS) - 但 Qdrant P99 延迟比 pgvectorscale 低 48%(39ms vs 75ms) - 两者定位不同:pgvectorscale 适合高吞吐批处理,Qdrant 适合低延迟交互
Milvus 340M vectors Reddit 实测: - Milvus 异构节点(ingest/query 分离)在大规模并发写入时干扰更小 - Qdrant 同构节点在中等规模(<100M)运营更简单
基准工具:VectorDBBench(Zilliz 开源,6 系统标准化对比) - 引用:https://github.com/zilliztech/VectorDBBench - 适用场景:选型前在真实硬件上跑自己的数据集
可信度:★★★★☆(多源交叉,第三方实测) 引用: - https://www.salttechno.ai/datasets/vector-database-performance-benchmark-2026 - https://www.actian.com/blog/databases/how-to-evaluate-vector-databases-in-2026
⚙️ BACKEND · 推理引擎 H100 2026 决策框架
🔴 高价值:Spheron H100 三引擎同框实测
来源:https://www.spheron.network/blog/vllm-vs-tensorrt-llm-vs-sglang-benchmarks
测试条件:H100 80GB + Llama 3.3 70B FP8 + 200 prompts / 60s warmup / 3min 测量窗口
| 引擎 | 50 并发吞吐 | TTFT p50 | 冷启动 | 生产适用场景 |
|---|---|---|---|---|
| vLLM | 1,850 tok/s | 120ms | ~62s | 通用首选,Blackwell 支持 |
| TensorRT-LLM | 2,100 tok/s | 105ms | ~28min | 极致吞吐,NVIDIA 优化 |
| SGLang | 1,920 tok/s | 112ms | ~58s | 前缀复用 / 多轮 Agent |
Winder.AI 实测数据(H100,Llama 3.1 8B,1K ShareGPT prompts):
| 引擎 | 1 并发 | 10 并发 | 50 并发 | 50 并发 TTFT | $ / M tokens |
|---|---|---|---|---|---|
| vLLM | 150 | 1,235 | 3,688 | 0.68s | $0.26 |
| SGLang | 154 | 1,233 | 3,617 | 0.73s | $0.27 |
| TensorRT-LLM | 141 | 1,127 | 3,219 | 0.54s | $0.30 |
| llama.cpp | 185 | 539 | 703 | 0.98s | $1.38 |
| Ollama | 79 | 239 | 277 | 1.7s | $3.50 |
决策树(Spheron 2026):
选 vLLM:当你不确定生产负载特征,Blackwell 需支持,单模型生态最广
选 SGLang:前缀共享率 >60%,多轮 Agent,结构化输出,AMD 生态
选 TensorRT-LLM:极致单次吞吐预算,冷启动可接受(~28min),NVIDIA 生产
选 llama.cpp:CPU/本地推理,无 GPU
选 Ollama:快速原型,个人使用
SGLang vs vLLM 前缀缓存量化阈值(Spheron 2026): - 前缀共享 <30%:两者差距 <5% - 前缀共享 30-60%:vLLM 略优 - 前缀共享 >60%:SGLang 领先,最高 5x(来自 LMSYS 原始数据,第三方未完全复现) - 80% 共享 + 50 并发:SGLang TTFT p50 从 310ms 降至 195ms(-37%)
可信度:★★★★★(实测数据 + 可复现命令) 引用: - https://www.spheron.network/blog/vllm-vs-tensorrt-llm-vs-sglang-benchmarks - https://winder.ai/vllm-vs-ollama-vs-sglang-llm-inference-comparison
🟡 中高价值:SitePoint vLLM 生产部署完整指南
来源:https://www.sitepoint.com/vllm-production-deployment-guide-2026
高价值命令:
# Docker 部署(安全实践)
docker run -d \
--gpus all \
--shm-size=10g \
--ipc=host \
--env-file .env \
--ulimit memlock=-1 \
vllm/vllm-openai:latest \
--model meta-llama/Llama-3.3-70B-Instruct \
--tensor-parallel-size 4 \
--gpu-memory-utilization 0.92 \
--enable-prefix-caching
关键配置:
- --shm-size=10g:共享内存防止 PagedAttention 性能下降
- --ipc=host:进程间通信最优模式
- --env-file .env:API keys 不在命令行明文(chmod 600)
- PagedAttention 实际收益:7B FP16 H100 80GB 并发从 30 提升到 100+
Benchmark 命令:
python vllm/benchmarks/benchmark_serving.py \
--backend vllm \
--model meta-llama/Llama-3.3-70B-Instruct \
--request-rate 50
输出解读:Mean TTFT / P99 TTFT / E2E latency / Throughput
可信度:★★★★☆(生产级命令 + 安全实践) 引用:https://www.sitepoint.com/vllm-production-deployment-guide-2026
☁️ CLOUD-NATIVE · K8s 1.36 + AI 推理部署
🟢 信息补充:Kubernetes 1.36 发布(2026-08-20)
来源:https://en.wikipedia.org/wiki/Kubernetes
版本:1.36.4(2026-08-20 stable) 特性: - 自动化 rollouts/rollbacks 持续完善 - Gateway API 稳定性提升 - 结构化参数验证增强
AI 推理 K8s 部署模式(来自多源综合): - vLLM/SGLang 作为 Deployment + HPA(Horizontal Pod Autoscaler) - GPU 节点池 + node selector - TensorRT-LLM 需要 ConfigMap 存编译产物(冷启动 28min 代价)
可信度:★★★☆☆(基础信息) 引用:https://kubernetes.io
💻 CSDN 高价值 · 阿里云函数计算压测 / SGLang 多卡部署
🟡 高价值:阿里云函数计算 vLLM vs SGLang 实测
来源:https://help.aliyun.com/zh/functioncompute/performance-comparison-of-deploying-qwen-models-using-sglang-and-vllm
测试环境:
- GPU:Ada 系列(极速模式毫秒级快照)
- SGLang:v0.4.6.post2-cu124
- vLLM:v0.8.5
- 压测工具:魔搭 evalscope
- NAS:通用 NAS-性能型(600MB/s 初始带宽)
核心数据(Qwen-QWQ-32B-AWQ,单卡 vs 双卡):
| 指标 | vLLM 单卡 | SGLang 单卡 | SGLang 双卡 |
|---|---|---|---|
| 吞吐量 | 35 tok/s | 约 35 tok/s | 50 tok/s |
| 最大并发建议 | ≤5 | ≤5 | ≤5 |
| 双卡提升幅度 | — | — | +43% |
关键结论: - TTFT:SGLang 优于 vLLM 15-50% - TPOT:SGLang 优于 vLLM 约 10% - 吞吐量:SGLang 优于 vLLM 约 10% - 模型越大(QWQ-32B),双卡收益越明显(20-50%) - 显存利用率:启动后两者均接近 100%(模型参数 + KV Cache)
SGLang vs vLLM 多卡并行(阿里云实测): - SGLang 启动速度比 vLLM 快约 30% - 两者启动耗时均在分钟级别
CSDN 补充(https://blog.csdn.net/Gaga246/article/details/155610267): - 四大框架定位总结: - vLLM:生态最完整的全能选手 - SGLang:高并发和结构化生成独树一帜 - LMDeploy:国产生态最佳搭档 - TensorRT-LLM:吞吐量性能天花板但部署成本最高
可信度:★★★★☆(国内云厂商实测,有具体命令和环境) 引用: - https://help.aliyun.com/zh/functioncompute/performance-comparison-of-deploying-qwen-models-using-sglang-and-vllm - https://blog.csdn.net/Gaga246/article/details/155610267
🔬 REPRODUCTION · 可复现命令集
🔴 高价值:Spheron 三引擎 Docker 部署命令
来源:https://www.spheron.network/blog/vllm-vs-tensorrt-llm-vs-sglang-benchmarks
vLLM:
docker run -d \
--gpus all \
--shm-size=10g \
--ipc=host \
-p 8000:8000 \
vllm/vllm-openai:latest \
--model meta-llama/Llama-3.3-70B-Instruct \
--gpu-memory-utilization 0.9
SGLang:
docker run -d \
--gpus all \
--shm-size=10g \
-p 3000:3000 \
lmsysorg/sglang:latest \
--model-path meta-llama/Llama-3.3-70B-Instruct \
--mem-fraction-static 0.92 \
--host 0.0.0.0 \
--port 3000
TensorRT-LLM(需编译,冷启动长):
# 编译阶段(耗时 ~28min)
docker run --rm --gpus all \
-v /tmp:/tmp \
-v ${MODEL_DIR}:/engine \
nvidia/trtllm:latest \
trtllm-build \
--model_dir /engine \
--output_dir /engine/engine_output \
--fp8
# 服务阶段
docker run -d --gpus all -p 8000:8000 \
nvidia/trtllm:latest \
trtllm-server \
--engine_dir /engine/engine_output \
--tokenizer /engine
可信度:★★★★★(官方文档 + 实测验证) 引用:https://www.spheron.network/blog/vllm-vs-tensorrt-llm-vs-sglang-benchmarks
🏷️ 分类标签
推理引擎 vLLM SGLang TensorRT-LLM VectorDB Qdrant pgvectorscale Milvus H100 Benchmark Docker K8s Agent-Memory CSDN 阿里云 函数计算
💡 后续行动建议
- 精读:Spheron 三引擎 H100 决策框架 + SitePoint vLLM 部署命令 → 更新 inference-engineering 主题页
- 核实:阿里云实测中 SGLang 双卡 50 tok/s 数据(相比 vLLM 提升 43%)—需在自有环境验证
- 跟踪:VectorDBBench 开源工具 + pgvectorscale 50M vector 实测数据
- 实践:在 GPU 环境复现 SGLang vs vLLM prefix caching 量化阈值(>60% 共享率场景)
📋 写入路径
已写入:/shared/research-kb/inbox/jay/2026-10-10T1505-jay-five-category-briefing.md
建议后续写入:
- /shared/research-kb/inbox/jay/2026-10-10-inference-decision-framework-vllm-sglang-trt-h100.md(来自 backend 节选)
- /shared/research-kb/inbox/jay/2026-10-10-vector-db-benchmark-2026-qdrant-pgvectorscale.md(来自 database 节选)
Jay · 2026-10-10 15:05 CST | 五类目简报 | 未执行 Git 写入