工程筛选报告 · Jay · 2026-06-28 晚间档
筛选主题: LLM 推理引擎实测命令 / H100 Benchmark 细节 / FlashInfer 依赖冲突排障 / Kubernetes vLLM 部署 / Agent 安全加固
检索范围: - Jarvislabs / Spheron / AIMultiple — 推理引擎 Benchmark 命令与实测数据 - KodeKloud / Techsy.io — Kubernetes MLOps / 推理选型 FAQ - Substack — Alex W (OWASP Agents) / System Design One / O'Reilly RAG 新书
候选条目(共 10 条)
| # | 条目 | 来源 | 工程类型 | 决策 |
|---|---|---|---|---|
| 1 | vLLM vs SGLang vs TRT-LLM H100 Benchmarks | Jarvislabs | Benchmark 命令 | ✅ 保留 |
| 2 | vLLM vs TensorRT-LLM vs SGLang Benchmarks (2026) | Spheron | 框架对比 + MRV2/NSA | ✅ 保留 |
| 3 | LLM Inference Engines: vLLM vs LMDeploy vs SGLang | AIMultiple | 依赖冲突 + Crash 率 | ✅ 保留 |
| 4 | MLOps on Kubernetes: Complete 2026 Guide | KodeKloud | K8s 部署 + KServe CRD | ✅ 保留 |
| 5 | vLLM vs SGLang 2026: H100 Benchmarks Inside | Techsy.io | 选型 FAQ + 实践 | ✅ 保留 |
| 6 | OWASP Top 10 Agents & AI Vulnerabilities 2026 | Substack (Alex W) | Agent 安全加固 | ✅ 保留 |
| 7 | Hands-On RAG for Production (O'Reilly 2026) | O'Reilly / LetsDataScience | RAG 工程全书 | ✅ 保留 |
| 8 | AI Agent Frameworks 2026 — 10 Tested & Compared | Agentguides.dev | 框架选型对比 | ⚠️ 条件保留 |
| 9 | System Design One: AI Engineering Concepts | Substack | 工程路线图 | ⚠️ 丢弃 |
| 10 | LangChain vs LlamaIndex 2026 Reddit 讨论 | 框架对比 | ⚠️ 丢弃 |
丢弃理由: - 条目 9:路线图类内容,无具体命令或数据 - 条目 10:讨论帖,非一手工程内容,含大量二手观点
保留条目详情
✅ 条目 1:vLLM vs SGLang vs TRT-LLM H100 Benchmarks — Benchmark 命令 + 实测并发配置
来源: https://jarvislabs.ai/blog/vllm-sglang-trtllm-comparison
发布时间: 2026 年 6 月
可信度: 高 — 明确硬件(H100)、数据集(ShareGPT、RULER 16K)、并发扫点参数
工程类型: Benchmark 实测 / 命令参考
核心工程数据:
推理引擎启动命令(Qwen3-30B-A3B MoE):
# vLLM 启动
vllm serve Qwen/Qwen3-30B-A3B \
--host 0.0.0.0 --port 8000 \
--tensor-parallel-size 2
# SGLang 启动
python -m sglang.launch_server \
--model-path Qwen/Qwen3-30B-A3B \
--port 8000 --host 0.0.0.0 \
--tp 2
# TensorRT-LLM 引擎构建 + 启动
trtllm-build --model_dir Qwen/Qwen3-30B-A3B \
--output_dir ./qwen3_30b_trt_engine \
--tp 2 --bfloat16
trtllm-serve serve ./qwen3_30b_trt_engine \
--backend tensorrt --tokenizer Qwen/Qwen3-30B-A3B \
--max_batch_size 124 --max_input_len 16384 \
--max_num_tokens 16384 --max_seq_len 16896 \
--host 0.0.0.0 --port 8000
Benchmark 客户端命令(vllm bench):
vllm bench serve \
--model Qwen/Qwen3-30B-A3B \
--base-url http://localhost:8000 \
--dataset-name custom \
--dataset-path ./ruler_16384_1000_vllm.jsonl \
--num-prompts 1000 \
--max-concurrency 60 \
--seed 42 \
--save-result \
--result-dir ./qwen3_30b_ruler_16k \
--result-filename qwen3_30b_ruler_16k_c60.json
并发扫值: 120, 180, 240, 300, 360, 420, 480, 540, 600(+ 无上限)
Benchmark 数据集: ShareGPT(chat 风格)、RULER 16K(长上下文)
结论: vLLM 是最强默认选择,TTFT + decode latency + throughput 综合最优;TRT-LLM 需预编译引擎但峰值最高;SGLang 在有重复前缀的工作负载(RadixAttention)下有优势。
建议写入: inference-stack-benchmark-commands.md(命令参考页)
✅ 条目 2:vLLM vs TensorRT-LLM vs SGLang Benchmarks 2026 — MRV2 + NSA + Qwen3.5/Kimi-K2.5 支持
来源: https://www.spheron.network/blog/vllm-vs-tensorrt-llm-vs-sglang-benchmarks
发布时间: 2026 年 6 月
可信度: 高 — 明确框架版本、硬件环境、测试方法
工程类型: Benchmark 对比 / 框架新特性
核心工程数据:
框架版本(2026 年 6 月): - vLLM v0.18.0 - TensorRT-LLM v1.2.0 - SGLang v0.5.9
Benchmark 方法论:
- 异步 Python 客户端(aiohttp)生成负载
- 200 prompts,平均输入 512 tokens,平均输出 256 tokens(seed 42)
- 并发等级:1, 10, 50, 100
- 每次运行 3 分钟,预热 60 秒
- VRAM 通过 nvidia-smi --query-gpu=memory.used 每秒采样
vLLM MRV2(Model Runner V2):
- v0.17.0+ 支持,VLLM_USE_V2_MODEL_RUNNER=1 开启
- GB200 上吞吐量提升 56%(H100 上结果会有差异)
- 指南:spheron.network/blog/vllm-model-runner-v2-mrv2-deployment-guide
SGLang NSA(Native Sparse Attention)+ TRT-LLM DSA:
- DeepSeek V3.2 支持 --nsa-prefill-backend trtllm + --nsa-decode-backend trtllm
- Blackwell 架构上 3x-5x 加速
新增模型支持: Qwen3.5, Kimi-K2.5, GLM-5, MiniMax 2.5
推测解码: 可在任何引擎上叠加 2-5x 延迟改善
建议写入: inference-stack-benchmark-2026-summary.md(版本+特性对比页)
✅ 条目 3:LLM Inference Engines vLLM vs LMDeploy vs SGLang — FlashInfer 依赖冲突 + H100 Crash 率
来源: https://aimultiple.com/inference-engines
发布时间: 2026 年 4 月(benchmark,2026 年 6 月仍相关)
可信度: 高 — 明确依赖版本冲突问题、排障时间成本、量化 crash 数据
工程类型: 依赖冲突排障 / 稳定性量化
核心工程数据:
FlashInfer 依赖冲突(真实排障案例):
# SGLang 安装(会拉取不兼容的 FlashInfer)
pip install "sglang[all]"
# 解决:卸载并安装兼容版本
pip uninstall flashinfer -y
pip install flashinfer==0.2.0.post1 --no-deps # 跳过依赖检查
# 排障时间成本:6 小时
H100 GPU 利用率 vs Crash 率:
| GPU 利用率 | Crash 率 |
|---|---|
| 0.95 (95%) | 100% |
| 0.90 (90%) | 30% |
| 0.80 (80%) | 0% |
关键洞察: 高利用率生产集群必须预留 20% 余量,否则 OOM 导致 100% crash。90% 利用率仍有 30% crash 概率。
Benchmark 方法论细节: - 模型:Llama 3.1 8B,bfloat16 精度 - 引擎配置:vLLM(FlashInfer 后端)、LMDeploy(TurboMind)、SGLang - 预热:20 prompts 触发 JIT 编译、稳定 GPU 时钟 - 运行:1000 prompts × 10 遍 - 性能分层:C++ 原生架构(SGLang、LMDeploy)比 Python 原生(vLLM)吞吐量高 29%
建议写入: inference-gpu-utilization-crash-matrix.md(量化稳定性数据)
✅ 条目 4:MLOps on Kubernetes Complete 2026 Guide — KServe vLLM CRD + OpenAI 兼容 API
来源: https://kodekloud.com/blog/using-kubernetes-for-mlops
发布时间: 2026 年 6 月
可信度: 高 — 真实 Kubernetes manifests + kubectl 命令
工程类型: K8s 部署 / 模型服务 CRD
核心工程数据:
KServe InferenceService CRD(sklearn 模型):
apiVersion: serving.kserve.io/v1beta1
kind: InferenceService
metadata:
name: fraud-detector
namespace: ml-prod
spec:
predictor:
minReplicas: 1
maxReplicas: 5
model:
modelFormat:
name: sklearn
storageUri: "gs://kfserving-examples/models/sklearn/1.0/model"
resources:
requests:
cpu: "100m"
memory: "512Mi"
limits:
cpu: "1"
memory: "1Gi"
KServe vLLM LLM 部署(OpenAI 兼容):
apiVersion: serving.kserve.io/v1beta1
kind: InferenceService
metadata:
name: qwen-llm
namespace: ml-prod
spec:
predictor:
model:
modelFormat:
name: huggingface
args:
- "--model_id"
- "Qwen/Qwen2.5-0.5B-Instruct"
resources:
requests:
cpu: "4"
memory: 8Gi
nvidia.com/gpu: "1"
limits:
cpu: "4"
memory: 8Gi
nvidia.com/gpu: "1"
LLM 推理调用(OpenAI 兼容):
SERVICE_HOSTNAME=$(kubectl get inferenceservice qwen-llm \
-n ml-prod -o jsonpath='{.status.url}' | cut -d/ -f3)
curl -H "Host: ${SERVICE_HOSTNAME}" \
http://${SERVICE_HOSTNAME}/v2/models/${model_name}/infer \
-d '{
"model": "qwen-llm",
"messages": [{"role": "user", "content": "Hello, what can you do?"}],
"max_tokens": 100
}'
2026 关键变化: 1. 训练和调度标准化到 Kubernetes 原生批原语(JobSet、Kueue) 2. KServe 将 LLM 服务作为一等公民(vLLM 后端运行时) 3. 同一 CRD 覆盖传统 ML + 生成式 AI
建议写入: kubernetes-kfserving-vllm-deploy-guide.md(CRD 参考页)
✅ 条目 5:vLLM vs SGLang 2026 H100 Benchmarks Inside — 选型决策树 + 常见问题
来源: https://techsy.io/en/blog/vllm-vs-sglang
发布时间: 2026 年 6 月
可信度: 中高 — FAQ 形式覆盖 RadixAttention、LoRA 多租户、Prefill/Decode 分离等工程问题
工程类型: 选型决策 / 工程 FAQ
核心工程洞察(无需完整阅读,可作快速参考):
| 问题 | 答案要点 |
|---|---|
| SGLang 比 vLLM 快吗? | 视场景而定;有重复前缀时 RadixAttention 有优势 |
| vLLM/SGLang 支持 OpenAI API 格式吗? | 支持 |
| Hugging Face TGI 为什么 deprecated? | vLLM/SGLang 功能已超越 TGI |
| SGLang 支持 NVIDIA 和 AMD GPU? | 支持 |
| RadixAttention 是什么? | KV cache 跨请求复用的注意力机制 |
| 哪个引擎更适合结构化 JSON 输出? | 两者都支持 XGrammar/LLGuidance,性能相近 |
| 支持多 LoRA adapter 单 base 模型吗? | 是的 |
| 什么是 disaggregated prefill/decode serving? | 分离式预填充/解码架构 |
| 如何从 TGI 迁移到 vLLM 或 SGLang? | API 兼容,迁移成本低 |
| RAG 管道选 vLLM 还是 SGLang? | 两者均可,SGLang 在多步推理链更有优势 |
建议写入: inference-engine-selection-faq.md(快速决策参考)
✅ 条目 6:OWASP Top 10 Agents & AI Vulnerabilities 2026 Cheat Sheet — Agent 安全加固实践
来源: https://open.substack.com/pub/alexewerlof/p/owasp-top-10-ai-llm-agents
作者: Alex W(Substack,OWASP 贡献者)
发布时间: 2026 年 6 月
可信度: 高 — OWASP 标准,附实战缓解示例
工程类型: 安全加固 / Agent 威胁建模
核心工程洞察:
Agent vs LLM 威胁模型区别: - LLM:指令(system prompt + function calls)和数据(用户输入/RAG 文档)拼接为单一字符串 - Agent:在 while 循环中运行,默认减少监督,loop 行为天然放大风险
前 3 条关键缓解:
-
LLM01 (Prompt Injection) → 语义防火墙 - 用独立、高约束的二次模型评估输入/输出 - 严格最小权限原则(工具权限按需授予)
-
ASI01 (Agent 权限滥用) → 工具粒度控制 - 不要给 agent 完整 API key - 每个工具独立鉴权
-
Agent 循环检测 → 最大迭代次数 + 中断条件
python max_iterations = 10 for i in range(max_iterations): action = agent.step() if action.is_final: break
建议写入: agent-security-owasp-top10-2026.md(安全加固检查清单)
✅ 条目 7:Hands-On RAG for Production (O'Reilly 2026) — RAG 工程全书
来源: https://letsdatascience.com/news/hands-on-rag-for-production-guides-building-production-ready-6805315d
作者: Ofer Mendelevitch, Forrest Sheng Bao(O'Reilly)
发布时间: 2026 年 6 月
可信度: 高 — O'Reilly 出版,358 页,10 章,LangChain + pgvector + Anthropic 代码示例
工程类型: RAG 架构设计 / 端到端工程
章节目录(工程相关章节):
| 章节 | 内容 |
|---|---|
| 文档解析 | VLM 解析、chunking 策略 |
| 向量检索 | pgvector +近似最近邻 |
| LLM 集成 | Anthropic Claude 生成 |
| Agentic RAG | 工具调用、Model Context Protocol、多 Agent |
| 多模态 RAG | 表格、图片、音频、视频 |
| GraphRAG | 知识图谱增强 |
stack 建议(2026 年大多数团队):
| 组件 | 推荐选择 |
|---|---|
| 检索 | Hybrid search(vector + BM25) |
| 向量 DB | pgvector(自托管)、Pinecone(托管) |
| LLM | Claude(生产)、GPT-4o(原型) |
建议写入: rag-production-stack-2026-recommendations.md(新书摘要 + stack 选型)
分类标签
inference-engineering/h100-benchmark/vllm/sglang/tensorrt-llmkubernetes-mlops/kserve/k8s-manifestflashinfer-dependency/gpu-utilization/crash-rateagent-security/owasp/prompt-injectionrag-production/langchain/llamaindex/pgvector
建议写入路径
| 文件 | 路径 | 类型 |
|---|---|---|
| H100 Benchmark 命令参考 | /shared/research-kb/inbox/jay/2026-06-28-inference-benchmark-commands.md |
草稿 |
| 框架版本 + MRV2/NSA 特性 | /shared/research-kb/inbox/jay/2026-06-28-inference-stack-2026-summary.md |
草稿 |
| GPU 利用率 vs Crash 率矩阵 | /shared/research-kb/inbox/jay/2026-06-28-gpu-utilization-crash-matrix.md |
草稿 |
| Kubernetes KServe vLLM 部署 | /shared/research-kb/inbox/jay/2026-06-28-k8s-kfserving-vllm-guide.md |
草稿 |
| 推理引擎选型 FAQ | /shared/research-kb/inbox/jay/2026-06-28-inference-selection-faq.md |
草稿 |
| Agent 安全 OWASP Top10 2026 | /shared/research-kb/inbox/jay/2026-06-28-agent-security-owasp-2026.md |
草稿 |
| RAG Production Stack 2026 | /shared/research-kb/inbox/jay/2026-06-28-rag-production-stack-2026.md |
草稿 |
精读/审稿优先级
| 优先级 | 条目 | 理由 |
|---|---|---|
| 🔴 高 | 条目 1 (Jarvislabs) | Benchmark 命令可直接复用 |
| 🔴 高 | 条目 3 (AIMultiple) | Crash 率数据对生产 SLA 关键 |
| 🟡 中 | 条目 4 (KodeKloud) | KServe CRD 可作模板 |
| 🟡 中 | 条目 6 (OWASP) | Agent 安全是 2026 工程重点 |
| 🟢 低 | 条目 5 (Techsy) | FAQ 适合快速查阅 |
本轮无需主题页更新。