工程筛选报告 · Jay · 2026-06-28 晚间档

筛选主题: LLM 推理引擎实测命令 / H100 Benchmark 细节 / FlashInfer 依赖冲突排障 / Kubernetes vLLM 部署 / Agent 安全加固

检索范围: - Jarvislabs / Spheron / AIMultiple — 推理引擎 Benchmark 命令与实测数据 - KodeKloud / Techsy.io — Kubernetes MLOps / 推理选型 FAQ - Substack — Alex W (OWASP Agents) / System Design One / O'Reilly RAG 新书


候选条目(共 10 条)

# 条目 来源 工程类型 决策
1 vLLM vs SGLang vs TRT-LLM H100 Benchmarks Jarvislabs Benchmark 命令 ✅ 保留
2 vLLM vs TensorRT-LLM vs SGLang Benchmarks (2026) Spheron 框架对比 + MRV2/NSA ✅ 保留
3 LLM Inference Engines: vLLM vs LMDeploy vs SGLang AIMultiple 依赖冲突 + Crash 率 ✅ 保留
4 MLOps on Kubernetes: Complete 2026 Guide KodeKloud K8s 部署 + KServe CRD ✅ 保留
5 vLLM vs SGLang 2026: H100 Benchmarks Inside Techsy.io 选型 FAQ + 实践 ✅ 保留
6 OWASP Top 10 Agents & AI Vulnerabilities 2026 Substack (Alex W) Agent 安全加固 ✅ 保留
7 Hands-On RAG for Production (O'Reilly 2026) O'Reilly / LetsDataScience RAG 工程全书 ✅ 保留
8 AI Agent Frameworks 2026 — 10 Tested & Compared Agentguides.dev 框架选型对比 ⚠️ 条件保留
9 System Design One: AI Engineering Concepts Substack 工程路线图 ⚠️ 丢弃
10 LangChain vs LlamaIndex 2026 Reddit 讨论 Reddit 框架对比 ⚠️ 丢弃

丢弃理由: - 条目 9:路线图类内容,无具体命令或数据 - 条目 10:讨论帖,非一手工程内容,含大量二手观点


保留条目详情


✅ 条目 1:vLLM vs SGLang vs TRT-LLM H100 Benchmarks — Benchmark 命令 + 实测并发配置

来源: https://jarvislabs.ai/blog/vllm-sglang-trtllm-comparison
发布时间: 2026 年 6 月
可信度: 高 — 明确硬件(H100)、数据集(ShareGPT、RULER 16K)、并发扫点参数
工程类型: Benchmark 实测 / 命令参考

核心工程数据:

推理引擎启动命令(Qwen3-30B-A3B MoE):

# vLLM 启动
vllm serve Qwen/Qwen3-30B-A3B \
  --host 0.0.0.0 --port 8000 \
  --tensor-parallel-size 2

# SGLang 启动
python -m sglang.launch_server \
  --model-path Qwen/Qwen3-30B-A3B \
  --port 8000 --host 0.0.0.0 \
  --tp 2

# TensorRT-LLM 引擎构建 + 启动
trtllm-build --model_dir Qwen/Qwen3-30B-A3B \
  --output_dir ./qwen3_30b_trt_engine \
  --tp 2 --bfloat16

trtllm-serve serve ./qwen3_30b_trt_engine \
  --backend tensorrt --tokenizer Qwen/Qwen3-30B-A3B \
  --max_batch_size 124 --max_input_len 16384 \
  --max_num_tokens 16384 --max_seq_len 16896 \
  --host 0.0.0.0 --port 8000

Benchmark 客户端命令(vllm bench):

vllm bench serve \
  --model Qwen/Qwen3-30B-A3B \
  --base-url http://localhost:8000 \
  --dataset-name custom \
  --dataset-path ./ruler_16384_1000_vllm.jsonl \
  --num-prompts 1000 \
  --max-concurrency 60 \
  --seed 42 \
  --save-result \
  --result-dir ./qwen3_30b_ruler_16k \
  --result-filename qwen3_30b_ruler_16k_c60.json

并发扫值: 120, 180, 240, 300, 360, 420, 480, 540, 600(+ 无上限)

Benchmark 数据集: ShareGPT(chat 风格)、RULER 16K(长上下文)

结论: vLLM 是最强默认选择,TTFT + decode latency + throughput 综合最优;TRT-LLM 需预编译引擎但峰值最高;SGLang 在有重复前缀的工作负载(RadixAttention)下有优势。

建议写入: inference-stack-benchmark-commands.md(命令参考页)


✅ 条目 2:vLLM vs TensorRT-LLM vs SGLang Benchmarks 2026 — MRV2 + NSA + Qwen3.5/Kimi-K2.5 支持

来源: https://www.spheron.network/blog/vllm-vs-tensorrt-llm-vs-sglang-benchmarks
发布时间: 2026 年 6 月
可信度: 高 — 明确框架版本、硬件环境、测试方法
工程类型: Benchmark 对比 / 框架新特性

核心工程数据:

框架版本(2026 年 6 月): - vLLM v0.18.0 - TensorRT-LLM v1.2.0 - SGLang v0.5.9

Benchmark 方法论: - 异步 Python 客户端(aiohttp)生成负载 - 200 prompts,平均输入 512 tokens,平均输出 256 tokens(seed 42) - 并发等级:1, 10, 50, 100 - 每次运行 3 分钟,预热 60 秒 - VRAM 通过 nvidia-smi --query-gpu=memory.used 每秒采样

vLLM MRV2(Model Runner V2): - v0.17.0+ 支持,VLLM_USE_V2_MODEL_RUNNER=1 开启 - GB200 上吞吐量提升 56%(H100 上结果会有差异) - 指南:spheron.network/blog/vllm-model-runner-v2-mrv2-deployment-guide

SGLang NSA(Native Sparse Attention)+ TRT-LLM DSA: - DeepSeek V3.2 支持 --nsa-prefill-backend trtllm + --nsa-decode-backend trtllm - Blackwell 架构上 3x-5x 加速

新增模型支持: Qwen3.5, Kimi-K2.5, GLM-5, MiniMax 2.5

推测解码: 可在任何引擎上叠加 2-5x 延迟改善

建议写入: inference-stack-benchmark-2026-summary.md(版本+特性对比页)


✅ 条目 3:LLM Inference Engines vLLM vs LMDeploy vs SGLang — FlashInfer 依赖冲突 + H100 Crash 率

来源: https://aimultiple.com/inference-engines
发布时间: 2026 年 4 月(benchmark,2026 年 6 月仍相关)
可信度: 高 — 明确依赖版本冲突问题、排障时间成本、量化 crash 数据
工程类型: 依赖冲突排障 / 稳定性量化

核心工程数据:

FlashInfer 依赖冲突(真实排障案例):

# SGLang 安装(会拉取不兼容的 FlashInfer)
pip install "sglang[all]"

# 解决:卸载并安装兼容版本
pip uninstall flashinfer -y
pip install flashinfer==0.2.0.post1 --no-deps  # 跳过依赖检查

# 排障时间成本:6 小时

H100 GPU 利用率 vs Crash 率:

GPU 利用率 Crash 率
0.95 (95%) 100%
0.90 (90%) 30%
0.80 (80%) 0%

关键洞察: 高利用率生产集群必须预留 20% 余量,否则 OOM 导致 100% crash。90% 利用率仍有 30% crash 概率。

Benchmark 方法论细节: - 模型:Llama 3.1 8B,bfloat16 精度 - 引擎配置:vLLM(FlashInfer 后端)、LMDeploy(TurboMind)、SGLang - 预热:20 prompts 触发 JIT 编译、稳定 GPU 时钟 - 运行:1000 prompts × 10 遍 - 性能分层:C++ 原生架构(SGLang、LMDeploy)比 Python 原生(vLLM)吞吐量高 29%

建议写入: inference-gpu-utilization-crash-matrix.md(量化稳定性数据)


✅ 条目 4:MLOps on Kubernetes Complete 2026 Guide — KServe vLLM CRD + OpenAI 兼容 API

来源: https://kodekloud.com/blog/using-kubernetes-for-mlops
发布时间: 2026 年 6 月
可信度: 高 — 真实 Kubernetes manifests + kubectl 命令
工程类型: K8s 部署 / 模型服务 CRD

核心工程数据:

KServe InferenceService CRD(sklearn 模型):

apiVersion: serving.kserve.io/v1beta1
kind: InferenceService
metadata:
  name: fraud-detector
  namespace: ml-prod
spec:
  predictor:
    minReplicas: 1
    maxReplicas: 5
    model:
      modelFormat:
        name: sklearn
      storageUri: "gs://kfserving-examples/models/sklearn/1.0/model"
      resources:
        requests:
          cpu: "100m"
          memory: "512Mi"
        limits:
          cpu: "1"
          memory: "1Gi"

KServe vLLM LLM 部署(OpenAI 兼容):

apiVersion: serving.kserve.io/v1beta1
kind: InferenceService
metadata:
  name: qwen-llm
  namespace: ml-prod
spec:
  predictor:
    model:
      modelFormat:
        name: huggingface
      args:
        - "--model_id"
        - "Qwen/Qwen2.5-0.5B-Instruct"
      resources:
        requests:
          cpu: "4"
          memory: 8Gi
          nvidia.com/gpu: "1"
        limits:
          cpu: "4"
          memory: 8Gi
          nvidia.com/gpu: "1"

LLM 推理调用(OpenAI 兼容):

SERVICE_HOSTNAME=$(kubectl get inferenceservice qwen-llm \
  -n ml-prod -o jsonpath='{.status.url}' | cut -d/ -f3)

curl -H "Host: ${SERVICE_HOSTNAME}" \
  http://${SERVICE_HOSTNAME}/v2/models/${model_name}/infer \
  -d '{
    "model": "qwen-llm",
    "messages": [{"role": "user", "content": "Hello, what can you do?"}],
    "max_tokens": 100
  }'

2026 关键变化: 1. 训练和调度标准化到 Kubernetes 原生批原语(JobSet、Kueue) 2. KServe 将 LLM 服务作为一等公民(vLLM 后端运行时) 3. 同一 CRD 覆盖传统 ML + 生成式 AI

建议写入: kubernetes-kfserving-vllm-deploy-guide.md(CRD 参考页)


✅ 条目 5:vLLM vs SGLang 2026 H100 Benchmarks Inside — 选型决策树 + 常见问题

来源: https://techsy.io/en/blog/vllm-vs-sglang
发布时间: 2026 年 6 月
可信度: 中高 — FAQ 形式覆盖 RadixAttention、LoRA 多租户、Prefill/Decode 分离等工程问题
工程类型: 选型决策 / 工程 FAQ

核心工程洞察(无需完整阅读,可作快速参考):

问题 答案要点
SGLang 比 vLLM 快吗? 视场景而定;有重复前缀时 RadixAttention 有优势
vLLM/SGLang 支持 OpenAI API 格式吗? 支持
Hugging Face TGI 为什么 deprecated? vLLM/SGLang 功能已超越 TGI
SGLang 支持 NVIDIA 和 AMD GPU? 支持
RadixAttention 是什么? KV cache 跨请求复用的注意力机制
哪个引擎更适合结构化 JSON 输出? 两者都支持 XGrammar/LLGuidance,性能相近
支持多 LoRA adapter 单 base 模型吗? 是的
什么是 disaggregated prefill/decode serving? 分离式预填充/解码架构
如何从 TGI 迁移到 vLLM 或 SGLang? API 兼容,迁移成本低
RAG 管道选 vLLM 还是 SGLang? 两者均可,SGLang 在多步推理链更有优势

建议写入: inference-engine-selection-faq.md(快速决策参考)


✅ 条目 6:OWASP Top 10 Agents & AI Vulnerabilities 2026 Cheat Sheet — Agent 安全加固实践

来源: https://open.substack.com/pub/alexewerlof/p/owasp-top-10-ai-llm-agents
作者: Alex W(Substack,OWASP 贡献者)
发布时间: 2026 年 6 月
可信度: 高 — OWASP 标准,附实战缓解示例
工程类型: 安全加固 / Agent 威胁建模

核心工程洞察:

Agent vs LLM 威胁模型区别: - LLM:指令(system prompt + function calls)和数据(用户输入/RAG 文档)拼接为单一字符串 - Agent:在 while 循环中运行,默认减少监督,loop 行为天然放大风险

前 3 条关键缓解:

  1. LLM01 (Prompt Injection) → 语义防火墙 - 用独立、高约束的二次模型评估输入/输出 - 严格最小权限原则(工具权限按需授予)

  2. ASI01 (Agent 权限滥用) → 工具粒度控制 - 不要给 agent 完整 API key - 每个工具独立鉴权

  3. Agent 循环检测 → 最大迭代次数 + 中断条件 python max_iterations = 10 for i in range(max_iterations): action = agent.step() if action.is_final: break

建议写入: agent-security-owasp-top10-2026.md(安全加固检查清单)


✅ 条目 7:Hands-On RAG for Production (O'Reilly 2026) — RAG 工程全书

来源: https://letsdatascience.com/news/hands-on-rag-for-production-guides-building-production-ready-6805315d
作者: Ofer Mendelevitch, Forrest Sheng Bao(O'Reilly)
发布时间: 2026 年 6 月
可信度: 高 — O'Reilly 出版,358 页,10 章,LangChain + pgvector + Anthropic 代码示例
工程类型: RAG 架构设计 / 端到端工程

章节目录(工程相关章节):

章节 内容
文档解析 VLM 解析、chunking 策略
向量检索 pgvector +近似最近邻
LLM 集成 Anthropic Claude 生成
Agentic RAG 工具调用、Model Context Protocol、多 Agent
多模态 RAG 表格、图片、音频、视频
GraphRAG 知识图谱增强

stack 建议(2026 年大多数团队):

组件 推荐选择
检索 Hybrid search(vector + BM25)
向量 DB pgvector(自托管)、Pinecone(托管)
LLM Claude(生产)、GPT-4o(原型)

建议写入: rag-production-stack-2026-recommendations.md(新书摘要 + stack 选型)


分类标签

  • inference-engineering / h100-benchmark / vllm / sglang / tensorrt-llm
  • kubernetes-mlops / kserve / k8s-manifest
  • flashinfer-dependency / gpu-utilization / crash-rate
  • agent-security / owasp / prompt-injection
  • rag-production / langchain / llamaindex / pgvector

建议写入路径

文件 路径 类型
H100 Benchmark 命令参考 /shared/research-kb/inbox/jay/2026-06-28-inference-benchmark-commands.md 草稿
框架版本 + MRV2/NSA 特性 /shared/research-kb/inbox/jay/2026-06-28-inference-stack-2026-summary.md 草稿
GPU 利用率 vs Crash 率矩阵 /shared/research-kb/inbox/jay/2026-06-28-gpu-utilization-crash-matrix.md 草稿
Kubernetes KServe vLLM 部署 /shared/research-kb/inbox/jay/2026-06-28-k8s-kfserving-vllm-guide.md 草稿
推理引擎选型 FAQ /shared/research-kb/inbox/jay/2026-06-28-inference-selection-faq.md 草稿
Agent 安全 OWASP Top10 2026 /shared/research-kb/inbox/jay/2026-06-28-agent-security-owasp-2026.md 草稿
RAG Production Stack 2026 /shared/research-kb/inbox/jay/2026-06-28-rag-production-stack-2026.md 草稿

精读/审稿优先级

优先级 条目 理由
🔴 高 条目 1 (Jarvislabs) Benchmark 命令可直接复用
🔴 高 条目 3 (AIMultiple) Crash 率数据对生产 SLA 关键
🟡 中 条目 4 (KodeKloud) KServe CRD 可作模板
🟡 中 条目 6 (OWASP) Agent 安全是 2026 工程重点
🟢 低 条目 5 (Techsy) FAQ 适合快速查阅

本轮无需主题页更新。