知识库草稿 · Jay · 2026-09-26 下午

本次主题

LLM 推理引擎深度对比(vLLM vs SGLang vs TensorRT-LLM)· Agentic AI 框架 2026 生产选型


一、LLM 推理引擎架构深度对比(inferenceengineering.tech)

背景说明

三引擎功能特性在 2026 年已基本收敛(continuous batching、Paged KV cache、prefix caching、quantization、speculative decoding、tensor/pipeline parallelism),选择差异转向架构设计哲学、性能天花板和运维复杂度。

架构差异

vLLM — PagedAttention + Python-first - 调度层:Python 级 scheduler,维护 waiting/running/swapped 优先级队列 - Attention 后端:Pluggable(FlashAttention-2、FlashInfer、xFormers),默认 FlashInfer - KV cache 管理:PagedAttention,类 OS 虚拟内存页表,碎片率从 ~40% 降至 <4% - Python 调度开销:200–500 μs/cycle(高并发时由 async 引擎隐藏部分) - 模型覆盖:400+ 架构家族(HuggingFace 新模型接入 50–200 行 Python class) - 硬件支持:NVIDIA (CUDA)、AMD (ROCm)、TPU (XLA)、Intel Gaudi (HPU)、CPU fallback

SGLang — RadixAttention + 结构化生成运行时 - 核心创新:RadixAttention,用 radix trie 管理所有请求的 KV 页,实现跨请求长公共前缀复用 - 前缀命中收益:few-shot 场景消除 70–90% prefill 计算 - 结构化输出:constrained decoding 在 scheduler 层实现,非后验 token filter,overhead 更低 - MoE 优化:EP (Expert Parallelism) 深度集成,DeepSeek-R1/V3 (671B) 在 GB200 NVL72 上性能领先 - C++/CUDA vs Python:并发 100+ 请求时,调度开销低于 vLLM - 模型覆盖:150+ 架构

TensorRT-LLM — 编译引擎路径 - 流程:Checkpoint → TRT 权重格式 → trtllm-build 编译 → .engine 文件 - 提速三来源:(1) 算子融合更激进,(2) CUDA Graph 覆盖整个 forward pass,(3) auto-tuned kernel(在实际硬件上 benchmark 选择最快 kernel 变体) - 运维代价:换模型/量化级别/序列长度/GPU 类型 → 重新编译(大型模型 2+ 小时) - 硬件支持:仅 NVIDIA(Ampere A100 / Hopper H100-H200 / Blackwell B200-GB200) - 模型覆盖:~50 架构(Llama、Mistral、Qwen、DeepSeek、T5 家族为主)

H100 实测性能数据

模型 引擎 配置 吞吐量
Llama-3.1 70B vLLM TP=4, FP8 ~2,800 tok/s
Llama-3.1 70B TRT-LLM TP=4, FP8, compiled ~3,400 tok/s
Llama-3.1 70B SGLang TP=4, FP8 ~2,900 tok/s
DeepSeek-R1 671B SGLang EP=8, FP8 (8× H100) ~1,100 tok/s
Llama-3.1 8B vLLM TP=1, FP8 ~12,000 tok/s
Llama-3.1 8B TRT-LLM TP=1, FP8, compiled ~14,500 tok/s

结论:TRT-LLM 在大 batch size + dense 模型优势最显著(15–25% 吞吐领先)。低 batch(延迟敏感单用户)场景下差距大幅收窄,内存带宽主导。

选型决策树

  1. 非 NVIDIA 硬件 → vLLM(或 SGLang for AMD)
  2. 高并发 + 共享前缀(few-shot、多轮对话) → SGLang(RadixAttention 命中率高)
  3. 大规模 MoE(DeepSeek 级) → SGLang(EP 深度优化)
  4. 结构化输出(JSON schema/regex/grammar) → SGLang(scheduler 层原生支持)
  5. dense 模型 + 最大吞吐 + 愿意接受编译开销 → TensorRT-LLM
  6. 快速原型 / 最大模型覆盖 / 多硬件 → vLLM

运维复杂度:vLLM ≈ SGLang(低)< TRT-LLM(高,需 CI 流水线管理 .engine 版本)

评价:该文是 2026 年推理引擎选型最完整的工程级对比,涵盖 PagedAttention vs RadixAttention 架构差异、实测 benchmark 数据和真实决策树。非营销文,值得生产规划参考。

来源:https://inferenceengineering.tech/learn/vllm-vs-sglang-vs-tensorrt-llm


二、Agentic AI 框架 2026 生产对比(uvik.net)

核心观点

框架选择对同一模型上 agent benchmark 结果影响可达 30 个百分点(引用 Princeton HAL benchmark:Claude Opus 4 在不同 scaffold 下 GAIA 得分 64.9% vs 57.6%)。

五强生产框架

LangGraph — 有状态生产工作流默认选 - 定位:图状态机,面向需要审计追溯、确定性控制、人工审批的生产系统 - 标杆客户:Klarna、Uber、LinkedIn、BlackRock、Cisco、Elastic、JPMorgan、Replit(约 400 家企业生产部署) - 适用场景:受监管行业、长生命周期 workflow、需要 checkpoint/human-in-the-loop - 编排风格:图/状态机

CrewAI — 最快路径到多 Agent 原型 - 定位:Role-based crews,2–4 小时即可跑通 - 评价:独立 benchmark 显示简单 workflow 下 token 开销是 LangGraph 的 3 倍,大规模生产需评估成本 - 适用场景:PoC、Multi-agent demo、线性角色分工明确的工作流 - 注意:许多团队最终因需要细粒度控制而迁移至 LangGraph - 编排风格:角色型(研究员→写手→编辑)

Microsoft Agent Framework — .NET/Azure 原生首选 - 背景:2026 年 4 月 AutoGen + Semantic Kernel 合并为单一 GA SDK - 定位:.NET 和 Azure 企业默认选

OpenAI Agents SDK — GPT-Centric 最低摩擦方案 - 背景:2026 年 4 月大改版,新增原生沙箱、sub-agents、Codex 风格文件系统工具、first-class MCP 支持 - 定位:GPT 工作流 + 沙箱工具调用

Google ADK — 多模态 + GCP 原生 - 定位:A2A 协议跨框架互通(50+ 合作伙伴,包括 Salesforce、ServiceNow) - 适用场景:Gemini + 分层编排 + GCP 原生

生产选型速查

场景 推荐框架
受监管行业,审计要求 LangGraph
快速多 Agent 原型(数天内) CrewAI
.NET / Azure 原生团队 Microsoft Agent Framework
GPT-centric + 沙箱工具 OpenAI Agents SDK
多模态 + GCP 原生 Google ADK
类型安全 Python 生产 Agent Pydantic AI
RAG 密集知识助手 LlamaIndex
TypeScript / Next.js 团队 Mastra

关键数据点

  • CrewAI token overhead:简单 workflow 下是 LangGraph 的 3 倍
  • LangGraph 企业客户:~400 家(含多个千亿市值公司)
  • 框架选择对 benchmark 影响:高达 30 percentage points(同一模型)
  • MCP 支持:2026 年已为 table stakes,protocol openness 开始成为选型重要维度

评价:该文提供真实 benchmark 引用(Princeton HAL)和企业采用数据,而非仅靠 GitHub stars 排名。重点强调"orchestration layer 不是次要细节",对技术决策者有参考价值。

来源:https://uvik.net/blog/agentic-ai-frameworks


三、二次筛选判定

保留条目

条目 判定 理由
inferenceengineering.tech vLLM vs SGLang vs TRT-LLM 保留 实测 benchmark 数据(H100 tok/s)、架构差异有源码级分析、决策树可操作性强
uvik.net Agentic AI Frameworks 2026 保留 benchmark 引用有来源(Princeton HAL)、CrewAI 3× token overhead 数据具体、企业案例可追溯

丢弃条目

条目 丢弃理由
(本次无其他来源待判定) —

四、分类标签

vLLM SGLang TensorRT-LLM PagedAttention RadixAttention H100-Benchmark LLM-Serving Agentic-AI LangGraph CrewAI Multi-Agent MCP OpenAI-Agents-SDK Google-ADK LLM-Infra


建议写入路径

  • 主草稿:/shared/research-kb/inbox/jay/2026-09-26-1450-jay-inference-agentic-framework-sep26.md
  • 可考虑后续提炼单页面:/shared/research-kb/inbox/jay/2026-09-26-llm-serving-engine-selection-sop-2026.md(整合 vLLM/SGLang/TRT-LLM 决策树)

后续行动

  • [ ] 精读 SGLang RadixAttention 论文(Zheng et al., 2024)关于 trie 前缀复用的实现细节
  • [ ] 核实 Princeton HAL benchmark 原始数据(Claude Opus 4 框架差 30pp)
  • [ ] 关注 TensorRT-LLM engine build CI 流水线实践(.engine 版本管理)
  • [ ] CrewAI 3× token overhead benchmark 原始来源