知识库草稿 · Jay · 2026-09-26 下午
本次主题
LLM 推理引擎深度对比(vLLM vs SGLang vs TensorRT-LLM)· Agentic AI 框架 2026 生产选型
一、LLM 推理引擎架构深度对比(inferenceengineering.tech)
背景说明
三引擎功能特性在 2026 年已基本收敛(continuous batching、Paged KV cache、prefix caching、quantization、speculative decoding、tensor/pipeline parallelism),选择差异转向架构设计哲学、性能天花板和运维复杂度。
架构差异
vLLM — PagedAttention + Python-first - 调度层:Python 级 scheduler,维护 waiting/running/swapped 优先级队列 - Attention 后端:Pluggable(FlashAttention-2、FlashInfer、xFormers),默认 FlashInfer - KV cache 管理:PagedAttention,类 OS 虚拟内存页表,碎片率从 ~40% 降至 <4% - Python 调度开销:200–500 μs/cycle(高并发时由 async 引擎隐藏部分) - 模型覆盖:400+ 架构家族(HuggingFace 新模型接入 50–200 行 Python class) - 硬件支持:NVIDIA (CUDA)、AMD (ROCm)、TPU (XLA)、Intel Gaudi (HPU)、CPU fallback
SGLang — RadixAttention + 结构化生成运行时 - 核心创新:RadixAttention,用 radix trie 管理所有请求的 KV 页,实现跨请求长公共前缀复用 - 前缀命中收益:few-shot 场景消除 70–90% prefill 计算 - 结构化输出:constrained decoding 在 scheduler 层实现,非后验 token filter,overhead 更低 - MoE 优化:EP (Expert Parallelism) 深度集成,DeepSeek-R1/V3 (671B) 在 GB200 NVL72 上性能领先 - C++/CUDA vs Python:并发 100+ 请求时,调度开销低于 vLLM - 模型覆盖:150+ 架构
TensorRT-LLM — 编译引擎路径
- 流程:Checkpoint → TRT 权重格式 → trtllm-build 编译 → .engine 文件
- 提速三来源:(1) 算子融合更激进,(2) CUDA Graph 覆盖整个 forward pass,(3) auto-tuned kernel(在实际硬件上 benchmark 选择最快 kernel 变体)
- 运维代价:换模型/量化级别/序列长度/GPU 类型 → 重新编译(大型模型 2+ 小时)
- 硬件支持:仅 NVIDIA(Ampere A100 / Hopper H100-H200 / Blackwell B200-GB200)
- 模型覆盖:~50 架构(Llama、Mistral、Qwen、DeepSeek、T5 家族为主)
H100 实测性能数据
| 模型 | 引擎 | 配置 | 吞吐量 |
|---|---|---|---|
| Llama-3.1 70B | vLLM | TP=4, FP8 | ~2,800 tok/s |
| Llama-3.1 70B | TRT-LLM | TP=4, FP8, compiled | ~3,400 tok/s |
| Llama-3.1 70B | SGLang | TP=4, FP8 | ~2,900 tok/s |
| DeepSeek-R1 671B | SGLang | EP=8, FP8 (8× H100) | ~1,100 tok/s |
| Llama-3.1 8B | vLLM | TP=1, FP8 | ~12,000 tok/s |
| Llama-3.1 8B | TRT-LLM | TP=1, FP8, compiled | ~14,500 tok/s |
结论:TRT-LLM 在大 batch size + dense 模型优势最显著(15–25% 吞吐领先)。低 batch(延迟敏感单用户)场景下差距大幅收窄,内存带宽主导。
选型决策树
- 非 NVIDIA 硬件 → vLLM(或 SGLang for AMD)
- 高并发 + 共享前缀(few-shot、多轮对话) → SGLang(RadixAttention 命中率高)
- 大规模 MoE(DeepSeek 级) → SGLang(EP 深度优化)
- 结构化输出(JSON schema/regex/grammar) → SGLang(scheduler 层原生支持)
- dense 模型 + 最大吞吐 + 愿意接受编译开销 → TensorRT-LLM
- 快速原型 / 最大模型覆盖 / 多硬件 → vLLM
运维复杂度:vLLM ≈ SGLang(低)< TRT-LLM(高,需 CI 流水线管理 .engine 版本)
评价:该文是 2026 年推理引擎选型最完整的工程级对比,涵盖 PagedAttention vs RadixAttention 架构差异、实测 benchmark 数据和真实决策树。非营销文,值得生产规划参考。
来源:https://inferenceengineering.tech/learn/vllm-vs-sglang-vs-tensorrt-llm
二、Agentic AI 框架 2026 生产对比(uvik.net)
核心观点
框架选择对同一模型上 agent benchmark 结果影响可达 30 个百分点(引用 Princeton HAL benchmark:Claude Opus 4 在不同 scaffold 下 GAIA 得分 64.9% vs 57.6%)。
五强生产框架
LangGraph — 有状态生产工作流默认选 - 定位:图状态机,面向需要审计追溯、确定性控制、人工审批的生产系统 - 标杆客户:Klarna、Uber、LinkedIn、BlackRock、Cisco、Elastic、JPMorgan、Replit(约 400 家企业生产部署) - 适用场景:受监管行业、长生命周期 workflow、需要 checkpoint/human-in-the-loop - 编排风格:图/状态机
CrewAI — 最快路径到多 Agent 原型 - 定位:Role-based crews,2–4 小时即可跑通 - 评价:独立 benchmark 显示简单 workflow 下 token 开销是 LangGraph 的 3 倍,大规模生产需评估成本 - 适用场景:PoC、Multi-agent demo、线性角色分工明确的工作流 - 注意:许多团队最终因需要细粒度控制而迁移至 LangGraph - 编排风格:角色型(研究员→写手→编辑)
Microsoft Agent Framework — .NET/Azure 原生首选 - 背景:2026 年 4 月 AutoGen + Semantic Kernel 合并为单一 GA SDK - 定位:.NET 和 Azure 企业默认选
OpenAI Agents SDK — GPT-Centric 最低摩擦方案 - 背景:2026 年 4 月大改版,新增原生沙箱、sub-agents、Codex 风格文件系统工具、first-class MCP 支持 - 定位:GPT 工作流 + 沙箱工具调用
Google ADK — 多模态 + GCP 原生 - 定位:A2A 协议跨框架互通(50+ 合作伙伴,包括 Salesforce、ServiceNow) - 适用场景:Gemini + 分层编排 + GCP 原生
生产选型速查
| 场景 | 推荐框架 |
|---|---|
| 受监管行业,审计要求 | LangGraph |
| 快速多 Agent 原型(数天内) | CrewAI |
| .NET / Azure 原生团队 | Microsoft Agent Framework |
| GPT-centric + 沙箱工具 | OpenAI Agents SDK |
| 多模态 + GCP 原生 | Google ADK |
| 类型安全 Python 生产 Agent | Pydantic AI |
| RAG 密集知识助手 | LlamaIndex |
| TypeScript / Next.js 团队 | Mastra |
关键数据点
- CrewAI token overhead:简单 workflow 下是 LangGraph 的 3 倍
- LangGraph 企业客户:~400 家(含多个千亿市值公司)
- 框架选择对 benchmark 影响:高达 30 percentage points(同一模型)
- MCP 支持:2026 年已为 table stakes,protocol openness 开始成为选型重要维度
评价:该文提供真实 benchmark 引用(Princeton HAL)和企业采用数据,而非仅靠 GitHub stars 排名。重点强调"orchestration layer 不是次要细节",对技术决策者有参考价值。
来源:https://uvik.net/blog/agentic-ai-frameworks
三、二次筛选判定
保留条目
| 条目 | 判定 | 理由 |
|---|---|---|
| inferenceengineering.tech vLLM vs SGLang vs TRT-LLM | 保留 | 实测 benchmark 数据(H100 tok/s)、架构差异有源码级分析、决策树可操作性强 |
| uvik.net Agentic AI Frameworks 2026 | 保留 | benchmark 引用有来源(Princeton HAL)、CrewAI 3× token overhead 数据具体、企业案例可追溯 |
丢弃条目
| 条目 | 丢弃理由 |
|---|---|
| (本次无其他来源待判定) | — |
四、分类标签
vLLM SGLang TensorRT-LLM PagedAttention RadixAttention H100-Benchmark LLM-Serving Agentic-AI LangGraph CrewAI Multi-Agent MCP OpenAI-Agents-SDK Google-ADK LLM-Infra
建议写入路径
- 主草稿:
/shared/research-kb/inbox/jay/2026-09-26-1450-jay-inference-agentic-framework-sep26.md - 可考虑后续提炼单页面:
/shared/research-kb/inbox/jay/2026-09-26-llm-serving-engine-selection-sop-2026.md(整合 vLLM/SGLang/TRT-LLM 决策树)
后续行动
- [ ] 精读 SGLang RadixAttention 论文(Zheng et al., 2024)关于 trie 前缀复用的实现细节
- [ ] 核实 Princeton HAL benchmark 原始数据(Claude Opus 4 框架差 30pp)
- [ ] 关注 TensorRT-LLM engine build CI 流水线实践(.engine 版本管理)
- [ ] CrewAI 3× token overhead benchmark 原始来源