Jay 工程筛选:LLM 推理引擎工程实践(2026-09-09)
任务元数据
- 筛选主题:LLM 推理引擎工程实践 · vLLM / SGLang / TensorRT-LLM / 生产部署
- 检索范围:arXiv · Substack · 工程博客 · 基准测试站点 · Hugging Face
- 本次筛选日期:2026-09-09
- 候选条目总数:~40 条
- 保留条目:8 条高价值
保留条目(按可信度降序)
🔵 T1 · 精读优先级 · 可直接写知识库
1. The AI Engineer · vLLM vs Ollama vs SGLang vs TensorRT-LLM
- 作者/来源:Paolo Perrone · theaiengineer.substack.com
- 链接:https://theaiengineer.substack.com/p/vllm-vs-ollama-vs-sglang-vs-tensorrt
- 发布时间:2026-04(活跃订阅号)
- 核心观点:
- 2026年 TGI(HuggingFace Text Generation Inference)正式进入维护模式,仅接受 bugfix,不再开发新功能
- 决策原则:80%团队应选 vLLM;高并发 MoE + 结构化输出选 SGLang;NVIDIA 稳定大批量选 TensorRT-LLM
- vLLM GPU 利用率 85-92%,TGI 同期仅 68-74%(同硬件)
- Ollama 单机无并发优化,5并发时 p95 延迟已达单用户 5 倍
- 包含 benchmark 引文:SGLang 原始论文显示 24x vs HF Transformers,3.5x vs TGI(2023)
- ⚠️ 区分"default vLLM"(正确)与"always vLLM"(错误)
- 工程含量:高 — OOM 错误描述、GPU 利用率数字、TGI 迁移警告、benchmark 引文链完整
- 可信度判断:高 — 技术订阅号,有引文,追行业动态积极
- 是否需核验:建议核对 vLLM 官方 benchmark 页面(vllm.ai)及 Spheron 2026 H100 实测数据
2. inferenceengineering.tech · vLLM vs SGLang vs TensorRT-LLM
- 作者/来源:inferenceengineering.tech(专注推理工程的独立技术站点)
- 链接:https://inferenceengineering.tech/learn/vllm-vs-sglang-vs-tensorrt-llm
- 发布时间:持续更新,2026-08 有数据
- 核心观点:
- 性能参考(H100 SXM 80GB):Llama-3.1 70B · vLLM TP=4 FP8 ~2,800 tok/s;TRT-LLM ~3,400;SGLang ~2,900
- DeepSeek-R1 671B:SGLang EP=8 FP8 ~1,100 tok/s(8×H100)
- SGLang vs vLLM 在 prefix-heavy 场景有 29% 优势(来自 RadixAttention),unique prompt 场景两者相当
- 决策树:先分析 workload,再选引擎,不要被 benchmark 排名牵着走
- 工程含量:高 — 具体 benchmark 配置(TP=4、FP8、compiled)、模型名、tok/s 数字
- 可信度判断:高 — 垂直技术站点,数字有来源标注,定期更新
- 是否需核验:建议核对 Spheron 2026 H100 benchmark 原始报告
3. arXiv 2606.17104 · Prefill/Decode-Aware Evaluation(HPAI4S'26 @ IPDPS 2026)
- 作者:多作者
- 链接:https://arxiv.org/html/2606.17104v1
- 发布时间:2026
- 核心观点:
- A100 平台:token transfer 时间 0.210 ms/token(25 Gbps Ethernet)到 0.00036 ms/token(NVLink)
- 对比 NVIDIA A100(vLLM v0.12.0)与 GroqRack(专用 AI 加速器)的 prefill/decode 执行模型差异
- prefill 阶段为单次并行前向传播,decode 阶段为自回归
- GroqRack 每次调用只处理一个 token,无批处理
- 工程含量:高 — 量化传输时间、GPU 架构对比、框架实测(vLLM v0.12.0)
- 可信度判断:高 — peer-reviewed 会议论文,HPAI4S@IPDPS 2026,有 formal evaluation
- 是否需核验:建议对照 vLLM 官方 release notes 确认 v0.12.0 特性
4. arXiv 2607.02574 · Survey of KV Cache Management for LLM Serving
- 作者:学术
- 链接:https://arxiv.org/html/2607.02574v1
- 发布时间:2026-07
- 核心观点:
- 对 30+ KV-cache 管理系统的系统性分类,基于 4 轴:locality / lifetime / ownership / substrate
- 5 大架构原型:local-paged · disaggregated-pipeline · shared-store · memory-pool · hybrid-tier
- 论文揭示当前评估中 7 个缺失的 KV 专项测量指标
- Mooncake(PD disaggregation + 分布式 KV 存储 + tiering)、Beluga(CXL KV-cache)等代表系统
- CXL memory pooling 架构可跨 worker 扩展容量
- 工程含量:高 — 系统性分类法,实践价值强,适合知识库专题
- 可信度判断:高 — arXiv 学术论文,2026-07,分类严谨
- 是否需核验:无需核验,属于调研类工作;建议作为知识库 RAG/serving 架构专题引用
🟢 T2 · 参考级 · 适合专题补充
5. arXiv 2604.25724 · Scalable Inference Architectures for Compound AI Systems(Salesforce, 2026-04)
- 作者:Salesforce 研究团队
- 链接:https://arxiv.org/html/2604.25724v1
- 核心数据:
- 生产规模:8,000 企业用户 · 日均 722,000 次推理 · 峰值 140万请求/天
- 21 个全球分布式推理区 · provisioned 峰值 2,250 RPS(135,000 RPM)
- 2026-03 处理 1360亿 token(日均约 44亿token),同比 8.7x 增长
- 关键发现:复合 AI 系统中各模型 scaling 不对称(Atlas 推理引擎过滤部分查询,导致对话 LLM 仅扩 6-7x;embedding 模型随流量线性扩 10x;SQL executor 仅扩 2-3x)
- 工程含量:极高 — 真实生产数字,架构设计决策,scaling 实测
- 可信度判断:高 — 企业研究团队,2026-04 发布,有生产数据背书
- 是否需核验:无需核验;直接作为"复合 AI 系统推理架构"知识库案例
6. Particula Tech Blog · SGLang vs vLLM in 2026: Benchmarks and When to Use Each
- 作者:Sebastian Mondragon
- 链接:https://particula.tech/blog/sglang-vs-vllm-inference-engine-comparison
- 核心观点:
- SGLang DeepSeek V3 比 vLLM 快 3.1x(受益于 MLA 优化 + FlashAttention3/FlashMLA/CutlassMLA)
- SGLang Multi-Token Prediction(EAGLE speculative decoding):batch=1 时 decode 加速 1.8x,batch=32 时 1.5x
- 结构化输出:SGLang compressed FSM 让 JSON 合规率从 90-94% 提升至 96-98.2%
- 生产建议:多轮对话 / 共享前缀 / 结构化输出 → SGLang;多硬件 / encoder-decoder / 批量 → vLLM
- 工程含量:高 — 特定模型(DeepSeek V3)实测数字,EAGLE decode 加速比,JSON 合规率
- 可信度判断:中高 — 行业博客,有实测数据但需对照官方 benchmark
- 是否需核验:建议核验 SGLang 官方 GitHub / DeepSeek V3 官方评测
7. arXiv 2603.16104 · Efficient LLM Serving for Agentic Workflows: A Data Systems Perspective
- 作者:多机构
- 链接:https://arxiv.org/html/2603.16104v1
- 核心观点:
- AI agent 工作流中 LLM 调用的特殊性:多步骤、异构 prompt、跨请求状态共享
- 当前 serving 引擎(vLLM 等)优化的是独立请求,未针对 agentic 工作流特征设计
- cache hit rate 实测表(Qwen3-8B / Qwen3-14B):Helium 59.2% / 42.9%;vLLM 42.9% / 43.0%
- agentic 场景 KV cache 命中率普遍低于预期(因多步异构请求共享率低)
- 工程含量:高 — 真实 benchmark,7 种 agentic 系统对比,命中率量化数据
- 可信度判断:高 — arXiv 2026-03,系统性研究
- 是否需核验:无需核验,属于调研类;建议作为 agentic serving 架构专题引用
8. theneuralmaze.substack.com · The Hands-on Guide to LLM Inference with vLLM
- 作者:Miguel Otero Pedrido
- 链接:https://theneuralmaze.substack.com/p/the-hands-on-guide-to-llm-inference
- 核心观点:
- vLLM 核心参数实战:max-num-seqs / gpu-memory-utilization / block-size / tensor-parallel-size / flash_attn_version / kv-cache-dtype / speculative-model
- 大规模企业部署:3 层 KV cache 存储架构图
- 包含 AKS(Azure Kubernetes Service)上 Unlimited-OCR VLM pipeline 部署步骤
- 工程含量:中 — 有命令参数解释和部署步骤,但主要内容付费
- 可信度判断:中 — 实战内容,但付费墙限制完整评估
- 是否需核验:vLLM 官方参数文档可替代
丢弃条目(附理由)
| # | 条目 | 丢弃理由 |
|---|---|---|
| D1 | PremAI 博客:10 Best vLLM Alternatives | 营销性质,无引文,benchmark 数据无法溯源 |
| D2 | spheron.network 通用 vLLM vs SGLang 对比 | 偏 IaaS 推广,数字以定价为主 |
| D3 | jarvislabs.ai 博客 | 深度一般,benchmark 方法论不透明 |
| D4 | kenhuangus Substack Chapter 1/Physics | 付费章节无法评估,免费摘要无新意 |
| D5 | Arslan Ahmad/designgurus Substack | 付费全文,摘要阶段无法评估工程含量 |
| D6 | leetllm.com 综合对比 | 数字有标注但大量来自第三方比较,无一手实测 |
| D7 | DigitalOcean 工程博客(LLM Inference Trilemma) | 概念性介绍,无新 benchmark 或命令 |
| D8 | MorphLLM 优化指南 | 泛化数字,无溯源,无实际环境描述 |
| D9 | kenhuangus 10-part 系列发布帖 | 发布预告,无实质内容(系列首篇 2026-09-04 才开始) |
分类标签建议
tag: llm-inferencetag: serving-enginetag: vllmtag: sglangtag: tensorrt-llmtag: kv-cachetag: production-systemstag: benchmarktag: compound-aitag: agentic-workflows
建议写入路径
/shared/research-kb/inbox/jay/2026-09-09-llm-inference-engineering-screening.md ← 本草稿
后续可整合为知识库专题页:
- inference/serving-engines-vLLM-SGLang-TRTLLM.md(T1 条目 #1 + #2)
- systems/kv-cache-management-taxonomy-2026.md(T1 条目 #4)
- systems/salesforce-compound-ai-inference.md(T2 条目 #5)
后续行动建议
- 精读优先级:T1 #1(AI Engineer Substack)+ T1 #3(arXiv IPDPS 论文)+ T2 #5(Salesforce 案例)可作为"LLM 生产推理架构"专题核心素材
- Substack 跟踪:The AI Engineer(Paolo Perrone)和 Particula Tech 定期产出工程内容,建议加入知识库监控列表
- 缺失追踪:arXiv 2605.17613(VeriCache)作为 KV cache compression 技术线索保留,待后续精读
- CSDN 检查:本期检索未发现高价值 CSDN 工程文章(推理引擎主题 CSDN 内容偏基础/转载)
Jay · 2026-09-09 14:50 UTC+8 · 工程筛选任务 · 未执行 Git 写入