Jay 工程筛选:LLM 推理引擎工程实践(2026-09-09)

任务元数据

  • 筛选主题:LLM 推理引擎工程实践 · vLLM / SGLang / TensorRT-LLM / 生产部署
  • 检索范围:arXiv · Substack · 工程博客 · 基准测试站点 · Hugging Face
  • 本次筛选日期:2026-09-09
  • 候选条目总数:~40 条
  • 保留条目:8 条高价值

保留条目(按可信度降序)

🔵 T1 · 精读优先级 · 可直接写知识库

1. The AI Engineer · vLLM vs Ollama vs SGLang vs TensorRT-LLM

  • 作者/来源:Paolo Perrone · theaiengineer.substack.com
  • 链接:https://theaiengineer.substack.com/p/vllm-vs-ollama-vs-sglang-vs-tensorrt
  • 发布时间:2026-04(活跃订阅号)
  • 核心观点
  • 2026年 TGI(HuggingFace Text Generation Inference)正式进入维护模式,仅接受 bugfix,不再开发新功能
  • 决策原则:80%团队应选 vLLM;高并发 MoE + 结构化输出选 SGLang;NVIDIA 稳定大批量选 TensorRT-LLM
  • vLLM GPU 利用率 85-92%,TGI 同期仅 68-74%(同硬件)
  • Ollama 单机无并发优化,5并发时 p95 延迟已达单用户 5 倍
  • 包含 benchmark 引文:SGLang 原始论文显示 24x vs HF Transformers,3.5x vs TGI(2023)
  • ⚠️ 区分"default vLLM"(正确)与"always vLLM"(错误)
  • 工程含量:高 — OOM 错误描述、GPU 利用率数字、TGI 迁移警告、benchmark 引文链完整
  • 可信度判断:高 — 技术订阅号,有引文,追行业动态积极
  • 是否需核验:建议核对 vLLM 官方 benchmark 页面(vllm.ai)及 Spheron 2026 H100 实测数据

2. inferenceengineering.tech · vLLM vs SGLang vs TensorRT-LLM

  • 作者/来源:inferenceengineering.tech(专注推理工程的独立技术站点)
  • 链接:https://inferenceengineering.tech/learn/vllm-vs-sglang-vs-tensorrt-llm
  • 发布时间:持续更新,2026-08 有数据
  • 核心观点
  • 性能参考(H100 SXM 80GB):Llama-3.1 70B · vLLM TP=4 FP8 ~2,800 tok/s;TRT-LLM ~3,400;SGLang ~2,900
  • DeepSeek-R1 671B:SGLang EP=8 FP8 ~1,100 tok/s(8×H100)
  • SGLang vs vLLM 在 prefix-heavy 场景有 29% 优势(来自 RadixAttention),unique prompt 场景两者相当
  • 决策树:先分析 workload,再选引擎,不要被 benchmark 排名牵着走
  • 工程含量:高 — 具体 benchmark 配置(TP=4、FP8、compiled)、模型名、tok/s 数字
  • 可信度判断:高 — 垂直技术站点,数字有来源标注,定期更新
  • 是否需核验:建议核对 Spheron 2026 H100 benchmark 原始报告

3. arXiv 2606.17104 · Prefill/Decode-Aware Evaluation(HPAI4S'26 @ IPDPS 2026)

  • 作者:多作者
  • 链接:https://arxiv.org/html/2606.17104v1
  • 发布时间:2026
  • 核心观点
  • A100 平台:token transfer 时间 0.210 ms/token(25 Gbps Ethernet)到 0.00036 ms/token(NVLink)
  • 对比 NVIDIA A100(vLLM v0.12.0)与 GroqRack(专用 AI 加速器)的 prefill/decode 执行模型差异
  • prefill 阶段为单次并行前向传播,decode 阶段为自回归
  • GroqRack 每次调用只处理一个 token,无批处理
  • 工程含量:高 — 量化传输时间、GPU 架构对比、框架实测(vLLM v0.12.0)
  • 可信度判断:高 — peer-reviewed 会议论文,HPAI4S@IPDPS 2026,有 formal evaluation
  • 是否需核验:建议对照 vLLM 官方 release notes 确认 v0.12.0 特性

4. arXiv 2607.02574 · Survey of KV Cache Management for LLM Serving

  • 作者:学术
  • 链接:https://arxiv.org/html/2607.02574v1
  • 发布时间:2026-07
  • 核心观点
  • 对 30+ KV-cache 管理系统的系统性分类,基于 4 轴:locality / lifetime / ownership / substrate
  • 5 大架构原型:local-paged · disaggregated-pipeline · shared-store · memory-pool · hybrid-tier
  • 论文揭示当前评估中 7 个缺失的 KV 专项测量指标
  • Mooncake(PD disaggregation + 分布式 KV 存储 + tiering)、Beluga(CXL KV-cache)等代表系统
  • CXL memory pooling 架构可跨 worker 扩展容量
  • 工程含量:高 — 系统性分类法,实践价值强,适合知识库专题
  • 可信度判断:高 — arXiv 学术论文,2026-07,分类严谨
  • 是否需核验:无需核验,属于调研类工作;建议作为知识库 RAG/serving 架构专题引用

🟢 T2 · 参考级 · 适合专题补充

5. arXiv 2604.25724 · Scalable Inference Architectures for Compound AI Systems(Salesforce, 2026-04)

  • 作者:Salesforce 研究团队
  • 链接:https://arxiv.org/html/2604.25724v1
  • 核心数据
  • 生产规模:8,000 企业用户 · 日均 722,000 次推理 · 峰值 140万请求/天
  • 21 个全球分布式推理区 · provisioned 峰值 2,250 RPS(135,000 RPM)
  • 2026-03 处理 1360亿 token(日均约 44亿token),同比 8.7x 增长
  • 关键发现:复合 AI 系统中各模型 scaling 不对称(Atlas 推理引擎过滤部分查询,导致对话 LLM 仅扩 6-7x;embedding 模型随流量线性扩 10x;SQL executor 仅扩 2-3x)
  • 工程含量:极高 — 真实生产数字,架构设计决策,scaling 实测
  • 可信度判断:高 — 企业研究团队,2026-04 发布,有生产数据背书
  • 是否需核验:无需核验;直接作为"复合 AI 系统推理架构"知识库案例

6. Particula Tech Blog · SGLang vs vLLM in 2026: Benchmarks and When to Use Each

  • 作者:Sebastian Mondragon
  • 链接:https://particula.tech/blog/sglang-vs-vllm-inference-engine-comparison
  • 核心观点
  • SGLang DeepSeek V3 比 vLLM 快 3.1x(受益于 MLA 优化 + FlashAttention3/FlashMLA/CutlassMLA)
  • SGLang Multi-Token Prediction(EAGLE speculative decoding):batch=1 时 decode 加速 1.8x,batch=32 时 1.5x
  • 结构化输出:SGLang compressed FSM 让 JSON 合规率从 90-94% 提升至 96-98.2%
  • 生产建议:多轮对话 / 共享前缀 / 结构化输出 → SGLang;多硬件 / encoder-decoder / 批量 → vLLM
  • 工程含量:高 — 特定模型(DeepSeek V3)实测数字,EAGLE decode 加速比,JSON 合规率
  • 可信度判断:中高 — 行业博客,有实测数据但需对照官方 benchmark
  • 是否需核验:建议核验 SGLang 官方 GitHub / DeepSeek V3 官方评测

7. arXiv 2603.16104 · Efficient LLM Serving for Agentic Workflows: A Data Systems Perspective

  • 作者:多机构
  • 链接:https://arxiv.org/html/2603.16104v1
  • 核心观点
  • AI agent 工作流中 LLM 调用的特殊性:多步骤、异构 prompt、跨请求状态共享
  • 当前 serving 引擎(vLLM 等)优化的是独立请求,未针对 agentic 工作流特征设计
  • cache hit rate 实测表(Qwen3-8B / Qwen3-14B):Helium 59.2% / 42.9%;vLLM 42.9% / 43.0%
  • agentic 场景 KV cache 命中率普遍低于预期(因多步异构请求共享率低)
  • 工程含量:高 — 真实 benchmark,7 种 agentic 系统对比,命中率量化数据
  • 可信度判断:高 — arXiv 2026-03,系统性研究
  • 是否需核验:无需核验,属于调研类;建议作为 agentic serving 架构专题引用

8. theneuralmaze.substack.com · The Hands-on Guide to LLM Inference with vLLM

  • 作者:Miguel Otero Pedrido
  • 链接:https://theneuralmaze.substack.com/p/the-hands-on-guide-to-llm-inference
  • 核心观点
  • vLLM 核心参数实战:max-num-seqs / gpu-memory-utilization / block-size / tensor-parallel-size / flash_attn_version / kv-cache-dtype / speculative-model
  • 大规模企业部署:3 层 KV cache 存储架构图
  • 包含 AKS(Azure Kubernetes Service)上 Unlimited-OCR VLM pipeline 部署步骤
  • 工程含量:中 — 有命令参数解释和部署步骤,但主要内容付费
  • 可信度判断:中 — 实战内容,但付费墙限制完整评估
  • 是否需核验:vLLM 官方参数文档可替代

丢弃条目(附理由)

# 条目 丢弃理由
D1 PremAI 博客:10 Best vLLM Alternatives 营销性质,无引文,benchmark 数据无法溯源
D2 spheron.network 通用 vLLM vs SGLang 对比 偏 IaaS 推广,数字以定价为主
D3 jarvislabs.ai 博客 深度一般,benchmark 方法论不透明
D4 kenhuangus Substack Chapter 1/Physics 付费章节无法评估,免费摘要无新意
D5 Arslan Ahmad/designgurus Substack 付费全文,摘要阶段无法评估工程含量
D6 leetllm.com 综合对比 数字有标注但大量来自第三方比较,无一手实测
D7 DigitalOcean 工程博客(LLM Inference Trilemma) 概念性介绍,无新 benchmark 或命令
D8 MorphLLM 优化指南 泛化数字,无溯源,无实际环境描述
D9 kenhuangus 10-part 系列发布帖 发布预告,无实质内容(系列首篇 2026-09-04 才开始)

分类标签建议

  • tag: llm-inference tag: serving-engine tag: vllm tag: sglang tag: tensorrt-llm
  • tag: kv-cache tag: production-systems tag: benchmark
  • tag: compound-ai tag: agentic-workflows

建议写入路径

/shared/research-kb/inbox/jay/2026-09-09-llm-inference-engineering-screening.md   ← 本草稿

后续可整合为知识库专题页: - inference/serving-engines-vLLM-SGLang-TRTLLM.md(T1 条目 #1 + #2) - systems/kv-cache-management-taxonomy-2026.md(T1 条目 #4) - systems/salesforce-compound-ai-inference.md(T2 条目 #5)


后续行动建议

  1. 精读优先级:T1 #1(AI Engineer Substack)+ T1 #3(arXiv IPDPS 论文)+ T2 #5(Salesforce 案例)可作为"LLM 生产推理架构"专题核心素材
  2. Substack 跟踪:The AI Engineer(Paolo Perrone)和 Particula Tech 定期产出工程内容,建议加入知识库监控列表
  3. 缺失追踪:arXiv 2605.17613(VeriCache)作为 KV cache compression 技术线索保留,待后续精读
  4. CSDN 检查:本期检索未发现高价值 CSDN 工程文章(推理引擎主题 CSDN 内容偏基础/转载)

Jay · 2026-09-09 14:50 UTC+8 · 工程筛选任务 · 未执行 Git 写入