研究知识库草稿 · 2026-09-27 · backend

主题:LLM Inference 引擎横评 / KV Cache 系统级论文 / 调度算法


[重点] vLLM vs SGLang vs LMDeploy — 2026 推理引擎横评

  • 来源:PremAI Blog(2026年3月)
  • URL:https://www.premai.io/blog/vllm-vs-sglang-vs-lmdeploy-fastest-llm-inference-engine-in-2026
  • 标签:vllm sglang lmdeploy inference-engine benchmark
  • 评分:⭐⭐⭐⭐

核心数据(H100 GPU 基准)

引擎 Throughput(tokens/s) 相对差距
SGLang ~16,200 基准
LMDeploy ~16,200 并列第一
vLLM ~12,500 -29%

各自优势

  • SGLang:RadixAttention 在多轮 agentic 场景 KV Cache 复用率最高;DeepSeek MLA 专用 kernel;SGLang 获 xAI、AMD、NVIDIA、LinkedIn、Oracle 采用
  • LMDeploy:量化模型(INT4/INT8)受限硬件部署路径最短
  • vLLM:PagedAttention 原创社区,稳定性和兼容性最优;获 Red Hat、IBM、Anyscale 采用;Continuous Batching、Chunked Prefill、Speculative Decoding、Disaggregated Serving 均支持

评价

2026 Q1 权威横评,数据清晰。引擎功能趋同(均支持 FlashAttention/FlashInfer、Continuous Batching、PagedAttention/RadixAttention、Speculative Decoding),差异化在生态和特定场景优化。


[重点] KV Cache 已成为 LLM 推理的核心系统问题

  • 来源:IntuitionLabs(2026年9月5日)/ Towards AI
  • URL:https://intuitionlabs.ai/articles/kv-cache-memory-long-context-inference-cost
  • 标签:kv-cache memory-management long-context llm-inference
  • 评分:⭐⭐⭐⭐⭐

核心数字

  • 单请求 10K tokens → KV Cache 约 5GB
  • 100 并发 → 500GB;单卡 H100 仅 80GB
  • 100K tokens 超长上下文 → 单请求 ~50GB KV Cache
  • Long-context 推理 = 内存管理问题,不是计算问题

KV Cache 公式

内存 = 2 × 层数 × KV头数 × 头维度 × 序列长度 × batch_size × bytes_per_param

主流缓解技术

  • GQA(Grouped Query Attention):减少 KV 头数
  • MLA(Multi-head Latent Attention):DeepSeek-V2/V3 采用,压缩 KV 维度
  • 量化:FP8/INT8 KV Cache(PagedAttention + vLLM 原生支持)
  • Prefix Caching:共享系统提示词 KV 复用(SGLang RadixAttention)

评价

概念清晰,数字直观。生产部署 long-context(>32K)的团队必读。推荐精读原文 27 分钟版本。


[重点 arXiv] LMCache — 企业级 KV Caching Layer

  • 来源:arXiv:2510.09665v1 / github.com/Cheng0826/LMCache
  • URL:https://arxiv.org/abs/2510.09665
  • 标签:kv-cache lmcache production arxiv-2025
  • 评分:⭐⭐⭐⭐⭐

核心贡献

  • 首个生产级 KV 缓存抽象层,将 KV Cache 从推理副产品升格为一等公民数据结构
  • 提供 API:定位(locate)、移动(move)、pin、压缩(compress)
  • 支撑应用层:KV-cache-aware 查询路由、多引擎状态共享、agent 间状态传递

关键数据

  • 跨多种 workload 和模型,吞吐量提升显著
  • KV Cache 复用率在多轮 agentic 场景提升明显

评价

方向性论文,生产 KV 复用必读。已有 NVIDIA TensorRT 2026c、llm-d、vLLM、LMCache 官方支持。


[重要 arXiv] AVP: Agent Vector Protocol — KV-Cache 跨模型 Latent Transfer

  • 来源:awesome-kv-cache-management(2026年新条目)/ Open-source Spec
  • URL:https://github.com/treeai-lab/awesome-kv-cache-management
  • 标签:kv-cache agent cross-model arxiv-2026
  • 评分:⭐⭐⭐⭐

核心思路

通过 KV-Cache 序列化 + Vocabulary 介导投影,实现跨模型 latent transfer。Agent 执行中途可将 KV 状态迁移至另一模型继续处理,无需重新计算。

评价

架构创新,MIT 协议。Multi-agent 系统设计方向,值得关注演进。


[重要 arXiv] ETCInfer: 热感知冷却联合 LLM 推理调度

  • 来源:arXiv:2609.15230v1(2026年9月)
  • URL:https://arxiv.org/html/2609.15230v1
  • 标签:scheduling thermal energy datacenter arxiv-2026
  • 评分:⭐⭐⭐⭐

核心方法

POMDP 建模热感知调度,协同冷却系统与 GPU 调度。

关键结果

模型 节能 SLO 违规 热节流降低
Qwen2.5-Instruct 30.4% 0.43% 88.6%
DeepSeek-R1-Distill-Qwen 28.7% 0.51% 85.2%
Mistral-Instruct 26.9% 0.47% 82.4%

评价

Datacenter 级 GPU 调度前沿方向,适合超大规模推理集群运营参考。


[重要 arXiv] TIE: 不确定性感知输出长度预测调度

  • 来源:arXiv:2604.00499v2(2026年5月)
  • URL:https://arxiv.org/abs/2604.00499
  • 标签:scheduling uncertainty llm arxiv-2026
  • 评分:⭐⭐⭐⭐

核心思路

  • 用 log-t 分布建模 LLM 输出长度重尾分布(EOS token 采样本质是随机的)
  • 引入 CVaR(Conditional Value at Risk)处理尾部风险
  • Shortest Job First 在 LLM 场景面临 HOL blocking,TIE 通过不确定性量化改善调度质量

评价

调度算法进阶内容,适合 SLO 敏感型推理服务设计者精读。


[重要 arXiv] SMetric: Session-Centric Balanced LLM 调度

  • 来源:arXiv:2607.08565v1(2026年)
  • URL:https://arxiv.org/html/2607.08565v1
  • 标签:scheduling session llm arxiv-2026
  • 评分:⭐⭐⭐

核心思路

面向 Agent 场景,以 session 为粒度的均衡调度,避免跨 session 的资源竞争。


[参考] llm-d v0.9 — 推理控制平面全面成熟

  • 来源:arXiv:2609.05565v1(2026年9月综述)/ llm-d 项目
  • URL:https://arxiv.org/html/2609.05565v1
  • 标签:llm-d inference-plane kubernetes arxiv-2026
  • 评分:⭐⭐⭐⭐

核心能力

  • Cache-aware 路由:前缀缓存命中率驱动调度
  • Prefill/Decode 分离: disaggregated serving
  • 多层 KV 管理:GPU/CPU/NVMe 多层 KV Cache
  • 预测延迟调度:基于在线回归模型(输入:prompt 长度、前缀缓存命中率、队列深度、KV 利用率)
  • 异构引擎编排:多引擎(vLLM/SGLang)统一入口
  • 自动扩缩容 + 请求级追踪

评价

K8s 推理平台方向,架构参考价值高。已有预测延迟调度与 GPU 功耗/能耗估算结合的潜力(自然实验方向)。


[参考] SGLang vs vLLM 2026 深度生态对比

  • 来源:Yotta Labs / Inclusion AI Medium(2026年)
  • URL:https://www.yottalabs.ai/post/vllm-vs-sglang-which-inference-engine-should-you-use-in-2026
  • 标签:vllm sglang ecosystem production
  • 评分:⭐⭐⭐

社区生态

引擎 采用方
vLLM Red Hat、IBM、Anyscale、Cerebrium
SGLang xAI、AMD、NVIDIA、LinkedIn、Oracle、Dataricks、Bytedance

评价

社区生态梳理,生产选型参考。


后续行动

  • [ ] 精读:IntuitionLabs KV Cache 内存公式 + 主流模型实测数据(原版 27 分钟)
  • [ ] 精读:LMCache 论文 + 官方 Quick Start(github.com/Cheng0826/LMCache)
  • [ ] 核验:ETCInfer 复现环境(需要多卡 GPU 集群)
  • [ ] 核验:TIE 论文预测精度数据
  • [ ] 更新:inference-engine 主题页(vLLM vs SGLang 2026 Q3 最新对比)