研究知识库草稿 · 2026-09-27 · backend
主题:LLM Inference 引擎横评 / KV Cache 系统级论文 / 调度算法
[重点] vLLM vs SGLang vs LMDeploy — 2026 推理引擎横评
- 来源:PremAI Blog(2026年3月)
- URL:https://www.premai.io/blog/vllm-vs-sglang-vs-lmdeploy-fastest-llm-inference-engine-in-2026
- 标签:
vllmsglanglmdeployinference-enginebenchmark - 评分:⭐⭐⭐⭐
核心数据(H100 GPU 基准)
| 引擎 | Throughput(tokens/s) | 相对差距 |
|---|---|---|
| SGLang | ~16,200 | 基准 |
| LMDeploy | ~16,200 | 并列第一 |
| vLLM | ~12,500 | -29% |
各自优势
- SGLang:RadixAttention 在多轮 agentic 场景 KV Cache 复用率最高;DeepSeek MLA 专用 kernel;SGLang 获 xAI、AMD、NVIDIA、LinkedIn、Oracle 采用
- LMDeploy:量化模型(INT4/INT8)受限硬件部署路径最短
- vLLM:PagedAttention 原创社区,稳定性和兼容性最优;获 Red Hat、IBM、Anyscale 采用;Continuous Batching、Chunked Prefill、Speculative Decoding、Disaggregated Serving 均支持
评价
2026 Q1 权威横评,数据清晰。引擎功能趋同(均支持 FlashAttention/FlashInfer、Continuous Batching、PagedAttention/RadixAttention、Speculative Decoding),差异化在生态和特定场景优化。
[重点] KV Cache 已成为 LLM 推理的核心系统问题
- 来源:IntuitionLabs(2026年9月5日)/ Towards AI
- URL:https://intuitionlabs.ai/articles/kv-cache-memory-long-context-inference-cost
- 标签:
kv-cachememory-managementlong-contextllm-inference - 评分:⭐⭐⭐⭐⭐
核心数字
- 单请求 10K tokens → KV Cache 约 5GB
- 100 并发 → 500GB;单卡 H100 仅 80GB
- 100K tokens 超长上下文 → 单请求 ~50GB KV Cache
- Long-context 推理 = 内存管理问题,不是计算问题
KV Cache 公式
内存 = 2 × 层数 × KV头数 × 头维度 × 序列长度 × batch_size × bytes_per_param
主流缓解技术
- GQA(Grouped Query Attention):减少 KV 头数
- MLA(Multi-head Latent Attention):DeepSeek-V2/V3 采用,压缩 KV 维度
- 量化:FP8/INT8 KV Cache(PagedAttention + vLLM 原生支持)
- Prefix Caching:共享系统提示词 KV 复用(SGLang RadixAttention)
评价
概念清晰,数字直观。生产部署 long-context(>32K)的团队必读。推荐精读原文 27 分钟版本。
[重点 arXiv] LMCache — 企业级 KV Caching Layer
- 来源:arXiv:2510.09665v1 / github.com/Cheng0826/LMCache
- URL:https://arxiv.org/abs/2510.09665
- 标签:
kv-cachelmcacheproductionarxiv-2025 - 评分:⭐⭐⭐⭐⭐
核心贡献
- 首个生产级 KV 缓存抽象层,将 KV Cache 从推理副产品升格为一等公民数据结构
- 提供 API:定位(locate)、移动(move)、pin、压缩(compress)
- 支撑应用层:KV-cache-aware 查询路由、多引擎状态共享、agent 间状态传递
关键数据
- 跨多种 workload 和模型,吞吐量提升显著
- KV Cache 复用率在多轮 agentic 场景提升明显
评价
方向性论文,生产 KV 复用必读。已有 NVIDIA TensorRT 2026c、llm-d、vLLM、LMCache 官方支持。
[重要 arXiv] AVP: Agent Vector Protocol — KV-Cache 跨模型 Latent Transfer
- 来源:awesome-kv-cache-management(2026年新条目)/ Open-source Spec
- URL:https://github.com/treeai-lab/awesome-kv-cache-management
- 标签:
kv-cacheagentcross-modelarxiv-2026 - 评分:⭐⭐⭐⭐
核心思路
通过 KV-Cache 序列化 + Vocabulary 介导投影,实现跨模型 latent transfer。Agent 执行中途可将 KV 状态迁移至另一模型继续处理,无需重新计算。
评价
架构创新,MIT 协议。Multi-agent 系统设计方向,值得关注演进。
[重要 arXiv] ETCInfer: 热感知冷却联合 LLM 推理调度
- 来源:arXiv:2609.15230v1(2026年9月)
- URL:https://arxiv.org/html/2609.15230v1
- 标签:
schedulingthermalenergydatacenterarxiv-2026 - 评分:⭐⭐⭐⭐
核心方法
POMDP 建模热感知调度,协同冷却系统与 GPU 调度。
关键结果
| 模型 | 节能 | SLO 违规 | 热节流降低 |
|---|---|---|---|
| Qwen2.5-Instruct | 30.4% | 0.43% | 88.6% |
| DeepSeek-R1-Distill-Qwen | 28.7% | 0.51% | 85.2% |
| Mistral-Instruct | 26.9% | 0.47% | 82.4% |
评价
Datacenter 级 GPU 调度前沿方向,适合超大规模推理集群运营参考。
[重要 arXiv] TIE: 不确定性感知输出长度预测调度
- 来源:arXiv:2604.00499v2(2026年5月)
- URL:https://arxiv.org/abs/2604.00499
- 标签:
schedulinguncertaintyllmarxiv-2026 - 评分:⭐⭐⭐⭐
核心思路
- 用 log-t 分布建模 LLM 输出长度重尾分布(EOS token 采样本质是随机的)
- 引入 CVaR(Conditional Value at Risk)处理尾部风险
- Shortest Job First 在 LLM 场景面临 HOL blocking,TIE 通过不确定性量化改善调度质量
评价
调度算法进阶内容,适合 SLO 敏感型推理服务设计者精读。
[重要 arXiv] SMetric: Session-Centric Balanced LLM 调度
- 来源:arXiv:2607.08565v1(2026年)
- URL:https://arxiv.org/html/2607.08565v1
- 标签:
schedulingsessionllmarxiv-2026 - 评分:⭐⭐⭐
核心思路
面向 Agent 场景,以 session 为粒度的均衡调度,避免跨 session 的资源竞争。
[参考] llm-d v0.9 — 推理控制平面全面成熟
- 来源:arXiv:2609.05565v1(2026年9月综述)/ llm-d 项目
- URL:https://arxiv.org/html/2609.05565v1
- 标签:
llm-dinference-planekubernetesarxiv-2026 - 评分:⭐⭐⭐⭐
核心能力
- Cache-aware 路由:前缀缓存命中率驱动调度
- Prefill/Decode 分离: disaggregated serving
- 多层 KV 管理:GPU/CPU/NVMe 多层 KV Cache
- 预测延迟调度:基于在线回归模型(输入:prompt 长度、前缀缓存命中率、队列深度、KV 利用率)
- 异构引擎编排:多引擎(vLLM/SGLang)统一入口
- 自动扩缩容 + 请求级追踪
评价
K8s 推理平台方向,架构参考价值高。已有预测延迟调度与 GPU 功耗/能耗估算结合的潜力(自然实验方向)。
[参考] SGLang vs vLLM 2026 深度生态对比
- 来源:Yotta Labs / Inclusion AI Medium(2026年)
- URL:https://www.yottalabs.ai/post/vllm-vs-sglang-which-inference-engine-should-you-use-in-2026
- 标签:
vllmsglangecosystemproduction - 评分:⭐⭐⭐
社区生态
| 引擎 | 采用方 |
|---|---|
| vLLM | Red Hat、IBM、Anyscale、Cerebrium |
| SGLang | xAI、AMD、NVIDIA、LinkedIn、Oracle、Dataricks、Bytedance |
评价
社区生态梳理,生产选型参考。
后续行动
- [ ] 精读:IntuitionLabs KV Cache 内存公式 + 主流模型实测数据(原版 27 分钟)
- [ ] 精读:LMCache 论文 + 官方 Quick Start(github.com/Cheng0826/LMCache)
- [ ] 核验:ETCInfer 复现环境(需要多卡 GPU 集群)
- [ ] 核验:TIE 论文预测精度数据
- [ ] 更新:inference-engine 主题页(vLLM vs SGLang 2026 Q3 最新对比)