知识库草稿:Jay 下午研究简报 · 2026-09-10 13:35

主题

下午研究简报:推理引擎格局 · KV-Cache 新研究 · GitHub Trending 新兴项目 · 多模态 LLM 现状


一、推理引擎格局(2026 年 9 月最新格局)

🔴 重点收录:vLLM vs SGLang 决策树(Particula Tech,实测 2026)

来源: particula.tech,2026 年 链接: https://particula.tech/blog/sglang-vs-vllm-inference-engine-comparison 工程价值: ⭐⭐⭐⭐⭐

核心数据(H100,Llama 3.1 8B-Instruct,ShareGPT 1000 prompts):

引擎 吞吐 适用场景
SGLang ~16,200 tok/s prefix overlap > 60%(RAG/多轮 Agent);xAI Grok 3、Azure、LinkedIn、Cursor 生产部署
vLLM ~12,500 tok/s 通用原型、100+ 模型支持、Blackwell、Eagle3 推测解码
LMDeploy ~16,200 tok/s 一键 pip install,H100 专用集群最短生产路径

决策树(2026 年 9 月最新): - prefix overlap > 60% → SGLang(RadixAttention 明显优势) - prefix overlap < 30% → 两者差距 < 5%,按生态/兼容性选 - Blackwell GPU → vLLM 生态更成熟 - AMD MI300X → vLLM(disaggregation 生产案例更多) - TGI → 正式进入维护模式,HF 官方推荐迁移 vLLM/SGLang

工程判断: 当前时间点(2026-09-10),生产选型建议: 1. 先上 vLLM:安装最简、调试最易、换引擎成本最低 2. 按需切换 SGLang:当测量到 prefix overlap > 60% 时,切换才有意义 3. 不要用 TGI 新项目:维护模式,不会有新功能

可信度: 高,多源交叉基准测试一致


🟡 新兴引擎:RetroInfer(Rust CUDA,纯 OpenAI 兼容)

来源: GitHub Topics llm-inference,2026-09-04 更新 链接: https://github.com/search?q=retroinfer&type=repositories stars: 672 工程价值: ⭐⭐⭐

定位: 纯 Rust + CUDA LLM 推理引擎,无 PyTorch 依赖,OpenAI 兼容 - 支持 Qwen3、Kimi-K2、DeepSeek MoE 系列 - Rust 语言栈,适合对性能/内存安全有要求的基础设施团队 - 2026-09-04 更新,属活跃期

建议: 作为技术观察项收录,关注与 vLLM/SGLang 的生态差距


二、KV-Cache 研究前沿(arXiv 2026 新论文)

🔴 重点收录:KV Cache 作为存储/通信/调度原语

来源: arxiv.org,2026 年 链接: https://arxiv.org/html/2608.01526v1 标题: "An Internet for the KV Cache: Rethinking Classical Infrastructure Boundaries in the LLM Inference Age" 可信度: 高,arXiv 学术论文

核心观点: - KV Cache 正在从「推理优化技巧」演变为一种存储/通信/调度原语 - LMCache(Cheng et al., 2025)、TensorRT(Nvidia, 2026)、llm-d(llm-d Contributors, 2026)、NVIDIA Dynamo 均在推进 KV Cache 能力边界 - Prefix Caching(vLLM/SGLang)已成为生产环境的事实标准,因多轮对话和 Agent 场景有天然的 prefix 重用 - 新研究方向:KV Cache 作为跨引擎、跨查询的全局共享表示

工程意义: 在多租户环境 + Agent 场景下,KV Cache 不仅是内存优化手段,也是系统设计的核心抽象


🟡 重点收录:分布式 KV Cache 存储层级综述

来源: arxiv.org,2026-07 链接: https://arxiv.org/html/2607.02574v1 标题: "From Tensor Buffer to Distributed Memory Hierarchy: A Survey of KV Cache Management for LLM Serving" 可信度: 高,综述论文,覆盖 MLSys/ASPLOS/ISCA 等顶会工作

分类框架(8 类 KV Cache 管理策略):

方案 代表系统 关键特性
Local KV Cache vLLM PagedAttention GPU 内存管理,块级分配
Prefix Caching vLLM RadixAttention / SGLang prompt prefix 复用
Disaggregation DistServe / Mooncake prefill/decode 分离
KV Offload ShadowKV 内存→SSD 分层
CXL Memory Pool CXL-SpecKV (Liu & Yu, 2026) CXL 互联,支持 FPGA
Hybrid Tier Mooncake 分布式 KV 存储 + 分层
KV Quantization INT8/FP8/NVFP4 压缩存储
KV Compression MLA (DeepSeek) 低秩压缩

工程判断: 生产系统正在从「单引擎内存管理」向「分布式 KV Cache 层级」演进,Mooncake/Prefix caching 方向最成熟


🟡 重点收录:SafeKV — 多租户 KV Cache 安全共享

来源: arxiv.org,2025-08(近期活跃引用) 链接: https://arxiv.org/html/2508.08438v2 标题: "Selective KV-Cache Sharing to Mitigate Timing Side-Channels in LLM Inference" 可信度:

核心问题: 当多租户共享同一 serving fleet 时,prefix caching 会导致跨租户信息泄露(通过 timing 侧信道) - 攻击者可以通过精心设计的 prompt 探测其他用户的 prefix 是否被缓存 - SafeKV 提出三层异步检测 pipeline + radix-tree 内存管理 + 敏感性感知淘汰策略

工程意义: 在共享 GPU 集群或多租户 API 服务场景下,KV Cache 共享需要安全边界,建议作为安全 checklist 项


🟡 katanemo/Plano — AI 原生代理网关(Rust, 7k stars)

来源: github.com/katanemo/plano,2026-08-19 更新 链接: https://github.com/katanemo/plano stars: 7k(快速上升) 工程价值: ⭐⭐⭐⭐

定位: AI-Native Proxy Server and Data Plane for Agentic Apps - Smart LLM 路由(多模型选择) - 可观测性(traces, metrics) - Agent 编排 - Guardrails(输出安全过滤) - Rust 实现,性能/内存效率高

典型用例: 企业 AI 网关,需要对多个 LLM 后端做统一流量管理、安全控制和可观测性


🟡 ai-dynamo/Dynamo — 数据中心级分布式推理框架(Rust, 8k stars)

来源: github.com/ai-dynamo/dynamo,2026-09-03 更新 链接: https://github.com/ai-dynamo/dynamo stars: 8k 工程价值: ⭐⭐⭐⭐

定位: Datacenter Scale Distributed Inference Serving Framework - Rust 实现,Kubernetes 原生 - 支持 vLLM / TensorRT-LLM / SGLang 后端 - Disaggregated Serving(prefill/decode 分离)核心实现 - 支持 Omni(多模态 diffusion)分布式推理 - 2026-09-03 活跃更新

工程判断: 面向大规模生产部署,适合需要 disaggregation + 分布式调度能力的团队


四、多模态 LLM 现状(2026-09)

✅ 收录:Llama 4 MoE 架构上线

来源: Meta AI Blog,2026 链接: https://ai.meta.com/blog/llama-4-multimodal-intelligence 可信度: 高,官方发布

核心数据: - Llama 4 Maverick:17B 活跃参数,128 experts,400B 总参数;多模态 SOTA,超越 GPT-4o 和 Gemini 2.0 - Llama 4 Behemoth:288B 活跃参数,16 experts,蒸馏 Teacher;仍在训练中 - 架构: MoE(Mixture of Experts),单 token 仅激活部分参数,训练/推理计算效率显著高于 dense 模型

工程判断: Llama 4 MoE 架构确认 2026 年生产级 MoE 模型方向,多模态能力进入实用阶段


✅ 收录:Qwen 3.5 性价比优势

来源: Reuters / 多方报道,2026-02 可信度: 中(厂商声明,需实测验证)

关键数据: - 官方称成本比上一代低 60%,吞吐量提升 8× - 支持超长上下文(与 KV Cache 优化密切相关)

注意: 与 vLLM/SGLang 基准数据存在量级差异,建议以独立 benchmark 结果为准


五、LLM 2026 推理经济学(宏观视角)

✅ 收录:AI 基础设施资本支出

来源: cosmo-edge.com,2026 链接: https://cosmo-edge.com/ai-inference-economics-2026-agents-cost-scale 可信度:

核心数据: - 2026 年全球 AI 基础设施资本支出超过 $6000 亿 - Agentic AI 系统(多步骤异步执行)相比单 prompt 产生更高持续 token 吞吐 - 1M token 上下文窗口 → KV Cache 成本占比达 70-90% GPU 内存

工程意义: 在 2026 年,推理成本已不可忽视。KV Cache 优化是单 GPU 成本压缩最有效的杠杆(4-40× 内存降低)


分类标签

推理引擎 vLLM SGLang KV-Cache 分布式推理 MoE 多模态LLM GitHub-Trending Rust ai-dynamo Plano 安全 Benchmark


建议写入路径

  • /shared/research-kb/inbox/jay/2026-09-10T1335-jay-afternoon-research-briefing.md(本文)
  • 可考虑拆分:
  • 推理引擎选型 → 推理引擎主题页
  • KV Cache 综述 → Inference Systems 主题页引用
  • Dynamo/Plano → AI Infrastructure Stack 2026 收录

后续行动建议

  1. 精读: arxiv 2608.01526(KV Cache as Infrastructure 原语)
  2. 核验: SGLang vs vLLM 决策树数据与 2026-09 最新 benchmark 对齐
  3. 跟踪: Dynamo 项目成熟度(8k stars 快速上升)
  4. 观察: Llama 4 Maverick 多模态生产部署案例

Jay · 2026-09-10 13:35 · 研究知识库草稿 · 请勿直接提交 GitHub