知识库草稿:Jay 下午研究简报 · 2026-09-10 13:35
主题
下午研究简报:推理引擎格局 · KV-Cache 新研究 · GitHub Trending 新兴项目 · 多模态 LLM 现状
一、推理引擎格局(2026 年 9 月最新格局)
🔴 重点收录:vLLM vs SGLang 决策树(Particula Tech,实测 2026)
来源: particula.tech,2026 年 链接: https://particula.tech/blog/sglang-vs-vllm-inference-engine-comparison 工程价值: ⭐⭐⭐⭐⭐
核心数据(H100,Llama 3.1 8B-Instruct,ShareGPT 1000 prompts):
| 引擎 | 吞吐 | 适用场景 |
|---|---|---|
| SGLang | ~16,200 tok/s | prefix overlap > 60%(RAG/多轮 Agent);xAI Grok 3、Azure、LinkedIn、Cursor 生产部署 |
| vLLM | ~12,500 tok/s | 通用原型、100+ 模型支持、Blackwell、Eagle3 推测解码 |
| LMDeploy | ~16,200 tok/s | 一键 pip install,H100 专用集群最短生产路径 |
决策树(2026 年 9 月最新): - prefix overlap > 60% → SGLang(RadixAttention 明显优势) - prefix overlap < 30% → 两者差距 < 5%,按生态/兼容性选 - Blackwell GPU → vLLM 生态更成熟 - AMD MI300X → vLLM(disaggregation 生产案例更多) - TGI → 正式进入维护模式,HF 官方推荐迁移 vLLM/SGLang
工程判断: 当前时间点(2026-09-10),生产选型建议: 1. 先上 vLLM:安装最简、调试最易、换引擎成本最低 2. 按需切换 SGLang:当测量到 prefix overlap > 60% 时,切换才有意义 3. 不要用 TGI 新项目:维护模式,不会有新功能
可信度: 高,多源交叉基准测试一致
🟡 新兴引擎:RetroInfer(Rust CUDA,纯 OpenAI 兼容)
来源: GitHub Topics llm-inference,2026-09-04 更新 链接: https://github.com/search?q=retroinfer&type=repositories stars: 672 工程价值: ⭐⭐⭐
定位: 纯 Rust + CUDA LLM 推理引擎,无 PyTorch 依赖,OpenAI 兼容 - 支持 Qwen3、Kimi-K2、DeepSeek MoE 系列 - Rust 语言栈,适合对性能/内存安全有要求的基础设施团队 - 2026-09-04 更新,属活跃期
建议: 作为技术观察项收录,关注与 vLLM/SGLang 的生态差距
二、KV-Cache 研究前沿(arXiv 2026 新论文)
🔴 重点收录:KV Cache 作为存储/通信/调度原语
来源: arxiv.org,2026 年 链接: https://arxiv.org/html/2608.01526v1 标题: "An Internet for the KV Cache: Rethinking Classical Infrastructure Boundaries in the LLM Inference Age" 可信度: 高,arXiv 学术论文
核心观点: - KV Cache 正在从「推理优化技巧」演变为一种存储/通信/调度原语 - LMCache(Cheng et al., 2025)、TensorRT(Nvidia, 2026)、llm-d(llm-d Contributors, 2026)、NVIDIA Dynamo 均在推进 KV Cache 能力边界 - Prefix Caching(vLLM/SGLang)已成为生产环境的事实标准,因多轮对话和 Agent 场景有天然的 prefix 重用 - 新研究方向:KV Cache 作为跨引擎、跨查询的全局共享表示
工程意义: 在多租户环境 + Agent 场景下,KV Cache 不仅是内存优化手段,也是系统设计的核心抽象
🟡 重点收录:分布式 KV Cache 存储层级综述
来源: arxiv.org,2026-07 链接: https://arxiv.org/html/2607.02574v1 标题: "From Tensor Buffer to Distributed Memory Hierarchy: A Survey of KV Cache Management for LLM Serving" 可信度: 高,综述论文,覆盖 MLSys/ASPLOS/ISCA 等顶会工作
分类框架(8 类 KV Cache 管理策略):
| 方案 | 代表系统 | 关键特性 |
|---|---|---|
| Local KV Cache | vLLM PagedAttention | GPU 内存管理,块级分配 |
| Prefix Caching | vLLM RadixAttention / SGLang | prompt prefix 复用 |
| Disaggregation | DistServe / Mooncake | prefill/decode 分离 |
| KV Offload | ShadowKV | 内存→SSD 分层 |
| CXL Memory Pool | CXL-SpecKV (Liu & Yu, 2026) | CXL 互联,支持 FPGA |
| Hybrid Tier | Mooncake | 分布式 KV 存储 + 分层 |
| KV Quantization | INT8/FP8/NVFP4 | 压缩存储 |
| KV Compression | MLA (DeepSeek) | 低秩压缩 |
工程判断: 生产系统正在从「单引擎内存管理」向「分布式 KV Cache 层级」演进,Mooncake/Prefix caching 方向最成熟
🟡 重点收录:SafeKV — 多租户 KV Cache 安全共享
来源: arxiv.org,2025-08(近期活跃引用) 链接: https://arxiv.org/html/2508.08438v2 标题: "Selective KV-Cache Sharing to Mitigate Timing Side-Channels in LLM Inference" 可信度: 高
核心问题: 当多租户共享同一 serving fleet 时,prefix caching 会导致跨租户信息泄露(通过 timing 侧信道) - 攻击者可以通过精心设计的 prompt 探测其他用户的 prefix 是否被缓存 - SafeKV 提出三层异步检测 pipeline + radix-tree 内存管理 + 敏感性感知淘汰策略
工程意义: 在共享 GPU 集群或多租户 API 服务场景下,KV Cache 共享需要安全边界,建议作为安全 checklist 项
三、GitHub Trending 新兴项目(2026-09 初)
🟡 katanemo/Plano — AI 原生代理网关(Rust, 7k stars)
来源: github.com/katanemo/plano,2026-08-19 更新 链接: https://github.com/katanemo/plano stars: 7k(快速上升) 工程价值: ⭐⭐⭐⭐
定位: AI-Native Proxy Server and Data Plane for Agentic Apps - Smart LLM 路由(多模型选择) - 可观测性(traces, metrics) - Agent 编排 - Guardrails(输出安全过滤) - Rust 实现,性能/内存效率高
典型用例: 企业 AI 网关,需要对多个 LLM 后端做统一流量管理、安全控制和可观测性
🟡 ai-dynamo/Dynamo — 数据中心级分布式推理框架(Rust, 8k stars)
来源: github.com/ai-dynamo/dynamo,2026-09-03 更新 链接: https://github.com/ai-dynamo/dynamo stars: 8k 工程价值: ⭐⭐⭐⭐
定位: Datacenter Scale Distributed Inference Serving Framework - Rust 实现,Kubernetes 原生 - 支持 vLLM / TensorRT-LLM / SGLang 后端 - Disaggregated Serving(prefill/decode 分离)核心实现 - 支持 Omni(多模态 diffusion)分布式推理 - 2026-09-03 活跃更新
工程判断: 面向大规模生产部署,适合需要 disaggregation + 分布式调度能力的团队
四、多模态 LLM 现状(2026-09)
✅ 收录:Llama 4 MoE 架构上线
来源: Meta AI Blog,2026 链接: https://ai.meta.com/blog/llama-4-multimodal-intelligence 可信度: 高,官方发布
核心数据: - Llama 4 Maverick:17B 活跃参数,128 experts,400B 总参数;多模态 SOTA,超越 GPT-4o 和 Gemini 2.0 - Llama 4 Behemoth:288B 活跃参数,16 experts,蒸馏 Teacher;仍在训练中 - 架构: MoE(Mixture of Experts),单 token 仅激活部分参数,训练/推理计算效率显著高于 dense 模型
工程判断: Llama 4 MoE 架构确认 2026 年生产级 MoE 模型方向,多模态能力进入实用阶段
✅ 收录:Qwen 3.5 性价比优势
来源: Reuters / 多方报道,2026-02 可信度: 中(厂商声明,需实测验证)
关键数据: - 官方称成本比上一代低 60%,吞吐量提升 8× - 支持超长上下文(与 KV Cache 优化密切相关)
注意: 与 vLLM/SGLang 基准数据存在量级差异,建议以独立 benchmark 结果为准
五、LLM 2026 推理经济学(宏观视角)
✅ 收录:AI 基础设施资本支出
来源: cosmo-edge.com,2026 链接: https://cosmo-edge.com/ai-inference-economics-2026-agents-cost-scale 可信度: 中
核心数据: - 2026 年全球 AI 基础设施资本支出超过 $6000 亿 - Agentic AI 系统(多步骤异步执行)相比单 prompt 产生更高持续 token 吞吐 - 1M token 上下文窗口 → KV Cache 成本占比达 70-90% GPU 内存
工程意义: 在 2026 年,推理成本已不可忽视。KV Cache 优化是单 GPU 成本压缩最有效的杠杆(4-40× 内存降低)
分类标签
推理引擎 vLLM SGLang KV-Cache 分布式推理 MoE 多模态LLM GitHub-Trending Rust ai-dynamo Plano 安全 Benchmark
建议写入路径
/shared/research-kb/inbox/jay/2026-09-10T1335-jay-afternoon-research-briefing.md(本文)- 可考虑拆分:
- 推理引擎选型 → 推理引擎主题页
- KV Cache 综述 → Inference Systems 主题页引用
- Dynamo/Plano → AI Infrastructure Stack 2026 收录
后续行动建议
- 精读: arxiv 2608.01526(KV Cache as Infrastructure 原语)
- 核验: SGLang vs vLLM 决策树数据与 2026-09 最新 benchmark 对齐
- 跟踪: Dynamo 项目成熟度(8k stars 快速上升)
- 观察: Llama 4 Maverick 多模态生产部署案例
Jay · 2026-09-10 13:35 · 研究知识库草稿 · 请勿直接提交 GitHub