研究知识库草稿 · 2026-09-27 · reproduction

主题:可复现工程笔记 / 部署实战 / 源码分析


[线索] FlashInfer 部署指南 — vLLM / SGLang 双后端

  • 来源:Spheron Blog(2026年4月27日)
  • URL:https://www.spheron.network/blog/deploy-flashinfer-gpu-cloud-llm-inference-kernels
  • 标签:flashinfer gpu-cloud deployment sglang vllm
  • 评分:⭐⭐⭐

核心内容

  • 在 GPU Cloud(Spheron)上部署 FlashInfer 内核
  • vLLM:Hopper (H100/H200) 默认 FlashAttention;设置 VLLM_ATTENTION_BACKEND=FLASHINFER 可切换
  • SGLang:Hopper 和 Blackwell 默认使用 FlashInfer,含 DeepSeek 风格 MLA 专用 kernel path
  • 支持 Spheron 部署(对比自托管成本)

可复现性

⭐⭐⭐ 中高,官方文档完整,需要 GPU Cloud 账号或自备 H100/H200

评价

工程部署路径,适合已在生产环境或准备迁移到 vLLM/SGLang 的团队参考。


[线索] NVIDIA ICMSP: KV Cache NVMe Offload — 5倍推理增益

  • 来源:Spheron Blog(2026年6月6日)
  • URL:https://www.spheron.network/blog/deploy-flashinfer-gpu-cloud-llm-inference-kernels(同一篇,含 ICMSP 章节)
  • 标签:nvidia nvme-offload kv-cache icmsp production
  • 评分:⭐⭐⭐

核心内容

  • NVIDIA ICMSP 协议实现 KV Cache NVMe 卸载
  • 声称实现 5 倍推理增益(需核实原始 NVIDIA 文档)
  • 适合超长上下文(>100K tokens)场景

可复现性

⭐⭐⭐ 中,依赖 NVIDIA 硬件支持,需要核实官方协议规范

评价

硬核工程方向,排障和性能优化可参考。


[线索] Megakernel 编译优化:Mirage

  • 来源:Spheron Blog(2026年9月15日)
  • URL:https://www.spheron.network/blog/deploy-flashinfer-gpu-cloud-llm-inference-kernels(同一篇)
  • 标签:compilation megakernel latency optimization
  • 评分:⭐⭐⭐

核心内容

LLM 推理延迟优化技术,通过 Megakernel 编译(Mirage 框架)减少 kernel 启动开销。

可复现性

⭐⭐⭐ 中,需要 CUDA 环境和基准测试工具

评价

编译器优化方向,可复现验证。对 latency-critical 场景有价值。


[线索] SGLang GitHub 官方部署材料

  • 来源:github.com/sgl-project/sgl-learning-materials
  • URL:https://github.com/sgl-project/sgl-learning-materials/blob/main/blogs/Efficient%20LLM%20Deployment%20and%20Serving.md
  • 标签:sglang deployment radixattention github
  • 评分:⭐⭐⭐

核心特性

  • RadixAttention:KV Cache 前缀树复用,多轮对话效率提升 6.4x(vs 其他 SOTA)
  • 压缩有限状态机(Compressed Finite State Machines):结构化输出加速
  • 官方生产案例:Databricks、Bytedance

可复现性

⭐⭐⭐⭐ 高,官方材料 + GitHub repo,亲测可行

评价

SGLang 部署首选参考,建议配合 SGLang 官方 docs(docs.sglang.ai)交叉验证。


[线索] KV Cache Optimization Strategies for Scalable LLM Inference

  • 来源:arXiv:2603.20397(2026年3月)
  • URL:https://arxiv.org/abs/2603.20397
  • 标签:kv-cache survey arxiv inference-optimization
  • 评分:⭐⭐⭐

核心内容

24 页综述,14 图,覆盖 KV Cache 优化全貌(量化、调度、分层、预取等技术方向)。

可复现性

⭐⭐⭐ 学术综述,适合建立系统认知


后续行动

  • [ ] 复现:SGLang + FlashInfer 部署(RadixAttention + MLA kernel 实测)
  • [ ] 核验:NVIDIA ICMSP 5x 增益声明(需查 NVIDIA 官方文档)
  • [ ] 精读:KV Cache Optimization arXiv 综述(arXiv:2603.20397)
  • [ ] 对比:vLLM vs SGLang 在实际长对话场景的 RadixAttention vs PagedAttention 效果差异