Cloud-Native · Kubernetes LLM 推理:CNCF 生态 2026 新进展

检索时间: 2026-07-13 21:00 实例: Jay 来源: Tavily → CNCF Blog / Spheron / Volcano / NVIDIA Developer Blog / Medium


📊 高价值条目

1. llm-d 进入 CNCF Sandbox(2026-03-24)⭐⭐⭐⭐⭐

  • 来源: CNCF Blog + GitHub
  • URL: https://www.cncf.io/blog/2026/05/21/how-netease-games-achieved-30-second-llm-cold-starts-on-kubernetes
  • URL2: https://github.com/llm-d/llm-d
  • 可信度: ⭐⭐⭐⭐⭐ CNCF 官方 + GitHub 1.2k+ stars
  • 核心内容:
  • Kubernetes 原生 disaggregated LLM 推理框架
  • 分离 prefill/decode 到不同 GPU 池,解决单体内核在高并发下的瓶颈
  • llm-d scheduler:缓存感知路由,最大化 prefix cache 命中率
  • Gateway API Inference Extension 一等公民支持
  • 架构:CRD + 标准 K8s 网络,无需定制化patch
  • 评价: 云原生推理 2026 年最重要项目进展,K8s 环境首选方案

2. NetEase Games:30秒 LLM 冷启动实践

  • 来源: CNCF Blog
  • URL: https://www.cncf.io/blog/2026/05/21/how-netease-games-achieved-30-second-llm-cold-starts-on-kubernetes
  • 可信度: ⭐⭐⭐⭐⭐ 大厂生产实践 + CNCF 背书
  • 核心数据:
  • 优化前:跨区域直接存储访问,模型加载 42 分钟
  • Alluxio 缓存层:14 分钟
  • Fluid prefetching 工作流:3 分钟(最终方案)
  • 游戏流量突发性强,Fluid 的抽象层次(cache cluster 为操作单元)显著优于原始块存储
  • 评价: 极致冷启动优化案例,对事件驱动/突发流量场景参考价值极高

3. Kthena:Volcano 推出的云原生推理路由引擎

  • 来源: Volcano Blog
  • URL: https://volcano.sh/blog/introducing-kthena-redefining-llm-inference-for-the-cloud-native-era
  • 可信度: ⭐⭐⭐⭐ 华为云背书,开源活跃
  • 核心内容:
  • Volcano 子项目,定位:Kubernetes 上的 LLM 推理路由/编排/调度
  • 目标:统一推理生命周期管理(训练 → 推理)
  • 核心能力:低延迟 + 高吞吐 + 智能路由
  • 评价: 与 llm-d 互补;Kthena 更偏路由/网关层,llm-d 更偏调度/内核层

4. Disaggregated LLM Inference on Kubernetes(NVIDIA 官方方案)

  • 来源: NVIDIA Developer Blog
  • URL: https://developer.nvidia.com/blog/deploying-disaggregated-llm-inference-workloads-on-kubernetes
  • 可信度: ⭐⭐⭐⭐⭐ 硬件厂商一手资料
  • 核心内容:
  • disaggregated 架构:prefill / decode / router 三阶段独立 K8s 服务
  • gang scheduling / hierarchical gang scheduling / topology-aware placement
  • KAI Scheduler / LeaderWorkerSet / NVIDIA Grove 等 K8s 扩展
  • per-role autoscaling + tensor-parallel-group 动态调整
  • 评价: 深度技术实现细节,适合 K8s 调度层开发者

5. Cloud Native System for LLM Inference Serving(arXiv)

  • 来源: arXiv 2507.18007v1
  • URL: https://arxiv.org/html/2507.18007v1
  • 可信度: ⭐⭐⭐⭐ 学术论文,有实验数据
  • 核心观点:
  • 云原生技术(容器化/微服务/动态调度)可显著改善 LLM 推理效率
  • K8s autoscaling 在高需求场景下动态适配,节省 35% 成本
  • 容器化方案比 VM 方案延迟降低 28%,吞吐量提升 2.1x
  • 评价: 学术视角的量化验证,引用数据适合支撑技术方案文档

🔍 分类标签

cloud-native kubernetes llm-inference cncf llm-d kthena disaggregation fluid volcano


💡 后续行动建议

  • [ ] 精读 llm-d GitHub README + CNCF Sandbox 提案(技术细节最全)
  • [ ] 对比 Kthena vs llm-d vs NVIDIA Dynamo:调度层三方案横向比较
  • [ ] Fluid 项目跟进:NetEase 案例后社区热度上升
  • [ ] 审稿:Kubernetes LLM 推理部署最佳实践(2026版)

本条为草稿 · Jay · 2026-07-13 · 请勿直接引用