研究知识库草稿 · 2026-09-27 · cloud-native

主题:KubeCon 2026 / llm-d / Kubernetes 推理平台


[参考] llm-d v0.9 — K8s 原生推理控制平面

  • 来源:arXiv:2609.05565v1(2026年9月3日)
  • URL:https://arxiv.org/html/2609.05565v1
  • 标签:llm-d kubernetes inference-plane kv-cache scheduling
  • 评分:⭐⭐⭐⭐

定位

llm-d 起源于 Kubernetes 原生分布式推理栈,已演化为推理控制平面,处于 v0.9 阶段(参考节点)。

核心能力矩阵

能力 说明
Cache-aware 路由 前缀缓存命中率驱动请求路由决策
Prefill/Decode 分离 Disaggregated serving,减少相互干扰
多层 KV 管理 GPU → CPU → NVMe 分层卸载
预测延迟调度 在线回归模型(prompt长度、缓存命中率、队列深度、KV利用率 → TTFT/TPOT)
异构引擎编排 统一入口,调度 vLLM / SGLang / 其他引擎
自动扩缩容 基于负载的弹性伸缩
请求级追踪 端到端可观测性

预测延迟调度输入特征

prompt_length + prefix_cache_hit_rate + running_requests + queue_depth + KV_utilization
→ TTFT(首 token 时间)+ TPOT(每输出 token 时间)

未来方向:加入 GPU power/frequency/energy counters,扩展为能耗感知调度(自然实验)。

评价

K8s 推理平台架构方向,参考价值高。KubeCon 2026 相关 Sessions 可交叉验证。


[参考] KubeCon 2026 — LLM 推理优化 Sessions

  • 来源:KubeCon 2026 会议预告
  • 标签:kubecon kubernetes llm-inference multi-model
  • 评分:⭐⭐

线索

  • LMD 项目:Multi-Model K8s 部署方案(单集群多模型共存)
  • 加速器管理:GPU 资源抽象与调度
  • 可观测性:LLM 推理场景的指标采集与追踪

评价

线索类,待验证具体 Sessions 列表和内容质量。KubeCon 2026 实际发生在 2026年(时间待确认,可关注 CNCF 官方存档)。


[背景] 连接 vLLM、llm-d 与高效推理演进

  • 来源:arXiv:2609.23130v1(2026年9月13日)
  • URL:https://arxiv.org/html/2609.23130v1
  • 标签:vllm llm-d arxiv-review inference-systems
  • 评分:⭐⭐⭐

软件快照(截至2026年9月)

  • vLLM v0.29.0(含 PagedAttention、Continuous Batching、Chunked Prefill、Prefix Caching、Speculative Decoding、多量化格式、FlashAttention/FlashInfer/DeepGEMM 内核、Tensor/Pipeline/Data/Expert 并行、Disaggregated Serving)
  • llm-d v0.9(K8s 原生推理控制平面)

评价

综合综述,学术严谨,适合建立 LLM inference 系统全景图。


后续行动

  • [ ] 核验:KubeCon 2026 实际日期和 Sessions 存档链接
  • [ ] 精读:llm-d 预测延迟调度 + 能量感知扩展方向
  • [ ] 更新:cloud-native 主题页(K8s + LLM 推理交叉领域)