研究知识库草稿 · 2026-09-27 · cloud-native
主题:KubeCon 2026 / llm-d / Kubernetes 推理平台
[参考] llm-d v0.9 — K8s 原生推理控制平面
- 来源:arXiv:2609.05565v1(2026年9月3日)
- URL:https://arxiv.org/html/2609.05565v1
- 标签:
llm-dkubernetesinference-planekv-cachescheduling - 评分:⭐⭐⭐⭐
定位
llm-d 起源于 Kubernetes 原生分布式推理栈,已演化为推理控制平面,处于 v0.9 阶段(参考节点)。
核心能力矩阵
| 能力 | 说明 |
|---|---|
| Cache-aware 路由 | 前缀缓存命中率驱动请求路由决策 |
| Prefill/Decode 分离 | Disaggregated serving,减少相互干扰 |
| 多层 KV 管理 | GPU → CPU → NVMe 分层卸载 |
| 预测延迟调度 | 在线回归模型(prompt长度、缓存命中率、队列深度、KV利用率 → TTFT/TPOT) |
| 异构引擎编排 | 统一入口,调度 vLLM / SGLang / 其他引擎 |
| 自动扩缩容 | 基于负载的弹性伸缩 |
| 请求级追踪 | 端到端可观测性 |
预测延迟调度输入特征
prompt_length + prefix_cache_hit_rate + running_requests + queue_depth + KV_utilization
→ TTFT(首 token 时间)+ TPOT(每输出 token 时间)
未来方向:加入 GPU power/frequency/energy counters,扩展为能耗感知调度(自然实验)。
评价
K8s 推理平台架构方向,参考价值高。KubeCon 2026 相关 Sessions 可交叉验证。
[参考] KubeCon 2026 — LLM 推理优化 Sessions
- 来源:KubeCon 2026 会议预告
- 标签:
kubeconkubernetesllm-inferencemulti-model - 评分:⭐⭐
线索
- LMD 项目:Multi-Model K8s 部署方案(单集群多模型共存)
- 加速器管理:GPU 资源抽象与调度
- 可观测性:LLM 推理场景的指标采集与追踪
评价
线索类,待验证具体 Sessions 列表和内容质量。KubeCon 2026 实际发生在 2026年(时间待确认,可关注 CNCF 官方存档)。
[背景] 连接 vLLM、llm-d 与高效推理演进
- 来源:arXiv:2609.23130v1(2026年9月13日)
- URL:https://arxiv.org/html/2609.23130v1
- 标签:
vllmllm-darxiv-reviewinference-systems - 评分:⭐⭐⭐
软件快照(截至2026年9月)
- vLLM v0.29.0(含 PagedAttention、Continuous Batching、Chunked Prefill、Prefix Caching、Speculative Decoding、多量化格式、FlashAttention/FlashInfer/DeepGEMM 内核、Tensor/Pipeline/Data/Expert 并行、Disaggregated Serving)
- llm-d v0.9(K8s 原生推理控制平面)
评价
综合综述,学术严谨,适合建立 LLM inference 系统全景图。
后续行动
- [ ] 核验:KubeCon 2026 实际日期和 Sessions 存档链接
- [ ] 精读:llm-d 预测延迟调度 + 能量感知扩展方向
- [ ] 更新:cloud-native 主题页(K8s + LLM 推理交叉领域)