KubeCon NA 2026 · AI Inference + Agentic 独立轨道 · GPU-Native K8s 三件套
主题: KubeCon NA 2026 新增 AI Inference + Agentic 专项轨道,CNCF 生态 AI Serving 基础设施确立
来源: CNCF 官方新闻稿 / Pulumi Blog KubeCon EU 2026 Recap
时间: 2026-08-07 公布日程;2026-11-09-12 会议(Salt Lake City)
可信度: 高(CNCF 官方 + 一手现场报告)
分类标签: #KubeCon #CNCF #Kubernetes #AI-Inference #Agentic #GPU-Scheduling #llm-d #KAI-Scheduler #DRA-Driver
一、核心事件:KubeCon NA 2026 新增 AI Inference + Agentic 轨道
事件背景
KubeCon NA 2026(2026 年 11 月 9-12 日,Salt Lake City)首次设立 AI Inference + Agentic 独立轨道,这是 Kubernetes 生态系统中 AI Serving 基础设施地位确立的里程碑。
轨道覆盖范围
- GPU 调度: 如何在 Kubernetes 上高效调度 GPU 资源用于 AI 推理
- AI Agent 工作流编排: 在 K8s 上运行生产级 Agent 自治系统
- Model Serving 可观测性: vLLM / KServe / Ray / OpenTelemetry 在 K8s 上的集成
- 分布式推理: 跨节点/跨集群的模型服务化
CNCF 执行董事 Jonathan Bryce 原话
"AI 是我们见过的最大计算工作负载之一,从训练模型到运行模型的转变才是真正工程挑战所在。"
CNCF 首席关键论断(Cloud Native Now 2026-08-26)
"AI inference models and the agents deployed with them will be invoking more cloud-native software running as a backend service... AI agents will eventually become the primary means for invoking what will become a portfolio of headless backend services."
工程含义: AI Agent 将成为调用无头(headless)后端服务的主要方式,Kubernetes 是这一架构的基础设施层。
二、CNCF Sandbox 新增 AI 基础设施项目
llm-d(分布式 LLM 推理运行时)
- 类型: 分布式推理引擎层
- 定位: 处理 inference engine 层的分布式协调
- 与 vLLM/SGLang 关系: llm-d 是编排层,底层可以对接 vLLM 或 SGLang 作为 worker
- CNCF 状态: Sandbox
KAI Scheduler(GPU 感知调度器)
- 类型: Kubernetes 调度器插件
- 定位: 处理 GPU 资源 placement 决策(多 GPU 亲和性、拓扑感知)
- 与 llm-d 和 DRA Driver 协同: KAI Scheduler + llm-d + DRA Driver = GPU-native K8s 栈三件套
DRA Driver(Dynamic Resource Allocation)
- 类型: K8s 资源分配驱动
- 定位: 处理 GPU 资源的动态分配(取代旧的 device plugin 模式)
- 作用: 让 KAI Scheduler 的调度决策能够实际执行
三件套协同架构
应用层(Agent / Model Serving)
↓
llm-d(分布式推理编排)
↓
KAI Scheduler(GPU 感知调度)
↓
DRA Driver(GPU 资源分配)
↓
Kubernetes 节点层(GPU 硬件)
Envoy AI Gateway
- 类型: API Gateway
- 新特性: token-aware 限速(按 token 而非 request 计费,更适合 LLM 变长请求)
- Provider failover: 支持多 LLM 提供商的自动故障转移
HolmesGPT + Dalec
- 类型: AI 驱动 SRE 工具
- 用途: AI 驱动故障排查(HolmesGPT)和依赖分析(Dalec)
Velero
- 新关注点: AI 工作负载备份恢复
- 原因: 模型权重、检查点、微调数据等 stateful 特性倒逼备份需求
三、工程影响评估
正面影响
- GPU 调度成熟度提升: KAI Scheduler + DRA Driver 的组合将显著改善多 GPU 任务的调度效率
- 分布式推理标准化: llm-d 提供了一层抽象,使得 vLLM/SGLang 部署可以用一致的 K8s 原语管理
- AI Agent 生产化路径清晰: KubeCon 轨道设立意味着最佳实践将快速积累
风险和待观察点
| 项目 | 风险 | 建议 |
|---|---|---|
| llm-d | Sandbox 阶段,生产需谨慎 | 关注 CNCF 升级路径 |
| KAI Scheduler | 调度决策与 inference engine 耦合 | 评估是否适合当前架构 |
| Envoy AI Gateway token-aware | 新功能,生产验证不足 | 关注 2026-11 KubeCon 现场案例 |
四、关注行动
立即关注
- [ ] 订阅 CNCF blog,追踪 llm-d/KAI Scheduler DRA Driver 的 CNCF 升级状态
- [ ] 评估现有 K8s 集群是否需要升级到支持 DRA 的版本(K8s 1.24+)
中期规划(2026 Q4)
- [ ] 参加 KubeCon NA 2026 AI Inference 轨道(或获取录像)
- [ ] 评估 Envoy AI Gateway token-aware 限速功能
长期关注
- [ ] llm-d 从 Sandbox 升级到 Incubating 时的架构稳定性评估
- [ ] KAI Scheduler 与现有 Volcano/S/Yarn 的功能重叠决策
五、相关资源
| 资源 | 链接 |
|---|---|
| CNCF KubeCon NA 2026 日程 | https://www.cncf.io/announcements/2026/08/10/cncf-reveals-kubecon-cloudnativecon-north-america-2026-schedule-adds-new-ai-inference-agentic-track |
| llm-d GitHub | https://github.com/cncf/llm-d |
| KAI Scheduler | https://github.com/CNCF/KAI |
| Pulumi KubeCon EU 2026 Recap | https://www.pulumi.com/blog/kubecon-eu-2026-recap |
| Cloud Native Now CNCF 首席访谈 | https://cloudnativenow.com(2026-08-26) |
六、工程价值评估
| 维度 | 评分 | 说明 |
|---|---|---|
| 行业影响 | ✅ | KubeCon 独立轨道 = CNCF 生态正式认可 AI Serving 地位 |
| 工程技术 | ✅ | llm-d/KAI/DRA 三件套 GA 代表 GPU-native K8s 栈成熟 |
| 时效性 | ✅ | 2026-11 月会议前关注可提前规划 |
综合评级: ⭐⭐⭐⭐⭐ 最高工程价值
行动建议: 作为 AI+Cloud-Native 工程路线图的核心里程碑事件
来源:CNCF 官方 / Pulumi Blog · 整理:Jay · 2026-08-30