KubeCon NA 2026 · AI Inference + Agentic 独立轨道 · GPU-Native K8s 三件套

主题: KubeCon NA 2026 新增 AI Inference + Agentic 专项轨道,CNCF 生态 AI Serving 基础设施确立
来源: CNCF 官方新闻稿 / Pulumi Blog KubeCon EU 2026 Recap
时间: 2026-08-07 公布日程;2026-11-09-12 会议(Salt Lake City)
可信度: 高(CNCF 官方 + 一手现场报告)
分类标签: #KubeCon #CNCF #Kubernetes #AI-Inference #Agentic #GPU-Scheduling #llm-d #KAI-Scheduler #DRA-Driver


一、核心事件:KubeCon NA 2026 新增 AI Inference + Agentic 轨道

事件背景

KubeCon NA 2026(2026 年 11 月 9-12 日,Salt Lake City)首次设立 AI Inference + Agentic 独立轨道,这是 Kubernetes 生态系统中 AI Serving 基础设施地位确立的里程碑。

轨道覆盖范围

  • GPU 调度: 如何在 Kubernetes 上高效调度 GPU 资源用于 AI 推理
  • AI Agent 工作流编排: 在 K8s 上运行生产级 Agent 自治系统
  • Model Serving 可观测性: vLLM / KServe / Ray / OpenTelemetry 在 K8s 上的集成
  • 分布式推理: 跨节点/跨集群的模型服务化

CNCF 执行董事 Jonathan Bryce 原话

"AI 是我们见过的最大计算工作负载之一,从训练模型到运行模型的转变才是真正工程挑战所在。"

CNCF 首席关键论断(Cloud Native Now 2026-08-26)

"AI inference models and the agents deployed with them will be invoking more cloud-native software running as a backend service... AI agents will eventually become the primary means for invoking what will become a portfolio of headless backend services."

工程含义: AI Agent 将成为调用无头(headless)后端服务的主要方式,Kubernetes 是这一架构的基础设施层。


二、CNCF Sandbox 新增 AI 基础设施项目

llm-d(分布式 LLM 推理运行时)

  • 类型: 分布式推理引擎层
  • 定位: 处理 inference engine 层的分布式协调
  • 与 vLLM/SGLang 关系: llm-d 是编排层,底层可以对接 vLLM 或 SGLang 作为 worker
  • CNCF 状态: Sandbox

KAI Scheduler(GPU 感知调度器)

  • 类型: Kubernetes 调度器插件
  • 定位: 处理 GPU 资源 placement 决策(多 GPU 亲和性、拓扑感知)
  • 与 llm-d 和 DRA Driver 协同: KAI Scheduler + llm-d + DRA Driver = GPU-native K8s 栈三件套

DRA Driver(Dynamic Resource Allocation)

  • 类型: K8s 资源分配驱动
  • 定位: 处理 GPU 资源的动态分配(取代旧的 device plugin 模式)
  • 作用: 让 KAI Scheduler 的调度决策能够实际执行

三件套协同架构

应用层(Agent / Model Serving)
        ↓
  llm-d(分布式推理编排)
        ↓
  KAI Scheduler(GPU 感知调度)
        ↓
  DRA Driver(GPU 资源分配)
        ↓
  Kubernetes 节点层(GPU 硬件)

Envoy AI Gateway

  • 类型: API Gateway
  • 新特性: token-aware 限速(按 token 而非 request 计费,更适合 LLM 变长请求)
  • Provider failover: 支持多 LLM 提供商的自动故障转移

HolmesGPT + Dalec

  • 类型: AI 驱动 SRE 工具
  • 用途: AI 驱动故障排查(HolmesGPT)和依赖分析(Dalec)

Velero

  • 新关注点: AI 工作负载备份恢复
  • 原因: 模型权重、检查点、微调数据等 stateful 特性倒逼备份需求

三、工程影响评估

正面影响

  1. GPU 调度成熟度提升: KAI Scheduler + DRA Driver 的组合将显著改善多 GPU 任务的调度效率
  2. 分布式推理标准化: llm-d 提供了一层抽象,使得 vLLM/SGLang 部署可以用一致的 K8s 原语管理
  3. AI Agent 生产化路径清晰: KubeCon 轨道设立意味着最佳实践将快速积累

风险和待观察点

项目 风险 建议
llm-d Sandbox 阶段,生产需谨慎 关注 CNCF 升级路径
KAI Scheduler 调度决策与 inference engine 耦合 评估是否适合当前架构
Envoy AI Gateway token-aware 新功能,生产验证不足 关注 2026-11 KubeCon 现场案例

四、关注行动

立即关注

  • [ ] 订阅 CNCF blog,追踪 llm-d/KAI Scheduler DRA Driver 的 CNCF 升级状态
  • [ ] 评估现有 K8s 集群是否需要升级到支持 DRA 的版本(K8s 1.24+)

中期规划(2026 Q4)

  • [ ] 参加 KubeCon NA 2026 AI Inference 轨道(或获取录像)
  • [ ] 评估 Envoy AI Gateway token-aware 限速功能

长期关注

  • [ ] llm-d 从 Sandbox 升级到 Incubating 时的架构稳定性评估
  • [ ] KAI Scheduler 与现有 Volcano/S/Yarn 的功能重叠决策

五、相关资源

资源 链接
CNCF KubeCon NA 2026 日程 https://www.cncf.io/announcements/2026/08/10/cncf-reveals-kubecon-cloudnativecon-north-america-2026-schedule-adds-new-ai-inference-agentic-track
llm-d GitHub https://github.com/cncf/llm-d
KAI Scheduler https://github.com/CNCF/KAI
Pulumi KubeCon EU 2026 Recap https://www.pulumi.com/blog/kubecon-eu-2026-recap
Cloud Native Now CNCF 首席访谈 https://cloudnativenow.com(2026-08-26)

六、工程价值评估

维度 评分 说明
行业影响 KubeCon 独立轨道 = CNCF 生态正式认可 AI Serving 地位
工程技术 llm-d/KAI/DRA 三件套 GA 代表 GPU-native K8s 栈成熟
时效性 2026-11 月会议前关注可提前规划

综合评级: ⭐⭐⭐⭐⭐ 最高工程价值
行动建议: 作为 AI+Cloud-Native 工程路线图的核心里程碑事件


来源:CNCF 官方 / Pulumi Blog · 整理:Jay · 2026-08-30