工程过滤简报 · 2026-07-07 下午

主题:LLM Inference Engines、Vector DB Benchmark、K8s GPU Orchestration、GPU Kernel Auto-Generation


一、LLM Inference Engines 2026 最新格局

核心格局变化

Hugging Face TGI 已于 2025年12月进入维护模式,官方推荐迁移至 vLLM 或 SGLang。Hugging Face Inference Endpoints 现默认使用 vLLM,SGLang 作为备选。

引擎 定位 H100 吞吐量 适用场景
vLLM 社区最大、生态最成熟 ~12,500 tok/s 通用生产部署,跨云厂商
SGLang 前缀缓存、多轮对话、结构化输出 ~16,200 tok/s (+29%) RAG、多 agent 流程
TensorRT-LLM NVIDIA 硬件深度优化 峰值性能最强 Blackwell GPU、RTX 4090
llama.cpp CPU / 边缘推理 端侧、国产硬件

关键数据点: - SGLang 在 prefix-heavy 工作负载(RAG 场景)TTFT 优势明显,RadixAttention prefix reuse - vLLM MRV2(Model Runner V2)在 GB200 上吞吐量提升 56% - TensorRT-LLM 在 RTX 4090 上比 llama.cpp 快 70% - Modular MAX(Mojo 内核)作为第五势力崛起

评价:选引擎原则——前缀共享多、agentic workflow → SGLang;硬件多样化、通用性 → vLLM;NVIDIA 原生硬件 → TensorRT-LLM。

来源: - vLLM vs SGLang 2026 H100 Benchmarks(TECHSY,2026) - Best LLM Inference Engines 2026(Yotta Labs) - vLLM vs SGLang vs TensorRT-LLM(JarvisLabs) - The AI Engineer Substack


二、Vector DB 2026 Benchmark 格局

最大变化:pgvector 已非慢选项。Timescale pgvectorscale 使 PostgreSQL 在 50M 向量规模达到 471 QPS @ 99% recall,是 Qdrant 的 11.4 倍。

数据库 类型 核心优势 适用规模
pgvector Postgres 扩展 无独立服务、与现有 DB 共存 <2M 向量(不加 pgvectorscale)
pgvectorscale Postgres 扩展+ 471 QPS @ 99% recall 50M 向量
Qdrant Rust 向量 DB ~850 QPS,最佳过滤能力 自托管生产
Pinecone 托管服务 sub-20ms p95,5M+ 向量 托管云场景
Weaviate 向量+混合搜索 内置向量化、GraphQL、多模态 混合搜索需求
Milvus 开源大规模 十亿级 超大规模
Chroma 向量存储 DX 最佳 原型开发

实用决策树:Postgres 团队 → pgvector(默认);托管云偏好 → Pinecone;自托管+性能优先 → Qdrant;<10M 向量+无特殊需求 → pgvector 足够。

来源: - pgvector vs Qdrant vs Weaviate 2026(PkgPulse) - pgvector vs Pinecone 2026(Kalvium Labs) - pgvector 471 QPS benchmark(DEV Community) - Vector DB for AI Agents 2026(Digital Applied)


三、GPU Kernel 自动生成:LLM Agent 的新战场

2026 新进展

GPU kernel 生成已成为 LLM 代码生成的热门子领域,多个 Agent 框架涌现:

框架 机构 关键特性
CUDA Agent 大规模 RL 生成 CUDA kernel(2026-02)
AutoTriton RL 自动 Triton 编程(2025-07)
KernelSkill 多 Agent GPU kernel 优化框架(2026-03)
VibeTensor NVIDIA LLM coding agents 生成完整 DL runtime(2026-02)
CuTeGen LLM agent 生成 CuTe 高性能 kernel(2026-04)
Astra 多 Agent GPU kernel 性能优化(2025-09)
CudaForge 硬件反馈驱动 CUDA kernel 优化(2025-10)
QiMeng-Kernel Macro-Thinking Micro-Coding paradigm(2025-11)

arXiv 重要论文: - arXiv:2606.26453 — 用 Micro-Profiling Tools 做 LLM kernel 优化的 expert surrogate - arXiv:2606.28565KernelSight-LM:Kernel 级 LLM inference 模拟器,cross-generation 预测误差 12.1%,target-measured 3.8% - arXiv:2603.29010 — DSL + Speed-of-Light 引导提升 kernel 优化效率,GPT-5-mini 从 0.40× regression 变为 1.27× speedup - arXiv:2601.15727 — 综述:LLM 时代自动 kernel 生成 - arXiv:2601.00227FlashInfer-Bench:真实 LLM serving trace 的 kernel benchmark + leaderboard

信号:NVIDIA 自己的 VibeTensor 论文表明,AI coding agents 已经可以从上层 human guidance 生成完整 DL runtime(语言绑定 → CUDA 内存管理),这是一个重要的里程碑。

来源: - awesome-LLM-driven-kernel-generation - VibeTensor — LinkedIn


四、Kubernetes GPU Orchestration 2026

关键事件:KubeCon Europe 2026 上,NVIDIA 将 Dynamic Resource Allocation (DRA) 驱动捐赠给 CNCF,这改变了 K8s GPU 调度格局。

旧问题 vs 新方案

旧方案 问题 新方案
NVIDIA Device Plugin(2017~) 只能整数 GPU 分配,无法感知拓扑 DRA — API 驱动资源模型
手动调度 多租户优先级无法精细控制 KAI Scheduler — 多租户优先级调度
手写 YAML inference workload 管理繁琐 Grove — 声明式推理 workload 管理

GPU 利用率危机

Cast AI 2026 报告:生产 K8s 集群 GPU 利用率仅 5%。这是 Kubernetes AI 基础设施最大的效率问题,也是 DRA 和 fractional GPU 分配技术兴起的根本原因。

参考架构层面

生产 K8s AI 栈核心组件: - GPU Operator — 节点上 NVIDIA 软件栈管理 - KubeRay — 分布式训练协调 - Kueue / Volcano — 作业队列和调度 - DRA — 新型 GPU 资源分配 - KServe — 模型 serving(含 batching、A/B、canary) - vLLM / SGLang Operator — LLM serving 专用

来源: - Kubernetes GPU Orchestration 2026(Spheron,2026) - Kubernetes AI Infrastructure 2026(CloudOptimo) - Kubernetes becoming AI OS(TFiR,vCluster) - Cast AI GPU Utilization Report


AI 开源 2026 年6月趋势(来源:agents-radar):

  1. Agentic Skills 框架崛起obra/superpowers(+1,110 stars)— 把 agent 开发当工程学科
  2. 轻量级 expertise 驱动multica-ai/andrej-karpathy-skills(+3,507 stars)— 单个 CLAUDE.md 文件胜过复杂框架
  3. Codebase → Knowledge GraphLum1104/Understand-Anything(+2,299 stars)— 任意代码库转成交互式知识图谱
  4. Agent 原生 LLMzai-org/GLM-5(+480 stars)— 从 "vibe coding" 到 agentic engineering
  5. Awesome Listawesome-ai-agents-2026 — 300+ AI agents、框架、编码/语音/研究/企业工具

Awesome-LLM-Inference-Enginesihyeong):25 个开源+商业推理引擎分类比较,含 survey paper。

来源: - agents-radar #1716 - Awesome AI Agents 2026


分类标签

LLM-Inference vLLM SGLang TensorRT-LLM Vector-DB pgvector Qdrant Kubernetes GPU-Orchestration DRA KAI-Scheduler GPU-Kernel LLM-Agent Kernel-AutoGen MLOps


建议写入路径

/shared/research-kb/inbox/jay/2026-07-07-1745-engineering-filter-inference-vecdb-k8s-arxiv.md


后续行动建议

  1. 精读KernelSight-LM(kernel 级 inference 模拟,跨 GPU 代际预测)→ 考虑补充进 inference 工程主题页
  2. 精读:VibeTensor 论文(Nvidia 生成完整 DL runtime)→ AI coding agents 能力边界标志性事件
  3. 跟踪:DRA 在 CNCF 的落地进展 → K8s GPU 调度标准化
  4. 更新:Inference Engines 对比页面 → 加入 SGLang vs vLLM H100 benchmark 数据
  5. 评估:pgvectorscale benchmark → 50M 向量规模下是否可直接替代 Qdrant

可信度判断: - 基础设施 benchmark 数据(TECHSY、Yotta Labs、Kalvium Labs)→ 第三方测试,可信度中高,需交叉验证 - Cast AI 报告 → 基于真实生产数据,可信度高 - agents-radar GitHub stars → 实时数据,高可信度 - arXiv 论文 → 学术来源,需论文原文核验