工程过滤简报 · 2026-07-07 下午
主题:LLM Inference Engines、Vector DB Benchmark、K8s GPU Orchestration、GPU Kernel Auto-Generation
一、LLM Inference Engines 2026 最新格局
核心格局变化
Hugging Face TGI 已于 2025年12月进入维护模式,官方推荐迁移至 vLLM 或 SGLang。Hugging Face Inference Endpoints 现默认使用 vLLM,SGLang 作为备选。
| 引擎 | 定位 | H100 吞吐量 | 适用场景 |
|---|---|---|---|
| vLLM | 社区最大、生态最成熟 | ~12,500 tok/s | 通用生产部署,跨云厂商 |
| SGLang | 前缀缓存、多轮对话、结构化输出 | ~16,200 tok/s (+29%) | RAG、多 agent 流程 |
| TensorRT-LLM | NVIDIA 硬件深度优化 | 峰值性能最强 | Blackwell GPU、RTX 4090 |
| llama.cpp | CPU / 边缘推理 | — | 端侧、国产硬件 |
关键数据点: - SGLang 在 prefix-heavy 工作负载(RAG 场景)TTFT 优势明显,RadixAttention prefix reuse - vLLM MRV2(Model Runner V2)在 GB200 上吞吐量提升 56% - TensorRT-LLM 在 RTX 4090 上比 llama.cpp 快 70% - Modular MAX(Mojo 内核)作为第五势力崛起
评价:选引擎原则——前缀共享多、agentic workflow → SGLang;硬件多样化、通用性 → vLLM;NVIDIA 原生硬件 → TensorRT-LLM。
来源: - vLLM vs SGLang 2026 H100 Benchmarks(TECHSY,2026) - Best LLM Inference Engines 2026(Yotta Labs) - vLLM vs SGLang vs TensorRT-LLM(JarvisLabs) - The AI Engineer Substack
二、Vector DB 2026 Benchmark 格局
最大变化:pgvector 已非慢选项。Timescale pgvectorscale 使 PostgreSQL 在 50M 向量规模达到 471 QPS @ 99% recall,是 Qdrant 的 11.4 倍。
| 数据库 | 类型 | 核心优势 | 适用规模 |
|---|---|---|---|
| pgvector | Postgres 扩展 | 无独立服务、与现有 DB 共存 | <2M 向量(不加 pgvectorscale) |
| pgvectorscale | Postgres 扩展+ | 471 QPS @ 99% recall | 50M 向量 |
| Qdrant | Rust 向量 DB | ~850 QPS,最佳过滤能力 | 自托管生产 |
| Pinecone | 托管服务 | sub-20ms p95,5M+ 向量 | 托管云场景 |
| Weaviate | 向量+混合搜索 | 内置向量化、GraphQL、多模态 | 混合搜索需求 |
| Milvus | 开源大规模 | 十亿级 | 超大规模 |
| Chroma | 向量存储 | DX 最佳 | 原型开发 |
实用决策树:Postgres 团队 → pgvector(默认);托管云偏好 → Pinecone;自托管+性能优先 → Qdrant;<10M 向量+无特殊需求 → pgvector 足够。
来源: - pgvector vs Qdrant vs Weaviate 2026(PkgPulse) - pgvector vs Pinecone 2026(Kalvium Labs) - pgvector 471 QPS benchmark(DEV Community) - Vector DB for AI Agents 2026(Digital Applied)
三、GPU Kernel 自动生成:LLM Agent 的新战场
2026 新进展
GPU kernel 生成已成为 LLM 代码生成的热门子领域,多个 Agent 框架涌现:
| 框架 | 机构 | 关键特性 |
|---|---|---|
| CUDA Agent | — | 大规模 RL 生成 CUDA kernel(2026-02) |
| AutoTriton | — | RL 自动 Triton 编程(2025-07) |
| KernelSkill | — | 多 Agent GPU kernel 优化框架(2026-03) |
| VibeTensor | NVIDIA | LLM coding agents 生成完整 DL runtime(2026-02) |
| CuTeGen | — | LLM agent 生成 CuTe 高性能 kernel(2026-04) |
| Astra | — | 多 Agent GPU kernel 性能优化(2025-09) |
| CudaForge | — | 硬件反馈驱动 CUDA kernel 优化(2025-10) |
| QiMeng-Kernel | — | Macro-Thinking Micro-Coding paradigm(2025-11) |
arXiv 重要论文: - arXiv:2606.26453 — 用 Micro-Profiling Tools 做 LLM kernel 优化的 expert surrogate - arXiv:2606.28565 — KernelSight-LM:Kernel 级 LLM inference 模拟器,cross-generation 预测误差 12.1%,target-measured 3.8% - arXiv:2603.29010 — DSL + Speed-of-Light 引导提升 kernel 优化效率,GPT-5-mini 从 0.40× regression 变为 1.27× speedup - arXiv:2601.15727 — 综述:LLM 时代自动 kernel 生成 - arXiv:2601.00227 — FlashInfer-Bench:真实 LLM serving trace 的 kernel benchmark + leaderboard
信号:NVIDIA 自己的 VibeTensor 论文表明,AI coding agents 已经可以从上层 human guidance 生成完整 DL runtime(语言绑定 → CUDA 内存管理),这是一个重要的里程碑。
来源: - awesome-LLM-driven-kernel-generation - VibeTensor — LinkedIn
四、Kubernetes GPU Orchestration 2026
关键事件:KubeCon Europe 2026 上,NVIDIA 将 Dynamic Resource Allocation (DRA) 驱动捐赠给 CNCF,这改变了 K8s GPU 调度格局。
旧问题 vs 新方案
| 旧方案 | 问题 | 新方案 |
|---|---|---|
| NVIDIA Device Plugin(2017~) | 只能整数 GPU 分配,无法感知拓扑 | DRA — API 驱动资源模型 |
| 手动调度 | 多租户优先级无法精细控制 | KAI Scheduler — 多租户优先级调度 |
| 手写 YAML | inference workload 管理繁琐 | Grove — 声明式推理 workload 管理 |
GPU 利用率危机
Cast AI 2026 报告:生产 K8s 集群 GPU 利用率仅 5%。这是 Kubernetes AI 基础设施最大的效率问题,也是 DRA 和 fractional GPU 分配技术兴起的根本原因。
参考架构层面
生产 K8s AI 栈核心组件: - GPU Operator — 节点上 NVIDIA 软件栈管理 - KubeRay — 分布式训练协调 - Kueue / Volcano — 作业队列和调度 - DRA — 新型 GPU 资源分配 - KServe — 模型 serving(含 batching、A/B、canary) - vLLM / SGLang Operator — LLM serving 专用
来源: - Kubernetes GPU Orchestration 2026(Spheron,2026) - Kubernetes AI Infrastructure 2026(CloudOptimo) - Kubernetes becoming AI OS(TFiR,vCluster) - Cast AI GPU Utilization Report
五、GitHub Trending 信号
AI 开源 2026 年6月趋势(来源:agents-radar):
- Agentic Skills 框架崛起:
obra/superpowers(+1,110 stars)— 把 agent 开发当工程学科 - 轻量级 expertise 驱动:
multica-ai/andrej-karpathy-skills(+3,507 stars)— 单个 CLAUDE.md 文件胜过复杂框架 - Codebase → Knowledge Graph:
Lum1104/Understand-Anything(+2,299 stars)— 任意代码库转成交互式知识图谱 - Agent 原生 LLM:
zai-org/GLM-5(+480 stars)— 从 "vibe coding" 到 agentic engineering - Awesome List:awesome-ai-agents-2026 — 300+ AI agents、框架、编码/语音/研究/企业工具
Awesome-LLM-Inference-Engine(sihyeong):25 个开源+商业推理引擎分类比较,含 survey paper。
来源: - agents-radar #1716 - Awesome AI Agents 2026
分类标签
LLM-Inference vLLM SGLang TensorRT-LLM Vector-DB pgvector Qdrant Kubernetes GPU-Orchestration DRA KAI-Scheduler GPU-Kernel LLM-Agent Kernel-AutoGen MLOps
建议写入路径
/shared/research-kb/inbox/jay/2026-07-07-1745-engineering-filter-inference-vecdb-k8s-arxiv.md
后续行动建议
- 精读:
KernelSight-LM(kernel 级 inference 模拟,跨 GPU 代际预测)→ 考虑补充进 inference 工程主题页 - 精读:VibeTensor 论文(Nvidia 生成完整 DL runtime)→ AI coding agents 能力边界标志性事件
- 跟踪:DRA 在 CNCF 的落地进展 → K8s GPU 调度标准化
- 更新:Inference Engines 对比页面 → 加入 SGLang vs vLLM H100 benchmark 数据
- 评估:pgvectorscale benchmark → 50M 向量规模下是否可直接替代 Qdrant
可信度判断: - 基础设施 benchmark 数据(TECHSY、Yotta Labs、Kalvium Labs)→ 第三方测试,可信度中高,需交叉验证 - Cast AI 报告 → 基于真实生产数据,可信度高 - agents-radar GitHub stars → 实时数据,高可信度 - arXiv 论文 → 学术来源,需论文原文核验