知识库草稿:推理引擎 · Vector DB · Agentic RAG · K8s v1.36 追踪

实例: Jay | 日期: 2026-08-14 | 检索范围: Tavily / Web Search · GitHub Topics · Hugging Face Blog · Substack (MLOps Community / The AI Engineer) · CSDN (openEuler) · 技术媒体


一、核心发现

1. LLM 推理引擎格局(2026 中期)

关键事件:Hugging Face TGI 进入维护模式

  • TGI(Text Generation Inference)正式进入维护模式,GitHub README 明确:"Going forward, we will accept pull requests for minor bug fixes, documentation improvements and lightweight maintenance tasks"
  • vLLM 和 SGLang 双寡头格局确立,TGI 退出主流竞争

vLLM vs SGLang 选型框架(2026-08 更新):

维度 vLLM SGLang
核心机制 PagedAttention + Continuous Batching RadixAttention
前缀缓存 --enable_prefix_caching 原生 RadixAttention,前缀复用更激进
结构化输出 xgrammar(v0.5.9+ 默认) grammar-cache 重复 schema 复用更好
投机解码 v0.5.9 更成熟 集成度略低
生态 最大,OpenAI 兼容 API 较小但快速增长
适用场景 稳定性优先、多模型混合部署 前缀重复(系统 prompt/工具定义/对话历史)占比高

建议: - 前缀复用高(Agent 系统、长对话、工具调用)→ SGLang - 追求稳定、多样化模型支持 → vLLM - 两者 API 兼容(OpenAI 兼容端点),迁移成本低

来源: Spheron Blog (vLLM vs SGLang 2026), Yotta Labs, DeployBase, The AI Engineer (substack.com)


2. Vector DB 生产格局(2026-08 benchmark)

五大主流选型:

DB 版本 核心优势 QPS(典型配置) 适用场景
pgvector 0.9(2026 初) 同一 Postgres,ACID+SQL,零新服务 ~5K-15K QPS 已有 Postgres、<2M 向量、向量与结构化同事务
Qdrant 1.9.x Rust 高性能,HNSW+过滤,多向量 ColBERT-V2 原生 ~30K-80K QPS 复杂过滤、生产级、高吞吐量
Weaviate - 混合检索(词义+语义)第一等,GraphQL - 混合搜索场景
Milvus - 十亿级规模 - 超大规模
LanceDB - 多模态(图像/视频) - 多模态 RAG
Chroma - 原型/MVP 最快启动 - 快速验证

pgvector 0.9 新特性: IVFFlat 改进、稀疏向量支持、HNSW 性能提升 Qdrant 亮点: 原生多向量支持,ColBERT-V2 风格 late-interaction retrieval 成为第一等公民

多租户隔离方案: - pgvector:行级安全(RLS),适合几十到几百租户 - Pinecone:Namespace 隔离 - Qdrant:Payload indexed field 过滤(tenant 关键词字段) - Weaviate:原生多租户

来源: CallMissed Vector DB 2026 对比, Kalvium Labs 生产报告, PkgPulse, Spheron


3. Agentic RAG 五大生产模式(2026 Q3)

五种canonical patterns:

  1. Query rewriting and decomposition:Agent 重写 query → retrieval-friendly,可选子查询拆分
  2. Multi-hop retrieval:retrieve-reason-retrieve 迭代,直到 stop condition 触发
  3. Tool routing:Agent 在向量搜索 / BM25 / Web 搜索 / SQL / Re-ranker 之间按 query 选型
  4. Self-check on draft:faithfulness / groundedness judge 守门,阻止 hallucination
  5. GraphRAG:微软客户支持、法律科技、医学文献搜索已有生产部署

迭代预算(Iteration Budget)工程实践: - 每个 primitive 有 token 成本和延迟成本 - 好系统按问题难度分流:简单问题 1 retrieve(80%),复杂问题 4 retrieve(20%) - 预算设置要紧到控制成本,但松到不让可靠率下降

评估工具链(生产推荐): - Tracing: Langfuse(MIT,基础设施内数据) - Evaluation: RAGAS(RAG 质量)+ DeepEval(通用 LLM 质量) - Cost & Routing: LiteLLM(跨多 provider 路由和缓存) - Safety: Guardrails AI(输入/输出验证)

来源: FutureAGI Agentic RAG 2026, TeacherAndTask RAG Failure Modes 2026, DigitalApplied Multi-Step Reasoning, Medium Elam Marisaoufiane RAG 2026


4. Kubernetes v1.36(2026):AI 原生平台正式确立

DRA(Dynamic Resource Allocation)正式 GA: - 彻底改变 GPU/TPU 管理方式 - ResourceClaim + ResourceClass 声明式管理 - 用户命名空间(User Namespaces)稳定,容器隔离增强

etcd 优化配置要点(生产建议):

# WAL 单独存储提升性能
--wal-dir=/var/lib/etcd/wal
# 减少快照频率
--snapshot-count=10000
# 自动压缩
--auto-compaction-mode=periodic
--auto-compaction-retention=1h
--quota-backend-bytes=8589934592  # 8GB

企业落地建议(分阶段): 1. 先升级控制面到 v1.36,再逐步升级节点 2. 生产环境等特性进入 GA 后再使用(当前 DRA + User Namespaces 已 GA) 3. 构建 AI 原生基础设施团队(K8S + AI 复合技能) 4. 部署基于 eBPF 的全链路监控系统

来源: openEuler 社区(CSDN), CloudOptimo K8s AI Infrastructure 2026, Northflank Managed K8s 2026


仓库 Stars 方向 亮点
opencode (anomalyco) 55.4k Coding Agent Cursor 本地开源替代,多模型切换
OpenHands (All-Hands-AI) 60.6k Coding Agent OpenDevin 继承者,企业采用率高
Langflow - RAG/Agent 可视化 LangChain 生态拖拽编排,低代码
Bumblebee (Perplexity) - Supply Chain 安全 依赖/MCP/编辑器扩展扫描
nanochat (Andrej Karpathy) 55k LLM 训练/推理全流程 单文件暴露 tokenization → pretraining → finetuning → inference 全链路
microsoft/Build26-* 多仓库 AI Agents 生产工程 Microsoft Build 2026 资源(部署/观测/Agent 编排)

来源: ByteByteGo Top AI GitHub Repos 2026, Firecrawl Best AI GitHub Repos 2026, GitHub Topics build-2026


6. Hugging Face 生态动态(Spring 2026)

里程碑: Hub 突破 200 万模型 关键趋势: - NVIDIA 成为最强大贡献者 - 个人用户创建有竞争力模型的能力大幅提升(第四大趋势模型来源) - 新模型家族:Google Gemma 4、Qwen 3.6、DeepSeek-V4、EuroBERT(多语言)、Mistral VoxtralRealtime(流式 ASR) - smolagents + MCP 组合:强大但新,Building reliable observable agent ≠ 简单 while 循环 - 成本控制关键:per-token 网关定价 / hourly Endpoints / ZeroGPU 配额 / 自托管 GPU 成本曲线各异

Benchmark 数据集: BenchGeckoAI/ai-model-benchmarks-2026(含 20+ 模型,按 average_score 排名,含定价数据)

来源: Hugging Face Blog State of Open Source Spring 2026


7. LLMOps 市场格局(2026)

规模: LLMOps 市场预计从 2024 年 $1.97B 增至 2028 年 $4.9B(42% CAGR) 趋势: - 72% 企业 2026 年采用 AI 自动化工具,但大多数未建立成本控制 - DataRobot 2026 重新定位:面向 agentic AI + GenAI 应用交付,guardrails + evaluation + production monitoring - Dataiku LLM Mesh:多模型路由 + 成本控制层,适合 visual-plus-code 团队

生产工具链推荐: - Langfuse(Tracing) - RAGAS + DeepEval(Evaluation) - LiteLLM(Cost & Routing) - Guardrails AI(Safety)

来源: Deepak Gupta Top 10 MLOps 2026, Prepzee MLOps Landscape, MachineLearningMastery LLMOps Roadmap, MLOps World


8. Substack 高价值研究线索

专栏 文章 核心洞察 可信度
The AI Engineer (substack.com) vLLM vs Ollama vs SGLang vs TensorRT-LLM TGI 维护模式确认;SGLang 增长最快;多引擎选型指南 ⭐⭐⭐⭐⭐ 行业工程师视角
MLOps Community QA the Agent, Not the Code Agent 评测范式转变;Agent autonomy vs weak foundations ⭐⭐⭐⭐⭐ MLOps 社区权威
MLOps Community Prod Is One Cell Away 生产 AI 观测;Agent telemetry;search as system ⭐⭐⭐⭐

二、分类标签

推理引擎 vLLM SGLang VectorDB Qdrant pgvector AgenticRAG GraphRAG RAG评估 Kubernetes DRA K8s-v1.36 LLMOps HuggingFace GitHub-Trending AI工程 后端 部署


三、建议写入路径

主草稿路径: /shared/research-kb/inbox/jay/2026-08-14-inference-vector-rag-k8s.md

关联补充(如后续精读): - 2026-08-14-substack-the-ai-engineer-inference-comparison.md - 2026-08-14-vector-db-benchmark-2026.md


四、后续行动建议

优先级 行动 理由
🔴 高 关注 vLLM v0.5.9 + SGLang 前缀缓存对比 benchmark 影响线上推理选型决策
🔴 高 pgvector 0.9 生产 benchmark 验证 可能是中小规模 RAG 最优解
🟡 中 精读 MLOps Community "QA the Agent, Not the Code" Agent 评测方法论,与当前 eval 工作相关
🟡 中 Qdrant ColBERT-V2 多向量实战评测 late-interaction 是 2026 高精度 RAG 方向
🟢 低 nanochat 全流程源码走读 Andrej Karpathy 教育价值高,适合内部培训