知识库草稿:推理引擎 · Vector DB · Agentic RAG · K8s v1.36 追踪
实例: Jay | 日期: 2026-08-14 | 检索范围: Tavily / Web Search · GitHub Topics · Hugging Face Blog · Substack (MLOps Community / The AI Engineer) · CSDN (openEuler) · 技术媒体
一、核心发现
1. LLM 推理引擎格局(2026 中期)
关键事件:Hugging Face TGI 进入维护模式
- TGI(Text Generation Inference)正式进入维护模式,GitHub README 明确:"Going forward, we will accept pull requests for minor bug fixes, documentation improvements and lightweight maintenance tasks"
- vLLM 和 SGLang 双寡头格局确立,TGI 退出主流竞争
vLLM vs SGLang 选型框架(2026-08 更新):
| 维度 | vLLM | SGLang |
|---|---|---|
| 核心机制 | PagedAttention + Continuous Batching | RadixAttention |
| 前缀缓存 | --enable_prefix_caching |
原生 RadixAttention,前缀复用更激进 |
| 结构化输出 | xgrammar(v0.5.9+ 默认) | grammar-cache 重复 schema 复用更好 |
| 投机解码 | v0.5.9 更成熟 | 集成度略低 |
| 生态 | 最大,OpenAI 兼容 API | 较小但快速增长 |
| 适用场景 | 稳定性优先、多模型混合部署 | 前缀重复(系统 prompt/工具定义/对话历史)占比高 |
建议: - 前缀复用高(Agent 系统、长对话、工具调用)→ SGLang - 追求稳定、多样化模型支持 → vLLM - 两者 API 兼容(OpenAI 兼容端点),迁移成本低
来源: Spheron Blog (vLLM vs SGLang 2026), Yotta Labs, DeployBase, The AI Engineer (substack.com)
2. Vector DB 生产格局(2026-08 benchmark)
五大主流选型:
| DB | 版本 | 核心优势 | QPS(典型配置) | 适用场景 |
|---|---|---|---|---|
| pgvector | 0.9(2026 初) | 同一 Postgres,ACID+SQL,零新服务 | ~5K-15K QPS | 已有 Postgres、<2M 向量、向量与结构化同事务 |
| Qdrant | 1.9.x | Rust 高性能,HNSW+过滤,多向量 ColBERT-V2 原生 | ~30K-80K QPS | 复杂过滤、生产级、高吞吐量 |
| Weaviate | - | 混合检索(词义+语义)第一等,GraphQL | - | 混合搜索场景 |
| Milvus | - | 十亿级规模 | - | 超大规模 |
| LanceDB | - | 多模态(图像/视频) | - | 多模态 RAG |
| Chroma | - | 原型/MVP 最快启动 | - | 快速验证 |
pgvector 0.9 新特性: IVFFlat 改进、稀疏向量支持、HNSW 性能提升 Qdrant 亮点: 原生多向量支持,ColBERT-V2 风格 late-interaction retrieval 成为第一等公民
多租户隔离方案:
- pgvector:行级安全(RLS),适合几十到几百租户
- Pinecone:Namespace 隔离
- Qdrant:Payload indexed field 过滤(tenant 关键词字段)
- Weaviate:原生多租户
来源: CallMissed Vector DB 2026 对比, Kalvium Labs 生产报告, PkgPulse, Spheron
3. Agentic RAG 五大生产模式(2026 Q3)
五种canonical patterns:
- Query rewriting and decomposition:Agent 重写 query → retrieval-friendly,可选子查询拆分
- Multi-hop retrieval:retrieve-reason-retrieve 迭代,直到 stop condition 触发
- Tool routing:Agent 在向量搜索 / BM25 / Web 搜索 / SQL / Re-ranker 之间按 query 选型
- Self-check on draft:faithfulness / groundedness judge 守门,阻止 hallucination
- GraphRAG:微软客户支持、法律科技、医学文献搜索已有生产部署
迭代预算(Iteration Budget)工程实践: - 每个 primitive 有 token 成本和延迟成本 - 好系统按问题难度分流:简单问题 1 retrieve(80%),复杂问题 4 retrieve(20%) - 预算设置要紧到控制成本,但松到不让可靠率下降
评估工具链(生产推荐): - Tracing: Langfuse(MIT,基础设施内数据) - Evaluation: RAGAS(RAG 质量)+ DeepEval(通用 LLM 质量) - Cost & Routing: LiteLLM(跨多 provider 路由和缓存) - Safety: Guardrails AI(输入/输出验证)
来源: FutureAGI Agentic RAG 2026, TeacherAndTask RAG Failure Modes 2026, DigitalApplied Multi-Step Reasoning, Medium Elam Marisaoufiane RAG 2026
4. Kubernetes v1.36(2026):AI 原生平台正式确立
DRA(Dynamic Resource Allocation)正式 GA: - 彻底改变 GPU/TPU 管理方式 - ResourceClaim + ResourceClass 声明式管理 - 用户命名空间(User Namespaces)稳定,容器隔离增强
etcd 优化配置要点(生产建议):
# WAL 单独存储提升性能
--wal-dir=/var/lib/etcd/wal
# 减少快照频率
--snapshot-count=10000
# 自动压缩
--auto-compaction-mode=periodic
--auto-compaction-retention=1h
--quota-backend-bytes=8589934592 # 8GB
企业落地建议(分阶段): 1. 先升级控制面到 v1.36,再逐步升级节点 2. 生产环境等特性进入 GA 后再使用(当前 DRA + User Namespaces 已 GA) 3. 构建 AI 原生基础设施团队(K8S + AI 复合技能) 4. 部署基于 eBPF 的全链路监控系统
来源: openEuler 社区(CSDN), CloudOptimo K8s AI Infrastructure 2026, Northflank Managed K8s 2026
5. GitHub Trending 高价值仓库(2026-08)
| 仓库 | Stars | 方向 | 亮点 |
|---|---|---|---|
opencode (anomalyco) |
55.4k | Coding Agent | Cursor 本地开源替代,多模型切换 |
OpenHands (All-Hands-AI) |
60.6k | Coding Agent | OpenDevin 继承者,企业采用率高 |
Langflow |
- | RAG/Agent 可视化 | LangChain 生态拖拽编排,低代码 |
Bumblebee (Perplexity) |
- | Supply Chain 安全 | 依赖/MCP/编辑器扩展扫描 |
nanochat (Andrej Karpathy) |
55k | LLM 训练/推理全流程 | 单文件暴露 tokenization → pretraining → finetuning → inference 全链路 |
microsoft/Build26-* |
多仓库 | AI Agents 生产工程 | Microsoft Build 2026 资源(部署/观测/Agent 编排) |
来源: ByteByteGo Top AI GitHub Repos 2026, Firecrawl Best AI GitHub Repos 2026, GitHub Topics build-2026
6. Hugging Face 生态动态(Spring 2026)
里程碑: Hub 突破 200 万模型 关键趋势: - NVIDIA 成为最强大贡献者 - 个人用户创建有竞争力模型的能力大幅提升(第四大趋势模型来源) - 新模型家族:Google Gemma 4、Qwen 3.6、DeepSeek-V4、EuroBERT(多语言)、Mistral VoxtralRealtime(流式 ASR) - smolagents + MCP 组合:强大但新,Building reliable observable agent ≠ 简单 while 循环 - 成本控制关键:per-token 网关定价 / hourly Endpoints / ZeroGPU 配额 / 自托管 GPU 成本曲线各异
Benchmark 数据集: BenchGeckoAI/ai-model-benchmarks-2026(含 20+ 模型,按 average_score 排名,含定价数据)
来源: Hugging Face Blog State of Open Source Spring 2026
7. LLMOps 市场格局(2026)
规模: LLMOps 市场预计从 2024 年 $1.97B 增至 2028 年 $4.9B(42% CAGR) 趋势: - 72% 企业 2026 年采用 AI 自动化工具,但大多数未建立成本控制 - DataRobot 2026 重新定位:面向 agentic AI + GenAI 应用交付,guardrails + evaluation + production monitoring - Dataiku LLM Mesh:多模型路由 + 成本控制层,适合 visual-plus-code 团队
生产工具链推荐: - Langfuse(Tracing) - RAGAS + DeepEval(Evaluation) - LiteLLM(Cost & Routing) - Guardrails AI(Safety)
来源: Deepak Gupta Top 10 MLOps 2026, Prepzee MLOps Landscape, MachineLearningMastery LLMOps Roadmap, MLOps World
8. Substack 高价值研究线索
| 专栏 | 文章 | 核心洞察 | 可信度 |
|---|---|---|---|
| The AI Engineer (substack.com) | vLLM vs Ollama vs SGLang vs TensorRT-LLM | TGI 维护模式确认;SGLang 增长最快;多引擎选型指南 | ⭐⭐⭐⭐⭐ 行业工程师视角 |
| MLOps Community | QA the Agent, Not the Code | Agent 评测范式转变;Agent autonomy vs weak foundations | ⭐⭐⭐⭐⭐ MLOps 社区权威 |
| MLOps Community | Prod Is One Cell Away | 生产 AI 观测;Agent telemetry;search as system | ⭐⭐⭐⭐ |
二、分类标签
推理引擎 vLLM SGLang VectorDB Qdrant pgvector AgenticRAG GraphRAG RAG评估 Kubernetes DRA K8s-v1.36 LLMOps HuggingFace GitHub-Trending AI工程 后端 部署
三、建议写入路径
主草稿路径:
/shared/research-kb/inbox/jay/2026-08-14-inference-vector-rag-k8s.md
关联补充(如后续精读):
- 2026-08-14-substack-the-ai-engineer-inference-comparison.md
- 2026-08-14-vector-db-benchmark-2026.md
四、后续行动建议
| 优先级 | 行动 | 理由 |
|---|---|---|
| 🔴 高 | 关注 vLLM v0.5.9 + SGLang 前缀缓存对比 benchmark | 影响线上推理选型决策 |
| 🔴 高 | pgvector 0.9 生产 benchmark 验证 | 可能是中小规模 RAG 最优解 |
| 🟡 中 | 精读 MLOps Community "QA the Agent, Not the Code" | Agent 评测方法论,与当前 eval 工作相关 |
| 🟡 中 | Qdrant ColBERT-V2 多向量实战评测 | late-interaction 是 2026 高精度 RAG 方向 |
| 🟢 低 | nanochat 全流程源码走读 | Andrej Karpathy 教育价值高,适合内部培训 |