知识库草稿 · 数据库 · 后端 · 云原生 · 推理工程 · 2026-07-25
实例: Jay | 日期: 2026-07-25 11:05 (CST) 检索范围: Tavily + vLLM Blog + CNCF + Substack · 向量数据库 / 推理优化 / Kubernetes AI / pgvector / Substack AI工程
主题总览
| 分类 | 高价值条目 | 置信度 | 亮点 |
|---|---|---|---|
| database | 向量数据库 2026 选型决策框架(Qdrant vs Milvus vs pgvector vs Pinecone) | ★★★★★ | 100+ 企业部署经验,6 大场景决策树 |
| database | pgvector 生产级 RAG 端到端指南(2026) | ★★★★★ | 三表 schema + HNSW 调参 + 混合检索 + 成本数据 |
| backend | vLLM Model Runner V2 (MRV2):56% 吞吐提升 | ★★★★★ | Triton kernel + async scheduling,显式启用 |
| backend | VeriCache:压缩 KV Cache 实现无损推理加速 | ★★★★☆ | 压缩 KV Cache,接受长度比 EAGLE 高 10 倍 |
| backend | Prefill-Decode Disaggregation(vLLM 拆解服务) | ★★★★☆ | 2026 新兴方向,decode 内存 bound / prefill 计算 bound |
| backend | Speculative Decoding 全景解析(2026 更新版) | ★★★★☆ | N-gram / EAGLE / Medusa / Self-spec 四大路线 |
| cloud-native | Kubernetes AI Serving 2026 指南(CNCF 数据) | ★★★★★ | 66% 生成式 AI 组织用 K8s,DRA + gang scheduling 成熟 |
| cloud-native | Cloud Native AI Model Distribution(Harbor + Dragonfly + Model CSI) | ★★★★☆ | OCI Artifacts 管理 AI 模型,声明式部署 |
| cloud-native | CNCF AI 工程生产实践(vLLM + Inference Gateway + DRA) | ★★★★☆ | 实践路线建议:从 inference serving stack 切入 |
| csdn | 企业级 LLM Agent 三层架构(Plan/Architect/Zulu) | ★★★★★ | Multi-Agent + LangGraph + MCP + 可观测性 |
| csdn | vLLM PagedAttention / KVCache / ContinuousBatching 原理实战 | ★★★★★ | 原理+代码+参数调优 |
| csdn | LangChain 2026 实战指南(conda 环境 + pip 安装 + 错误排查) | ★★★★★ | 环境配置可操作性强 |
| reproduction | vLLM Model Runner V2 部署命令(VLLM_USE_V2_MODEL_RUNNER=1) | ★★★★☆ | 需验证 GB200 上 56% 提升数据来源 |
| reproduction | BatchLLM vs vLLM Prefix Caching 对比(v0.6.4 vs 2026-01 最新) | ★★★★☆ | BatchLLM 8.67 vs vLLM 最新 6.57,A100 吞吐量对比 |
高价值条目详情
【database】向量数据库 2026 选型决策框架
来源: Medium · Pratik K Rupareliya · 2026-07 更新 URL: https://medium.com/@pratik-rupareliya/top-15-vector-databases-in-2026-a-production-decision-guide-from-100-enterprise-deployments-dd58a04f51a5
核心观点(100+ 企业部署经验):
| 维度 | 结论 |
|---|---|
| 10M 以下向量 | pgvector 是默认最优解,已有 Postgres 则无脑选 |
| 10M–50M 向量 | pgvectorscale(471 QPS,99% recall),HNSW 调参 |
| 50M–5 亿向量 | Qdrant(Rust,4ms p50,payload 过滤强),推荐自托管 |
| 亿级向量 + 多租户 | Milvus(K8s 原生分布式,Zilliz Cloud 托管) |
| 全托管免运维 | Pinecone(4.2ms p50,~800 QPS),成本较高 |
| 混合检索 + 合规多租户 | Weaviate(原生 BM25 + 向量融合,租户隔离) |
工程要点: - Qdrant 在 340M 向量 Reddit 规模下,ingest/query 并发隔离优于 Milvus(架构分离节点职责) - Milvus 同构节点在高并发读写混合负载下干扰更明显 - Chroma → Qdrant/pgvector 是最常见生产迁移路径
可信度: ⭐⭐⭐⭐⭐(100+ 企业生产经验,2026-07 月更新)
标签: #向量数据库 #Qdrant #pgvector #Milvus #选型决策
后续行动: 纳入向量数据库主题页,选型矩阵已完整
【database】pgvector 生产级 RAG 端到端指南(2026)
来源: digitalapplied.com · 2026 URL: https://www.digitalapplied.com/blog/build-self-hosted-rag-postgres-pgvector-tutorial-2026
核心内容:
- 三表 schema:documents + chunks + embeddings
- HNSW vs IVFFlat 索引选择:HNSW 查询更快但内存更高;IVFFlat 适合写入密集
- 关键参数:ef_search(默认 40,生产建议 100–200)、m(HNSW 构造连接数)
- 混合检索:vector_similarity + BM25 结合,cosine distance
- 实测数据(100k chunk 语料):
- P50 ANN 查询延迟:12ms
- 首 token 时间:320ms(embedding + LLM)
- 每 1k 查询成本:embedding + LLM 费用
可信度: ⭐⭐⭐⭐⭐(可复现步骤,真实性能数据)
标签: #pgvector #HNSW #IVFFlat #混合检索 #RAG #PostgreSQL
后续行动: 适合作为 pgvector 入门+生产部署参考页核心
【backend】vLLM Model Runner V2(MRV2):56% 吞吐提升
来源: Spheron Blog + vLLM 官方文档 · v0.20.0+ URL: https://www.spheron.network/blog/vllm-production-deployment-2026
核心内容:
- MRV2 基于 GPU-native Triton kernels + async scheduling
- 需显式启用:VLLM_USE_V2_MODEL_RUNNER=1
- 实测提升:GB200 上最高 56% 吞吐提升(结果因硬件而异)
- v0.20.2(2026-05)为当前稳定版
- v0.23.0rc1(2026-07-20)为最新候选版
关键新功能(2026 上半年): | 功能 | 版本 | 说明 | |------|------|------| | MRV2 | v0.20.0+ | 56% 吞吐提升,需显式启用 | | FP8 inference | H100/B200 | 单 flag 启用 | | NGram GPU speculative decoding | v0.18.0 | 支持 chunked prefill 共存 | | Chunked Prefill | 默认 | 动态 prefill 长度,p95 改善 68% | | Native RL APIs | v0.18.0+ | 在线 RL 训练支持 | | Model Runner V2 | v0.20.0+ | 模块化核心 | | Disaggregated Serving | 实验性 | prefill/decode 分离 | | Ascend 950 支持 | v0.23.0rc1 | 华为昇腾支持 |
可信度: ⭐⭐⭐⭐(官方文档 + 第三方 benchmark)
标签: #vLLM #MRV2 #Triton #FP8 #ContinuousBatching #DisaggregatedServing
后续行动: 验证 MRV2 56% 数据来源,提取实际部署命令
【backend】VeriCache:压缩 KV Cache 替代 EAGLE 类 Draft Model
来源: arXiv:2605.17613v1 · 2026-05 URL: https://arxiv.org/html/2605.17613v1
核心观点: - EAGLE 等 speculative decoding 用小型 draft model 预测 token,分布差异导致接受长度短(~3–11) - VeriCache 压缩 KV Cache(4×4 compaction),用压缩后 KV 做 self-draft,不引入新模型 - 接受长度:VeriCache 在 Qwen-32B 上 ~19,Llama-70B 上 ~23;EAGLE 仅 ~2–22(饱和);小 draft model ~3–10 - 核心优势:接受长度比传统 speculative decoding 高一个数量级,且无损
可信度: ⭐⭐⭐⭐(arXiv 学术论文,有量化对比)
标签: #VeriCache #KVCache #SpeculativeDecoding #无损加速
后续行动: 精读原文 4.1 节,理解压缩方法与验证流程
【backend】Prefill-Decode Disaggregation(vLLM 拆解服务)
来源: vLLM Blog + CNCF 博客 · 2026 URL: https://www.cncf.io/blog/2026/03/26/the-platform-under-the-model-how-cloud-native-powers-ai-engineering-in-production
核心内容: - 问题:Prefill 是计算 bound(并行处理 prompt),Decode 是内存 bound(逐 token 生成);两者资源需求不同,混合部署效率低 - 解法:将 prefill 和 decode 分离到不同 GPU 池,各自独立扩缩容 - 适用场景:长 prompt + 短输出(RAG)或短 prompt + 长输出(代码生成) - vLLM 已支持 disaggregated serving(实验性) - 2026 KubeCon 重点议题之一
可信度: ⭐⭐⭐⭐(CNCF 博客 + vLLM 官方)
标签: #DisaggregatedServing #PrefillDecode #vLLM #K8s #GPU调度
后续行动: 纳入推理架构主题页,补充实际配置示例
【backend】Speculative Decoding 全景解析(2026 更新版)
来源: Aussie AI Blog + LinkedIn 技术解析 + PremAI benchmarks · 2026-05 URL: https://www.aussieai.com/research/speculative-decoding
四大路线对比:
| 路线 | 代表工作 | 原理 | 接受率 | 限制 |
|---|---|---|---|---|
| N-gram | vLLM 内置 | 输入中提取 n-gram 模式预测 | 中 | 仅适合 summarization/extraction |
| EAGLE/Medusa | llama.cpp EAGLE3 | 额外 draft head 预测 | 高 | 需额外训练 |
| Self-spec(VeriCache) | VeriCache | 压缩 KV Cache 自draft | 最高 | 需压缩算法 |
| Small draft model | DeepSeek 类 | 小模型预测,大模型验证 | 低(~3 tokens) | 分布偏移快 |
Benchmark 数据(PremAI 2026): - 通用场景:2–3x 加速,零质量损失 - AMD MI300X + FP8 + Spec Decoding:Llama 3.1-405B 提升 3.6x - Prefill-heavy + short output + N-gram:成本降低 84%
可信度: ⭐⭐⭐⭐(学术综述 + benchmark 数据)
标签: #SpeculativeDecoding #EAGLE #Medusa #Ngram #VeriCache
后续行动: 补充 ASPLOS 2026 SwiftSpec(disaggregated spec decoding)arXiv 引用
【cloud-native】Kubernetes AI Serving 2026 指南
来源: MLflow Blog + CNCF Survey 2026 URL: https://mlflow.org/articles/the-role-of-kubernetes-in-ai-serving-2026-guide
关键数据: - 66% 的生成式 AI 推理组织使用 Kubernetes(CNCF 2026 调查) - 98% 组织使用云原生技术,82% 容器用户在生产环境运行 K8s - DRA(Dynamic Resource Allocation)+ gang scheduling 成熟,消除了多 GPU AI 负载主要摩擦点
K8s AI Serving 核心能力:
1. GPU-aware 调度:nvidia.com/gpu 资源类型,nodeSelector / taints 隔离
2. InferenceService(KServe):声明式模型生命周期管理
3. HPA + KEDA + Karpenter:三层扩缩容(HPA 响应在跑指标,KEDA 响应外部队列,Karpenter 响应资源压力)
4. 多模型 / 多团队共享:命名空间隔离 + RBAC + ResourceQuota
5. 可观测性:OpenTelemetry + Prometheus + Grafana
CNCF 推荐的 AI 工程 K8s 起步路径:
"If you're an AI engineer moving to Kubernetes, start with the inference serving stack. Deploy a model server (vLLM or similar) behind the Inference Gateway, use DRA to manage your GPU resources declaratively, and instrument with OpenTelemetry from the start."
可信度: ⭐⭐⭐⭐⭐(CNCF 官方数据,MLflow 权威解读)
标签: #Kubernetes #K8sAI #KServe #KEDA #Karpenter #CNCF #DRA
后续行动: 纳入云原生 AI 基础设施主题页,作为 K8s AI Serving 入口参考
【cloud-native】Cloud Native AI Model Distribution(Harbor + Dragonfly + Model CSI)
来源: Harbor 官方博客 · CNCF · 2026-03-11 URL: https://goharbor.io/blog/cloud-native-ai-model-management
核心内容(四步交付流水线): 1. Develop:算法工程师推送 weights + configs 到 Hugging Face Hub(作为 Git Repository) 2. Build:CI/CD 流水线打包为不可变 Model Artifact(含 weights、runtime 配置、元数据) 3. Manage:Artifact Registry 管理(复用现有容器基础设施),Harbor AI Model Processor + ORAS 4. Deploy:通过 Kubernetes OCI Volumes 或 Model CSI Driver 将模型挂载为 Volume,声明式解耦推理引擎
CNCF 项目协同: - Harbor:AI Model Processor(模型签名 + 元数据管理) - Dragonfly:负载感知调度算法(模型分发加速) - CRI-O / containerd:OCI Artifacts 支持模型作为镜像 - Model CSI Driver:将模型挂载到推理容器 - ORAS:OCI Registry As Storage(模型分发协议)
可信度: ⭐⭐⭐⭐(CNCF 维护者署名,多项目协同)
标签: #CNIA #ModelCSI #Harbor #Dragonfly #ORAS #OCIRegistry #模型分发
后续行动: 补充 KubeCon 2026 NA CNCF AI & Inference Day 议程(11 月 9 日,Salt Lake City)
【csdn】企业级 LLM Agent 三层架构(Plan/Architect/Zulu Agent)
来源: CSDN 智能体开发者社区 · 2026-07-11 URL: https://adg.csdn.net/6a522430662f9a54cb8e637c.html
核心架构: - Plan Agent:意图分解 + 任务规划 - Architect Agent:技术方案设计 - Zulu Agent:执行引擎(LangGraph 状态机驱动) - 验证循环:执行 → 验证 → 修正 → 再执行
工程要点: - MCP 协议跨系统工具标准化接入 - LangGraph 状态机构建可自我修正的 Agentic RAG - 可观测性 + 安全护栏 + 混合架构工程化 - 完整 Python 代码可复现
可信度: ⭐⭐⭐⭐(有源码、有架构图)
标签: #LLM-Agent #LangGraph #MCP #Multi-Agent #架构设计 #CSDN
后续行动: 与 2026-07-25-ai-engineering-trending.md 中 Context Engineering 条目合并
【csdn】vLLM PagedAttention / KVCache / ContinuousBatching 原理实战
来源: CSDN · 2026 URL: (来自 2026-07-25-csdn-llm-rag-agent-vecdb.md)
核心内容:
- PagedAttention:分页式 KV Cache 管理,消除内存碎片
- Continuous Batching:迭代级调度,请求完成立即释放 slot
- 实战参数:--enforce-eager(禁用 CUDA graph)、--gpu-memory-utilization(显存利用率)、--max-num-batched-tokens
- 性能数据:14–24x 吞吐提升 vs HuggingFace Transformers
可信度: ⭐⭐⭐⭐(CSDN 高价值)
标签: #vLLM #PagedAttention #KVCache #ContinuousBatching
后续行动: 与本文件 MRV2 条目合并为 vLLM 推理优化主题
【csdn】LangChain 2026 实战指南
来源: CSDN · fenglingguitar · 2026-07-17 URL: https://blog.csdn.net/fenglingguitar/article/details/159823695
核心操作命令:
conda create -n langchain-demo python=3.10
pip install langchain-core langchain-community
- API Key 管理与 .env 配置
- 多模型统一调用(OpenAI / 通义 / 智谱)
- 错误排查:端点连通性 → API Key → 代理 → 模板格式
可信度: ⭐⭐⭐⭐(2026-07 最新,步骤可操作)
标签: #LangChain #Python #环境配置 #API-Key #多模型
与已入库内容的去重说明
| 本轮条目 | 已入库文件 | 去重结论 |
|---|---|---|
| 向量数据库选型决策框架 | 2026-07-25-csdn-llm-rag-agent-vecdb.md(已有压测报告) |
互补:csdn 版有压测数据,本文版有 100+ 企业决策经验;两者并存 |
| pgvector RAG 指南 | 2026-07-25-csdn-llm-rag-agent-vecdb.md(已有向量数据库对比) |
互补;csdn 版偏对比选型,本文版偏端到端部署步骤 |
| vLLM MRV2 | 2026-07-25-csdn-llm-rag-agent-vecdb.md(已有 vLLM 原理实战) |
互补:csdn 版偏原理+参数调优,本文版新增 MRV2 量化数据 |
| VeriCache | 2026-07-24-1105-noon-kv-rag-db-substack.md(KV Cache 相关) |
互补;kv-rag-db 版偏基准测试,本文版偏 VeriCache 压缩方法 |
| Kubernetes AI Serving | 2026-07-25-ai-engineering-trending.md(已有 K8s 相关) |
互补;trending 版偏 GitHub 学习路径和供应商架构,本文版新增 CNCF 66% 数据点 |
| Cloud Native Model Distribution | 无直接重复 | 全新条目,CNCF 模型交付流水线 |
| pgvector 生产 RAG | 2026-07-25-csdn-llm-rag-agent-vecdb.md(已有向量库选型) |
互补;csdn 版偏选型决策树,本文版偏端到端 schema 和调参 |
分类标签汇总
#向量数据库 #Qdrant #pgvector #Milvus #Pinecone #Weaviate #选型决策 #HNSW #IVFFlat #pgvector #RAG #PostgreSQL #vLLM #MRV2 #Triton #FP8 #PagedAttention #KVCache #ContinuousBatching #SpeculativeDecoding #EAGLE #VeriCache #DisaggregatedServing #Kubernetes #KServe #KEDA #CNCF #DRA #ModelCSI #Harbor #Dragonfly #ORAS #LLM-Agent #LangGraph #MCP #Multi-Agent
高价值条目优先级
| 优先级 | 条目 | 核验建议 |
|---|---|---|
| 🔴 高 | Kubernetes AI Serving CNCF 数据(66% K8s) | 提取 CNCF 2026 Survey 原文数据来源 |
| 🔴 高 | vLLM MRV2 56% 吞吐提升 | 验证 GB200 测试配置,提取 vLLM 官方 release note |
| 🟠 中 | VeriCache 压缩 KV Cache | 精读 arXiv:2605.17613v1,理解 self-draft 机制 |
| 🟠 中 | pgvector 端到端 RAG 部署 | 提取三表 schema 代码块,补充 HNSW 参数说明 |
| 🟡 低 | Cloud Native Model Distribution 流水线 | 作为 CNCF 模型交付参考,待补 KubeCon 2026 NA 详情 |
| 🟡 低 | Speculative Decoding 全景解析 | 补充 SwiftSpec ASPLOS 2026 论文引用 |
建议写入路径
/shared/research-kb/inbox/jay/2026-07-25-1105-db-backend-cloudnative-inference-briefing.md(本文)
后续主题页建议:
- 2026-07-25-llm-inference-optimization-vllm-2026h1.md(MRV2 + VeriCache + Disagg Serving 合并)
- 2026-07-25-vector-db-production-selection-matrix-2026.md(向量数据库选型矩阵)
附:本轮未写入文件说明
本轮检索覆盖向量数据库(10+ 条)、vLLM(10+ 条)、Kubernetes AI(8+ 条)、Substack(8+ 条)。
主要发现: - 向量数据库选型在 2026H2 已形成相对稳定格局(pgvector ≤ 50M / Qdrant 50M–5 亿 / Milvus 亿级+ / Pinecone 全托管) - vLLM 2026 上半年最大更新是 MRV2(56% 吞吐提升)和 Disaggregated Serving - CNCF 2026 数据:66% 生成式 AI 组织用 K8s,K8s 是 AI 推理事实标准 - Cloud Native Model Distribution 开始标准化(Harbor + Dragonfly + Model CSI 协同)
未执行 GitHub 写入操作。
Jay · 2026-07-25 11:05 · 数据库·后端·云原生·推理工程简报