知识库草稿 · 数据库 · 后端 · 云原生 · 推理工程 · 2026-07-25

实例: Jay | 日期: 2026-07-25 11:05 (CST) 检索范围: Tavily + vLLM Blog + CNCF + Substack · 向量数据库 / 推理优化 / Kubernetes AI / pgvector / Substack AI工程


主题总览

分类 高价值条目 置信度 亮点
database 向量数据库 2026 选型决策框架(Qdrant vs Milvus vs pgvector vs Pinecone) ★★★★★ 100+ 企业部署经验,6 大场景决策树
database pgvector 生产级 RAG 端到端指南(2026) ★★★★★ 三表 schema + HNSW 调参 + 混合检索 + 成本数据
backend vLLM Model Runner V2 (MRV2):56% 吞吐提升 ★★★★★ Triton kernel + async scheduling,显式启用
backend VeriCache:压缩 KV Cache 实现无损推理加速 ★★★★☆ 压缩 KV Cache,接受长度比 EAGLE 高 10 倍
backend Prefill-Decode Disaggregation(vLLM 拆解服务) ★★★★☆ 2026 新兴方向,decode 内存 bound / prefill 计算 bound
backend Speculative Decoding 全景解析(2026 更新版) ★★★★☆ N-gram / EAGLE / Medusa / Self-spec 四大路线
cloud-native Kubernetes AI Serving 2026 指南(CNCF 数据) ★★★★★ 66% 生成式 AI 组织用 K8s,DRA + gang scheduling 成熟
cloud-native Cloud Native AI Model Distribution(Harbor + Dragonfly + Model CSI) ★★★★☆ OCI Artifacts 管理 AI 模型,声明式部署
cloud-native CNCF AI 工程生产实践(vLLM + Inference Gateway + DRA) ★★★★☆ 实践路线建议:从 inference serving stack 切入
csdn 企业级 LLM Agent 三层架构(Plan/Architect/Zulu) ★★★★★ Multi-Agent + LangGraph + MCP + 可观测性
csdn vLLM PagedAttention / KVCache / ContinuousBatching 原理实战 ★★★★★ 原理+代码+参数调优
csdn LangChain 2026 实战指南(conda 环境 + pip 安装 + 错误排查) ★★★★★ 环境配置可操作性强
reproduction vLLM Model Runner V2 部署命令(VLLM_USE_V2_MODEL_RUNNER=1) ★★★★☆ 需验证 GB200 上 56% 提升数据来源
reproduction BatchLLM vs vLLM Prefix Caching 对比(v0.6.4 vs 2026-01 最新) ★★★★☆ BatchLLM 8.67 vs vLLM 最新 6.57,A100 吞吐量对比

高价值条目详情


【database】向量数据库 2026 选型决策框架

来源: Medium · Pratik K Rupareliya · 2026-07 更新 URL: https://medium.com/@pratik-rupareliya/top-15-vector-databases-in-2026-a-production-decision-guide-from-100-enterprise-deployments-dd58a04f51a5

核心观点(100+ 企业部署经验):

维度 结论
10M 以下向量 pgvector 是默认最优解,已有 Postgres 则无脑选
10M–50M 向量 pgvectorscale(471 QPS,99% recall),HNSW 调参
50M–5 亿向量 Qdrant(Rust,4ms p50,payload 过滤强),推荐自托管
亿级向量 + 多租户 Milvus(K8s 原生分布式,Zilliz Cloud 托管)
全托管免运维 Pinecone(4.2ms p50,~800 QPS),成本较高
混合检索 + 合规多租户 Weaviate(原生 BM25 + 向量融合,租户隔离)

工程要点: - Qdrant 在 340M 向量 Reddit 规模下,ingest/query 并发隔离优于 Milvus(架构分离节点职责) - Milvus 同构节点在高并发读写混合负载下干扰更明显 - Chroma → Qdrant/pgvector 是最常见生产迁移路径

可信度: ⭐⭐⭐⭐⭐(100+ 企业生产经验,2026-07 月更新) 标签: #向量数据库 #Qdrant #pgvector #Milvus #选型决策 后续行动: 纳入向量数据库主题页,选型矩阵已完整


【database】pgvector 生产级 RAG 端到端指南(2026)

来源: digitalapplied.com · 2026 URL: https://www.digitalapplied.com/blog/build-self-hosted-rag-postgres-pgvector-tutorial-2026

核心内容: - 三表 schema:documents + chunks + embeddings - HNSW vs IVFFlat 索引选择:HNSW 查询更快但内存更高;IVFFlat 适合写入密集 - 关键参数:ef_search(默认 40,生产建议 100–200)、m(HNSW 构造连接数) - 混合检索:vector_similarity + BM25 结合,cosine distance - 实测数据(100k chunk 语料): - P50 ANN 查询延迟:12ms - 首 token 时间:320ms(embedding + LLM) - 每 1k 查询成本:embedding + LLM 费用

可信度: ⭐⭐⭐⭐⭐(可复现步骤,真实性能数据) 标签: #pgvector #HNSW #IVFFlat #混合检索 #RAG #PostgreSQL 后续行动: 适合作为 pgvector 入门+生产部署参考页核心


【backend】vLLM Model Runner V2(MRV2):56% 吞吐提升

来源: Spheron Blog + vLLM 官方文档 · v0.20.0+ URL: https://www.spheron.network/blog/vllm-production-deployment-2026

核心内容: - MRV2 基于 GPU-native Triton kernels + async scheduling - 需显式启用:VLLM_USE_V2_MODEL_RUNNER=1 - 实测提升:GB200 上最高 56% 吞吐提升(结果因硬件而异) - v0.20.2(2026-05)为当前稳定版 - v0.23.0rc1(2026-07-20)为最新候选版

关键新功能(2026 上半年): | 功能 | 版本 | 说明 | |------|------|------| | MRV2 | v0.20.0+ | 56% 吞吐提升,需显式启用 | | FP8 inference | H100/B200 | 单 flag 启用 | | NGram GPU speculative decoding | v0.18.0 | 支持 chunked prefill 共存 | | Chunked Prefill | 默认 | 动态 prefill 长度,p95 改善 68% | | Native RL APIs | v0.18.0+ | 在线 RL 训练支持 | | Model Runner V2 | v0.20.0+ | 模块化核心 | | Disaggregated Serving | 实验性 | prefill/decode 分离 | | Ascend 950 支持 | v0.23.0rc1 | 华为昇腾支持 |

可信度: ⭐⭐⭐⭐(官方文档 + 第三方 benchmark) 标签: #vLLM #MRV2 #Triton #FP8 #ContinuousBatching #DisaggregatedServing 后续行动: 验证 MRV2 56% 数据来源,提取实际部署命令


【backend】VeriCache:压缩 KV Cache 替代 EAGLE 类 Draft Model

来源: arXiv:2605.17613v1 · 2026-05 URL: https://arxiv.org/html/2605.17613v1

核心观点: - EAGLE 等 speculative decoding 用小型 draft model 预测 token,分布差异导致接受长度短(~3–11) - VeriCache 压缩 KV Cache(4×4 compaction),用压缩后 KV 做 self-draft,不引入新模型 - 接受长度:VeriCache 在 Qwen-32B 上 ~19,Llama-70B 上 ~23;EAGLE 仅 ~2–22(饱和);小 draft model ~3–10 - 核心优势:接受长度比传统 speculative decoding 高一个数量级,且无损

可信度: ⭐⭐⭐⭐(arXiv 学术论文,有量化对比) 标签: #VeriCache #KVCache #SpeculativeDecoding #无损加速 后续行动: 精读原文 4.1 节,理解压缩方法与验证流程


【backend】Prefill-Decode Disaggregation(vLLM 拆解服务)

来源: vLLM Blog + CNCF 博客 · 2026 URL: https://www.cncf.io/blog/2026/03/26/the-platform-under-the-model-how-cloud-native-powers-ai-engineering-in-production

核心内容: - 问题:Prefill 是计算 bound(并行处理 prompt),Decode 是内存 bound(逐 token 生成);两者资源需求不同,混合部署效率低 - 解法:将 prefill 和 decode 分离到不同 GPU 池,各自独立扩缩容 - 适用场景:长 prompt + 短输出(RAG)或短 prompt + 长输出(代码生成) - vLLM 已支持 disaggregated serving(实验性) - 2026 KubeCon 重点议题之一

可信度: ⭐⭐⭐⭐(CNCF 博客 + vLLM 官方) 标签: #DisaggregatedServing #PrefillDecode #vLLM #K8s #GPU调度 后续行动: 纳入推理架构主题页,补充实际配置示例


【backend】Speculative Decoding 全景解析(2026 更新版)

来源: Aussie AI Blog + LinkedIn 技术解析 + PremAI benchmarks · 2026-05 URL: https://www.aussieai.com/research/speculative-decoding

四大路线对比:

路线 代表工作 原理 接受率 限制
N-gram vLLM 内置 输入中提取 n-gram 模式预测 仅适合 summarization/extraction
EAGLE/Medusa llama.cpp EAGLE3 额外 draft head 预测 需额外训练
Self-spec(VeriCache) VeriCache 压缩 KV Cache 自draft 最高 需压缩算法
Small draft model DeepSeek 类 小模型预测,大模型验证 低(~3 tokens) 分布偏移快

Benchmark 数据(PremAI 2026): - 通用场景:2–3x 加速,零质量损失 - AMD MI300X + FP8 + Spec Decoding:Llama 3.1-405B 提升 3.6x - Prefill-heavy + short output + N-gram:成本降低 84%

可信度: ⭐⭐⭐⭐(学术综述 + benchmark 数据) 标签: #SpeculativeDecoding #EAGLE #Medusa #Ngram #VeriCache 后续行动: 补充 ASPLOS 2026 SwiftSpec(disaggregated spec decoding)arXiv 引用


【cloud-native】Kubernetes AI Serving 2026 指南

来源: MLflow Blog + CNCF Survey 2026 URL: https://mlflow.org/articles/the-role-of-kubernetes-in-ai-serving-2026-guide

关键数据: - 66% 的生成式 AI 推理组织使用 Kubernetes(CNCF 2026 调查) - 98% 组织使用云原生技术,82% 容器用户在生产环境运行 K8s - DRA(Dynamic Resource Allocation)+ gang scheduling 成熟,消除了多 GPU AI 负载主要摩擦点

K8s AI Serving 核心能力: 1. GPU-aware 调度nvidia.com/gpu 资源类型,nodeSelector / taints 隔离 2. InferenceService(KServe):声明式模型生命周期管理 3. HPA + KEDA + Karpenter:三层扩缩容(HPA 响应在跑指标,KEDA 响应外部队列,Karpenter 响应资源压力) 4. 多模型 / 多团队共享:命名空间隔离 + RBAC + ResourceQuota 5. 可观测性:OpenTelemetry + Prometheus + Grafana

CNCF 推荐的 AI 工程 K8s 起步路径:

"If you're an AI engineer moving to Kubernetes, start with the inference serving stack. Deploy a model server (vLLM or similar) behind the Inference Gateway, use DRA to manage your GPU resources declaratively, and instrument with OpenTelemetry from the start."

可信度: ⭐⭐⭐⭐⭐(CNCF 官方数据,MLflow 权威解读) 标签: #Kubernetes #K8sAI #KServe #KEDA #Karpenter #CNCF #DRA 后续行动: 纳入云原生 AI 基础设施主题页,作为 K8s AI Serving 入口参考


【cloud-native】Cloud Native AI Model Distribution(Harbor + Dragonfly + Model CSI)

来源: Harbor 官方博客 · CNCF · 2026-03-11 URL: https://goharbor.io/blog/cloud-native-ai-model-management

核心内容(四步交付流水线): 1. Develop:算法工程师推送 weights + configs 到 Hugging Face Hub(作为 Git Repository) 2. Build:CI/CD 流水线打包为不可变 Model Artifact(含 weights、runtime 配置、元数据) 3. Manage:Artifact Registry 管理(复用现有容器基础设施),Harbor AI Model Processor + ORAS 4. Deploy:通过 Kubernetes OCI Volumes 或 Model CSI Driver 将模型挂载为 Volume,声明式解耦推理引擎

CNCF 项目协同: - Harbor:AI Model Processor(模型签名 + 元数据管理) - Dragonfly:负载感知调度算法(模型分发加速) - CRI-O / containerd:OCI Artifacts 支持模型作为镜像 - Model CSI Driver:将模型挂载到推理容器 - ORAS:OCI Registry As Storage(模型分发协议)

可信度: ⭐⭐⭐⭐(CNCF 维护者署名,多项目协同) 标签: #CNIA #ModelCSI #Harbor #Dragonfly #ORAS #OCIRegistry #模型分发 后续行动: 补充 KubeCon 2026 NA CNCF AI & Inference Day 议程(11 月 9 日,Salt Lake City)


【csdn】企业级 LLM Agent 三层架构(Plan/Architect/Zulu Agent)

来源: CSDN 智能体开发者社区 · 2026-07-11 URL: https://adg.csdn.net/6a522430662f9a54cb8e637c.html

核心架构: - Plan Agent:意图分解 + 任务规划 - Architect Agent:技术方案设计 - Zulu Agent:执行引擎(LangGraph 状态机驱动) - 验证循环:执行 → 验证 → 修正 → 再执行

工程要点: - MCP 协议跨系统工具标准化接入 - LangGraph 状态机构建可自我修正的 Agentic RAG - 可观测性 + 安全护栏 + 混合架构工程化 - 完整 Python 代码可复现

可信度: ⭐⭐⭐⭐(有源码、有架构图) 标签: #LLM-Agent #LangGraph #MCP #Multi-Agent #架构设计 #CSDN 后续行动: 与 2026-07-25-ai-engineering-trending.md 中 Context Engineering 条目合并


【csdn】vLLM PagedAttention / KVCache / ContinuousBatching 原理实战

来源: CSDN · 2026 URL: (来自 2026-07-25-csdn-llm-rag-agent-vecdb.md)

核心内容: - PagedAttention:分页式 KV Cache 管理,消除内存碎片 - Continuous Batching:迭代级调度,请求完成立即释放 slot - 实战参数:--enforce-eager(禁用 CUDA graph)、--gpu-memory-utilization(显存利用率)、--max-num-batched-tokens - 性能数据:14–24x 吞吐提升 vs HuggingFace Transformers

可信度: ⭐⭐⭐⭐(CSDN 高价值) 标签: #vLLM #PagedAttention #KVCache #ContinuousBatching 后续行动: 与本文件 MRV2 条目合并为 vLLM 推理优化主题


【csdn】LangChain 2026 实战指南

来源: CSDN · fenglingguitar · 2026-07-17 URL: https://blog.csdn.net/fenglingguitar/article/details/159823695

核心操作命令:

conda create -n langchain-demo python=3.10
pip install langchain-core langchain-community
  • API Key 管理与 .env 配置
  • 多模型统一调用(OpenAI / 通义 / 智谱)
  • 错误排查:端点连通性 → API Key → 代理 → 模板格式

可信度: ⭐⭐⭐⭐(2026-07 最新,步骤可操作) 标签: #LangChain #Python #环境配置 #API-Key #多模型


与已入库内容的去重说明

本轮条目 已入库文件 去重结论
向量数据库选型决策框架 2026-07-25-csdn-llm-rag-agent-vecdb.md(已有压测报告) 互补:csdn 版有压测数据,本文版有 100+ 企业决策经验;两者并存
pgvector RAG 指南 2026-07-25-csdn-llm-rag-agent-vecdb.md(已有向量数据库对比) 互补;csdn 版偏对比选型,本文版偏端到端部署步骤
vLLM MRV2 2026-07-25-csdn-llm-rag-agent-vecdb.md(已有 vLLM 原理实战) 互补:csdn 版偏原理+参数调优,本文版新增 MRV2 量化数据
VeriCache 2026-07-24-1105-noon-kv-rag-db-substack.md(KV Cache 相关) 互补;kv-rag-db 版偏基准测试,本文版偏 VeriCache 压缩方法
Kubernetes AI Serving 2026-07-25-ai-engineering-trending.md(已有 K8s 相关) 互补;trending 版偏 GitHub 学习路径和供应商架构,本文版新增 CNCF 66% 数据点
Cloud Native Model Distribution 无直接重复 全新条目,CNCF 模型交付流水线
pgvector 生产 RAG 2026-07-25-csdn-llm-rag-agent-vecdb.md(已有向量库选型) 互补;csdn 版偏选型决策树,本文版偏端到端 schema 和调参

分类标签汇总

#向量数据库 #Qdrant #pgvector #Milvus #Pinecone #Weaviate #选型决策 #HNSW #IVFFlat #pgvector #RAG #PostgreSQL #vLLM #MRV2 #Triton #FP8 #PagedAttention #KVCache #ContinuousBatching #SpeculativeDecoding #EAGLE #VeriCache #DisaggregatedServing #Kubernetes #KServe #KEDA #CNCF #DRA #ModelCSI #Harbor #Dragonfly #ORAS #LLM-Agent #LangGraph #MCP #Multi-Agent


高价值条目优先级

优先级 条目 核验建议
🔴 高 Kubernetes AI Serving CNCF 数据(66% K8s) 提取 CNCF 2026 Survey 原文数据来源
🔴 高 vLLM MRV2 56% 吞吐提升 验证 GB200 测试配置,提取 vLLM 官方 release note
🟠 中 VeriCache 压缩 KV Cache 精读 arXiv:2605.17613v1,理解 self-draft 机制
🟠 中 pgvector 端到端 RAG 部署 提取三表 schema 代码块,补充 HNSW 参数说明
🟡 低 Cloud Native Model Distribution 流水线 作为 CNCF 模型交付参考,待补 KubeCon 2026 NA 详情
🟡 低 Speculative Decoding 全景解析 补充 SwiftSpec ASPLOS 2026 论文引用

建议写入路径

  • /shared/research-kb/inbox/jay/2026-07-25-1105-db-backend-cloudnative-inference-briefing.md(本文)

后续主题页建议: - 2026-07-25-llm-inference-optimization-vllm-2026h1.md(MRV2 + VeriCache + Disagg Serving 合并) - 2026-07-25-vector-db-production-selection-matrix-2026.md(向量数据库选型矩阵)


附:本轮未写入文件说明

本轮检索覆盖向量数据库(10+ 条)、vLLM(10+ 条)、Kubernetes AI(8+ 条)、Substack(8+ 条)。

主要发现: - 向量数据库选型在 2026H2 已形成相对稳定格局(pgvector ≤ 50M / Qdrant 50M–5 亿 / Milvus 亿级+ / Pinecone 全托管) - vLLM 2026 上半年最大更新是 MRV2(56% 吞吐提升)和 Disaggregated Serving - CNCF 2026 数据:66% 生成式 AI 组织用 K8s,K8s 是 AI 推理事实标准 - Cloud Native Model Distribution 开始标准化(Harbor + Dragonfly + Model CSI 协同)

未执行 GitHub 写入操作。


Jay · 2026-07-25 11:05 · 数据库·后端·云原生·推理工程简报