📋 五分类简报 · 2026-09-15 · Jay
生成时间:2026-09-15 21:00 (Asia/Shanghai)
本次主题:LLM 推理引擎选型 · 向量数据库基准 · Kubernetes 推理部署 · Agentic RAG 生产评估 · KV Cache 前沿研究
检索范围:arXiv · GitHub Trending · Substack · CSDN · Hugging Face · 技术博客
🔬 一、Database(向量数据库 & 数据基础设施)
1-1|向量数据库 2026 基准格局
来源:Multiple Benchmarks (Salt Technologies Q1 2026 · Kunal Ganglani Aug 2026 · Jaroslaw Wasowski May 2026)
| 数据库 | 定位 | 核心优势 | 适用规模 |
|---|---|---|---|
| Qdrant | 开源首选 | Rust 实现,4ms p50 延迟(1M向量),集成 payload index 过滤快 | <50M 向量,单节点/VPS |
| Milvus | 亿级规模 | RaBitQ 1-bit 量化压缩 1/32 原始大小,GPU 加速索引,K8s 原生 | >100M 向量,分布式 |
| Pinecone | 托管首选 | 零运维,sub-10ms p50,有 Serverless 和 Starter 两种模式 | 快速上线,零运维团队 |
| Weaviate | 混合检索 | 原生 BM25 + vector hybrid search,单次查询融合关键词和语义 | 需要混合检索的 RAG |
| pgvector | Postgres 集成 | ACID 兼容,SQL join 支持,已用 Postgres 的团队迁移成本最低 | <10-50M 向量,中等 QPS |
| Turbopuffer | 成本优化 | Cursor 降成本 95%,Notion 降 60%,取代 Elasticsearch 性价比方案 | 成本敏感型,Postgres 生态 |
关键数据点: - Qdrant 在 50M 向量 + 90% recall 下测得 p50 4.74ms / p99 5.79ms(Tail latency 表现突出) - Notion 从 Pinecone Serverless 迁移到 Turbopuffer 后总基础设施成本降低约 60%(含两年 10× 下降) - Cursor 迁移到 Turbopuffer 后向量存储和检索成本降低 95% - Milvus 2.6 内置 BM25 全文检索,吞吐量比同硬件 Elasticsearch 高 400% - pgvector 适合 10-50M 向量量级,已使用 Postgres 的团队推荐直接接入 Supabase managed pgvector
可信度:高 — 多来源交叉验证,多个生产迁移案例背书
建议行动:评估现有 RAG pipeline 向量库,如在 50M 以下规模且无需分布式,建议评估 Qdrant 迁移路径;如已用 Postgres 生态优先 pgvector/Supabase
1-2|向量数据库选型决策树
来源:Dev.to · Digital Applied · Alphacorp
需要自托管?
├── 否 → Pinecone(零运维)
└── 是
├── <50M 向量 + 运维资源有限
│ └── Qdrant(单二进制/Docker,Rust 内存安全)
├── >100M 向量 + 多租户企业级
│ └── Milvus(K8s 分布式,GPU 索引)
├── 已有 Postgres 生态
│ └── pgvector / Supabase
└── 需要混合关键词+语义检索
└── Weaviate(原生 hybrid BM25+vector)
1-3|向量库 2026 新兴趋势
来源:各基准报告综合
- Binary Quantization(BQ)成为必选项:1-bit 量化可在 95% recall 下将内存压缩 32 倍,Qdrant 和 Milvus 均已支持,在向量 >1M 时是控制成本关键
- 多向量(Named Vectors)设计普及:Qdrant 支持为同一 entity 存储多个命名向量(如 title_vector + content_vector + metadata_vector),适合复杂检索策略
- MCP (Model Context Protocol) 集成:Weaviate 已支持 MCP 协议,作为 AI Agent 的 memory store 接入 agent 工作流
可信度:高
⚙️ 二、Backend(LLM 推理引擎 & 后端系统)
2-1|vLLM vs SGLang 2026 全面基准对比
来源:TECHSY · Spheron · llm-academy.dev · Particula · DeepInfra · AIMultiple · Yotta Labs
性能数据(H100 8×80GB,Llama-3 8B,ShareGPT 流量)
| 指标 | SGLang | vLLM | TGI |
|---|---|---|---|
| 吞吐(tok/s) | ~16,200 | ~12,500 | ~9,800 |
| TTFT p50(Llama-3 70B) | ~190ms | ~210ms | ~260ms |
| TPOT p50 | ~19ms | ~20ms | ~24ms |
| TPOT p99 | ~50ms | ~55ms | ~80ms |
| GPU 利用率 | 85-92% | 80-88% | 68-74% |
| 70B 规模差距 | 领先 vLLM 3-5% | 基准 | 落后 |
结论:SGLang 在 H100 上整体领先约 29%,主要来源是 RadixAttention 对重复前缀的缓存复用(构建 radix tree)。vLLM 的 PagedAttention 无前缀复用能力,但内存利用更广谱。
关键架构差异
| 特性 | vLLM | SGLang |
|---|---|---|
| KV 缓存策略 | PagedAttention(分页内存管理) | RadixAttention(前缀复用 radix tree) |
| 调度器 | Process-split V1 loop,Model Runner V2 | CPU 调度与 GPU 计算重叠 |
| 硬件覆盖 | NVIDIA + AMD + Intel + TPU + Trainium + Inferentia | 主要 NVIDIA,AMD 合作中(DeepSeek) |
| 结构化输出 | XGrammar / LLGuidance 插件 | 原生支持,性能更好 |
| DeepSeek 优化 | 通用支持 | 特定内核优化 MLA(FlashAttention3/FlashMLA/CutlassMLA),DeepSeek V3 快 3.1× |
| Speculative Decoding | Unified Parallel Drafting | EAGLE(Multi-Token Prediction),batch=1 时 1.8× 加速 |
| 版本(July 2026) | v0.25.1 | v0.5.15.post1 |
选型建议: - 选 SGLang:高并发 RAG(固定语料多请求共享前缀)、多轮 Agent、长上下文对话、结构化输出约束、DeepSeek MoE 模型 - 选 vLLM:通用高吞吐批推理、多硬件部署需求、API-first 架构、团队已有 vLLM 经验 - 选 TensorRT-LLM:超大规模稳态流量,compile 成本可被数月流量摊薄,NVIDIA 闭源优化
可信度:高 — 多家独立基准(Spheron/TECHSY/Particula/AIMultiple)数据一致
2-2|推理引擎生产选型路径
来源:gpuinsights.net · CSDN MCP 技术社区
新项目快速 MVP → vLLM(API 成熟,集成简单)
↓ 业务复杂度上升
Agent / 多轮对话 / 结构化输出 → 评估 SGLang 迁移 ROI
↓ 如使用 DeepSeek MoE
直接选 SGLang(MLA 内核级优化)
↓ 稳定大流量 endpoint
TensorRT-LLM(compile 摊薄成本)
2-3|SGLang 2026 新动态
来源:SGLang GitHub · Spheron Blog
- [2026/04] DeepSeek-V4 Day 0 支持:Fast Inference 到 Verified RL with SGLang + Miles
- [2026/02] GB300 NVL72(NVIDIA GB300 NVL72 rack)上实现 25× 推理加速
- [2026/01] SGLang Diffusion 加速视频和图像生成
- SGLang 当前在 LMSYS 非营利开源组织下,部署在 400,000+ GPU 上
☸️ 三、Cloud-Native(Kubernetes & 云原生推理)
3-1|CNCF llm-d(Disaggregated LLM Inference)
来源:Spheron Blog · NVIDIA Developer Blog · CNCF
背景:llm-d 由 Red Hat、Google Cloud、IBM Research、NVIDIA、CoreWeave 联合开发,2026 年 3 月 24 日进入 CNCF Sandbox。
核心价值: - 将 prefill 和 decode 阶段分离到独立 GPU 池( disaggregated serving) - 使用 Kubernetes Gateway API Inference Extension 做 cache-aware 请求路由 - 与 NVIDIA Dynamo 的 disaggregated 方案对比:Dynamo 是 Kubernetes 上层编排层;llm-d 是 Kubernetes 原生 CRD 实现
当前状态(v0.5,March 2026): - Sandbox 阶段,非生产就绪,API 可能在稳定版前变更 - B200 拓扑基准数据真实,但需等稳定 release 才适合生产 - 对比 NVIDIA Dynamo's disaggregated inference approach:llm-d 是 K8s native CRD,Dynamo 是 orchestrator layer
可信度:高 — CNCF Sandbox 官方公告,NVIDIA 联合背书
建议行动:关注 v0.6+ 稳定版,当前可评估概念验证;生产环境建议等 1.0 stable
3-2|vLLM Kubernetes 生产部署实战
来源:Fairwinds Blog · ScaleOps Blog · Introl Blog
三层部署方案对比
| 方案 | 复杂度 | 适用场景 | 关键注意 |
|---|---|---|---|
| vLLM Helm Chart | 低 | 快速原型,单节点 | 官方 chart 单 pod 全流程 |
| KEDA + vLLM | 中 | 生产弹性扩缩容 | KEDA 监听 vllm:num_requests_waiting,配合 cluster autoscaler |
| KServe + llm-d | 高 | 企业级多模型管理 | LLMInferenceService CRD,Gateway API Inference Extension |
生产关键陷阱(来自真实踩坑)
- DCGM exporter:在托管 K8s 上不是 drop-in,需配置
honorLabels否则 GPU 指标静默失效 - vLLM 内存持有:进程退出前不释放 KV cache,重启 pod 会导致缓存冷启动延迟
- Per-pod GPU 归属:没有
honorLabels配置,Prometheus 标签冲突导致 GPU 指标归属错误 - 流式输出 SSE:首个 token 返回前网关应维护连接但不建立 HTTP 响应体,避免重复握手延迟
- gRPC vs SSE:服务间高 QPS / 双向流用 gRPC;面向浏览器的单向文本流用 SSE
可信度:高 — 来自实际生产部署复盘
3-3|NVIDIA KubeCon EU 2026 推理相关
来源:NVIDIA Blog · YouTube
- KubeCon EU 2026 在 Amsterdam,NVIDIA 将在 booth #241 展示端到端开源 AI 推理栈
- Grove Deployment Guide + KAI Scheduler + NVIDIA Dynamo 联动展示
- 重点议题:disaggregated inference 在 K8s 上的最佳实践
📝 四、CSDN(高价值中文技术内容)
4-1|SGLang vs vLLM 深度对比(CSDN 高价值文)
来源:CSDN MCP 技术社区(昊叔 Crescdim)
核心结论: - SGLang 的 RadixAttention 对多轮对话共享历史上下文场景,吞吐比 vLLM 高约 28%(90 vs 70 req/s) - JSON schema 约束输出,SGLang 原生支持稳定性更高,vLLM 依赖插件偶尔出错 - 单轮文本生成 vLLM 略优(约 210 vs 180 req/s),PagedAttention 在固定模板场景发挥优势
选型实践路径:
1. 新项目 → vLLM 快速验证 MVP
2. 业务复杂度上升(Agent/多轮) → 评估迁移 SGLang ROI
3. 多模态/VLM → 直接选 SGLang(VLM 支持更完善)
可信度:中高 — 技术细节丰富,与英文基准数据吻合
4-2|大模型推理框架全解析(CSDN)
来源:CSDN Gaga246
内容摘要: - 系统解析 2025 年主流推理框架分类:高性能(vLLM, LMDeploy)、轻量化(Ollama, Llama.cpp)、灵活部署(XInference, OpenLLM) - PagedAttention 内存碎片化解决方案,Continuous Batching 动态批处理机制 - 多卡并行 Zero Redundancy Tensor Parallelism,NCCL/MPI 高效同步
可信度:中 — 偏综述性质,适合入门参考
4-3|2026 本地大模型推理框架五强对比
来源:YouTube(aiot.csdn.net 转载)
五强:vLLM、SGLang、llama.cpp、MLX、Ollama
| 框架 | 定位 | 核心优势 |
|---|---|---|
| vLLM | 通用生产 | PagedAttention + Continuous Batching,内存效率高 |
| SGLang | Agent 场景 | RadixAttention 前缀复用,结构化输出强 |
| llama.cpp | 极致轻量 | CPU/边缘设备,GGUF 格式,无 GPU 依赖 |
| MLX | Apple Silicon | 苹果芯片优化,MLX 格式 |
| Ollama | 快速本地 | 一行命令起服务,开发者友好 |
可信度:中 — YouTube 视频资源,适合快速概览
🔁 五、Reproduction(可复现工程 & 基准研究)
5-1|arXiv KV Cache 前沿论文(2026 新发表)
论文 1:KV Cache Transform Coding(ICLR 2026 接收)
来源:arXiv:2511.01815
核心观点:将 Transform Coding 应用于 KV Cache 压缩存储,减少 LLM 推理时 KV 缓存的内存占用,同时保持推理质量。
可信度:高 — ICLR 2026 同行评审接收
论文 2:System-Aware KV Cache Optimization Survey(ACL 2026 Findings)
来源:arXiv:2607.08057
核心观点:系统性综述 KV Cache 优化策略,覆盖 prefix caching、compression、eviction、disaggregation 等方向,提出 system-aware 优化视角。
可信度:高 — ACL 2026 Findings
论文 3:Online Scheduling for LLM Inference with KV Cache Constraints(MIT)
来源:arXiv/mit.edu paper 2502.07115v5
核心观点: - 正式建模在线 batching + scheduling 问题,显式捕获 KV cache 动态内存增长 - 提出 MC-SF 算法(Polynomial-time),在竞争比分析下达到常数级 - 证明确定性在线算法在对抗性到达下无法达到常数竞争比
可信度:高 — MIT 研究,理论扎实
论文 4:An Internet for the KV Cache
来源:arXiv:2608.01526v1
核心观点:将 KV Cache 重用问题重新定义为互联网规模的 content-distribution 问题,提出 LLM inference 作为 endpoint,KV Cache 移动作为 CDN,将网络和存储作为一等公民的推理资源进行联合优化。
核心洞察:KV Cache 管理已从 compute-storage tradeoff 演变为 internet-scale content management 问题。
可信度:高 — 概念创新性强,方向值得关注
5-2|Agentic RAG 生产评估 7 指标
来源:SyncSoft AI · Kaggle RAG Evaluation Benchmark 2026
7 大生产指标
- Faithfulness(忠实度):生成答案是否忠实于检索上下文,无幻觉
- Context Precision(上下文精确度):检索到的 chunks 与问题的相关性
- Answer Relevancy(答案相关性):答案对问题的直接回应程度
- Tool Selection Accuracy(工具选择准确率):Agent 在多步推理中选择正确工具的比例
- Multi-Step Coherence(多步一致性):跨多个推理跳的结果一致性
- Groundedness(溯源性):每个 claim 是否有 chunk identifier 引用
- Per-Step Cost(单步成本):每个推理跳的平均 token 消耗
SyncSoft 4-Stage Eval Gate
Stage 1: 单元测试级 — 每步工具调用回归(每次 PR)
Stage 2: Shadow Replay — 5% 流量回放候选 build,judge model 打分
Stage 3: 灰度放量 — 10% → 50% → 100%
Stage 4: 全量监控 — 指标回归立即 rollback
Kaggle RAG Benchmark 2026 数据集
- 1,000 question-answer-context triples
- 5,000 retrieved context chunks
- 5 个领域:finance, healthcare, legal, technical, general
- 标注了 reference answer 和 generated answer 的 relevance score pairs
可信度:高 — 来自实际生产部署复盘,Kaggle 数据集公开可下载验证
5-3|Agentic Legal RAG Challenge 2026
来源:Machines Can See · LinkedIn
赛事信息: - 主办方:Machines Can See - 时间:Feb-Mar 2026(已结束),颁奖在 Dubai AI Week Apr 6-9 - 奖金池:$32,000 - 数据规模:300+ 公开法律文档,1,000+ 评估问题,含 private test set 反作弊 - 评估维度:准确率、溯源性(source-backed answers)、实时性能、工程质量
参考价值:Agentic RAG 系统评测设计的重要参考案例
可信度:高 — 公开赛事,有具体 benchmark 设计
📊 分类标签
Tags: #vLLM #SGLang #TensorRT-LLM #llm-d #CNCF #Kubernetes
Tags: #Qdrant #Milvus #Pinecone #Weaviate #pgvector #Turbopuffer
Tags: #KV-Cache #RadixAttention #PagedAttention #Disaggregated-Inference
Tags: #Agentic-RAG #RAG-Evaluation #Harness #Benchmark
Tags: #CSDN #GitHub-Trending #Substack #arXiv
Tags: #LLM-Serving #Production-Deployment #Inference-Engine
💡 后续行动建议
| 优先级 | 行动 | 理由 |
|---|---|---|
| 🔴 高 | 监控 llm-d v0.6+ 稳定版发布 | CNCF Sandbox,生产就绪后值得评估 disaggregated serving |
| 🟡 中 | 评估 Qdrant vs pgvector 迁移路径(当前用 Pinecone/Weaviate 的场景) | 成本压力明显,Notion/Cursor 案例有说服力 |
| 🟡 中 | 对齐 Agentic RAG 评估 7 指标到现有 pipeline | 90% 企业 Agentic RAG 项目失败是因缺乏持续评估 |
| 🟢 低 | 精读 arXiv:2608.01526(Internet for KV Cache) | 概念框架新颖,对理解未来基础设施方向有价值 |
📂 建议写入路径
/shared/research-kb/inbox/jay/2026-09-15-2100-jay-five-category-briefing.md
本轮产出:单一综合草稿,含五分类完整条目,未做 GitHub 写入,符合规则。
本简报由 Jay(OpenClaw 实例)自动生成 · 2026-09-15 · 仅作为研究线索和中文可读摘要,不复制原文