📋 五分类简报 · 2026-09-15 · Jay

生成时间:2026-09-15 21:00 (Asia/Shanghai)
本次主题:LLM 推理引擎选型 · 向量数据库基准 · Kubernetes 推理部署 · Agentic RAG 生产评估 · KV Cache 前沿研究
检索范围:arXiv · GitHub Trending · Substack · CSDN · Hugging Face · 技术博客


🔬 一、Database(向量数据库 & 数据基础设施)

1-1|向量数据库 2026 基准格局

来源:Multiple Benchmarks (Salt Technologies Q1 2026 · Kunal Ganglani Aug 2026 · Jaroslaw Wasowski May 2026)

数据库 定位 核心优势 适用规模
Qdrant 开源首选 Rust 实现,4ms p50 延迟(1M向量),集成 payload index 过滤快 <50M 向量,单节点/VPS
Milvus 亿级规模 RaBitQ 1-bit 量化压缩 1/32 原始大小,GPU 加速索引,K8s 原生 >100M 向量,分布式
Pinecone 托管首选 零运维,sub-10ms p50,有 Serverless 和 Starter 两种模式 快速上线,零运维团队
Weaviate 混合检索 原生 BM25 + vector hybrid search,单次查询融合关键词和语义 需要混合检索的 RAG
pgvector Postgres 集成 ACID 兼容,SQL join 支持,已用 Postgres 的团队迁移成本最低 <10-50M 向量,中等 QPS
Turbopuffer 成本优化 Cursor 降成本 95%,Notion 降 60%,取代 Elasticsearch 性价比方案 成本敏感型,Postgres 生态

关键数据点: - Qdrant 在 50M 向量 + 90% recall 下测得 p50 4.74ms / p99 5.79ms(Tail latency 表现突出) - Notion 从 Pinecone Serverless 迁移到 Turbopuffer 后总基础设施成本降低约 60%(含两年 10× 下降) - Cursor 迁移到 Turbopuffer 后向量存储和检索成本降低 95% - Milvus 2.6 内置 BM25 全文检索,吞吐量比同硬件 Elasticsearch 高 400% - pgvector 适合 10-50M 向量量级,已使用 Postgres 的团队推荐直接接入 Supabase managed pgvector

可信度:高 — 多来源交叉验证,多个生产迁移案例背书

建议行动:评估现有 RAG pipeline 向量库,如在 50M 以下规模且无需分布式,建议评估 Qdrant 迁移路径;如已用 Postgres 生态优先 pgvector/Supabase


1-2|向量数据库选型决策树

来源:Dev.to · Digital Applied · Alphacorp

需要自托管?
├── 否 → Pinecone(零运维)
└── 是
    ├── <50M 向量 + 运维资源有限
    │   └── Qdrant(单二进制/Docker,Rust 内存安全)
    ├── >100M 向量 + 多租户企业级
    │   └── Milvus(K8s 分布式,GPU 索引)
    ├── 已有 Postgres 生态
    │   └── pgvector / Supabase
    └── 需要混合关键词+语义检索
        └── Weaviate(原生 hybrid BM25+vector)

1-3|向量库 2026 新兴趋势

来源:各基准报告综合

  • Binary Quantization(BQ)成为必选项:1-bit 量化可在 95% recall 下将内存压缩 32 倍,Qdrant 和 Milvus 均已支持,在向量 >1M 时是控制成本关键
  • 多向量(Named Vectors)设计普及:Qdrant 支持为同一 entity 存储多个命名向量(如 title_vector + content_vector + metadata_vector),适合复杂检索策略
  • MCP (Model Context Protocol) 集成:Weaviate 已支持 MCP 协议,作为 AI Agent 的 memory store 接入 agent 工作流

可信度:高


⚙️ 二、Backend(LLM 推理引擎 & 后端系统)

2-1|vLLM vs SGLang 2026 全面基准对比

来源:TECHSY · Spheron · llm-academy.dev · Particula · DeepInfra · AIMultiple · Yotta Labs

性能数据(H100 8×80GB,Llama-3 8B,ShareGPT 流量)

指标 SGLang vLLM TGI
吞吐(tok/s) ~16,200 ~12,500 ~9,800
TTFT p50(Llama-3 70B) ~190ms ~210ms ~260ms
TPOT p50 ~19ms ~20ms ~24ms
TPOT p99 ~50ms ~55ms ~80ms
GPU 利用率 85-92% 80-88% 68-74%
70B 规模差距 领先 vLLM 3-5% 基准 落后

结论:SGLang 在 H100 上整体领先约 29%,主要来源是 RadixAttention 对重复前缀的缓存复用(构建 radix tree)。vLLM 的 PagedAttention 无前缀复用能力,但内存利用更广谱。

关键架构差异

特性 vLLM SGLang
KV 缓存策略 PagedAttention(分页内存管理) RadixAttention(前缀复用 radix tree)
调度器 Process-split V1 loop,Model Runner V2 CPU 调度与 GPU 计算重叠
硬件覆盖 NVIDIA + AMD + Intel + TPU + Trainium + Inferentia 主要 NVIDIA,AMD 合作中(DeepSeek)
结构化输出 XGrammar / LLGuidance 插件 原生支持,性能更好
DeepSeek 优化 通用支持 特定内核优化 MLA(FlashAttention3/FlashMLA/CutlassMLA),DeepSeek V3 快 3.1×
Speculative Decoding Unified Parallel Drafting EAGLE(Multi-Token Prediction),batch=1 时 1.8× 加速
版本(July 2026) v0.25.1 v0.5.15.post1

选型建议: - 选 SGLang:高并发 RAG(固定语料多请求共享前缀)、多轮 Agent、长上下文对话、结构化输出约束、DeepSeek MoE 模型 - 选 vLLM:通用高吞吐批推理、多硬件部署需求、API-first 架构、团队已有 vLLM 经验 - 选 TensorRT-LLM:超大规模稳态流量,compile 成本可被数月流量摊薄,NVIDIA 闭源优化

可信度:高 — 多家独立基准(Spheron/TECHSY/Particula/AIMultiple)数据一致


2-2|推理引擎生产选型路径

来源:gpuinsights.net · CSDN MCP 技术社区

新项目快速 MVP → vLLM(API 成熟,集成简单)
     ↓ 业务复杂度上升
Agent / 多轮对话 / 结构化输出 → 评估 SGLang 迁移 ROI
     ↓ 如使用 DeepSeek MoE
直接选 SGLang(MLA 内核级优化)
     ↓ 稳定大流量 endpoint
TensorRT-LLM(compile 摊薄成本)

2-3|SGLang 2026 新动态

来源:SGLang GitHub · Spheron Blog

  • [2026/04] DeepSeek-V4 Day 0 支持:Fast Inference 到 Verified RL with SGLang + Miles
  • [2026/02] GB300 NVL72(NVIDIA GB300 NVL72 rack)上实现 25× 推理加速
  • [2026/01] SGLang Diffusion 加速视频和图像生成
  • SGLang 当前在 LMSYS 非营利开源组织下,部署在 400,000+ GPU 上

☸️ 三、Cloud-Native(Kubernetes & 云原生推理)

3-1|CNCF llm-d(Disaggregated LLM Inference)

来源:Spheron Blog · NVIDIA Developer Blog · CNCF

背景:llm-d 由 Red Hat、Google Cloud、IBM Research、NVIDIA、CoreWeave 联合开发,2026 年 3 月 24 日进入 CNCF Sandbox。

核心价值: - 将 prefill 和 decode 阶段分离到独立 GPU 池( disaggregated serving) - 使用 Kubernetes Gateway API Inference Extension 做 cache-aware 请求路由 - 与 NVIDIA Dynamo 的 disaggregated 方案对比:Dynamo 是 Kubernetes 上层编排层;llm-d 是 Kubernetes 原生 CRD 实现

当前状态(v0.5,March 2026): - Sandbox 阶段,非生产就绪,API 可能在稳定版前变更 - B200 拓扑基准数据真实,但需等稳定 release 才适合生产 - 对比 NVIDIA Dynamo's disaggregated inference approach:llm-d 是 K8s native CRD,Dynamo 是 orchestrator layer

可信度:高 — CNCF Sandbox 官方公告,NVIDIA 联合背书

建议行动:关注 v0.6+ 稳定版,当前可评估概念验证;生产环境建议等 1.0 stable


3-2|vLLM Kubernetes 生产部署实战

来源:Fairwinds Blog · ScaleOps Blog · Introl Blog

三层部署方案对比

方案 复杂度 适用场景 关键注意
vLLM Helm Chart 快速原型,单节点 官方 chart 单 pod 全流程
KEDA + vLLM 生产弹性扩缩容 KEDA 监听 vllm:num_requests_waiting,配合 cluster autoscaler
KServe + llm-d 企业级多模型管理 LLMInferenceService CRD,Gateway API Inference Extension

生产关键陷阱(来自真实踩坑)

  1. DCGM exporter:在托管 K8s 上不是 drop-in,需配置 honorLabels 否则 GPU 指标静默失效
  2. vLLM 内存持有:进程退出前不释放 KV cache,重启 pod 会导致缓存冷启动延迟
  3. Per-pod GPU 归属:没有 honorLabels 配置,Prometheus 标签冲突导致 GPU 指标归属错误
  4. 流式输出 SSE:首个 token 返回前网关应维护连接但不建立 HTTP 响应体,避免重复握手延迟
  5. gRPC vs SSE:服务间高 QPS / 双向流用 gRPC;面向浏览器的单向文本流用 SSE

可信度:高 — 来自实际生产部署复盘


3-3|NVIDIA KubeCon EU 2026 推理相关

来源:NVIDIA Blog · YouTube

  • KubeCon EU 2026 在 Amsterdam,NVIDIA 将在 booth #241 展示端到端开源 AI 推理栈
  • Grove Deployment Guide + KAI Scheduler + NVIDIA Dynamo 联动展示
  • 重点议题:disaggregated inference 在 K8s 上的最佳实践

📝 四、CSDN(高价值中文技术内容)

4-1|SGLang vs vLLM 深度对比(CSDN 高价值文)

来源:CSDN MCP 技术社区(昊叔 Crescdim)

核心结论: - SGLang 的 RadixAttention 对多轮对话共享历史上下文场景,吞吐比 vLLM 高约 28%(90 vs 70 req/s) - JSON schema 约束输出,SGLang 原生支持稳定性更高,vLLM 依赖插件偶尔出错 - 单轮文本生成 vLLM 略优(约 210 vs 180 req/s),PagedAttention 在固定模板场景发挥优势

选型实践路径

1. 新项目 → vLLM 快速验证 MVP
2. 业务复杂度上升(Agent/多轮) → 评估迁移 SGLang ROI
3. 多模态/VLM → 直接选 SGLang(VLM 支持更完善)

可信度:中高 — 技术细节丰富,与英文基准数据吻合


4-2|大模型推理框架全解析(CSDN)

来源:CSDN Gaga246

内容摘要: - 系统解析 2025 年主流推理框架分类:高性能(vLLM, LMDeploy)、轻量化(Ollama, Llama.cpp)、灵活部署(XInference, OpenLLM) - PagedAttention 内存碎片化解决方案,Continuous Batching 动态批处理机制 - 多卡并行 Zero Redundancy Tensor Parallelism,NCCL/MPI 高效同步

可信度:中 — 偏综述性质,适合入门参考


4-3|2026 本地大模型推理框架五强对比

来源:YouTube(aiot.csdn.net 转载)

五强:vLLM、SGLang、llama.cpp、MLX、Ollama

框架 定位 核心优势
vLLM 通用生产 PagedAttention + Continuous Batching,内存效率高
SGLang Agent 场景 RadixAttention 前缀复用,结构化输出强
llama.cpp 极致轻量 CPU/边缘设备,GGUF 格式,无 GPU 依赖
MLX Apple Silicon 苹果芯片优化,MLX 格式
Ollama 快速本地 一行命令起服务,开发者友好

可信度:中 — YouTube 视频资源,适合快速概览


🔁 五、Reproduction(可复现工程 & 基准研究)

5-1|arXiv KV Cache 前沿论文(2026 新发表)

论文 1:KV Cache Transform Coding(ICLR 2026 接收)

来源:arXiv:2511.01815

核心观点:将 Transform Coding 应用于 KV Cache 压缩存储,减少 LLM 推理时 KV 缓存的内存占用,同时保持推理质量。

可信度:高 — ICLR 2026 同行评审接收


论文 2:System-Aware KV Cache Optimization Survey(ACL 2026 Findings)

来源:arXiv:2607.08057

核心观点:系统性综述 KV Cache 优化策略,覆盖 prefix caching、compression、eviction、disaggregation 等方向,提出 system-aware 优化视角。

可信度:高 — ACL 2026 Findings


论文 3:Online Scheduling for LLM Inference with KV Cache Constraints(MIT)

来源:arXiv/mit.edu paper 2502.07115v5

核心观点: - 正式建模在线 batching + scheduling 问题,显式捕获 KV cache 动态内存增长 - 提出 MC-SF 算法(Polynomial-time),在竞争比分析下达到常数级 - 证明确定性在线算法在对抗性到达下无法达到常数竞争比

可信度:高 — MIT 研究,理论扎实


论文 4:An Internet for the KV Cache

来源:arXiv:2608.01526v1

核心观点:将 KV Cache 重用问题重新定义为互联网规模的 content-distribution 问题,提出 LLM inference 作为 endpoint,KV Cache 移动作为 CDN,将网络和存储作为一等公民的推理资源进行联合优化。

核心洞察:KV Cache 管理已从 compute-storage tradeoff 演变为 internet-scale content management 问题。

可信度:高 — 概念创新性强,方向值得关注


5-2|Agentic RAG 生产评估 7 指标

来源:SyncSoft AI · Kaggle RAG Evaluation Benchmark 2026

7 大生产指标

  1. Faithfulness(忠实度):生成答案是否忠实于检索上下文,无幻觉
  2. Context Precision(上下文精确度):检索到的 chunks 与问题的相关性
  3. Answer Relevancy(答案相关性):答案对问题的直接回应程度
  4. Tool Selection Accuracy(工具选择准确率):Agent 在多步推理中选择正确工具的比例
  5. Multi-Step Coherence(多步一致性):跨多个推理跳的结果一致性
  6. Groundedness(溯源性):每个 claim 是否有 chunk identifier 引用
  7. Per-Step Cost(单步成本):每个推理跳的平均 token 消耗

SyncSoft 4-Stage Eval Gate

Stage 1: 单元测试级 — 每步工具调用回归(每次 PR)
Stage 2: Shadow Replay — 5% 流量回放候选 build,judge model 打分
Stage 3: 灰度放量 — 10% → 50% → 100%
Stage 4: 全量监控 — 指标回归立即 rollback

Kaggle RAG Benchmark 2026 数据集

  • 1,000 question-answer-context triples
  • 5,000 retrieved context chunks
  • 5 个领域:finance, healthcare, legal, technical, general
  • 标注了 reference answer 和 generated answer 的 relevance score pairs

可信度:高 — 来自实际生产部署复盘,Kaggle 数据集公开可下载验证


来源:Machines Can See · LinkedIn

赛事信息: - 主办方:Machines Can See - 时间:Feb-Mar 2026(已结束),颁奖在 Dubai AI Week Apr 6-9 - 奖金池:$32,000 - 数据规模:300+ 公开法律文档,1,000+ 评估问题,含 private test set 反作弊 - 评估维度:准确率、溯源性(source-backed answers)、实时性能、工程质量

参考价值:Agentic RAG 系统评测设计的重要参考案例

可信度:高 — 公开赛事,有具体 benchmark 设计


📊 分类标签

Tags: #vLLM #SGLang #TensorRT-LLM #llm-d #CNCF #Kubernetes
Tags: #Qdrant #Milvus #Pinecone #Weaviate #pgvector #Turbopuffer
Tags: #KV-Cache #RadixAttention #PagedAttention #Disaggregated-Inference
Tags: #Agentic-RAG #RAG-Evaluation #Harness #Benchmark
Tags: #CSDN #GitHub-Trending #Substack #arXiv
Tags: #LLM-Serving #Production-Deployment #Inference-Engine

💡 后续行动建议

优先级 行动 理由
🔴 高 监控 llm-d v0.6+ 稳定版发布 CNCF Sandbox,生产就绪后值得评估 disaggregated serving
🟡 中 评估 Qdrant vs pgvector 迁移路径(当前用 Pinecone/Weaviate 的场景) 成本压力明显,Notion/Cursor 案例有说服力
🟡 中 对齐 Agentic RAG 评估 7 指标到现有 pipeline 90% 企业 Agentic RAG 项目失败是因缺乏持续评估
🟢 低 精读 arXiv:2608.01526(Internet for KV Cache) 概念框架新颖,对理解未来基础设施方向有价值

📂 建议写入路径

/shared/research-kb/inbox/jay/2026-09-15-2100-jay-five-category-briefing.md

本轮产出:单一综合草稿,含五分类完整条目,未做 GitHub 写入,符合规则。


本简报由 Jay(OpenClaw 实例)自动生成 · 2026-09-15 · 仅作为研究线索和中文可读摘要,不复制原文