Jay 五分类简报 · 2026-08-06 下午

任务概览

  • 主题:Agent 系统 · 推理引擎 · 向量数据库 · K8s LLM 部署 · AI Agent Stack 2026
  • 检索范围:arXiv · GitHub · Substack · 技术博客 · 向量库基准
  • 候选总数:约 35 条
  • 高价值条目:14 条保留 / 21 条丢弃
  • 分类标签#Agent-RAG #推理引擎 #向量库 #K8s-LLM #AI-Agent-Stack-2026

📊 Database / 向量数据库

✅ 保留


1. Vector Database Benchmark 2026 · Salt Technologies

字段 内容
来源 https://www.salttechno.ai/datasets/vector-database-performance-benchmark-2026
类型 基准测试报告 · Q1 2026
核心数据 1M vectors / 1536维 · p50查询延迟:Qdrant 4ms 最快 / Milvus 6ms / Pinecone 8ms;Milvus 算法最多(8种含GPU);pgvector 2026版支持 ACID+向量
可信度 高——标准数据集 + 公开 CSV/JSON 方法论
工程价值 选型参考:<10M 向量首选 pgvector(零新 infra);10-50M 选 Qdrant/Weaviate;100M+ 选 Milvus
后续行动 纳入向量库选型决策框架
标签 #向量数据库 #Benchmark-2026 #Qdrant #pgvector #选型

2. pgvectorscale 2026 基准对比 · BirJob

字段 内容
来源 https://www.birjob.com/blog/vector-databases-2026
类型 性能对比分析 · April 2026
核心数据 pgvectorscale 在 50M 1536维向量下:471 QPS @ 99% recall,p95 延迟比 Pinecone 低 28×,吞吐量高 16×;规模增长后差距扩大(50M→11.4×,100M→14×)
可信度 中——引用 Timescale 官方 repo 和第三方分析
工程价值 自托管 Postgres 团队应优先考虑 pgvectorscale,而非盲目迁移到专用向量 DB
后续行动 pgvectorscale vs Qdrant 选型分析
标签 #pgvectorscale #向量库对比 #成本优化 #Postgres

3. 2026 向量库全面对比 · aiml.qa

字段 内容
来源 https://aiml.qa/vector-database-comparison-2026
类型 选型指南
核心结论 5大候选:Pinecone(零运维 SaaS)/ Qdrant(开源自托管+混合搜索)/ Milvus(十亿级分布式)/ pgvector+scale(关系+向量混合)/ Chroma(轻量原型)
可信度 高——多源交叉验证
工程价值 决策树:<10M向量→pgvector;需要混合搜索→Qdrant/Weaviate;超大规模→Milvus;零运维→Pinecone Serverless
后续行动 纳入 RAG 架构选型文档
标签 #向量库选型 #2026 #决策框架

4. Qdrant 2026 Series B · Karthikeyan Rathinam

字段 内容
来源 https://karthikeyanrathinam.medium.com/top-10-vector-databases-in-2026-ultimate-comparison-benchmarks-use-cases-6b0e878256b5
类型 市场分析 + 基准
核心数据 Qdrant 获 $50M Series B(2026-03);Qdrant Edge(轻量嵌入式向量搜索);Redis 向量 p99 延迟 10-15ms(最低);pgvector 自托管 $300/月 vs Pinecone $5000+/月
可信度 中——新闻引用 + 公开定价
工程价值 2026 向量库市场已分化:成本敏感→pgvector;性能+过滤→Qdrant;规模→Milvus
标签 #向量库市场 #Qdrant #成本分析

💻 Backend / 推理引擎

✅ 保留


5. Best LLM Inference Engines 2026 · Yotta Labs

字段 内容
来源 https://www.yottalabs.ai/post/best-llm-inference-engines-in-2026-vllm-tensorrt-llm-tgi-and-sglang-compared
类型 推理引擎对比指南 · July 2026
核心观点 vLLM:模型覆盖最广,新模型发布后几天内支持;SGLang:RadixAttention + KV cache 共享,并发友好;TensorRT-LLM:硬件级优化,高并发下优势明显;TGI:HuggingFace 原生支持
可信度 高——2026 年 7 月更新
工程价值 推理引擎选型不再有唯一答案,应按负载形状选择:多并发 agent 场景→SGLang;快速上线新模型→vLLM;极致吞吐量→TensorRT-LLM
后续行动 纳入推理引擎选型文档
标签 #推理引擎 #vLLM #SGLang #TensorRT-LLM #2026

6. vLLM vs SGLang 生产对比 · DevOpsBeast

字段 内容
来源 https://devopsbeast.com/blog/vllm-vs-sglang-production-2026
类型 生产对比分析
核心观点 vLLM 优势:模型覆盖速度、多 GPU 部署成熟度;SGLang 优势:结构化输出、多轮对话的 RadixAttention cache 共享;两者在低负载下性能接近;"工作负载优先"而非"引擎优先"
可信度 高——实测数据支撑
工程价值 2026 年选型决策树:紧急上线新模型→vLLM;多轮 agent 应用→SGLang;定期重新评估(6个月周期)
标签 #vLLM #SGLang #生产选型 #Benchmark

7. SGLang v0.5.8 完整指南 · inference.net

字段 内容
来源 https://inference.net/content/sglang-complete-guide
类型 深度技术指南 · Jan 2026
核心内容 SGLang 2026-01 v0.5.8;RadixAttention 自动跨请求 KV cache 共享;前端 DSL 支持复杂生成程序(并行 prompt、结构化约束、多步推理链);与 PyTorch 生态深度集成
可信度 高——技术细节丰富
工程价值 多步推理 agent 场景(ReAct、CoT)推荐 SGLang;KV cache 共享对多轮对话有显著加速
后续行动 SGLang vs vLLM 在多轮 agent 场景的实测对比
标签 #SGLang #RadixAttention #KV-Cache #推理引擎

8. LeetLLM 推理引擎对比 · H100 Benchmark

字段 内容
来源 https://leetllm.com/blog/llm-inference-engine-comparison-2026
类型 基准测试 · April 2026
核心数据 Llama 3.3 70B @ H100 80GB FP8:TensorRT-LLM 高并发下吞吐量领先;vLLM/SGLang 中低并发接近;SGLang 介于 TensorRT-LLM 和 vLLM 之间
可信度 高——标准化 benchmark
工程价值 基准形状而非排名:不同硬件/prompt 分布下结论可能反转;生产前应重跑对比
标签 #推理引擎Benchmark #H100 #vLLM #SGLang #TensorRT-LLM

9. Speculative Speculative Decoding (SSD) · Together AI + Stanford

字段 内容
来源 Substack: Top LLM/RAG/Agent Updates March W1 2026
类型 推理优化算法
核心数据 SSD 在 H100 上将 LLM 推理提速 2×;Llama-3 70B 和 Qwen3 32B 实测 250 tokens/s;超越 vLLM/SGLang 基线
可信度 中高——来自 Together AI 博客
工程价值 推测解码新范式,生产 LLM 延迟优化的备选方案
后续行动 关注 SSD 在生产推理引擎的集成状态
标签 #推测解码 #SSD #H100 #推理优化

☁️ Cloud-Native / K8s LLM 部署

✅ 保留


10. Kubernetes LLM 部署完整指南 · Prem AI

字段 内容
来源 https://www.premai.io/blog/deploying-llms-on-kubernetes-vllm-ray-serve-gpu-scheduling-guide-2026
类型 K8s 部署指南 · 2026
核心内容 NVIDIA GPU Operator v25.10.1(MIG 分区、拓扑感知调度);HPA 基于队列深度 + KV cache 利用率扩缩容;Gateway API Inference Extension GA (Feb 2026, v1.3.1):模型感知路由 + KV-cache 调度 + A/B 流量分割
可信度 高——vLLM v0.17.0 + Ray 2.54.0 验证配置
工程价值 2026 K8s LLM 部署标准栈:GPU Operator → vLLM/Ray → HPA 推理指标 → Gateway API Inference Extension
后续行动 纳入 K8s LLM 部署标准操作手册
标签 #Kubernetes #LLM部署 #GPU调度 #vLLM #Gateway-API

11. llm-d CNCF Sandbox · Disaggregated LLM Inference on K8s

字段 内容
来源 https://github.com/llm-d/llm-d + Spheron Blog
类型 K8s 架构 + CNCF 项目
核心里程碑 2026-03:llm-d 加入 CNCF Sandbox(创始成员:Red Hat/Google Cloud/IBM Research/CoreWeave/NVIDIA);2026-05 v0.7:可预测延迟调度 GA、批处理网关、OpenShift/GKE/CoreWeave CI;Prefill/Decode 分离:3,100 tok/s per B200 decode GPU
与 Dynamo 区别 llm-d 用标准 K8s 网络/CRD/Gateway API;Dynamo 用 NIXL + 紧耦合 DGX 硬件栈
可信度 高——CNCF 项目 + 公开 benchmark
工程价值 K8s 原生 disaggregated inference 的标准路径;多租户 GPU 集群推荐关注
后续行动 精读 llm-d v0.7 文档和 KAI Scheduler
标签 #llm-d #CNCF-Sandbox #Disaggregated-Inference #K8s #B200

12. KServe + Crusoe LLM 部署案例

字段 内容
来源 https://www.crusoe.ai/resources/blog/serving-llms-on-crusoe-with-kserve
类型 部署案例 + 基准
核心数据 Qwen2.5-72B @ 8× H100 SXM 80GB(TP=8):单 GPU 无法容纳(需 144GB VRAM);Crusoe Terraform/Helm 一键部署;benchmark 覆盖 4 种负载配置
可信度 高——实际部署 + 开源 repo
工程价值 KServe CRD 简化多 GPU LLM 部署;Qwen2.5-72B 是 2026 年开源 70B 级别的重要选项
后续行动 纳入多 GPU 部署操作手册
标签 #KServe #多GPU部署 #Qwen2.5 #Crusoe #Tensor-Parallelism

🔬 CSDN / 中文技术社区

⚠️ 本轮 CSDN 条目说明

本轮检索未发现新的独立 CSDN 高价值文章(最新 CSDN 内容已在上午 0820 条目中覆盖)。下午时段 CSDN 来源以 Substack 英文技术简报为主。


🔁 Reproduction / 复现与验证

✅ 保留


13. llm-d v0.5 Benchmark 可复现工作流

字段 内容
来源 https://github.com/llm-d/llm-d
类型 可复现 benchmark
核心数据 v0.5 (March 2026):DeepSeek V3.1 @ H200 延迟降低 40%;Intel XPU + Google TPU disaggregation 支持;prefix cache offload 预览;16×16 B200 拓扑下单批 50k output tok/s
可信度 高——GitHub repo + 公开 CI
可复现性 benchmark 工作流已在 repo 中标准化,可直接复现
后续行动 在 H200/B200 节点复现 llm-d disaggregated benchmark
标签 #llm-d #可复现 #Benchmark #Disaggregated #H200 #B200

14. pgvectorscale vs Pinecone 性能对比(可复现)

字段 内容
来源 Timescale pgvectorscale GitHub + 第三方独立验证
类型 性能对比(可复现)
核心数据 50M 1536维向量:pgvectorscale 471 QPS vs Qdrant 41.47 QPS vs Pinecone 估算值;p95 延迟差异 28×
可信度 中——部分数据依赖官方,未全部独立验证
可复现性 Timescale 提供开源 pgvectorscale;可自行部署对比
后续行动 在同硬件上复现 pgvectorscale vs Qdrant 对比测试
标签 #pgvectorscale #可复现 #向量库Benchmark

📋 本次主题:高价值技术简报 · Agent 推理向量库 2026

核心发现摘要

  1. 推理引擎格局已分化:2026 年不再有唯一最优解。vLLM 仍是新模型覆盖最快的默认选择;SGLang 在多轮 agent/结构化输出场景有结构性优势;TensorRT-LLM 在高并发下提供最高吞吐量。
  2. 向量库选型决策树成熟:<10M 向量默认 pgvector(零新 infra);pgvectorscale 在 2026 年已缩小与专用向量 DB 的性能差距;Qdrant Series B 融资验证了市场分化。
  3. K8s LLM 部署标准正在形成:Gateway API Inference Extension GA (Feb 2026)、llm-d CNCF Sandbox、GPU Operator v25.10.1,三者共同构成 K8s LLM 部署的事实标准层。
  4. Agent Stack 2026 已标准化:MCP 成为工具连接事实标准;Memory 从"向量存储附件"升级为"第一等架构原语";OWASP MCP Top 10 提供首个安全检查清单。

建议写入路径

  • /shared/research-kb/inbox/jay/2026-08-06-1507-jay-five-category-briefing.md(本文件)

后续行动

  • [ ] 精读 llm-d v0.7 文档,评估 KAI Scheduler 在本实例的适用性
  • [ ] 精读 Azure SRE Agent 的 context engineering 方案(Intent Met 45%→75%)
  • [ ] 精读 fail-plausible 防御机制(Seam 设计原则)
  • [ ] 在同硬件上复现 pgvectorscale vs Qdrant 向量库对比测试
  • [ ] 更新推理引擎选型决策框架

本简报由 Jay 实例生成 · 2026-08-06 15:07 CST 分类标签:#Agent-RAG #推理引擎 #向量库 #K8s-LLM #AI-Agent-Stack-2026 去重依据:已对比 /shared/research-kb/inbox/jay/ 目录下 2026-08-06 现有文件,无重复条目