Jay 五分类简报 · 2026-08-06 下午
任务概览
- 主题:Agent 系统 · 推理引擎 · 向量数据库 · K8s LLM 部署 · AI Agent Stack 2026
- 检索范围:arXiv · GitHub · Substack · 技术博客 · 向量库基准
- 候选总数:约 35 条
- 高价值条目:14 条保留 / 21 条丢弃
- 分类标签:
#Agent-RAG #推理引擎 #向量库 #K8s-LLM #AI-Agent-Stack-2026
📊 Database / 向量数据库
✅ 保留
1. Vector Database Benchmark 2026 · Salt Technologies
| 字段 |
内容 |
| 来源 |
https://www.salttechno.ai/datasets/vector-database-performance-benchmark-2026 |
| 类型 |
基准测试报告 · Q1 2026 |
| 核心数据 |
1M vectors / 1536维 · p50查询延迟:Qdrant 4ms 最快 / Milvus 6ms / Pinecone 8ms;Milvus 算法最多(8种含GPU);pgvector 2026版支持 ACID+向量 |
| 可信度 |
高——标准数据集 + 公开 CSV/JSON 方法论 |
| 工程价值 |
选型参考:<10M 向量首选 pgvector(零新 infra);10-50M 选 Qdrant/Weaviate;100M+ 选 Milvus |
| 后续行动 |
纳入向量库选型决策框架 |
| 标签 |
#向量数据库 #Benchmark-2026 #Qdrant #pgvector #选型 |
2. pgvectorscale 2026 基准对比 · BirJob
| 字段 |
内容 |
| 来源 |
https://www.birjob.com/blog/vector-databases-2026 |
| 类型 |
性能对比分析 · April 2026 |
| 核心数据 |
pgvectorscale 在 50M 1536维向量下:471 QPS @ 99% recall,p95 延迟比 Pinecone 低 28×,吞吐量高 16×;规模增长后差距扩大(50M→11.4×,100M→14×) |
| 可信度 |
中——引用 Timescale 官方 repo 和第三方分析 |
| 工程价值 |
自托管 Postgres 团队应优先考虑 pgvectorscale,而非盲目迁移到专用向量 DB |
| 后续行动 |
pgvectorscale vs Qdrant 选型分析 |
| 标签 |
#pgvectorscale #向量库对比 #成本优化 #Postgres |
3. 2026 向量库全面对比 · aiml.qa
| 字段 |
内容 |
| 来源 |
https://aiml.qa/vector-database-comparison-2026 |
| 类型 |
选型指南 |
| 核心结论 |
5大候选:Pinecone(零运维 SaaS)/ Qdrant(开源自托管+混合搜索)/ Milvus(十亿级分布式)/ pgvector+scale(关系+向量混合)/ Chroma(轻量原型) |
| 可信度 |
高——多源交叉验证 |
| 工程价值 |
决策树:<10M向量→pgvector;需要混合搜索→Qdrant/Weaviate;超大规模→Milvus;零运维→Pinecone Serverless |
| 后续行动 |
纳入 RAG 架构选型文档 |
| 标签 |
#向量库选型 #2026 #决策框架 |
4. Qdrant 2026 Series B · Karthikeyan Rathinam
| 字段 |
内容 |
| 来源 |
https://karthikeyanrathinam.medium.com/top-10-vector-databases-in-2026-ultimate-comparison-benchmarks-use-cases-6b0e878256b5 |
| 类型 |
市场分析 + 基准 |
| 核心数据 |
Qdrant 获 $50M Series B(2026-03);Qdrant Edge(轻量嵌入式向量搜索);Redis 向量 p99 延迟 10-15ms(最低);pgvector 自托管 $300/月 vs Pinecone $5000+/月 |
| 可信度 |
中——新闻引用 + 公开定价 |
| 工程价值 |
2026 向量库市场已分化:成本敏感→pgvector;性能+过滤→Qdrant;规模→Milvus |
| 标签 |
#向量库市场 #Qdrant #成本分析 |
💻 Backend / 推理引擎
✅ 保留
5. Best LLM Inference Engines 2026 · Yotta Labs
| 字段 |
内容 |
| 来源 |
https://www.yottalabs.ai/post/best-llm-inference-engines-in-2026-vllm-tensorrt-llm-tgi-and-sglang-compared |
| 类型 |
推理引擎对比指南 · July 2026 |
| 核心观点 |
vLLM:模型覆盖最广,新模型发布后几天内支持;SGLang:RadixAttention + KV cache 共享,并发友好;TensorRT-LLM:硬件级优化,高并发下优势明显;TGI:HuggingFace 原生支持 |
| 可信度 |
高——2026 年 7 月更新 |
| 工程价值 |
推理引擎选型不再有唯一答案,应按负载形状选择:多并发 agent 场景→SGLang;快速上线新模型→vLLM;极致吞吐量→TensorRT-LLM |
| 后续行动 |
纳入推理引擎选型文档 |
| 标签 |
#推理引擎 #vLLM #SGLang #TensorRT-LLM #2026 |
6. vLLM vs SGLang 生产对比 · DevOpsBeast
| 字段 |
内容 |
| 来源 |
https://devopsbeast.com/blog/vllm-vs-sglang-production-2026 |
| 类型 |
生产对比分析 |
| 核心观点 |
vLLM 优势:模型覆盖速度、多 GPU 部署成熟度;SGLang 优势:结构化输出、多轮对话的 RadixAttention cache 共享;两者在低负载下性能接近;"工作负载优先"而非"引擎优先" |
| 可信度 |
高——实测数据支撑 |
| 工程价值 |
2026 年选型决策树:紧急上线新模型→vLLM;多轮 agent 应用→SGLang;定期重新评估(6个月周期) |
| 标签 |
#vLLM #SGLang #生产选型 #Benchmark |
7. SGLang v0.5.8 完整指南 · inference.net
| 字段 |
内容 |
| 来源 |
https://inference.net/content/sglang-complete-guide |
| 类型 |
深度技术指南 · Jan 2026 |
| 核心内容 |
SGLang 2026-01 v0.5.8;RadixAttention 自动跨请求 KV cache 共享;前端 DSL 支持复杂生成程序(并行 prompt、结构化约束、多步推理链);与 PyTorch 生态深度集成 |
| 可信度 |
高——技术细节丰富 |
| 工程价值 |
多步推理 agent 场景(ReAct、CoT)推荐 SGLang;KV cache 共享对多轮对话有显著加速 |
| 后续行动 |
SGLang vs vLLM 在多轮 agent 场景的实测对比 |
| 标签 |
#SGLang #RadixAttention #KV-Cache #推理引擎 |
8. LeetLLM 推理引擎对比 · H100 Benchmark
| 字段 |
内容 |
| 来源 |
https://leetllm.com/blog/llm-inference-engine-comparison-2026 |
| 类型 |
基准测试 · April 2026 |
| 核心数据 |
Llama 3.3 70B @ H100 80GB FP8:TensorRT-LLM 高并发下吞吐量领先;vLLM/SGLang 中低并发接近;SGLang 介于 TensorRT-LLM 和 vLLM 之间 |
| 可信度 |
高——标准化 benchmark |
| 工程价值 |
基准形状而非排名:不同硬件/prompt 分布下结论可能反转;生产前应重跑对比 |
| 标签 |
#推理引擎Benchmark #H100 #vLLM #SGLang #TensorRT-LLM |
9. Speculative Speculative Decoding (SSD) · Together AI + Stanford
| 字段 |
内容 |
| 来源 |
Substack: Top LLM/RAG/Agent Updates March W1 2026 |
| 类型 |
推理优化算法 |
| 核心数据 |
SSD 在 H100 上将 LLM 推理提速 2×;Llama-3 70B 和 Qwen3 32B 实测 250 tokens/s;超越 vLLM/SGLang 基线 |
| 可信度 |
中高——来自 Together AI 博客 |
| 工程价值 |
推测解码新范式,生产 LLM 延迟优化的备选方案 |
| 后续行动 |
关注 SSD 在生产推理引擎的集成状态 |
| 标签 |
#推测解码 #SSD #H100 #推理优化 |
☁️ Cloud-Native / K8s LLM 部署
✅ 保留
10. Kubernetes LLM 部署完整指南 · Prem AI
| 字段 |
内容 |
| 来源 |
https://www.premai.io/blog/deploying-llms-on-kubernetes-vllm-ray-serve-gpu-scheduling-guide-2026 |
| 类型 |
K8s 部署指南 · 2026 |
| 核心内容 |
NVIDIA GPU Operator v25.10.1(MIG 分区、拓扑感知调度);HPA 基于队列深度 + KV cache 利用率扩缩容;Gateway API Inference Extension GA (Feb 2026, v1.3.1):模型感知路由 + KV-cache 调度 + A/B 流量分割 |
| 可信度 |
高——vLLM v0.17.0 + Ray 2.54.0 验证配置 |
| 工程价值 |
2026 K8s LLM 部署标准栈:GPU Operator → vLLM/Ray → HPA 推理指标 → Gateway API Inference Extension |
| 后续行动 |
纳入 K8s LLM 部署标准操作手册 |
| 标签 |
#Kubernetes #LLM部署 #GPU调度 #vLLM #Gateway-API |
11. llm-d CNCF Sandbox · Disaggregated LLM Inference on K8s
| 字段 |
内容 |
| 来源 |
https://github.com/llm-d/llm-d + Spheron Blog |
| 类型 |
K8s 架构 + CNCF 项目 |
| 核心里程碑 |
2026-03:llm-d 加入 CNCF Sandbox(创始成员:Red Hat/Google Cloud/IBM Research/CoreWeave/NVIDIA);2026-05 v0.7:可预测延迟调度 GA、批处理网关、OpenShift/GKE/CoreWeave CI;Prefill/Decode 分离:3,100 tok/s per B200 decode GPU |
| 与 Dynamo 区别 |
llm-d 用标准 K8s 网络/CRD/Gateway API;Dynamo 用 NIXL + 紧耦合 DGX 硬件栈 |
| 可信度 |
高——CNCF 项目 + 公开 benchmark |
| 工程价值 |
K8s 原生 disaggregated inference 的标准路径;多租户 GPU 集群推荐关注 |
| 后续行动 |
精读 llm-d v0.7 文档和 KAI Scheduler |
| 标签 |
#llm-d #CNCF-Sandbox #Disaggregated-Inference #K8s #B200 |
12. KServe + Crusoe LLM 部署案例
| 字段 |
内容 |
| 来源 |
https://www.crusoe.ai/resources/blog/serving-llms-on-crusoe-with-kserve |
| 类型 |
部署案例 + 基准 |
| 核心数据 |
Qwen2.5-72B @ 8× H100 SXM 80GB(TP=8):单 GPU 无法容纳(需 144GB VRAM);Crusoe Terraform/Helm 一键部署;benchmark 覆盖 4 种负载配置 |
| 可信度 |
高——实际部署 + 开源 repo |
| 工程价值 |
KServe CRD 简化多 GPU LLM 部署;Qwen2.5-72B 是 2026 年开源 70B 级别的重要选项 |
| 后续行动 |
纳入多 GPU 部署操作手册 |
| 标签 |
#KServe #多GPU部署 #Qwen2.5 #Crusoe #Tensor-Parallelism |
🔬 CSDN / 中文技术社区
⚠️ 本轮 CSDN 条目说明
本轮检索未发现新的独立 CSDN 高价值文章(最新 CSDN 内容已在上午 0820 条目中覆盖)。下午时段 CSDN 来源以 Substack 英文技术简报为主。
🔁 Reproduction / 复现与验证
✅ 保留
13. llm-d v0.5 Benchmark 可复现工作流
| 字段 |
内容 |
| 来源 |
https://github.com/llm-d/llm-d |
| 类型 |
可复现 benchmark |
| 核心数据 |
v0.5 (March 2026):DeepSeek V3.1 @ H200 延迟降低 40%;Intel XPU + Google TPU disaggregation 支持;prefix cache offload 预览;16×16 B200 拓扑下单批 50k output tok/s |
| 可信度 |
高——GitHub repo + 公开 CI |
| 可复现性 |
benchmark 工作流已在 repo 中标准化,可直接复现 |
| 后续行动 |
在 H200/B200 节点复现 llm-d disaggregated benchmark |
| 标签 |
#llm-d #可复现 #Benchmark #Disaggregated #H200 #B200 |
14. pgvectorscale vs Pinecone 性能对比(可复现)
| 字段 |
内容 |
| 来源 |
Timescale pgvectorscale GitHub + 第三方独立验证 |
| 类型 |
性能对比(可复现) |
| 核心数据 |
50M 1536维向量:pgvectorscale 471 QPS vs Qdrant 41.47 QPS vs Pinecone 估算值;p95 延迟差异 28× |
| 可信度 |
中——部分数据依赖官方,未全部独立验证 |
| 可复现性 |
Timescale 提供开源 pgvectorscale;可自行部署对比 |
| 后续行动 |
在同硬件上复现 pgvectorscale vs Qdrant 对比测试 |
| 标签 |
#pgvectorscale #可复现 #向量库Benchmark |
📋 本次主题:高价值技术简报 · Agent 推理向量库 2026
核心发现摘要
- 推理引擎格局已分化:2026 年不再有唯一最优解。vLLM 仍是新模型覆盖最快的默认选择;SGLang 在多轮 agent/结构化输出场景有结构性优势;TensorRT-LLM 在高并发下提供最高吞吐量。
- 向量库选型决策树成熟:<10M 向量默认 pgvector(零新 infra);pgvectorscale 在 2026 年已缩小与专用向量 DB 的性能差距;Qdrant Series B 融资验证了市场分化。
- K8s LLM 部署标准正在形成:Gateway API Inference Extension GA (Feb 2026)、llm-d CNCF Sandbox、GPU Operator v25.10.1,三者共同构成 K8s LLM 部署的事实标准层。
- Agent Stack 2026 已标准化:MCP 成为工具连接事实标准;Memory 从"向量存储附件"升级为"第一等架构原语";OWASP MCP Top 10 提供首个安全检查清单。
建议写入路径
/shared/research-kb/inbox/jay/2026-08-06-1507-jay-five-category-briefing.md(本文件)
后续行动
- [ ] 精读 llm-d v0.7 文档,评估 KAI Scheduler 在本实例的适用性
- [ ] 精读 Azure SRE Agent 的 context engineering 方案(Intent Met 45%→75%)
- [ ] 精读 fail-plausible 防御机制(Seam 设计原则)
- [ ] 在同硬件上复现 pgvectorscale vs Qdrant 向量库对比测试
- [ ] 更新推理引擎选型决策框架
本简报由 Jay 实例生成 · 2026-08-06 15:07 CST
分类标签:#Agent-RAG #推理引擎 #向量库 #K8s-LLM #AI-Agent-Stack-2026
去重依据:已对比 /shared/research-kb/inbox/jay/ 目录下 2026-08-06 现有文件,无重复条目