Jay · 五分类简报 · 2026-08-25 上午

实例:Jay | 时间:2026-08-25 11:05 (Asia/Shanghai) | 本次搜索覆盖:Tavily · Web Search · GitHub Topics


本次主题

检索范围:LLM 推理引擎 · Vector DB · K8s 云原生 · Agent 协议 · RAG 评测 · KV Cache 优化 · Substack 工程洞察


📦 一、Database(向量数据库 & 关系数据库)

★ 高价值条目

1. Vector DB 选型决策树(2026Q3 更新)

  • 链接
  • https://www.kunalganglani.com/blog/milvus-vs-qdrant
  • https://medium.com/@pratik-rupareliya/top-15-vector-databases-in-2026-a-production-decision-guide-from-100-enterprise-deployments-dd58a04f51a5
  • https://www.braintrust.dev/articles/best-vector-databases-for-rag-2026
  • 摘要:2026 向量数据库市场决策框架:
  • Qdrant:50M 向量以下首选;Rust 实现;filtered search 性能最优;单进程部署;中小团队默认选项
  • Milvus: billion-scale(1 亿+)首选;K8s 原生分布式;多租户隔离;企业级
  • pgvector:50-100M 向量生产可用;Postgres 生态;30+ 企业客户验证;迁移成本低
  • Pinecone:零运维托管;快速上线;不适用于断网/主权环境
  • Chroma:原型/MVP <10M 向量首选;Python 原生;部署零摩擦
  • Weaviate:混合搜索 + 多租户隔离;schema 灵活
  • 评价:⭐⭐⭐⭐⭐ 工程必读。50M 向量是 pgvector→Qdrant 的分水岭;超过 100M 才考虑 Milvus。选型错误是生产中代价最高的技术债之一。
  • 标签向量数据库 RAG Qdrant Milvus pgvector 选型
  • 操作建议:可直接作为团队内部选型文档基准;补充 Benchmark 数据(ann-benchmarks / vectordb-bench)

2. pgbot · Postgres AI DBA 工具(更新追踪)

  • 链接:https://github.com/pgrundev/pgbot | https://pgbot.dev
  • 摘要:Go 编写;为 AI Agent 提供只读 Postgres 健康检查接口(连接数、缓存命中率、锁争用、索引未使用率、回滚率、复制延迟、checkpoint);支持 Supabase/Neon/AWS RDS/本地/Docker/K8s;Read-only 默认;可作为 MCP 数据库观测 Tool 的参考实现
  • 评价:⭐⭐⭐⭐⭐ AI 工程 + 数据库运维交叉价值极高;适合作为 AI Agent 数据库 Tool 的标杆实现
  • 标签AI工程 数据库 PostgreSQL MCP 运维
  • 操作建议:精读源码;研究扩展 MySQL/TiDB 的路径;参考其 MCP 集成方式设计通用 DB 观测 Tool

3. EnSI-RAG · 实体-结构索引 RAG(ACL 2026 相关论文线索)

  • 链接:https://papers.cool/arxiv/2608.21252
  • 摘要:长文档问答中证据跨越多个实体及其关系时,传统稀疏/密集检索均受限;EnSI-RAG 提出实体-结构索引方法;相关工作列入 Awesome-KV-Cache-Optimization (ACL 2026 Findings)
  • 评价:⭐⭐⭐⭐ RAG 工程进阶线索;适合对生产级 RAG 精度有要求时的精读论文
  • 标签RAG 检索 长文档 ACL2026 学术
  • 操作建议:根据 EnSI-RAG 作者团队追踪;对比 RAGCap-Bench 评测框架的覆盖范围

⚙️ 二、Backend(推理引擎 & LLM 服务端)

★ 高价值条目

1. SGLang vs vLLM 2026 决策矩阵(持续更新)

  • 链接
  • https://www.spheron.network/blog/llm-inference-optimization-2026
  • https://www.yottalabs.ai/post/vllm-vs-sglang-which-inference-engine-should-you-use-in-2026
  • https://atomic.chat/blog/llm-updates/sglang-vs-vllm
  • https://www.spheron.network/blog/vllm-vs-sglang-2026
  • 摘要
  • SGLang:RadixAttention(前缀复用 radix tree);前缀共享率 >60% 时 6.4x 优势;H100 上 ~16,200 tok/s vs vLLM ~12,500 tok/s(+29%);RAG 管道、多轮对话、结构化输出(constrained decoding)场景最优;DeepSeek V4 官方背书
  • vLLM:PagedAttention(内存碎片化);生态最广(模型/hardware 支持最多); Blackwell 原生优化;Eagle3 推测解码;适合 batch unique prompts
  • LMDeploy:H100 实测 99.5% SGLang 吞吐,pip 安装极简;H100 专用场景可替代 SGLang
  • 关键指标:前缀复用率是唯一核心数字;>60% → SGLang;<60% → 两者差异 <5%
  • 评价:⭐⭐⭐⭐⭐ 2026 生产选型必读。当前推理引擎格局基本稳定,SGLang 在 Agent/RAG 场景有结构性优势;vLLM 在生态广度上有护城河。
  • 标签推理引擎 SGLang vLLM PagedAttention RadixAttention Benchmark
  • 操作建议:生产团队可将"前缀复用率 >60%"作为 SGLang 迁移触发条件;参考 vLLM 官方 Blog(vllm.ai/blog)深度解剖 V1 架构

2. vLLM 官方 Blog · Inside vLLM: Anatomy of a High-Throughput System

  • 链接:https://vllm.ai/blog
  • 摘要:vLLM 41 分钟深度长文(Featured);覆盖 PagedAttention、Continuous Batching、Prefix Caching、Speculative Decoding、Multi-GPU Serving、Scheduling;附 TML Inkling(1T 参数多模态)Day-0 支持;GB200 380 tok/s/user;MORL-IO prefill/decode disaggregation(AMD MI300X 8-GPU);韩国 Meetup 2026 社区更新
  • 评价:⭐⭐⭐⭐⭐ vLLM 架构最权威一手文档;适合深度掌握 PagedAttention 和调度原理
  • 标签vLLM 推理系统 PagedAttention Benchmark 架构
  • 操作建议:精读;可拆解为团队内部分享材料

3. ai-dynamo/dynamo · Datacenter Scale 分布式推理框架

  • 链接:https://github.com/ai-dynamo/dynamo
  • 语言:Rust | ⭐ 7.8k(2026-08-21 更新)
  • 摘要:数据中心级分布式推理 Serving 框架;支持 vLLM/SGLang/TensorRT-LLM;Kubernetes 原生; disaggregated serving(prefill/decode 分离);Rust 实现
  • 评价:⭐⭐⭐⭐⭐ 对标 llm-d 的 Rust 版本分布式推理框架;值得关注其与 llm-d 的差异化定位
  • 标签分布式推理 Rust Kubernetes disaggregated serving
  • 操作建议:关注 Star 增长趋势;对比 llm-d 选型

☁️ 三、Cloud-Native(K8s · CNCF · 分布式推理)

★ 高价值条目

1. llm-d · CNCF Sandbox(2026-03-24 正式加入)

  • 链接
  • https://www.cncf.io/blog/2026/03/24/welcome-llm-d-to-the-cncf-evolving-kubernetes-into-sota-ai-infrastructure
  • https://llm-d.ai/blog/production-grade-llm-inference-at-scale-kserve-llm-d-vllm
  • https://developer.nvidia.com/blog/deploying-disaggregated-llm-inference-workloads-on-kubernetes
  • https://blogs.oracle.com/ai-and-datascience/llm-inference-at-scale-with-llm-d-on-oci
  • 摘要
  • llm-d:CNCF Sandbox(2026-03-24);Red Hat + IBM + Google + CoreWeave + NVIDIA 联合背书;Kubernetes-native;Prefill/Decode 分离;K8s Gateway API Inference Extension;CRD 标准化
  • NVIDIA 部署指南:K8s 上 disaggregated 推理完整步骤;Grove 部署指南;KAI Scheduler;Dynamo 编排层
  • Oracle OCI + llm-d:OKE 托管 K8s + 裸金属 GPU + RDMA 完整部署路径
  • KServe + llm-d + vLLM:生产级组合;解决 StatefulSet 运维瓶颈;Inference Gateway Extension
  • 评价:⭐⭐⭐⭐⭐ llm-d 已成为 K8s 原生分布式推理的事实标准;CNCF 背书意味着企业可用性已过临界点。KubeCon EU 2026(阿姆斯特丹)重点议题。
  • 标签CNCF llm-d Kubernetes disaggregated inference vLLM KServe
  • 操作建议:生产团队应开始评估 llm-d vs Dynamo 选型;关注 KubeCon EU 2026 会议记录

2. Cloud Native LLM Inference · K8s HPA 研究

  • 链接:https://arxiv.org/html/2507.18007v1
  • 摘要:将 LLM 拆解为细粒度微服务 + K8s HPA 动态调度;实验证明有效降低关键层延迟、提升吞吐和稳定性;Transformer 层级别弹性伸缩可行性验证
  • 评价:⭐⭐⭐ 学术验证 K8s HPA 对 LLM 推理的有效性;为 llm-d 等框架提供理论基础
  • 标签Kubernetes HPA LLM推理 云原生 学术
  • 操作建议:与 llm-d 实践对比;判断 HPA 方案 vs llm-d CRD 方案的取舍

💻 四、CSDN(高价值技术文章)

注:本次 Tavily/Web 搜索未直接命中 CSDN 高价值条目(2026-08-25 时段)。参考今日已收录条目(2026-08-25T0506、CSDN 0510-0600 时段已处理 vLLM OOM Debug 深入排障等)。

候选条目(需二次筛选)

1. SGLang vs vLLM 对比分析(中文工程视角)

  • 推测标题:SGLang vs vLLM 2026 完整对比:RadixAttention vs PagedAttention 决策指南
  • 来源平台:CSDN / 掘金(需验证)
  • 价值判断依据:当前搜索到的英文源(Spheron/YottaLabs/Atomic)均已提供完整 Benchmark 数据,中文复现价值中等;需寻找中文原创的源码分析、生产排障或本地化调优内容
  • 操作建议:CSDN 检索时增加"源码分析""OOM""生产环境"等关键词组合;重点关注有实际命令、版本、环境记录的文章

🔬 五、Reproduction(可复现工程 · 学术落地)

★ 高价值条目

1. Memory-Centric KV Cache Server · HotInfra 2026(2.4x 吞吐提升)

  • 链接:https://hotinfra.org/2026/papers/hotinfra26-final59.pdf
  • 摘要:用 CXL + PIM-DIMM(Processing-In-Memory DIMM)替代 HBM 作为 KV Cache 存储层;DeepSeek-R1-671B 32K token 生成分组测试:
  • CXL+PIM:679→1,607 tok/s(2.4x↑)
  • CapEx:$570,000 → $27,664(20.6x↓);OpEx:$59.23/hr → $3.53/hr(16.8x↓)
  • Aggregate Bandwidth:63.7 TB/s → 150.7 TB/s(2.4x↑)
  • 评价:⭐⭐⭐⭐⭐ KV Cache 存储层颠覆性研究方向;CXL + PIM 组合将 GPU 显存瓶颈转移到 PIM-DIMM 带宽;非常适合作为硬件感知推理工程的研究线索
  • 标签KV Cache CXL PIM 推理工程 HotInfra2026 硬件
  • 操作建议:追踪论文源码(GitHub: Mooncake → TraCT → 本论文的演进路径);评估对 llm-d disaggregated 架构的启示

2. Awesome-KV-Cache-Optimization · ACL 2026 Findings 配套

  • 链接:https://github.com/jjiantong/Awesome-KV-Cache-Optimization
  • 摘要:ACL 2026 Findings 论文配套资源库;收录 HotPrefix(热感 KV Cache 调度,前缀复用)、Async KV Cache Prefetch(L2 prefetch)、ACL 2026 Survey 等近期更新条目
  • 评价:⭐⭐⭐⭐ KV Cache 优化方向全景图;是复现/比较 KV Cache 策略的基准资源
  • 标签KV Cache ACL2026 优化策略 Benchmark
  • 操作建议:按"Hierarchy"和"Scheduling"分类复现对比

3. arXiv:2607.08057 · ACL 2026 Findings:KV Cache 优化全景综述

  • 链接:https://arxiv.org/abs/2607.08057
  • 摘要:Towards Efficient LLM Serving: A Survey on System-Aware KV Cache Optimization;ACL 2026 Findings(pp.38450-38476);覆盖 KV Cache 管理全栈:prefill/decode 分离、前缀缓存 admission/reuse、层级存储(CPU offloading)、热力调度
  • 评价:⭐⭐⭐⭐⭐ KV Cache 优化领域最系统的 2026 综述;适合作为团队内部培训材料
  • 标签KV Cache LLM Serving ACL2026 综述
  • 操作建议:精读;对比 Dell Technologies arXiv:2603.20397(KV Cache Optimization Strategies)

📋 分类标签总览

分类 核心标签
Database 向量数据库 Qdrant Milvus pgvector PostgreSQL MCP RAG选型
Backend 推理引擎 SGLang vLLM RadixAttention PagedAttention Benchmark 分布式推理
Cloud-Native CNCF llm-d Kubernetes disaggregated inference KServe K8s HPA
CSDN vLLM SGLang RAG OOM排障 生产部署(待二次筛选)
Reproduction KV Cache CXL PIM HotInfra2026 ACL2026 Benchmark 复现工程

✅ 操作建议汇总

优先级 行动 关联条目
🔴 精读 vLLM 官方 Blog(Inside vLLM 41min) Backend-2
🔴 精读 llm-d CNCF Blog + 生产部署指南 Cloud-Native-1
🟠 精读 ACL 2026 KV Cache Survey (arXiv:2607.08057) Reproduction-3
🟠 精读 HotInfra 2026 CXL+PIM KV Cache Paper Reproduction-1
🟡 关注 ai-dynamo/dynamo(Rust 分布式推理框架)Star 趋势 Backend-3
🟡 关注 pgbot 源码(DB Tool MCP 参考实现) Database-2
🟡 关注 Qdrant vs Milvus 选型(50M 向量分水岭) Database-1

建议写入路径/shared/research-kb/inbox/jay/2026-08-25T1105-jay-five-category-briefing.md

是否需要精读/审稿/主题页更新: - 精读:vLLM Blog + llm-d CNCF Blog + ACL 2026 KV Cache Survey - 审稿:Vector DB 选型决策树(Database-1)可直接作为团队内部文档审稿 - 主题页更新建议:Inference Engines 主题页补充 SGLang vs vLLM 2026 决策矩阵;llm-d 条目可并入 Cloud-Native AI Infrastructure 主题页