Jay 五类简报 · 2026-10-05
实例:Jay | 时间:2026-10-05 11:05 (Asia/Shanghai) 检索范围:arXiv · Tavily · Hugging Face · 技术博客 · Substack · CSDN 分类:database · backend · cloud-native · csdn · reproduction
📦 Database
Vector DB 2026 选型地图(综合 Instaclustr / Cloudian / Ranksquire / Redis.io)
| 场景 | 推荐 | 关键理由 |
|---|---|---|
| 单节点 <500 万向量 | Qdrant | 单二进制,sub-30ms,BM25+向量混合搜索 |
| 亿级 K8s 分布式 | Milvus | CNCF 项目,K8s 原生,GPU CAGRA 索引 |
| 自托管混合搜索 | Weaviate | BM25+dense 原生混合,物理多租户隔离 |
| 已有 PostgreSQL | pgvector | 零新增基础设施,SQL JOIN 向量+关系数据 |
| 快速原型 RAG | Chroma | pip 安装,零配置,LangChain 原生 |
| K8s 原生 ANN | Vald | NGT 算法,自动索引复制自愈,Ingress 过滤器 |
核心洞察: - 向量数据库已从"专业工具"演变为"统一平台"竞争(ZeroDB 提出向量+NoSQL 混合路径) - 2026 年新趋势:将 K8s 元数据同步进 Vector DB 实现语义搜索(DevOps & AI Toolkit,2026-02)
来源: - https://www.instaclustr.com/education/vector-database/best-open-source-vector-database-solutions-top-5-in-2026 - https://ranksquire.com/2026/02/27/best-self-hosted-vector-database-2026 - https://redis.io/blog/best-open-source-vector-databases-comparison - https://cloudian.com/guides/ai-infrastructure/vector-database-how-it-works-use-cases-top-6-in-2026
⚙️ Backend(推理引擎)
推理引擎三国杀(2026-09 最新数据)
vLLM v0.28.0(Aug 2026) - ~91,000 GitHub stars,PyTorch Foundation 托管(2025-05) - 重大修正:v0.11.0(2025-10)已移除旧 V0 引擎,V1 是唯一代码库 - Q3 2026 路线图:重写模型执行层,针对 top 模型架构 - 自动前缀缓存(APC), disaggregated prefill/decode/encode - AMD ROCm 生产级支持,v0.28.0 于 2026-08 下旬发布
SGLang v0.5.19(Sep 2026) - ~35,500 stars,PyTorch 生态(LMSYS→PyTorch 2025-03) - RadixAttention 最长前缀匹配 KV 缓存复用,prefix-heavy 场景比 vLLM 快 29% - H100 FP8:~16,200 tok/s vs vLLM ~12,500 tok/s(同负载) - 零开销批调度(v0.4+),CPU 调度开销从 15-25% 降至 <2% - 支持 prefix-heavy / 多轮对话 / 树搜索 / 自洽采样 - SGLang v0.5.8(Jan 2026)已支持
TensorRT-LLM v1.2.1(Apr 2026) - ~14,500 stars,NVIDIA 官方 - 深度 kernel 协同设计,B200/GB300 NVL72 基准测试最强 - 不支持 AMD ROCm,无 TPU 支持 - Context/generation 分离式 disaggregation
Herschel(arXiv 2609.40247)— 新观测框架 - 生产级 LLM 持续优化研究,聚焦 prefix caching 和 KV 共享 - 分析了 RTP-LLM 和 AgentX(SemiAnalysis,2026-08)的推理效率
Galahad(arXiv 2609.39358,Sep 2026)— KV 持久化内存 - 核心发现:98.7% 的 prompt token 是模型已读过的文本 - 将 KV cache 持久化到磁盘,实现跨请求复用(状态化推理) - 支持 vLLM、SGLang、llama.cpp,重启后 bit-identical 恢复(262,144 logits 匹配) - 论文评估了 30 个模型,fail-closed 设计
LLM Inference Field Guide(Sahil Creates,2026)— 生产视角 - 投机解码 2026 年真实评估:在实际 batch size 下系统性测试 - 结论:投机解码收益被高估,batch=1 特殊场景才有明显优势 - disaggregation 成本收益临界点:低于一定规模,跨池 KV 传输开销 > 专业化收益
来源: - https://arxiv.org/html/2609.40247v1 — Herschel - https://arxiv.org/html/2609.39358v1 — Galahad - https://arxiv.org/pdf/2609.26777 — SWE-Serve - https://www.sahilcreates.dev/blog/inference-deep-dive — LLM Field Guide 2026 - https://mlai.qa/blog/vllm-vs-sglang-vs-tensorrt-llm — 三引擎对比 - https://qdna.fr/en/blog/moteur-inference-llm-comparatif-2026 — SiliconBench 引用 - https://www.spheron.network/blog/vllm-vs-sglang-2026 — H100/H200 基准
☁️ Cloud-Native
分布式 LLM Serving 架构趋势
Disaggregation 现实检验 - "Beyond the Buzz: A Pragmatic Take on Inference Disaggregation"(MLSys 2026) - 低于临界规模时,KV 跨池传输成本 > 专业化收益 - Mooncake(USENIX FAST 2025):KVCache 中心化 disaggregated 架构 - Sangam(arXiv 2511.12286):Chiplet DRAM-PIM + CXL 集成
Inference Control Plane 新范式(arXiv 2609.23130,Sep 2026) - 标题:From Inference Engine to Inference Control Plane - 连接 vLLM、llm-d 和分布式 LLM serving 演进 - 涉及 llm-d(AWS disaggregated inference)、BLIS(llm-d 模拟速度演进)
Workload-Router-Pool Architecture(arXiv 2603.21354,Mar 2026) - vLLM Semantic Router Project 出品 - Token-budget-aware pool routing(Huamin Chen et al., 2026) - FleetOpt:压缩+路由的 fleet 容量规划 - inference-fleet-sim:基于排队论的 fleet 容量规划器
K8s + Vector DB 融合 - Vald:K8s 原生分布式 ANN,NGT 算法,自动索引备份和自愈 - Milvus:云原生分布式,存储计算分离,支持 Kubernetes - K8s 元数据 → Vector DB 语义搜索实验(YouTube DevOps & AI Toolkit,2026-02)
来源: - https://arxiv.org/html/2609.23130v1 — Inference Control Plane - https://hotinfra.org/2026/papers/hotinfra26-final59.pdf — Reimagining LLM Inference with Memory - https://www.youtube.com/watch?v=uUdbQkq5c4k — K8s in Vector DB
💻 CSDN(高价值筛选)
严格筛选标准:含版本/环境/命令/源码分析/复现/排障经验
本轮 CSDN 直接搜索结果:检索到的 CSDN 内容多为框架对比文章(vLLM vs SGLang),技术深度不及上述 arXiv/技术博客原始内容。关键建议:CSDN 在 inference engine 对比领域的高价值条目通常出现在具体部署场景的排障和源码分析中,而非概述性对比文章。
CSDN 有效场景: - vLLM OOM 问题排查(含具体 GPU 型号/批大小/序列长度参数) - SGLang RadixAttention 源码走读(含代码片段和调试输出) - 特定模型在特定推理引擎下的精度/性能实测(含 benchmark 命令) - 企业级部署架构(含 Kubernetes YAML 配置和 Helm values)
来源: - https://www.runpod.io/articles/comparison/vllm-vs-tensorrt-llm - https://www.premai.io/blog/vllm-vs-sglang-vs-lmdeploy-fastest-llm-inference-engine-in-2026
🔬 Reproduction(可复现性研究)
SWE-Serve(arXiv 2609.26777,Sep 2026)— 推理工程基准
- 来自:NVIDIA + LMSYS + UC Berkeley
- 核心:53 个生产级推理工程任务,来自 SGLang/vLLM/TensorRT-LLM/Triton 的真实 PR
- 任务族:model support、decoding、distributed execution、serving APIs
- 亮点:基于 2025-12 以来合并的 PR 构建,每个任务含容器化环境+隐藏测试+Oracle 解
Silent Hyperparameter(arXiv 2605.19537,May 2026)
- 来自:CISPA Helmholtz
- 核心:量化推理 backend 对 LLM 可复现性的影响
- 测试:llama.cpp、LMDeploy、Transformers 等多个 backend 运行相同模型的一致性
- 警示:不同 inference backend 引入的非显式超参数影响结果可复现性
SiliconBench(arXiv 2609.19169)— 并发扩展基准
- 数据:DGX Spark 上 CUDA vLLM 和 SGLang,concurrency 1→16 测量
- 结论:Flat TTFT,4.3x-7.7x 扩展(concurrency 1→16)
Galahad 重现细节
- 模型:Gemma 4 31B,在 llama.cpp(A6000)、vLLM 0.29(RTX 6000 Ada)、SGLang 0.5.20(L40S)三 runtime 上测试
- 验证:262,144 output logits 重启后 bit-identical 匹配
- 能效:约 100s 和 28kJ,13 个问题后能量回收
来源: - https://arxiv.org/pdf/2609.26777 — SWE-Serve - https://arxiv.org/html/2605.19537v1 — Silent Hyperparameter - https://arxiv.org/html/2609.39358v1 — Galahad - https://arxiv.org/html/2603.21354v2 — Workload-Router-Pool
🏷️ 分类标签
database vector-db qdrant milvus weaviate backend inference-engine vllm sglang tensorrt-llm llama.cpp kv-cache disaggregation cloud-native kubernetes k8s llm-d mooncake csdn reproduction arxiv benchmark swe-serve galahad herschel
📋 建议写入路径
/shared/research-kb/inbox/jay/2026-10-05-1105-jay-five-category-briefing.md
🎯 后续行动建议
| 优先级 | 行动 | 理由 |
|---|---|---|
| 🔴 高 | 精读 Galahad(arXiv 2609.39358) | KV 持久化是状态化推理的关键突破,影响 vLLM/SGLang 生产架构 |
| 🔴 高 | 跟踪 SWE-Serve | 首个生产级推理工程 benchmark,意义类似 SWE-bench |
| 🟡 中 | 审稿 Inference Control Plane(arXiv 2609.23130) | 系统性综述,适合作为知识库主题页底层 |
| 🟡 中 | 验证 vLLM v0.28 vs SGLang v0.5.19 基准差异 | 29% 吞吐差异在 prefix-heavy 场景真实,需实测确认 |
| 🟢 低 | 更新 Inference Engines 主题页 | 汇聚 vLLM/SGLang/TensorRT-LLM 最新版本和架构对比 |
本简报由 Jay 实例生成 · 2026-10-05 · 不含 API Key / Cookie / Token