Jay · 知识库草稿 · 2026-09-25 上午
主题:LLM Inference Engine · Agentic RAG · KV Cache Optimization · Cloud-Native AI
database
1. Vector DB 选型指南 2026:Qdrant vs Milvus vs pgvector
来源: deploybase.ai / 多源基准综合
类型: 工程选型参考
可信度: 高(2026 Q1 标准化基准,数据来自 vectordb-bench + ann-benchmarks)
链接: https://deploybase.ai/articles/best-vector-database
发布时间: 2026 Q1(持续更新)
核心内容摘要: - Qdrant:p50 延迟 4ms(HNSW),50K QPS(100M向量),过滤性能最优,metadata filter 与 ANN 联合优化,支持多向量(ColBERT / SPLADE),Apache 2.0 - Milvus:吞吐量最高 100K QPS,支持 GPU 加速索引,水平扩展至 10 亿向量,需要 K8s + DevOps 团队,升级需了解 coordinator 顺序 - pgvector:≤50M 向量内足够用,优势在于与现有 Postgres 生态(Supabase Row-Level Security)无缝集成;超过 5M 行性能显著下降
评价: 选型原则——先构建再优化。不要今天为一个三年后才有的数据量去部署 Milvus 集群。Qdrant 适合大多数独立 AI 应用;Milvus 适合真正的分布式大规模场景。
后续行动: 建议补充各 DB 的生产级别配置参数(HNSW M/ef 参数调优指南)
2. Qdrant vs Milvus 2026 深度对比
来源: Kunal Ganglani Blog
类型: 选型深度分析
可信度: 高
链接: https://www.kunalganglani.com/blog/milvus-vs-qdrant
发布时间: 2026(最新)
核心内容摘要: - Qdrant = 大多数团队的更好默认选择:Rust 实现内存安全,操作简单,升级只需拉新镜像 - Milvus = 当需要数百亿到亿级向量、K8s 原生分布式架构,或已有 ML 平台生态时 - 两者均 Apache 2.0;但 Qdrant 由 VC 支持(Qdrant Solutions GmbH),存在许可变更风险参考模式 - 过滤查询是 Qdrant 的差异化优势,JSON filter 与向量搜索 co-optimized
评价: 实用主义选型框架,与 deploybase 的结论一致。
backend
3. KV Cache Optimization 2026 工程指南
来源: Digital Applied Blog
类型: 工程实践总结
可信度: 高(引用 vLLM 0.7 / SGLang / DeepSeek MLA paper)
链接: https://www.digitalapplied.com/blog/kv-cache-optimization-techniques-2026-engineering-guide
发布时间: 2026-04-24
核心内容摘要: 五大技术族: 1. PagedAttention(vLLM):GPU 内存碎片从 30-50% 降至 <4%,是 2026 生产部署必选 2. Prefix Caching / RadixAttention(SGLang):前缀命中时节省 85-95% 成本;agent loop / 多租户 SaaS 场景命中率 60-85% 3. MQA / GQA / MLA:DeepSeek MLA 是 2026 压缩率最高的方案,FP8 KV cache 比 FP16 基线节省 50% 4. KV Cache Quantization:INT8 / FP8 量化 5. 连续 Batching + Prefix-aware Scheduling:SGLang 调度器自动识别可复用 KV cache 的请求
关键数据: - 32K tokens 以上 KV memory 开始超过参数内存 - 128K tokens KV cache 占 GPU VRAM 主导 - 1M tokens:KV cache 占 70-90% GPU 显存,60-85% wall-clock
评价: 2026 年 Inference 成本控制的核心战场。MLA(Multi-head Latent Attention)是 DeepSeek V2/V3/V4 系列的关键创新,值得深入研究。
后续行动: 建议建立内部 KV cache 成本估算工具,结合 workload 特征(平均 context 长度、prefix 重用率)预估实际 GPU 利用率。
4. vLLM vs SGLang 2026 对比:PagedAttention vs RadixAttention
来源: SandBase Blog / Spheron Blog / Yotta Labs / theaiengineer.substack.com
类型: 系统对比 + Substack 高价值来源
可信度: 高(多源交叉验证)
链接:
- https://blog.sandbase.ai/vllm-vs-sglang-2026
- https://www.spheron.network/blog/vllm-vs-sglang-2026
- https://theaiengineer.substack.com/p/vllm-vs-ollama-vs-sglang-vs-tensorrt
发布时间: 2026
核心对比:
| 维度 | vLLM | SGLang |
|---|---|---|
| KV cache 策略 | PagedAttention(分页) | RadixAttention(前缀树) |
| 大批量吞吐量 | 更高 | 有竞争力 |
| 小批量 p95 延迟 | ~85ms | ~48ms |
| 前缀复用 | 块级 | 任意深度自动 |
| 结构化输出 | Grammar-guided | FSM-native(更快) |
| RL 训练后端 | 较少 | AReaL / verl / Slime 主战场 |
| 最佳场景 | 高吞吐批量推理 | 低延迟交互式 Agent |
SGLang 在以下场景明显优势: - 多用户查询同一文档(shared system prompt):SGLang 处理一次,vLLM 处理 N 次 - 多轮对话:turn 1-9 的 KV state 可复用 - Agentic RAG:JSON 输出 + prefix reuse 叠加
实践建议:
"Agentic RAG + 交互式 Chat API → SGLang;Bulk batch inference + 最大吞吐量 → vLLM;两者同时跑在同一个 gateway 后面按请求类型路由"(theaiengineer.substack.com)
评价: 这是 2026 年生产部署最常见的架构选择问题。上述对比有充足的基准数据支撑。
后续行动: 建议更新 inference engine 选型决策树,增加 RL training 场景作为 SGLang 的独立决策分支。
5. vLLM vs Ollama vs SGLang vs TensorRT-LLM 服务层完整对比
来源: theaiengineer.substack.com(AI Engineer 子栈,专注 AI Infra 工程实践)
类型: 工程对比 + Substack
可信度: 高
链接: https://theaiengineer.substack.com/p/vllm-vs-ollama-vs-sglang-vs-tensorrt
发布时间: 2026
关键洞察: - TensorRT-LLM:编译优化最激进,适合已确定模型和 batch size 的固定 workload;迁移灵活性最低 - Ollama:本地 / 开发环境首选,生产级吞吐不足 - 极端并发下 vLLM TTFT(Time To First Token)最差:100 并发时 worst-case 最长 - SGLang 的 RadixAttention 对 shared-context 模式有 29% 吞吐量优势(H100 实测:16,200 vs 12,500 tokens/sec)
评价: Substack 高质量来源,聚焦 AI Engineer 视角而非管理层视角,内容深度与工程相关性高。
cloud-native
6. Kubernetes 吸收了 AI 浪潮:Cloud Native Now
来源: Cloud Native Now
类型: 行业趋势报道
可信度: 中(行业媒体)
链接: https://cloudnativenow.com/tag/ai-inference/feed
发布时间: 2026-09-10
核心内容摘要: - 2026 年 Kubernetes 已成为 AI 部署的标准控制平面:统一调度 GPU Jobs(训练)和 Inference Services(推理) - GPU 资源管理:节点池 + 污点 / 容忍机制避免非 GPU Pod 占用加速器 - 多云 / 边缘部署:延迟敏感推理靠近用户,数据敏感负载留在特定地区,使用同一套 K8s 操作模型 - Platform Engineering 角色在 2026 年与 AI/ML 能力深度绑定
评价: 行业趋势确认,不是深度技术文章。
7. GPU 预算不再浪费:KEDA + 自定义 External Scaler 自动扩缩容 AI 推理
来源: Cloud Native Now / Pavan Madduri
类型: 工程实践(Oracle Kubernetes Engine 案例)
可信度: 高(开源代码 pmady/keda-gpu-scaler)
链接: https://cloudnativenow.com/contributed-content/stop-wasting-gpu-budget-autoscaling-ai-inference-on-kubernetes-with-keda
发布时间: 2026-09-17
核心内容摘要:
三层架构:
1. 遥测层:从物理硬件暴露 GPU SM utilization + memory allocation 指标(需要 DCGM 或类似工具)
2. 翻译层:KEDA External Scaler(pmady/keda-gpu-scaler)将 GPU 硬件指标转为 KEDA metrics server 格式
3. 执行层:KEDA Operator 触发推理 Pod 扩缩容,包括 minReplicaCount: 0(scale to zero,闲时消除云成本)
关键配置示例:(GPU 利用率 > 80% 时扩容)
# KEDA ScaledObject 配置伪代码
minReplicaCount: 0
maxReplicaCount: 10
triggers:
- type: external
metadata:
scalerAddress: keda-gpu-scaler:8080
utilizationThreshold: "80"
评价: Scale to zero 对非 Always-on 的推理服务(如 RAG API、内部工具)有显著成本价值。KEDA External Scaler 机制是扩展 K8s 调度能力的标准方式。
后续行动: 建议评估 OpenClaw 推理服务是否可用类似架构实现 GPU 成本优化。
8. 2026 Kubernetes Playbook:AI 规模化、自愈集群
来源: Fairwinds
类型: 最佳实践手册(企业级)
可信度: 高(Kubernetes 安全 / 治理头部公司)
链接: https://www.fairwinds.com/blog/2026-kubernetes-playbook-ai-self-healing-clusters-growth
发布时间: 2026
核心内容摘要: - AI 工作负载在 K8s 上最重的是 MLOps 平台:突发密集型 Jobs(训练)+ 持续运行 Services(推理)共存 - GitOps + Platform Engineering 是 2026 Kubernetes 成熟度的分水岭 - AI 辅助可观测性:AI 辅助告警根因分析,指标异常检测 - 建议用小规模试点验证 2026 实践,而非全面铺开
评价: 来自 RBAC / 安全 / 成本治理视角,适合作为 AI K8s 部署的 checklist 对照。
csdn
(本轮搜索未发现 CSDN 高价值条目。Agentic RAG / Inference Engine / KEDA 相关内容在 CSDN 上本次搜索结果重复度低,未发现源码分析、排障经验或环境命令类高价值文章。)
建议: 下轮可针对性搜索 "vLLM 部署 排障" / "SGLang 实际生产问题" / "KEDA GPU scaler 使用体验" 的 CSDN 内容。
reproduction
9. ISCA 2026 · KV Cache 相关论文族
来源: ACM Digital Library
类型: 学术论文
可信度: 高(顶级体系架构会议,2026-06)
链接: https://dl.acm.org/doi/10.1145/3695053.3731019 等
核心论文列表(2026 ISCA):
| 论文 | 机构/作者 | 核心贡献 |
|---|---|---|
| Oaken: Online-Offline Hybrid KV Cache Quantization | (待查) | 在线+离线混合 KV 量化 |
| IroKnight: Ownership-Preserving Neural Acceleration | (ISCA 2026) | 推理服务保留所有权的神经加速 |
| SingularBit: SVD + Low-Bit Quantization 联合压缩 | (ISCA 2026) | 权重与 KV 联合压缩 |
| Omni-LUT: LUT-based Accelerator + Hardware-Aware KV Quantization | (ISCA 2026) | LUT 加速器 + 硬件感知 KV 量化 |
| Cassandra: Edge 推理自推测解码 | (ISCA 2026) | Edge 场景自推测解码 |
| ConServe: Multi-Turn LLM Serving 连续性保留内存管理 | (ISCA 2026) | 多轮服务内存管理 |
| P³-LLM: NPU-PIM 混合精度边缘推理 | (ISCA 2026) | 混合数值格式边缘 LLM |
评价: ISCA 2026 显示 KV cache 优化已从系统软件层(vLLM PagedAttention)深入到硬件感知共同设计层(LUT 加速器、SVD 分解、3D 存储)。这些论文代表前沿但距生产落地有距离。
10. arXiv · RaBitQCache: Rotated Binary Quantization for KVCache
来源: arXiv:2606.31519
类型: 预印本
可信度: 中(预印本,待同行评审)
链接: https://arxiv.org/abs/2606.31519
发布时间: 2026-06-30
核心内容: 对 KV cache 施以旋转二进制量化(Rotated Binary Quantization),针对 Long Context LLM 推理的内存压缩。
评价: 二进制量化(1-bit)是 KV cache 量化的极限方向,但精度损失需要验证。本地实施前需对照现有 INT8/FP8 方案做精度基准测试。
11. arXiv · SemKV: Semantic Mixed-Precision KV Cache Quantization
来源: arXiv:2608.28911
类型: 预印本
可信度: 中(预印本,待同行评审)
链接: https://arxiv.org/abs/2608.28911
发布时间: 2026-08-28(约 1 个月前)
核心内容: 基于语义质量悬崖(Quality Cliff)引导的混合精度 KV cache 量化——对不同语义区域使用不同量化精度,兼顾压缩率与生成质量。
评价: 语义感知量化比统一精度量化更有潜力,但实现复杂度高,需评估在 vLLM/SGLang 中的集成成本。
12. arXiv · KV Cache Transform Coding(ICLR 2026 接收)
来源: arXiv:2511.01815
类型: 已接收论文
可信度: 高(ICLR 2026)
链接: https://arxiv.org/abs/2511.01815
领域: cs.CL / cs.AI / cs.LG
核心内容: 将 Transform Coding 应用于 KV cache 压缩存储,是 2025 年底的工作,已被 ICLR 2026 接收。
评价: 相比二进制量化,Transform Coding 更成熟,可作为 RaBitQCache 的对比基线。
GitHub Trending(2026-09 快照)
来源: we0.ai / GitHub Topics / OSS Insight
类型: 社区热度
可信度: 中
关键发现:
- browser-use(browser-use):114k stars,Playwright 驱动 AI Agent 操控浏览器
- claude-code(Anthropic):255k stars,Claude Code 主智能体
- antigravity(Remy Khan/ByteByteGo):coding agent harness,性能优化系统
- hermes-agent(NousResearch):244k stars,多提供商自托管 agent
- deepseek-harness(DeepSeek):218k stars,插件化 agent 运行时
- firecrawl(Firecrawl):179k stars,网页抓取 + 结构化为 LLM context
2026-09 新面孔:
- Ponytail:最小化 coding agent 技能系统
- Chrome DevTools MCP:MCP 协议连接浏览器调试工具
- SIE:OpenAI 兼容的 embedding / reranking / OCR 统一推理层
分类标签
#LLM-Inference #vLLM #SGLang #KV-Cache #RAG #Agentic-RAG #Vector-DB #Qdrant #Milvus #Kubernetes #KEDA #GPU-autoscaling #ISCA-2026 #arXiv #Cloud-Native #AI-Agents #MCP #GitHub-Trending
建议写入路径
- 主草稿路径:
/shared/research-kb/inbox/jay/2026-09-25-inference-agents-systems.md - 精读优先级: #4(vLLM vs SGLang 对比)、#3(KV Cache 工程指南)、#7(KEDA GPU autoscaling)
- 审稿优先级: #9(ISCA 2026 论文族概览)、#11(SemKV 混合精度量化)
- 主题页更新建议: Inference Engine 选型决策树(加入 RL training 分支)、RAG Architecture 页(加入 Agentic RAG 类型说明)
Jay · 2026-09-25 11:05 UTC+8 · 研究知识库草稿