研究草稿:下午简报 · Database · Backend · Cloud-Native · KV Cache · MCP

主题:数据库推理性能基准 · vLLM/SGLang 生产实测数据 · KubeCon 2026 AI 推理赛道 · KVTC ICLR 2026 · MCP 7月大修订 实例:Jay 日期:2026-10-01 15:06 UTC+8 检索范围:Tavily 搜索 · 近一月内容 · 含 Substack 路由规则


一、Database · 向量数据库 2026 生产基准

⭐⭐⭐ 条目 1 · Qdrant 生产性能实测数据

来源:Alpha Corp / Qdrant 官方 benchmark 可信度:高(多来源交叉印证)

核心数据:

规模 P50 延迟 P99 延迟 QPS 对比
1M 向量 · 1536维 ~4.2 ms ~12 ms — CORE Systems 2026 benchmark
1M 向量 · 1536维 ~2.1 ms ~6.3 ms ~1,200 Tiger Data 独立测试
50M 向量 · 90% recall 4.74 ms 5.79 ms — Qdrant 官方 1.17 版本

关键洞察: - Qdrant P99 延迟在 50M 规模下仍控制在 6ms 以内,尾部延迟控制极强 - 相比 Pinecone、Weaviate、pgvector 在同测试中均更快 - 1.2M QPS 对交互式 RAG(UX 预算严格场景)是强信号

pgvector 定位更新: - 50M 向量内 pgvector 够用,与现有 Postgres 基础设施集成 - 生产决策框架:p95/p99 延迟优先于平均延迟;benchmark 须含过滤条件 - Simon Frey 金句:"The best vector database is the one you already have"(2026 生态转向信号)

建议行动:入库 database/vector-db/2026-10-qdrant-p50-p99-benchmark.md


⭐⭐ 条目 2 · 向量数据库选择决策框架(PingCAP/TiDB)

来源:pingcap.com/compare/best-vector-database 可信度:中(行业博客,但框架有价值)

生产优先测量指标:

正确顺序:recall@k → p95/p99 延迟 → QPS → 成本/1k 查询

Benchmark 避坑指南: - ❌ 剔除 tiny dataset(缓存掩盖真实行为) - ❌ 剔除无过滤条件的测试(生产几乎总有元数据过滤) - ❌ 剔除只报平均延迟(尾部才是破坏 UX 的) - ✅ 用自己的 embeddings、自己的查询分布、自己的运营约束做基准

建议行动:入库 database/vector-db/2026-10-production-selection-framework.md


二、Backend · Inference Engine · vLLM vs SGLang 2026 实测

⭐⭐⭐⭐ 条目 3 · SGLang Mamba State Cache Bug(已在 14:52 草稿记录)

已在 2026-10-01-jay-engineering-filter-oct01.md 详细记录: - 根因:max_running_requests 被 Mamba state cache 强制 cap 到 12 - 修复后 throughput 提升 106%(3,833 → 7,883 tokens/s) - 所有 SGLang Mamba 模型用户需排查此配置


⭐⭐⭐ 条目 4 · SGLang 400K GPU 部署规模 · RadixAttention 选型指南

来源:Prem AI Blog + Towards AI (Chew Loong Nian) 可信度:高(第三方实测 + 工程分析)

SGLang 已部署规模:超过 400,000 GPU(xAI、AMD、NVIDIA、LinkedIn、Cursor、Oracle Cloud、GCP、Azure、AWS)

RadixAttention vs PagedAttention 选型决策树:

请求前缀共享率 > 60%?
├── 是 → SGLang (RadixAttention): +29% throughput
│         适用:长 system prompt 聊天、多轮对话、RAG 文档复用、agent 模板
└── 否 → vLLM (PagedAttention): 生态更广,模型支持更多
          两者在 unique-prompt 场景下差距 < 5%

Prefix-heavy 基准数据(H100 TP=2,Llama 3.1 8B): | 引擎 | Throughput | TTFT (1 req) | TTFT (100 req) | |------|-----------|--------------|----------------| | SGLang | ~16,200 tok/s | ~42 ms | ~710 ms | | vLLM | ~12,500 tok/s | ~45 ms | ~740 ms | | Delta | +29% | -3ms | -30ms |

SGLang 强场景(工程确认): - RAG 管道复用检索文档上下文(跨查询共享 KV) - 多轮 agent 循环(共享 system prompt + tool definitions) - 客服聊天机器人(长 system prompt + 短用户轮次) - 编码助手(few-shot 示例复用)

Unique-prompt 场景(H100 TP=2,Llama 3.3 70B FP8,50 并发): | 引擎 | Throughput | 差距 | |------|-----------|------| | SGLang | ~1,920 tok/s | +3.8% | | vLLM | ~1,850 tok/s | baseline |

工程教训:选引擎先测自己 workload 的前缀共享率,而不是直接照抄 benchmark。

建议行动:入库 backend/inference/2026-10-sglang-vllm-prefix-sharing-guide.md


三、Cloud-Native · KubeCon 2026 AI 推理赛道 + llm-d CNCF

⭐⭐⭐⭐ 条目 5 · KubeCon NA 2026 新增 AI Inference + Agentic Track

来源:CNCF 官方公告 时间:2026-08-07 发布 · 大会时间:2026-11-09–12 · 盐湖城 可信度:最高(官方公告)

核心信息: - AI Inference + Agentic 为 全新专题轨道,与平台工程、安全并行 - 聚焦:Kubernetes GPU 调度、模型 serving、可观测性、动态路由、agent 编排 - 涉及项目:vLLM、KServe、Ray、OpenTelemetry

Sessions 亮点: - "Integrating Envoy AI Gateway and Kyverno Authz for Realtime Governance of LLM and MCP Traffic"(Nov 10) - LLM + Kubernetes 集成、GPU scheduling 最佳实践

产业信号:K8s 正在从通用容器编排向 AI 原生基础设施进化,llm-d 是这个方向的 CNCF 代表。


⭐⭐⭐ 条目 6 · llm-d CNCF 项目关键指标(2026-08 更新)

来源:cncf.io/projects/llm-d 可信度:高(CNCF 官方数据)

指标 数值 同比增长
总贡献者 3,011 +63%
贡献组织 773 +34%
GitHub Stars 2,184 +26%
GitHub Forks 639 +350%
首次提交 2025-04-29 —

llm-d 定位: - vendor-neutral Kubernetes-native 分布式推理框架 - 模块化架构:将 vLLM 等引擎转化为生产级分布式云原生 serving - IBM 贡献,已捐赠 CNCF

关联新闻: - "Running a self-hosted LLM in Kubernetes with vLLm"(2026-07-16,CNCF Blog) - "Introducing Kthena: LLM inference for the cloud native era"(Volcano 生态)

建议行动:入库 cloudnative/llm-d-cncf-2026.md


⭐⭐ 条目 7 · Cilium 1.20 发布 + AI 训练分布式基础

来源:CNCF Blog 可信度:高(CNCF 官方)

Cilium 1.20(2026-09-14):云原生网络核心,支撑大规模 AI 训练集群网络。 AI Factory 定义:不是单个模型或集群,而是多团队共享 GPU 池——fine-tuning、serving inference、evaluations 同时运行。

建议行动:标记 cloudnative/cilium-1-20-release-notes.md


四、KV Cache 前沿研究 · ICLR 2026 新增

⭐⭐⭐⭐ 条目 8 · KVTC(KV Cache Transform Coding)· ICLR 2026 录用

来源:arXiv:2511.01815(Staniszewski & Łańcucki) 发布:ICLR 2026 录用 · v2 更新于 2026-03-11 可信度:高(顶会论文)

核心技术: - 将媒体压缩中的经典变换编码应用于 KV cache 压缩 - 支持跨对话轮次的共享前缀重用(conversational turns / code editing) - 可压缩 KV cache 用于紧凑的 on-GPU 和 off-GPU 存储

Benchmark 结果: - 相比推理时基线(token eviction、quantization、SVD-based)持续优于 - 在 LongBench、MATH-500、MMLU、LiveCodeBench、RULER 上一致胜出 - 高压缩比 + 高精度兼得

工程意义:KVTC 提供了 cache 可复用 + 可压缩的双重能力,适合多轮对话和代码编辑场景。

建议行动:精读 → research/kv-cache/2026-10-kvtc-iclr2026.md


⭐⭐⭐ 条目 9 · SAW-INT4:System-Aware 4-bit KV Cache Quantization

来源:arXiv(Aussie AI 汇总索引,2026-04-21) 可信度:中(预印本,需核验论文代码)

核心技术:System-Aware 4-bit KV Cache 量化方案 工程价值:4bit KV 量化将峰值内存降低 2.6×(Llama/Mistral/Falcon),batch size 可扩大 4 倍

建议行动:入库 research/kv-cache/2026-10-kv-quantization-roundup.md(与 KVTC、KVQuant、KIVI 合并记录)


⭐⭐⭐ 条目 10 · VeriCache:将 Hazy KV Cache 转化为无损推理

来源:arXiv:2605.17613v1 可信度:高(学术预印本)

核心贡献:有损 KV cache 压缩后,通过特定重建机制恢复精度 与其他方法的引用关系:引用了 KVTC(ICLR 2026)、KVZip、KVQuant、KIVI、PyramidInfer

建议行动:入库 research/kv-cache/2026-10-vericache-lossy-to-lossless.md


五、MCP 协议 · 7月大修订 · 生产部署数据

⭐⭐⭐⭐ 条目 11 · MCP 2026-07-28 重大修订:无状态协议

来源:MCP 官方博客 + Wikipedia 可信度:最高(协议维护者官方说明)

修订核心: - 移除协议层会话跟踪 → MCP 在协议层变为无状态 - 协议版本、客户端身份、能力信息移至每个请求的 _meta 参数 - 这是自加入 authorization 以来 MCP 最大幅度的规格变更

各方评价: - Anthropic David Soria Parra:"most substantial change since authorization" - Manufact(mcp-use 框架):SDK v2 包体积 缩小 83%,速度 提升 25%(client-server split) - AWS Bedrock AgentCore:支持无状态 MCP core,Tasks 扩展支持长时运行 agent

生产数据(截至 2026 年中): - 已部署 10,000+ MCP servers - 月 SDK 下载量:97M+ - Salesforce Headless 360:自 Launch 起处理 450 万次 MCP 调用

建议行动:更新 standards/mcp/2026-07-mcp-stateless-major-revision.md;标记为精读


六、本轮丢弃条目

条目 来源 丢弃理由
"Best Vector DB for RAG 2026: Top 7 Picks" alphacorp.ai 综述性比较,无独立实测数据
"SGLang vs vLLM in 2026: Which Wins?" kanerika.com 大量付费咨询 CTA 内容,技术深度不足
"LLM Inference Engines 2026" YouTube Uplatz 视频内容,文字摘要无工程命令/数据
"Cilium 1.20 for AI Training" CNCF Blog 引用博客(非官方 release notes),实际发布内容未核实
"MCP Tool Descriptions Are Smelly" arXiv 2602.14878 论文方向有趣,但 tool description smells 分类偏学术,暂无工程落地验证

分类标签

vector-db qdrant pgvector inference-engineering vllm sglang radixattention pagedattention kv-cache kvtc iclr2026 cloudnative kubernetes llm-d cncf kubecon mcp protocol


建议写入路径

文件 路径
Qdrant p50/p99 基准 database/vector-db/2026-10-qdrant-benchmark-production.md
SGLang RadixAttention 选型 backend/inference/2026-10-sglang-prefix-sharing-production-guide.md
llm-d CNCF 指标 cloudnative/llm-d-cncf-2026-metrics.md
KubeCon NA 2026 AI Track cloudnative/kubecon-na-2026-ai-inference-track.md
KVTC ICLR 2026 research/kv-cache/2026-10-kvtc-iclr2026.md
MCP 7月修订 standards/mcp/2026-07-mcp-major-revision-stateless.md

是否需要精读/审稿/主题页更新

  • 精读:KVTC 原论文(ICLR 2026);MCP 7月修订官方博客全文
  • 审稿:SAW-INT4 论文出处(arXiv ID 待确认)
  • 主题页更新:inference-engineering 补充 SGLang 选型决策树;mcp 补充 7月无状态修订条目

Jay · 2026-10-01 15:06 CST · Tavily 多源扫描