下午简报 · 2026-06-28

Jay · 研究知识库 · 高频研究任务


📌 本次主题

推理引擎生态更新 · Vector DB 2026 选型格局 · K8s AI 生产现状 · Substack 高价值专栏


🔬 检索范围

  • tavily: vLLM/SGLang 推理引擎 2026 benchmark、Vector DB 生产对比(Milvus/Qdrant/pgvector)、K8s AI inference 2026、Substack AI research weekly、GitHub Trending AI/LLM inference
  • Substack 规则:优先 AI research / LLM systems / agent / MLOps / engineering notes,摘要后附原文链接/发布时间/核心观点/可信度

🗄️ database · 向量数据库 2026 选型格局

⭐ 高价值 ⭐ Vector DB 生产选型决策框架(2026)

来源: 多源对比综合(Kunal Gangalni blog、Kalvium Labs、Layerbase、DigitalApplied、Ranksquire) 可信度: ★★★★☆(多源交叉验证,2026年5-6月最新数据)

核心结论(按规模分层):

场景 推荐方案 理由
中小规模(< 100万向量)+ 已有 PG pgvector 内置集成,无单独服务,百万级无需特调
中等规模(100万~千万级) Qdrant Rust 实现,850 QPS @ p95~8ms,过滤搜索强
大规模(亿级以上)+ 低延迟 Milvus / Vespa K8s 原生分布式,Milvus 3.0 zero-copy 数据湖查询
完全托管 / 企业级 Pinecone sub-20ms p95,但成本是 PG 的 3-8x
向量 + 文档统一查询 Weaviate(混合+GraphQL)或 MongoDB Atlas Vector Search 已用 MongoDB 时优先
开发测试 / 轻量 Chroma DX 最佳,不适合生产

选型第一条原则:先看现有数据平台。 Postgres 团队直接上 pgvector;单独运行 Vector DB 的成本在百万级向量以前几乎不值。

Qdrant v1.18(2026年5月): TurboQuant 量化 + dynamic named vectors + io_uring 优化 Milvus v3.0.0-beta(2026年5月): zero-copy 数据湖查询,v2.6.16 GA 稳定 Pinecone(2026年5月): Builder tier $20/月 GA,Nexus knowledge engine 预览,Singapore + Frankfurt 区域 GA

⚠️ 安全告警:pgvector 0.8.2 — CVE-2026-3172 跨 relation 数据泄露风险,PostgreSQL 生产环境需在 7 天内升级。 来源:RankSquire Vector DB News May 2026 可信度: ★★★★★(CVE 编号明确,来源可查)


⚙️ backend · 推理引擎三分天下(vLLM / SGLang / TRT-LLM)

⭐ 高价值 ⭐ 推理引擎深度对比 2026(H100 基准)

来源: Particula Tech Blog、Spheron Network、InferenceEngineering.Tech(2026年) 可信度: ★★★★☆(多方基准交叉)

核心技术差异:

维度 vLLM SGLang TRT-LLM
核心机制 PagedAttention + Python-first RadixAttention + 结构化生成运行时 编译引擎路径
H100 吞吐 12,500 tokens/sec 16,200 tokens/sec(+29%) 最高原始吞吐
前缀缓存 / RAG 中等 6.4x(prefix-heavy 工作负载) 不适用
MoE 调度 一般 RadixAttention 多 call 调度优 中等
DeepSeek 模型 支持 官方推荐,EAGLE 投机解码 1.8x 支持
Blackwell MRV2 + DSA kernel 3-5x NSA + TRT-LLM decode backend 原生
部署复杂度 高(需编译)
适用场景 动态批处理、多样请求 长输出、多轮对话、RAG NVIDIA 硬件最高吞吐

SGLang vs vLLM 结论(2026年6月): - 部署 DeepSeek 全系 → SGLang(官方推荐) - 前缀重复多的 RAG / Agent 多轮 → SGLang(29% 优势) - 单轮 unique prompt 大批量 → vLLM 可与之匹敌 - 追求最高原始吞吐 + 可接受工程复杂度 → TRT-LLM

vLLM MRV2(Model Runner V2): GB200 上比旧版 runner 提升 56% 吞吐;H100 表现待官方更新

SGLang Native Sparse Attention(NSA)+ TRT-LLM decode backend: DeepSeek V3.2 在 Blackwell 上通过 --nsa-prefill-backend trtllm --nsa-decode-backend trtllm 实现 3x-5x 加速

SGLang 新模型支持(2026年6月): Qwen3.5、Kimi-K2.5、GLM-5、MiniMax 2.5

LLM Inference Engines 对比(AMultiple,2026年4月): Llama 3.1 8B batch inference H100,C++ 原生架构(SGLang / LMDeploy)比 vLLM(FlashInfer 优化)额外释放 29% 吞吐

GitHub Octoverse 2025 数据点: vLLM 是 GitHub 第 1 大 AI 开源项目(按活跃度)


☸️ cloud-native · Kubernetes AI 基础设施 2026

⭐ 高价值 ⭐ Kubernetes AI Infrastructure 2026:GPU 调度与生产现实

来源: CloudOptimo Blog(2026年) 可信度: ★★★★☆

核心数据(2026年1月): - 82% 容器用户在生产环境运行 K8s(CNBC 2026) - 66% 的生成式 AI 推理工作负载跑在 K8s 上,K8s 是事实上的 AI 推理 OS

AI Kubernetes 生态关键组件: - GPU 调度: node taints + node selectors + GKE ProvisioningRequest 动态扩缩 - 分布式训练: KubeRay(Ray on K8s)做协调 - 模型推理: KServe 是生产推理默认选择,抽象 serving runtime 配置,提供 CRD 语义 - 多租户: DRA-based resource allocation + accelerator clusters 共享 - 推理特定问题: KV-cache aware routing、模型分片、GPU 显存管理

⭐ 高价值 ⭐ K8s 运行 AI Agent:2026 现场手册

来源: KodeKloud Blog(2026年6月) 可信度: ★★★★☆

核心挑战: 自主 AI Agent 调用工具、浏览网页、依据用户指令行动——这是 K8s 原始威胁模型从未预料的场景,存在新安全缺口。


📮 substack · 高价值专栏更新

① State of AI: May 2026 — Nathan Benaich

链接: https://nathanbenaich.substack.com/p/state-of-ai-may-2026 可信度: ★★★★☆ 发布时间: 2026年6月

核心观点摘要: - 中国四大实验室 12 天内连续发布开源代码模型: GLM-5.1(Z.ai)、MiniMax M2.7、 Kimi K2.6(Moonshot)、DeepSeek V4,全部在 agentic engineering 能力上达到相近水平,推理成本显著低于西方前沿模型 - AI 编码公司估值飙升: Cognition 洽商 $25B(较 2025年9月 $10.2B 翻倍);Cursor 洽商 $2B+ @ $50B+(企业收入冲向 $6B ARR) - 主权 AI 并购: Cohere($6.8B估值)+ 德国 Aleph Alpha 合并,定位"AI 中等国家"替代方案(加德政府批准)

评价: Nathan Benaich 是欧洲 AI 投资领域老牌 newsletter,信息密度高,行业趋势判断可信。

② LLMs Research — 每周论文精选

链接: https://llmsresearch.substack.com 可信度: ★★★★☆ 来源特征: 专注 LLM 论文速递,附开源实现

近期亮点(2026年6月): - GLM 从 Fill-in-the-Blank(2021)到 744B MoE(2026):架构演进完整复盘,Zhipu AI $19B IPO on 华为昇腾芯片 - "你的 700亿参数模型可能有 40% 是浪费的":三篇论文同时指向一个十年旧怀疑(2026年2月) - 推理三路调试:training / memory / inference 三个方向同时修复 reasoning

③ AI Evaluation Digest — 2026 June

链接: https://aievaluation.substack.com/p/2026-june-ai-evaluation-digest 可信度: ★★★★☆ 发布时间: 2026年6月

核心观点: - SuperARC 基准发现:前沿 LLM 在算法信息论测试上没有变好——可能因为现代 RL for CoT 模型使 compression 变差 - OpenAI 发现:对话轨迹可以替代模拟环境做 agent 测试;WildChat 等噪声数据是完整部署模拟的成本节约替代方案

④ Simon Willison — LLM predictions for 2026(Substack + Oxide and Friends)

链接: https://simonw.substack.com/p/llm-predictions-for-2026-shared-with 可信度: ★★★★★ 时间戳: 2026年1月(回顾性质)

核心预测(已部分验证): - 1年内:LLM 写代码能力将无可否认 - 3年内:编码 Agent Jevons 悖论将解决(之一) - 6年内:手工写代码将走上打卡纸的老路


🔬 reproduction · arXiv KV Cache 优化方向(2026)

⭐ 高价值 ⭐ Predictive Multi-Tier Memory Management for KV Cache(arXiv 2604.26968)

可信度: ★★★★★ 来源: arXiv:2604.26968v1

核心贡献: 现有 KV cache 系统三大失效: 1. 缺乏对 MLA 等特殊注意力架构的统一内存 sizing(导致 57x 内存过度配置) 2. KV cache 困于单一内存层(GPU HBM),未利用 CPU DRAM / CXL / NVMe / RDMA / 并行文件系统层级 3. 被动 evict 策略丢弃可复用状态,强制重计算

关键数字: - 架构感知 sizing engine → batch size 提升 7.4x - TTFT 降低 1.4–2.1x(分析推算) - 吞吐提升 1.7–2.9x - 成本降低 47%(相比 SOTA 基线)

⭐ 高价值 ⭐ MLRA: Multi-Head Low-Rank Attention(arXiv 2603.02188)

可信度: ★★★★★ 来源: arXiv:2603.02188v1

核心贡献: 可分区 latent state,支持高效 4-way TP 解码。MLA 将 KV cache 压缩为 latent head(约 4.5×dh),MLRA 在此基础上将 latent state 设计为可分区,使 4 路 TP 解码成为可能,而非 MLA 的单一 MQA-absorb 路径。

⭐ 高价值 ⭐ GQLA: Group-Query Latent Attention(arXiv 2605.15250)

可信度: ★★★★★ 来源: arXiv:2605.15250v1/v2

核心贡献: MLA 的 joint low-rank latent 产生最小 KV cache,但锁死为单一 MQA-absorb 解码路径。GQLA 保留 latent 压缩,同时支持硬件自适应的分组查询——解决 MLA 的架构锁定问题。

LRKV: Low-Rank Key Value Attention(arXiv 2601.11471v3)

可信度: ★★★★☆ 来源: arXiv:2601.11471v3

核心数字: 在 128M~6.3B 模型上,LRKV 一致性以更低 test loss 超越标准 MHA、MQA/GQA、MLA,同时只使用 MHA 的 45-53% KV cache。核心思路:跨 attention head 利用冗余 + 低秩 head-specific residual。

MHA2MLA-VLM(arXiv 2601.11464v1)

可信度: ★★★★☆ 来源: arXiv:2601.11464v1

核心贡献: 将现有多模态 VLM 转换为 MLA 架构。两项核心技术: 1. Modality-adaptive partial-RoPE:选择性屏蔽非必要维度,适配传统和多模态场景 2. Modality-decoupled 低秩近似:视觉和文本 KV 空间独立压缩

效果:MHA2MLA-VLM 恢复原模型性能,显著降低 KV cache 占用,无缝集成 KV 量化。

CCGQA: Compressed Convolutional Grouped Query Attention(arXiv 2510.04476v2)

可信度: ★★★★☆ 来源: arXiv:2510.04476v2

核心贡献: GQA 和 MLA 压缩 cache 但不减少 compute(prefill 和训练速度不变)。CCGQA 将 down-projection 后的 queries、keys、values 在共享 latent space 内完成全部 attention 操作,实现 compute 和 memory 的联合压缩。在 MoE 模型上以 GQA/MLA 一半的 KV cache 超越两者;8x KV cache 压缩无性能下降。


🏷️ 分类标签

database vector-db pgvector qdrant milvus backend llm-inference vllm sglang tensorrt-llm cloud-native kubernetes k8s-ai arxiv kv-cache mla lrkv substack state-of-ai reproduction


📁 建议写入路径

  • /shared/research-kb/inbox/jay/2026-06-28-afternoon-briefing-inference-vectordb-k8s-substack.md ✅ 本文件
  • /shared/research-kb/inbox/jay/2026-06-28-database-kv-cache-arxiv.md ✅ 续写至下方独立文件

✅ 精读 / 审稿 / 主题页 建议

编号 条目 行动建议
1 pgvector CVE-2026-3172 ⚠️ 紧急:7天内升级生产 PG 实例
2 Predictive Multi-Tier KV Cache(2604.26968) 精读:7.4x batch size 数字对生产影响大
3 MLRA(2603.02188) 审稿:4-way TP 解码路径对分布式推理意义
4 GQLA vs MLA 精读:硬件自适应是 2026 推理优化主轴
5 State of AI May 2026(Nathan Benaich) 审稿:中国开源模型集中爆发是重大事件
6 K8s AI Agent 安全(KodeKloud) 主题页更新:AI Agent 安全威胁模型
7 SGLang NSA + TRT-LLM Blackwell 精读:DeepSeek V3.2 推理配置参考
8 CCGQA 审稿:8x KV cache 压缩无性能下降 claim 需核验