下午简报 · 2026-06-28
Jay · 研究知识库 · 高频研究任务
📌 本次主题
推理引擎生态更新 · Vector DB 2026 选型格局 · K8s AI 生产现状 · Substack 高价值专栏
🔬 检索范围
- tavily: vLLM/SGLang 推理引擎 2026 benchmark、Vector DB 生产对比(Milvus/Qdrant/pgvector)、K8s AI inference 2026、Substack AI research weekly、GitHub Trending AI/LLM inference
- Substack 规则:优先 AI research / LLM systems / agent / MLOps / engineering notes,摘要后附原文链接/发布时间/核心观点/可信度
🗄️ database · 向量数据库 2026 选型格局
⭐ 高价值 ⭐ Vector DB 生产选型决策框架(2026)
来源: 多源对比综合(Kunal Gangalni blog、Kalvium Labs、Layerbase、DigitalApplied、Ranksquire) 可信度: ★★★★☆(多源交叉验证,2026年5-6月最新数据)
核心结论(按规模分层):
| 场景 | 推荐方案 | 理由 |
|---|---|---|
| 中小规模(< 100万向量)+ 已有 PG | pgvector | 内置集成,无单独服务,百万级无需特调 |
| 中等规模(100万~千万级) | Qdrant | Rust 实现,850 QPS @ p95~8ms,过滤搜索强 |
| 大规模(亿级以上)+ 低延迟 | Milvus / Vespa | K8s 原生分布式,Milvus 3.0 zero-copy 数据湖查询 |
| 完全托管 / 企业级 | Pinecone | sub-20ms p95,但成本是 PG 的 3-8x |
| 向量 + 文档统一查询 | Weaviate(混合+GraphQL)或 MongoDB Atlas Vector Search | 已用 MongoDB 时优先 |
| 开发测试 / 轻量 | Chroma | DX 最佳,不适合生产 |
选型第一条原则:先看现有数据平台。 Postgres 团队直接上 pgvector;单独运行 Vector DB 的成本在百万级向量以前几乎不值。
Qdrant v1.18(2026年5月): TurboQuant 量化 + dynamic named vectors + io_uring 优化 Milvus v3.0.0-beta(2026年5月): zero-copy 数据湖查询,v2.6.16 GA 稳定 Pinecone(2026年5月): Builder tier $20/月 GA,Nexus knowledge engine 预览,Singapore + Frankfurt 区域 GA
⚠️ 安全告警:pgvector 0.8.2 — CVE-2026-3172 跨 relation 数据泄露风险,PostgreSQL 生产环境需在 7 天内升级。 来源:RankSquire Vector DB News May 2026 可信度: ★★★★★(CVE 编号明确,来源可查)
⚙️ backend · 推理引擎三分天下(vLLM / SGLang / TRT-LLM)
⭐ 高价值 ⭐ 推理引擎深度对比 2026(H100 基准)
来源: Particula Tech Blog、Spheron Network、InferenceEngineering.Tech(2026年) 可信度: ★★★★☆(多方基准交叉)
核心技术差异:
| 维度 | vLLM | SGLang | TRT-LLM |
|---|---|---|---|
| 核心机制 | PagedAttention + Python-first | RadixAttention + 结构化生成运行时 | 编译引擎路径 |
| H100 吞吐 | 12,500 tokens/sec | 16,200 tokens/sec(+29%) | 最高原始吞吐 |
| 前缀缓存 / RAG | 中等 | 6.4x(prefix-heavy 工作负载) | 不适用 |
| MoE 调度 | 一般 | RadixAttention 多 call 调度优 | 中等 |
| DeepSeek 模型 | 支持 | 官方推荐,EAGLE 投机解码 1.8x | 支持 |
| Blackwell | MRV2 + DSA kernel 3-5x | NSA + TRT-LLM decode backend | 原生 |
| 部署复杂度 | 低 | 中 | 高(需编译) |
| 适用场景 | 动态批处理、多样请求 | 长输出、多轮对话、RAG | NVIDIA 硬件最高吞吐 |
SGLang vs vLLM 结论(2026年6月): - 部署 DeepSeek 全系 → SGLang(官方推荐) - 前缀重复多的 RAG / Agent 多轮 → SGLang(29% 优势) - 单轮 unique prompt 大批量 → vLLM 可与之匹敌 - 追求最高原始吞吐 + 可接受工程复杂度 → TRT-LLM
vLLM MRV2(Model Runner V2): GB200 上比旧版 runner 提升 56% 吞吐;H100 表现待官方更新
SGLang Native Sparse Attention(NSA)+ TRT-LLM decode backend: DeepSeek V3.2 在 Blackwell 上通过 --nsa-prefill-backend trtllm --nsa-decode-backend trtllm 实现 3x-5x 加速
SGLang 新模型支持(2026年6月): Qwen3.5、Kimi-K2.5、GLM-5、MiniMax 2.5
LLM Inference Engines 对比(AMultiple,2026年4月): Llama 3.1 8B batch inference H100,C++ 原生架构(SGLang / LMDeploy)比 vLLM(FlashInfer 优化)额外释放 29% 吞吐
GitHub Octoverse 2025 数据点: vLLM 是 GitHub 第 1 大 AI 开源项目(按活跃度)
☸️ cloud-native · Kubernetes AI 基础设施 2026
⭐ 高价值 ⭐ Kubernetes AI Infrastructure 2026:GPU 调度与生产现实
来源: CloudOptimo Blog(2026年) 可信度: ★★★★☆
核心数据(2026年1月): - 82% 容器用户在生产环境运行 K8s(CNBC 2026) - 66% 的生成式 AI 推理工作负载跑在 K8s 上,K8s 是事实上的 AI 推理 OS
AI Kubernetes 生态关键组件: - GPU 调度: node taints + node selectors + GKE ProvisioningRequest 动态扩缩 - 分布式训练: KubeRay(Ray on K8s)做协调 - 模型推理: KServe 是生产推理默认选择,抽象 serving runtime 配置,提供 CRD 语义 - 多租户: DRA-based resource allocation + accelerator clusters 共享 - 推理特定问题: KV-cache aware routing、模型分片、GPU 显存管理
⭐ 高价值 ⭐ K8s 运行 AI Agent:2026 现场手册
来源: KodeKloud Blog(2026年6月) 可信度: ★★★★☆
核心挑战: 自主 AI Agent 调用工具、浏览网页、依据用户指令行动——这是 K8s 原始威胁模型从未预料的场景,存在新安全缺口。
📮 substack · 高价值专栏更新
① State of AI: May 2026 — Nathan Benaich
链接: https://nathanbenaich.substack.com/p/state-of-ai-may-2026 可信度: ★★★★☆ 发布时间: 2026年6月
核心观点摘要: - 中国四大实验室 12 天内连续发布开源代码模型: GLM-5.1(Z.ai)、MiniMax M2.7、 Kimi K2.6(Moonshot)、DeepSeek V4,全部在 agentic engineering 能力上达到相近水平,推理成本显著低于西方前沿模型 - AI 编码公司估值飙升: Cognition 洽商 $25B(较 2025年9月 $10.2B 翻倍);Cursor 洽商 $2B+ @ $50B+(企业收入冲向 $6B ARR) - 主权 AI 并购: Cohere($6.8B估值)+ 德国 Aleph Alpha 合并,定位"AI 中等国家"替代方案(加德政府批准)
评价: Nathan Benaich 是欧洲 AI 投资领域老牌 newsletter,信息密度高,行业趋势判断可信。
② LLMs Research — 每周论文精选
链接: https://llmsresearch.substack.com 可信度: ★★★★☆ 来源特征: 专注 LLM 论文速递,附开源实现
近期亮点(2026年6月): - GLM 从 Fill-in-the-Blank(2021)到 744B MoE(2026):架构演进完整复盘,Zhipu AI $19B IPO on 华为昇腾芯片 - "你的 700亿参数模型可能有 40% 是浪费的":三篇论文同时指向一个十年旧怀疑(2026年2月) - 推理三路调试:training / memory / inference 三个方向同时修复 reasoning
③ AI Evaluation Digest — 2026 June
链接: https://aievaluation.substack.com/p/2026-june-ai-evaluation-digest 可信度: ★★★★☆ 发布时间: 2026年6月
核心观点: - SuperARC 基准发现:前沿 LLM 在算法信息论测试上没有变好——可能因为现代 RL for CoT 模型使 compression 变差 - OpenAI 发现:对话轨迹可以替代模拟环境做 agent 测试;WildChat 等噪声数据是完整部署模拟的成本节约替代方案
④ Simon Willison — LLM predictions for 2026(Substack + Oxide and Friends)
链接: https://simonw.substack.com/p/llm-predictions-for-2026-shared-with 可信度: ★★★★★ 时间戳: 2026年1月(回顾性质)
核心预测(已部分验证): - 1年内:LLM 写代码能力将无可否认 - 3年内:编码 Agent Jevons 悖论将解决(之一) - 6年内:手工写代码将走上打卡纸的老路
🔬 reproduction · arXiv KV Cache 优化方向(2026)
⭐ 高价值 ⭐ Predictive Multi-Tier Memory Management for KV Cache(arXiv 2604.26968)
可信度: ★★★★★ 来源: arXiv:2604.26968v1
核心贡献: 现有 KV cache 系统三大失效: 1. 缺乏对 MLA 等特殊注意力架构的统一内存 sizing(导致 57x 内存过度配置) 2. KV cache 困于单一内存层(GPU HBM),未利用 CPU DRAM / CXL / NVMe / RDMA / 并行文件系统层级 3. 被动 evict 策略丢弃可复用状态,强制重计算
关键数字: - 架构感知 sizing engine → batch size 提升 7.4x - TTFT 降低 1.4–2.1x(分析推算) - 吞吐提升 1.7–2.9x - 成本降低 47%(相比 SOTA 基线)
⭐ 高价值 ⭐ MLRA: Multi-Head Low-Rank Attention(arXiv 2603.02188)
可信度: ★★★★★ 来源: arXiv:2603.02188v1
核心贡献: 可分区 latent state,支持高效 4-way TP 解码。MLA 将 KV cache 压缩为 latent head(约 4.5×dh),MLRA 在此基础上将 latent state 设计为可分区,使 4 路 TP 解码成为可能,而非 MLA 的单一 MQA-absorb 路径。
⭐ 高价值 ⭐ GQLA: Group-Query Latent Attention(arXiv 2605.15250)
可信度: ★★★★★ 来源: arXiv:2605.15250v1/v2
核心贡献: MLA 的 joint low-rank latent 产生最小 KV cache,但锁死为单一 MQA-absorb 解码路径。GQLA 保留 latent 压缩,同时支持硬件自适应的分组查询——解决 MLA 的架构锁定问题。
LRKV: Low-Rank Key Value Attention(arXiv 2601.11471v3)
可信度: ★★★★☆ 来源: arXiv:2601.11471v3
核心数字: 在 128M~6.3B 模型上,LRKV 一致性以更低 test loss 超越标准 MHA、MQA/GQA、MLA,同时只使用 MHA 的 45-53% KV cache。核心思路:跨 attention head 利用冗余 + 低秩 head-specific residual。
MHA2MLA-VLM(arXiv 2601.11464v1)
可信度: ★★★★☆ 来源: arXiv:2601.11464v1
核心贡献: 将现有多模态 VLM 转换为 MLA 架构。两项核心技术: 1. Modality-adaptive partial-RoPE:选择性屏蔽非必要维度,适配传统和多模态场景 2. Modality-decoupled 低秩近似:视觉和文本 KV 空间独立压缩
效果:MHA2MLA-VLM 恢复原模型性能,显著降低 KV cache 占用,无缝集成 KV 量化。
CCGQA: Compressed Convolutional Grouped Query Attention(arXiv 2510.04476v2)
可信度: ★★★★☆ 来源: arXiv:2510.04476v2
核心贡献: GQA 和 MLA 压缩 cache 但不减少 compute(prefill 和训练速度不变)。CCGQA 将 down-projection 后的 queries、keys、values 在共享 latent space 内完成全部 attention 操作,实现 compute 和 memory 的联合压缩。在 MoE 模型上以 GQA/MLA 一半的 KV cache 超越两者;8x KV cache 压缩无性能下降。
🏷️ 分类标签
database vector-db pgvector qdrant milvus backend llm-inference vllm sglang tensorrt-llm cloud-native kubernetes k8s-ai arxiv kv-cache mla lrkv substack state-of-ai reproduction
📁 建议写入路径
/shared/research-kb/inbox/jay/2026-06-28-afternoon-briefing-inference-vectordb-k8s-substack.md✅ 本文件/shared/research-kb/inbox/jay/2026-06-28-database-kv-cache-arxiv.md✅ 续写至下方独立文件
✅ 精读 / 审稿 / 主题页 建议
| 编号 | 条目 | 行动建议 |
|---|---|---|
| 1 | pgvector CVE-2026-3172 | ⚠️ 紧急:7天内升级生产 PG 实例 |
| 2 | Predictive Multi-Tier KV Cache(2604.26968) | 精读:7.4x batch size 数字对生产影响大 |
| 3 | MLRA(2603.02188) | 审稿:4-way TP 解码路径对分布式推理意义 |
| 4 | GQLA vs MLA | 精读:硬件自适应是 2026 推理优化主轴 |
| 5 | State of AI May 2026(Nathan Benaich) | 审稿:中国开源模型集中爆发是重大事件 |
| 6 | K8s AI Agent 安全(KodeKloud) | 主题页更新:AI Agent 安全威胁模型 |
| 7 | SGLang NSA + TRT-LLM Blackwell | 精读:DeepSeek V3.2 推理配置参考 |
| 8 | CCGQA | 审稿:8x KV cache 压缩无性能下降 claim 需核验 |