五类简报 · Jay · 2026-09-18 21:05 (UTC+8)
本次主题:傍晚五类简报 · 数据库 / 后端推理 / 云原生 / CSDN / 可复现工程 检索范围:arXiv · Tavily · HF Blog · Substack · NVIDIA Blog · Medium/TowardsDataScience
一、Database · Vector DB 生产选型决策(2026Q3 最新)
核心数据:pgvectorscale 性能突破
| 引擎 | QPS @99% recall | 50M 向量 p95 latency | vs Qdrant |
|---|---|---|---|
| pgvectorscale | 471 QPS | ~low ms | 11.4× better |
| Qdrant | ~41 QPS | 28× higher | baseline |
| Pinecone s1 | ~41 QPS | baseline | equivalent |
来源:firecrawl.dev (2026),引用 VectorDBBench 实测数据
2026 向量数据库决策树(更新版)
向量规模判断
├─ < 1M
│ ├─ 已有 PostgreSQL → pgvector(零成本,够用)
│ └─ 无 Postgres → Qdrant(单二进制,运维简单)
├─ 1M–50M
│ ├─ 需要复杂过滤+JOIN → pgvector (tuned) 或 Qdrant
│ └─ 纯高速检索 → Qdrant(payload index 集成,filter 优秀)
└─ 50M+ / 水平扩展需求 → Milvus(异构节点,ingest/query 隔离)
2026 各引擎更新亮点
| 引擎 | 2026 亮点 | 定位 |
|---|---|---|
| Qdrant | v1.17 (July 2026);~2.1ms p50 / ~6.3ms p99 @1.2K QPS | 通用首选 |
| Milvus | Reddit 340M 向量验证,replication scaling 强 | 亿级规模 |
| pgvector | pgvectorscale 追赶;ACID+SQL 完整 | Postgres 团队 |
| Chroma | 原型/POC | 小规模快速验证 |
| LanceDB | 多模态支持 | 嵌入式+多模态 |
| Weaviate | 原生 hybrid search | BM25+向量混合 |
生产陷阱(经验证)
- pgvector:HNSW 参数(
m,ef_construction)创建后不可改;超过 2000 维用 IVFFlat - Qdrant:collection 维度不可变;payload indexes 不会自动创建;需调
hnsw_config.m - Milvus:
compact()需手动调用回收存储;Lite 模式禁止生产使用
分类标签:VectorDB Qdrant Milvus pgvector production benchmark
建议写入路径:/shared/research-kb/inbox/jay/2026-09-18-vecdb-production-decision-tree-2026.md
二、Backend · LLM Inference Systems 傍晚新增条目
★ PolyKV:多 Agent 共享非对称压缩 KV Cache(arXiv 2604.24971)
| 字段 | 内容 |
|---|---|
| 标题 | PolyKV: A Shared Asymmetrically-Compressed KV Cache Pool for Multi-Agent LLM Inference |
| 链接 | https://arxiv.org/pdf/2604.24971 |
| 来源 | arXiv |
| 发布时间 | 2026-04(Indexed Zenodo DOI: 10.5281/zenodo.19686729) |
| 作者 | Ishan Patel, Ishan Joshi(独立研究者) |
核心工程贡献: - 问题:每个 concurrent inference agent 独立分配 KV cache → 内存浪费严重 - 方案:多 agent 共享单一非对称压缩 KV cache pool(写一次,N 个 agent 注入) - Token 节省:Reddit 实验证实跨 Qwen/Llama/DeepSeek 73-78% token 节省 - 相关工作:TurboAngle(arXiv 2603.27467,无损角度量化);LRAgent(KV sharing for Multi-LoRA)
保留理由:⭐⭐⭐⭐⭐ - 多 Agent 场景的 KV cache 共享是 2026 生产高频痛点 - 有实测 token 节省数字,可直接用于容量规划
★ An Internet for the KV Cache(arXiv 2608.01526)
| 字段 | 内容 |
|---|---|
| 标题 | An Internet for the KV Cache: Rethinking Classical Infrastructure |
| 链接 | https://arxiv.org/html/2608.01526v1 |
| 来源 | arXiv |
| 发布时间 | 2026-08(约) |
核心工程洞察: - LLM serving 成为全球主导负载,prefix caching 依赖请求间共享 prefix - 模型侧优化(KV cache 压缩)和系统侧优化(存储/传输成本)需协同设计 - KV Cache 作为 persistent, steerable contextual knowledge 载体,可在全局复用
保留理由:⭐⭐⭐⭐ - 概念框架完整,适合作为 KV cache infrastructure 研究参照 - 揭示了 inference 系统侧与模型侧协同优化的新方向
HYBRIDKV:多模态 LLM 推理的混合 KV Cache 压缩(ACL 2026)
| 字段 | 内容 |
|---|---|
| 标题 | HYBRIDKV: Hybrid KV Cache Compression for Efficient Multimodal Large Language Model Inference |
| 来源 | ACL 2026 Long Papers(pp.13018-13034) |
| 链接 | https://aclanthology.org/2026.acl-long.594.pdf |
| 作者 | 浙江大学+Boson AI 联合 |
核心贡献: - 针对多模态 LLM 的 KV cache 压缩 - 平衡有损/无损压缩,提升多模态推理内存效率
保留理由:⭐⭐⭐(ACL 2026 学术验证)
Online Scheduling for LLM Inference with KV Cache Constraints(MIT)
| 字段 | 内容 |
|---|---|
| 链接 | https://web.mit.edu/jaillet/www/general/2502.07115v5.pdf |
| 发布时间 | 2026-01 |
| 作者 | Patrick Jaillet et al.(MIT) |
核心贡献: - 学术优化理论框架:LLM inference 调度 + KV cache 约束联合优化 - 引用了 throughput-optimal scheduling algorithms for LLM inference and AI agents(arXiv 2025)
NVIDIA Grove:Kubernetes 原生解聚式 LLM 推理编排
| 字段 | 内容 |
|---|---|
| 标题 | NVIDIA Grove on GPU Cloud: Kubernetes-Native Orchestration for Disaggregated LLM Inference |
| 链接 | https://www.spheron.network/blog/nvidia-grove-kubernetes-disaggregated-inference-guide |
| 发布时间 | 2026-06-22 |
核心架构: - Dynamo:分布式推理编排层(运行在 vLLM 之上,K8s 外部) - Grove:K8s 原生 API,通过 CRD + K8s scheduler + NVIDIA DRA driver - Grove 声明 workload 规格,K8s control plane 强制执行;Dynamo 负责运行时 serving control plane - 互补关系:Grove 负责资源分配,Dynamo 负责推理调度
保留理由:⭐⭐⭐⭐(有架构图和生产部署路径)
llm-d 捐赠给 CNCF
| 字段 | 内容 |
|---|---|
| 标题 | Donating llm-d to the Cloud Native Computing Foundation |
| 链接 | https://research.ibm.com/blog/donating-llm-d-to-the-cloud-native-computing-foundation |
| 来源 | IBM Research Blog |
| 发布时间 | 2026 |
核心信息: - llm-d = vendor-neutral inference serving stack for Kubernetes-native deployment - 2025 启动,2026 捐赠 CNCF - 与 OpenCost 协作:测量 GPU 利用率 idle-GPU 检测,KV cache hit 归因
保留理由:⭐⭐⭐⭐(CNCF 治理 = 供应商中立长期可维护性保证)
OpenCost 1.121.0:K8s 推理成本追踪(首创)
| 字段 | 内容 |
|---|---|
| 标题 | OpenCost 1.121.0: First-of-a-kind Kubernetes inference cost tracking |
| 链接 | https://www.cncf.io/blog/2026/08/05/opencost-1-121-0-first-of-a-kind-kubernetes-inference-cost-tracking |
| 发布时间 | 2026-08-05 |
核心功能: - 追踪"warm but idle"GPU 浪费(模型权重占 VRAM 但无请求) - KV cache hit 归因(直接影响 input token 处理成本) - GPU capacity waste 估算 + idle-GPU detection for LLM-specific patterns
保留理由:⭐⭐⭐⭐(FinOps + LLM inference 交叉领域创新)
三、Cloud-Native · CNCF + K8s AI Inference 生态更新
CNCF 扩展 AI Inference Workloads on K8s(2026-08)
| 字段 | 内容 |
|---|---|
| 链接 | https://cloudnativenow.com/features/cncf-expands-efforts-to-run-ai-inference-workloads-on-kubernetes-clusters |
| 关键词 | AICR, KAR v1.35, KRO, llm-d, NVIDIA AI Cluster Runtime, Kubernetes AI Conformance Program |
生态清单: - KAI Scheduler(gang scheduling for LLM) - KRO(Kubernetes Resource Orchestrator) - Kueue job queueing - Kubernetes AI Requirements 规范 - vLLM extension(K8s 生态)
Cloud Native LLM Inference Serving(arXiv 2507.18007)
| 字段 | 内容 |
|---|---|
| 链接 | https://arxiv.org/html/2507.18007v1 |
| 实验环境 | K8s 3 节点 × A100-80GB + NVLink;LLaMA-2-13B;gRPC + Istio + Prometheus/Grafana |
关键数据: - 微服务化(每 Transformer layer 一个微服务)+ K8s HPA - 瓶颈缓解:critical layer 延迟降低 + 整体吞吐量和稳定性提升
保留理由:⭐⭐⭐⭐(有实测数据+生产部署架构参考)
NVIDIA Grove + Dynamo 解聚式推理(2026-06 Spheron)
架构分层:
[Application] → Dynamo(serving control plane)
↓
vLLM workers
↓
Grove(K8s resource allocation via CRD)
↓
NVIDIA DRA driver + KAI Scheduler
↓
[GPU nodes]
四、CSDN · Agentic RAG 2026 实施路径(CSDN/Medium/TDS 精选)
Agentic RAG 2026 五种生产模式(futureagi.com)
| 模式 | 描述 | 适用场景 |
|---|---|---|
| Query rewriting | Agent 重写用户 query 为检索友好形式 | 复杂/模糊查询 |
| Multi-hop retrieval | iterate retrieve-reason-retrieve 直到证据充分 | 需综合多处信息 |
| Tool routing | Agent 在向量搜索/BM25/网页搜索/SQL/重排器间选择 | 异构数据源 |
| Self-check on draft | faithfulness judge 审查草稿,gating 最终答案 | 高可靠要求 |
| Citation enforcement | Agent 被要求每个句子附带 chunk ID | 需要可溯源答案 |
生产系统通常组合使用 3-4 种,极少全用(成本/延迟权衡)
Hyperbolic Vector Search 出现在 2026 产品路线
| 发现 | 描述 |
|---|---|
| Hyperbolic space | 类似马鞍面/庞加莱圆盘,容量随距离指数增长,天然匹配树状数据结构 |
| 适用场景 | 层级知识图谱、分类目录;向量数据库(Qdrant/Milvus)开始支持 |
| 意义 | 对 RAG 中的知识层级结构(不是纯平面语义)有特殊优势 |
GraphRAG 幻觉减少 62%(May 2026 MLOps Community benchmark)
| 字段 | 内容 |
|---|---|
| 来源 | RAG About It(via aithinkerlab.com) |
| 数据 | 47 个生产部署,平均 hallucination 减少约 62% |
| 前提代价 | 延迟增加 + 编排复杂度上升 |
| 对比基准 | Microsoft Research Project GraphRAG |
RAGCap-Bench(arXiv 2510.13910v2)
| 字段 | 内容 |
|---|---|
| 标题 | RAGCap-Bench: Benchmarking Capabilities of LLMs in Agentic RAG Systems |
| 链接 | https://arxiv.org/html/2510.13910v2 |
| 评估任务 | Planning / Evidence Extraction / Grounded Reasoning / Noise Robustness |
| 格式 | MCQ(选择题)items,从 LLM 中间错误分类推导而来 |
Inference Cost Attacks on RAG(arXiv 2606.02643v1)
| 字段 | 内容 |
|---|---|
| 标题 | Inference Cost Attacks for Retrieval-Augmented Large Language Models |
| 链接 | https://arxiv.org/html/2606.02643v1 |
| 攻击方式 | CREEP framework:恶意文档诱导 RAG 系统 token 消费异常增长 |
| 策略 | 3 种资源耗尽策略 × 2 种 agent paradigm(rewrite-based + generation-based) |
| 影响 | 攻击者可在无需 API key 的情况下使目标 RAG 系统产生高额 token 费用 |
保留理由:⭐⭐⭐⭐⭐(RAG 安全新维度,生产需防御性设计)
五、Reproduction · 可复现工程条目
PolyKV + KV Cache Token 节省验证路径
# Reddit 实验:KV cache 跨 Agent 传递 vs text 传递
# 覆盖 Qwen / Llama / DeepSeek 三模型
# 实测 token 节省:73-78%
# PolyKV 多 Agent KV cache 共享架构
# 关键:asymmetric compression + shared pool
# 参考:arxiv.org/pdf/2604.24971
Cloud Native LLM Serving 复现路径
# 基础设施
kubectl apply -f [llm-microservice-yaml] # 每层独立 Deployment
istioctl install # gRPC + mTLS
kubectl autoscale deployment llm-layer-X --cpu-percent=80 --min=1 --max=10
# 监控
prometheus + grafana # 关键指标:GPU 利用率 / TTFT / 吞吐
# 实验结果:critical layer 延迟降低 + 吞吐量提升
# 参考:arxiv.org/html/2507.18007v1
pgvectorscale 安装路径
# Timescale pgvectorscale(需要 TimescaleDB 或 PostgreSQL 16+)
CREATE EXTENSION IF NOT EXISTS vectorscale;
# HNSW 参数注意:创建后不可修改
# m=16, ef_construction=64 是生产安全起点
六、高价值条目汇总
| 优先级 | 主题 | 来源 | 理由 |
|---|---|---|---|
| ⭐⭐⭐⭐⭐ | PolyKV 多 Agent KV cache 共享 | arXiv 2604.24971 | 73-78% token 节省,多 Agent 生产必读 |
| ⭐⭐⭐⭐⭐ | Inference Cost Attacks on RAG | arXiv 2606.02643v1 | 安全新维度,RAG 防御设计必需 |
| ⭐⭐⭐⭐⭐ | pgvectorscale 性能数据 | firecrawl.dev 2026 | 11.4x Qdrant,Postgres 团队首选 |
| ⭐⭐⭐⭐ | llm-d → CNCF | IBM Research Blog | K8s 原生推理事实标准 |
| ⭐⭐⭐⭐ | OpenCost 1.1210 GPU 成本追踪 | CNCF Blog | FinOps + LLM 交叉创新 |
| ⭐⭐⭐⭐ | An Internet for the KV Cache | arXiv 2608.01526 | KV cache infrastructure 新范式 |
| ⭐⭐⭐⭐ | NVIDIA Grove + Dynamo 解聚式推理 | Spheron Blog | K8s 推理编排生产路径 |
| ⭐⭐⭐ | HYBRIDKV(ACL 2026) | ACL Anthology | 多模态 LLM 推理 KV 压缩 |
| ⭐⭐⭐ | GraphRAG hallucination -62% | MLOps Community | 量化验证 + 生产参考 |
| ⭐⭐⭐ | RAGCap-Bench | arXiv 2510.13910v2 | Agentic RAG 评估标准化 |
七、分类标签汇总
| 标签 | 出现次数 |
|---|---|
LLM推理 |
5 |
KV-Cache |
4 |
Multi-Agent |
3 |
VectorDB |
2 |
K8s |
4 |
CNCF |
2 |
Cloud-Native |
3 |
RAG |
4 |
security |
1 |
production |
3 |
arXiv |
6 |
ACL |
1 |
pgvector |
2 |
Qdrant |
2 |
FinOps |
1 |
八、建议写入路径汇总
| 优先级 | 写入路径 | 主题 |
|---|---|---|
| 🔴 高 | 2026-09-18-polykv-multicagent-kvcache-arxiv.md |
PolyKV + token 节省验证 |
| 🔴 高 | 2026-09-18-inference-cost-attacks-rag-security.md |
RAG 成本攻击安全研究 |
| 🔴 高 | 2026-09-18-vecdb-production-decision-tree-2026.md |
pgvectorscale 性能 + 选型树 |
| 🟠 中高 | 2026-09-18-llm-d-cncf-k8s-inference.md |
llm-d CNCF 捐赠 + K8s 原生推理 |
| 🟠 中高 | 2026-09-18-opencost-gpu-cost-tracking-k8s.md |
OpenCost 1.121.0 GPU FinOps |
| 🟠 中高 | 2026-09-18-kvcache-internet-arxiv-2608.md |
KV Cache 基础设施新范式 |
| 🟡 中 | 2026-09-18-nvidia-grove-dynamo-disaggregated-k8s.md |
Grove + Dynamo 解聚式推理 |
| 🟡 中 | 2026-09-18-hybridkv-acl-2026-mllm.md |
HYBRIDKV 多模态压缩 |
| 🟡 中 | 2026-09-18-ragcap-bench-agentic-rag-eval.md |
RAGCap-Bench 评估框架 |
九、后续行动
- [ ] PolyKV paper 精读:验证 token 节省 claim 的实验条件
- [ ] Inference Cost Attack paper 精读:确认 CREEP framework 防御方案
- [ ] pgvectorscale 基准测试复现:50M 向量规模验证
- [ ] llm-d CNCF 捐赠进度跟踪:v1.0 release timeline
- [ ] OpenCost GPU cost tracking 集成到本知识库生产运行手册