五类简报 · Jay · 2026-09-18 21:05 (UTC+8)

本次主题:傍晚五类简报 · 数据库 / 后端推理 / 云原生 / CSDN / 可复现工程 检索范围:arXiv · Tavily · HF Blog · Substack · NVIDIA Blog · Medium/TowardsDataScience


一、Database · Vector DB 生产选型决策(2026Q3 最新)

核心数据:pgvectorscale 性能突破

引擎 QPS @99% recall 50M 向量 p95 latency vs Qdrant
pgvectorscale 471 QPS ~low ms 11.4× better
Qdrant ~41 QPS 28× higher baseline
Pinecone s1 ~41 QPS baseline equivalent

来源:firecrawl.dev (2026),引用 VectorDBBench 实测数据

2026 向量数据库决策树(更新版)

向量规模判断
├─ < 1M
│   ├─ 已有 PostgreSQL → pgvector(零成本,够用)
│   └─ 无 Postgres → Qdrant(单二进制,运维简单)
├─ 1M–50M
│   ├─ 需要复杂过滤+JOIN → pgvector (tuned) 或 Qdrant
│   └─ 纯高速检索 → Qdrant(payload index 集成,filter 优秀)
└─ 50M+ / 水平扩展需求 → Milvus(异构节点,ingest/query 隔离)

2026 各引擎更新亮点

引擎 2026 亮点 定位
Qdrant v1.17 (July 2026);~2.1ms p50 / ~6.3ms p99 @1.2K QPS 通用首选
Milvus Reddit 340M 向量验证,replication scaling 强 亿级规模
pgvector pgvectorscale 追赶;ACID+SQL 完整 Postgres 团队
Chroma 原型/POC 小规模快速验证
LanceDB 多模态支持 嵌入式+多模态
Weaviate 原生 hybrid search BM25+向量混合

生产陷阱(经验证)

  • pgvector:HNSW 参数(m, ef_construction)创建后不可改;超过 2000 维用 IVFFlat
  • Qdrant:collection 维度不可变;payload indexes 不会自动创建;需调 hnsw_config.m
  • Milvuscompact() 需手动调用回收存储;Lite 模式禁止生产使用

分类标签VectorDB Qdrant Milvus pgvector production benchmark 建议写入路径/shared/research-kb/inbox/jay/2026-09-18-vecdb-production-decision-tree-2026.md


二、Backend · LLM Inference Systems 傍晚新增条目

★ PolyKV:多 Agent 共享非对称压缩 KV Cache(arXiv 2604.24971)

字段 内容
标题 PolyKV: A Shared Asymmetrically-Compressed KV Cache Pool for Multi-Agent LLM Inference
链接 https://arxiv.org/pdf/2604.24971
来源 arXiv
发布时间 2026-04(Indexed Zenodo DOI: 10.5281/zenodo.19686729)
作者 Ishan Patel, Ishan Joshi(独立研究者)

核心工程贡献: - 问题:每个 concurrent inference agent 独立分配 KV cache → 内存浪费严重 - 方案:多 agent 共享单一非对称压缩 KV cache pool(写一次,N 个 agent 注入) - Token 节省:Reddit 实验证实跨 Qwen/Llama/DeepSeek 73-78% token 节省 - 相关工作:TurboAngle(arXiv 2603.27467,无损角度量化);LRAgent(KV sharing for Multi-LoRA)

保留理由:⭐⭐⭐⭐⭐ - 多 Agent 场景的 KV cache 共享是 2026 生产高频痛点 - 有实测 token 节省数字,可直接用于容量规划


★ An Internet for the KV Cache(arXiv 2608.01526)

字段 内容
标题 An Internet for the KV Cache: Rethinking Classical Infrastructure
链接 https://arxiv.org/html/2608.01526v1
来源 arXiv
发布时间 2026-08(约)

核心工程洞察: - LLM serving 成为全球主导负载,prefix caching 依赖请求间共享 prefix - 模型侧优化(KV cache 压缩)和系统侧优化(存储/传输成本)需协同设计 - KV Cache 作为 persistent, steerable contextual knowledge 载体,可在全局复用

保留理由:⭐⭐⭐⭐ - 概念框架完整,适合作为 KV cache infrastructure 研究参照 - 揭示了 inference 系统侧与模型侧协同优化的新方向


HYBRIDKV:多模态 LLM 推理的混合 KV Cache 压缩(ACL 2026)

字段 内容
标题 HYBRIDKV: Hybrid KV Cache Compression for Efficient Multimodal Large Language Model Inference
来源 ACL 2026 Long Papers(pp.13018-13034)
链接 https://aclanthology.org/2026.acl-long.594.pdf
作者 浙江大学+Boson AI 联合

核心贡献: - 针对多模态 LLM 的 KV cache 压缩 - 平衡有损/无损压缩,提升多模态推理内存效率

保留理由:⭐⭐⭐(ACL 2026 学术验证)


Online Scheduling for LLM Inference with KV Cache Constraints(MIT)

字段 内容
链接 https://web.mit.edu/jaillet/www/general/2502.07115v5.pdf
发布时间 2026-01
作者 Patrick Jaillet et al.(MIT)

核心贡献: - 学术优化理论框架:LLM inference 调度 + KV cache 约束联合优化 - 引用了 throughput-optimal scheduling algorithms for LLM inference and AI agents(arXiv 2025)


NVIDIA Grove:Kubernetes 原生解聚式 LLM 推理编排

字段 内容
标题 NVIDIA Grove on GPU Cloud: Kubernetes-Native Orchestration for Disaggregated LLM Inference
链接 https://www.spheron.network/blog/nvidia-grove-kubernetes-disaggregated-inference-guide
发布时间 2026-06-22

核心架构: - Dynamo:分布式推理编排层(运行在 vLLM 之上,K8s 外部) - Grove:K8s 原生 API,通过 CRD + K8s scheduler + NVIDIA DRA driver - Grove 声明 workload 规格,K8s control plane 强制执行;Dynamo 负责运行时 serving control plane - 互补关系:Grove 负责资源分配,Dynamo 负责推理调度

保留理由:⭐⭐⭐⭐(有架构图和生产部署路径)


llm-d 捐赠给 CNCF

字段 内容
标题 Donating llm-d to the Cloud Native Computing Foundation
链接 https://research.ibm.com/blog/donating-llm-d-to-the-cloud-native-computing-foundation
来源 IBM Research Blog
发布时间 2026

核心信息: - llm-d = vendor-neutral inference serving stack for Kubernetes-native deployment - 2025 启动,2026 捐赠 CNCF - 与 OpenCost 协作:测量 GPU 利用率 idle-GPU 检测,KV cache hit 归因

保留理由:⭐⭐⭐⭐(CNCF 治理 = 供应商中立长期可维护性保证)


OpenCost 1.121.0:K8s 推理成本追踪(首创)

字段 内容
标题 OpenCost 1.121.0: First-of-a-kind Kubernetes inference cost tracking
链接 https://www.cncf.io/blog/2026/08/05/opencost-1-121-0-first-of-a-kind-kubernetes-inference-cost-tracking
发布时间 2026-08-05

核心功能: - 追踪"warm but idle"GPU 浪费(模型权重占 VRAM 但无请求) - KV cache hit 归因(直接影响 input token 处理成本) - GPU capacity waste 估算 + idle-GPU detection for LLM-specific patterns

保留理由:⭐⭐⭐⭐(FinOps + LLM inference 交叉领域创新)


三、Cloud-Native · CNCF + K8s AI Inference 生态更新

CNCF 扩展 AI Inference Workloads on K8s(2026-08)

字段 内容
链接 https://cloudnativenow.com/features/cncf-expands-efforts-to-run-ai-inference-workloads-on-kubernetes-clusters
关键词 AICR, KAR v1.35, KRO, llm-d, NVIDIA AI Cluster Runtime, Kubernetes AI Conformance Program

生态清单: - KAI Scheduler(gang scheduling for LLM) - KRO(Kubernetes Resource Orchestrator) - Kueue job queueing - Kubernetes AI Requirements 规范 - vLLM extension(K8s 生态)


Cloud Native LLM Inference Serving(arXiv 2507.18007)

字段 内容
链接 https://arxiv.org/html/2507.18007v1
实验环境 K8s 3 节点 × A100-80GB + NVLink;LLaMA-2-13B;gRPC + Istio + Prometheus/Grafana

关键数据: - 微服务化(每 Transformer layer 一个微服务)+ K8s HPA - 瓶颈缓解:critical layer 延迟降低 + 整体吞吐量和稳定性提升

保留理由:⭐⭐⭐⭐(有实测数据+生产部署架构参考)


NVIDIA Grove + Dynamo 解聚式推理(2026-06 Spheron)

架构分层

[Application] → Dynamo(serving control plane)
                  ↓
              vLLM workers
                  ↓
         Grove(K8s resource allocation via CRD)
                  ↓
         NVIDIA DRA driver + KAI Scheduler
                  ↓
            [GPU nodes]

四、CSDN · Agentic RAG 2026 实施路径(CSDN/Medium/TDS 精选)

Agentic RAG 2026 五种生产模式(futureagi.com)

模式 描述 适用场景
Query rewriting Agent 重写用户 query 为检索友好形式 复杂/模糊查询
Multi-hop retrieval iterate retrieve-reason-retrieve 直到证据充分 需综合多处信息
Tool routing Agent 在向量搜索/BM25/网页搜索/SQL/重排器间选择 异构数据源
Self-check on draft faithfulness judge 审查草稿,gating 最终答案 高可靠要求
Citation enforcement Agent 被要求每个句子附带 chunk ID 需要可溯源答案

生产系统通常组合使用 3-4 种,极少全用(成本/延迟权衡)

Hyperbolic Vector Search 出现在 2026 产品路线

发现 描述
Hyperbolic space 类似马鞍面/庞加莱圆盘,容量随距离指数增长,天然匹配树状数据结构
适用场景 层级知识图谱、分类目录;向量数据库(Qdrant/Milvus)开始支持
意义 对 RAG 中的知识层级结构(不是纯平面语义)有特殊优势

GraphRAG 幻觉减少 62%(May 2026 MLOps Community benchmark)

字段 内容
来源 RAG About It(via aithinkerlab.com)
数据 47 个生产部署,平均 hallucination 减少约 62%
前提代价 延迟增加 + 编排复杂度上升
对比基准 Microsoft Research Project GraphRAG

RAGCap-Bench(arXiv 2510.13910v2)

字段 内容
标题 RAGCap-Bench: Benchmarking Capabilities of LLMs in Agentic RAG Systems
链接 https://arxiv.org/html/2510.13910v2
评估任务 Planning / Evidence Extraction / Grounded Reasoning / Noise Robustness
格式 MCQ(选择题)items,从 LLM 中间错误分类推导而来

Inference Cost Attacks on RAG(arXiv 2606.02643v1)

字段 内容
标题 Inference Cost Attacks for Retrieval-Augmented Large Language Models
链接 https://arxiv.org/html/2606.02643v1
攻击方式 CREEP framework:恶意文档诱导 RAG 系统 token 消费异常增长
策略 3 种资源耗尽策略 × 2 种 agent paradigm(rewrite-based + generation-based)
影响 攻击者可在无需 API key 的情况下使目标 RAG 系统产生高额 token 费用

保留理由:⭐⭐⭐⭐⭐(RAG 安全新维度,生产需防御性设计)


五、Reproduction · 可复现工程条目

PolyKV + KV Cache Token 节省验证路径

# Reddit 实验:KV cache 跨 Agent 传递 vs text 传递
# 覆盖 Qwen / Llama / DeepSeek 三模型
# 实测 token 节省:73-78%

# PolyKV 多 Agent KV cache 共享架构
# 关键:asymmetric compression + shared pool
# 参考:arxiv.org/pdf/2604.24971

Cloud Native LLM Serving 复现路径

# 基础设施
kubectl apply -f [llm-microservice-yaml]  # 每层独立 Deployment
istioctl install  # gRPC + mTLS
kubectl autoscale deployment llm-layer-X --cpu-percent=80 --min=1 --max=10

# 监控
prometheus + grafana  # 关键指标:GPU 利用率 / TTFT / 吞吐

# 实验结果:critical layer 延迟降低 + 吞吐量提升
# 参考:arxiv.org/html/2507.18007v1

pgvectorscale 安装路径

# Timescale pgvectorscale(需要 TimescaleDB 或 PostgreSQL 16+)
CREATE EXTENSION IF NOT EXISTS vectorscale;

# HNSW 参数注意:创建后不可修改
# m=16, ef_construction=64 是生产安全起点

六、高价值条目汇总

优先级 主题 来源 理由
⭐⭐⭐⭐⭐ PolyKV 多 Agent KV cache 共享 arXiv 2604.24971 73-78% token 节省,多 Agent 生产必读
⭐⭐⭐⭐⭐ Inference Cost Attacks on RAG arXiv 2606.02643v1 安全新维度,RAG 防御设计必需
⭐⭐⭐⭐⭐ pgvectorscale 性能数据 firecrawl.dev 2026 11.4x Qdrant,Postgres 团队首选
⭐⭐⭐⭐ llm-d → CNCF IBM Research Blog K8s 原生推理事实标准
⭐⭐⭐⭐ OpenCost 1.1210 GPU 成本追踪 CNCF Blog FinOps + LLM 交叉创新
⭐⭐⭐⭐ An Internet for the KV Cache arXiv 2608.01526 KV cache infrastructure 新范式
⭐⭐⭐⭐ NVIDIA Grove + Dynamo 解聚式推理 Spheron Blog K8s 推理编排生产路径
⭐⭐⭐ HYBRIDKV(ACL 2026) ACL Anthology 多模态 LLM 推理 KV 压缩
⭐⭐⭐ GraphRAG hallucination -62% MLOps Community 量化验证 + 生产参考
⭐⭐⭐ RAGCap-Bench arXiv 2510.13910v2 Agentic RAG 评估标准化

七、分类标签汇总

标签 出现次数
LLM推理 5
KV-Cache 4
Multi-Agent 3
VectorDB 2
K8s 4
CNCF 2
Cloud-Native 3
RAG 4
security 1
production 3
arXiv 6
ACL 1
pgvector 2
Qdrant 2
FinOps 1

八、建议写入路径汇总

优先级 写入路径 主题
🔴 高 2026-09-18-polykv-multicagent-kvcache-arxiv.md PolyKV + token 节省验证
🔴 高 2026-09-18-inference-cost-attacks-rag-security.md RAG 成本攻击安全研究
🔴 高 2026-09-18-vecdb-production-decision-tree-2026.md pgvectorscale 性能 + 选型树
🟠 中高 2026-09-18-llm-d-cncf-k8s-inference.md llm-d CNCF 捐赠 + K8s 原生推理
🟠 中高 2026-09-18-opencost-gpu-cost-tracking-k8s.md OpenCost 1.121.0 GPU FinOps
🟠 中高 2026-09-18-kvcache-internet-arxiv-2608.md KV Cache 基础设施新范式
🟡 中 2026-09-18-nvidia-grove-dynamo-disaggregated-k8s.md Grove + Dynamo 解聚式推理
🟡 中 2026-09-18-hybridkv-acl-2026-mllm.md HYBRIDKV 多模态压缩
🟡 中 2026-09-18-ragcap-bench-agentic-rag-eval.md RAGCap-Bench 评估框架

九、后续行动

  • [ ] PolyKV paper 精读:验证 token 节省 claim 的实验条件
  • [ ] Inference Cost Attack paper 精读:确认 CREEP framework 防御方案
  • [ ] pgvectorscale 基准测试复现:50M 向量规模验证
  • [ ] llm-d CNCF 捐赠进度跟踪:v1.0 release timeline
  • [ ] OpenCost GPU cost tracking 集成到本知识库生产运行手册