知识库草稿 · Jay · 2026-07-13 15:06

📋 本次简报主题

LLM Inference / Vector DB / RAG / Cloud-Native / CSDN · 2026年7月中旬精选

🔍 检索范围

  • arXiv (cs.DB / cs.CL / cs.LG / cs.DC)
  • Substack (AI engineering, RAG, agentic systems)
  • CNCF / Istio 官方博客
  • CSDN (高价值筛选)
  • GitHub Awesome Lists

🗄️ DATABASE · 向量数据库与 GPU/CPU 协同

⭐ 高价值条目

1. To GPU or Not to GPU: Vector Search in Relational Engines

  • 来源: arXiv · cs.DB
  • 核心观点:
  • 扩展 TPC-H 基准(加入文本/图像向量数据),提出 SQL+VS 联合查询;
  • 开发 CPU/GPU 模块化执行引擎,覆盖多种部署形态;
  • 反直觉发现:关系型组件从 GPU 加速获益远大于向量搜索本身;
  • 在 NVLink 互联下,关系和向量搜索均在 GPU 上更快,与现有架构结论相反。
  • PCIe 数据传输开销: 在 PCIe 配置下,数据传输占总耗时 40%~97%,印证 GPU 向量搜索的 IO 瓶颈。
  • 可信度: ⭐⭐⭐⭐ (arXiv 2026-05, 含大规模实验)
  • 是否需精读: 是——反直觉结论对工程选型有直接指导意义
  • 来源: arXiv · 2026-01
  • 核心观点:
  • 层级式向量索引架构,CPU-GPU 协同处理 + workload-aware 向量缓存;
  • 在大规模动态数据流场景下,吞吐量平均提升 20.9×,延迟降低 1.3×~50.7×,同时保持高召回率;
  • 解决 GPU 显存有限 + 动态更新两大难题。
  • 可信度: ⭐⭐⭐⭐ (含 SOTA 对比实验)
  • 是否需精读: 是——工程落地价值高,覆盖动态更新场景

3. GPU-Accelerated Graph Vector Search: Taxonomy & Empirical Study

  • 来源: arXiv · 2026-02
  • 核心观点:
  • 建立 GPU 加速图向量搜索的详细分类体系(6 种算法 × 8 个数据集);
  • 距离计算是首要计算瓶颈,CPU-GPU 数据传输是大规模场景下延迟的主导因素;
  • 明确了 GPU 优化策略与硬件执行单元的映射关系。
  • 可信度: ⭐⭐⭐⭐ (实验充分,分类严谨)
  • 是否需精读: 中——可作为向量系统 GPU 优化的survey参考

4. Filtered ANN Search in Vector Databases

  • 来源: arXiv · 2026-02
  • 核心观点:
  • 提出 MoReVec 关系数据集(含两张表,768维向量),填补过滤式 ANN 基准空白;
  • 揭示现有向量数据库在带属性过滤的 ANN 查询上的系统性缺陷。
  • 可信度: ⭐⭐⭐⭐
  • 是否需审稿: 可参考该基准来评估向量数据库选型

5. Comprehensive Survey on Vector Database (v4, 2026-03)

  • 来源: arXiv · cs.DB · 最新版 2026-03
  • 覆盖内容: 向量数据库全栈——存储技术、索引方法、分布式架构、与 LLM 的协同框架(LLMs for VDB + VDBs for LLMs)
  • 可信度: ⭐⭐⭐⭐⭐ (综述性质,引用广泛)
  • 是否需审稿: 适合作为知识库主题页的背景材料

候选条目


⚙️ BACKEND · LLM 推理引擎与 KV Cache

⭐ 高价值条目

1. A Survey on Inference Engines for LLMs (arXiv:2505.01658)

  • 来源: arXiv · Under review · 106 pages · 46 figures
  • 核心观点: 系统梳理 LLM 推理引擎的优化与效率研究方向,覆盖从算法到系统的全栈内容
  • 可信度: ⭐⭐⭐⭐⭐ (综述性质,ICLR under review)
  • 是否需精读: 是——高质量综述,适合作为推理系统知识库主题页的骨架

2. KV Cache Transform Coding for Compact Storage in LLM Inference

  • 来源: arXiv · ICLR 2026 录用
  • 核心观点: 通过变换编码压缩 KV Cache 存储,在不损失精度前提下显著降低显存占用
  • 可信度: ⭐⭐⭐⭐⭐ (顶会录用)
  • 是否需精读: 是——LLM 推理系统工程必读

3. DUAL-BLADE: Dual-Path NVMe-Direct KV-Cache Offloading for Edge LLM Inference

  • 来源: arXiv · ICDCS 2026 录用
  • 核心观点:
  • 双路径 NVMe 直连 KV Cache 卸载,用于边缘 LLM 推理;
  • 解决边缘设备显存不足的核心瓶颈。
  • 可信度: ⭐⭐⭐⭐ (顶会录用)
  • 是否需精读: 是——边缘推理 + 卸载方向的重要论文

4. VeriCache: Turning Lossy KV Cache into Lossless LLM Inference

  • 来源: arXiv · 2026-05
  • 核心观点: 有损 KV Cache 通过验证机制恢复无损推理质量,O(n) 内存随 Context 增长的难题给出新解法
  • 可信度: ⭐⭐⭐⭐
  • 是否需精读: 中——是 KV Cache 压缩方向的新思路

5. KV Cache Optimization Strategies: Systematic Review

  • 来源: arXiv · 2026-03 · 系统性综述
  • 五大方向: Cache eviction / Cache compression / Hybrid memory / Novel attention / Combination
  • 可信度: ⭐⭐⭐⭐⭐
  • 是否需审稿: 适合作为 KV Cache 优化方向的知识库导航页

6. Agent Memory: Persistent Q4 KV Cache for Multi-Agent LLM Inference on Edge

  • 来源: arXiv · 2026-03
  • 核心观点:
  • Q4 量化 KV Cache 持久化方案,支持多 Agent 并发推理;
  • 在 Apple M4 Pro (10.2GB cache) 上,3 个 Agent 8K context 可运行;
  • TTFT (Time to First Token) 降低最多 136× (Gemma)。
  • 可信度: ⭐⭐⭐⭐
  • 是否需精读: 是——边缘多 Agent 场景直接相关

7. Albireo: Scaling LLM Inference Beyond Amdahl's Limits

  • 来源: arXiv · 2026-06
  • 核心观点:
  • 通过计算与 I/O 重叠、序列并行采样,消除张量并行中的非可扩展开销;
  • 固定 GPU 预算下的最优 TP degree (tet) 可被提升;
  • 实验显示超线性扩展:T(t) ≥ 2×T(t/2)。
  • 可信度: ⭐⭐⭐⭐
  • 是否需精读: 是——分布式推理方向硬核论文

8. OptiKIT: Automated Enterprise LLM Optimization

  • 来源: arXiv · 2026-01 · 2× GPU throughput 提升
  • 可信度: ⭐⭐⭐⭐ (企业级框架)
  • 评价: 面向非专家团队的自动化优化平台,设计思路值得关注

候选条目


☁️ CLOUD-NATIVE · Istio 与平台工程

⭐ 高价值条目

1. Istio @ KubeCon EU 2026: Ambient Multicluster + Gateway API Inference Extension

  • 来源: CNCF 官方公告 · 2026-03
  • 核心更新:
  • Ambient Multicluster β — 无 sidecar 的多集群服务网格;
  • Gateway API Inference Extension β — 网格能力扩展到 AI 推理负载;
  • agentgateway (实验) — Istio 数据面引入 AI Agent 网关组件。
  • 评价: 这是 Istio 首次将服务网格概念延伸到 AI 推理基础设施,标志性信号
  • 可信度: ⭐⭐⭐⭐⭐ (CNCF 官方)
  • 是否需精读: 是——平台工程 + AI Infra 融合的里程碑事件
  • 来源: Medium · Platform Engineering
  • 核心观点:
  • 轻量级容器运行时 + 灵活编排器 + GitOps 原生交付工具正在挑战 Kubernetes 主导地位;
  • CNCF 标准化 CRI 以解耦编排层与容器运行时;
  • 边缘计算和多云架构推动"超越 Kubernetes"趋势。
  • 可信度: ⭐⭐⭐
  • 是否需审稿: 可作为平台工程趋势的背景参考

3. Service Mesh 市场数据


📝 CSDN · 高价值条目(严格筛选)

本轮检索 CSDN 整体质量偏低,仅保留以下条目:

1. 2026年国产时序数据库选型指南

  • 标签: database · CSDN · 国产数据库
  • 内容摘要: TDengine(涛思数据)、AntDB、IoTDB 等国产时序数据库对比;多模架构融合实践;写入吞吐与存储成本分析
  • 收录理由: 国产时序 DB 选型参考,覆盖 2026 年国内竞争格局
  • 是否需精读: 否(偏选型,非代码级)

2. 集中式 vs 分布式:2026数据库选型决策树

  • 标签: database · CSDN · 选型
  • 内容摘要: MySQL/PostgreSQL/Oracle 与分布式数据库选型对比,适合作为选型决策的checklist参考
  • 收录理由: 选型框架整理,但无深度实现分析

3. 2026年揭秘:为什么国内大厂纷纷弃坑MySQL押注PostgreSQL

  • 标签: database · CSDN · PostgreSQL
  • 内容摘要: 国内大厂从 MySQL 向 PostgreSQL 生态迁移现象分析(openHalo 等国产数据库均基于 PG)
  • 收录理由: 行业趋势信号,PostgreSQL 生态在国产化场景中的主导地位

本轮 CSDN 未发现满足以下条件的文章:

  • ❌ 源码分析 / 内核解读
  • ❌ 环境+命令+复现过程
  • ❌ 真实排障经验
  • ❌ 版本对比(需有具体版本号、环境配置)

🔬 REPRODUCTION · 可复现条目

推荐关注(含代码/基准)

条目 来源 亮点 优先级
SVFusion arXiv CPU-GPU协同,代码+实验齐全
Agent Memory Q4 KV Cache arXiv 边缘多Agent,有量化代码
Albireo arXiv 分布式推理消融实验
SparKV arXiv 端侧卸载框架代码

📦 Substack · AI Engineering 高质量来源

⭐ 每日/每周固定追踪

1. Comparative Analysis of RAG Architectures 2026

  • 作者/专栏: Michael Allanham
  • 来源: Substack
  • 核心观点: Pipeline RAG / Agentic RAG / GraphRAG 三路对比;2026 年 RAG 已从 Chat 演变为 Agentic 系统的基础设施
  • 收录理由: 三种 RAG 架构的清晰对比框架,适合作为知识库 RAG 主题页的选型参考
  • 原文链接: https://micheallanham.substack.com/p/comparative-analysis-of-rag-architectures

2. Top 5 Agentic AI Frameworks to Watch in 2026

  • 作者/专栏: Future AGI
  • 来源: Substack
  • 核心观点: Gartner 预测 2026 年底 40% 企业应用将嵌入任务特定 AI Agent;5 大框架横向对比 + 选型指南
  • 收录理由: Agent 框架选型实用指南
  • 原文链接: https://futureagi.substack.com/p/top-5-agentic-ai-frameworks-to-watch

3. RAG Reimagined: 5 Breakthroughs

  • 作者/专栏: Gradient Flow
  • 来源: Substack
  • 核心观点: GraphRAG 实用性分析(知识图谱构建门槛仍高);多模态 RAG、长文档 RAG 生产实践
  • 收录理由: RAG 2026 实用现状评估,避免 hype
  • 原文链接: https://gradientflow.substack.com/p/rag-reimagined-5-breakthroughs-you

4. AI Agents Don't Need Vector Search Anymore (Agentic Search Stack 2026)

  • 作者: Abdullah Grewal
  • 来源: Medium
  • 核心观点: Agent-as-retriever 模式(Anthropic Claude Code 已在用)取代传统向量检索 RAG;即时加载(JIT loading)替代预索引
  • 收录理由: RAG 范式转变的重要信号——需持续跟踪验证
  • 原文链接: https://buzzgrewal.medium.com/ai-agents-dont-need-vector-search-anymore-inside-the-agentic-search-stack-replacing-rag-in-2026-58efcabe4f6f

5. Lesson 44: Evaluating Agentic RAG Reliability

  • 作者/专栏: AI Mastery
  • 来源: Substack
  • 核心观点: Ragas + Gemini LLM Judge 自动化评估 Pipeline;持续评估作为推理的副产物而非离线批量任务
  • 收录理由: 生产 RAG 评估的最佳实践总结
  • 原文链接: https://aiamastery.substack.com/p/lesson-44-evaluating-agentic-rag

🏷️ 分类标签汇总

database | vector-search | gpu-cpu-coprocessing | inference-engineering | kv-cache | 
rag-2026 | agentic-rag | graphrag | cloud-native | istio | platform-engineering | 
csdn-filter | substack | arxiv-2026 | edge-inference

📁 建议写入路径

类别 路径建议
向量数据库 GPU 优化 vecdb/gpu-acceleration/index.mdvecdb/gpu-cpu-coprocessing/svfusion.md
LLM 推理系统工程 inference-engineering/kv-cache-optimization/survey-2026.md
RAG 2026 范式转变 rag/paradigm-shift-2026/agentic-retriever.md
Istio AI 扩展 cloud-native/istio-ambient-multicluster-inference-2026.md
Substack 来源导航 sources/newsletter/ai-engineering-2026-substack.md

✅ 行动建议

精读(优先级排序)

  1. arxiv 2605.15957 — "To GPU or Not to GPU":反直觉结论对向量系统选型直接相关
  2. arxiv 2601.08528 — SVFusion:动态更新场景工程价值高
  3. arxiv 2603.20397 — KV Cache 优化综述:系统性梳理
  4. ICLR 2026 KV Transform Coding — 顶会录用,生产必读

审稿

  • Vector DB Survey (arXiv 2310.11703 v4) 适合作为知识库主题页背景
  • Istio Ambient Multicluster CNCF 公告适合作为 Cloud-Native 主题页更新材料

主题页更新建议

  • inference-engineering: 加入 KV Cache 优化五大方向分类(2026-07 更新)
  • rag: 加入 "Agentic Retriever 模式 vs Naive RAG" 范式对比
  • cloud-native: 加入 Istio agentgateway 实验性支持(2026-03 KubeCon EU)

Jay · 2026-07-13 15:06 · /shared/research-kb/inbox/jay/