知识库草稿 · Jay · 2026-07-13 15:06
📋 本次简报主题
LLM Inference / Vector DB / RAG / Cloud-Native / CSDN · 2026年7月中旬精选
🔍 检索范围
- arXiv (cs.DB / cs.CL / cs.LG / cs.DC)
- Substack (AI engineering, RAG, agentic systems)
- CNCF / Istio 官方博客
- CSDN (高价值筛选)
- GitHub Awesome Lists
🗄️ DATABASE · 向量数据库与 GPU/CPU 协同
⭐ 高价值条目
1. To GPU or Not to GPU: Vector Search in Relational Engines
- 来源: arXiv · cs.DB
- 核心观点:
- 扩展 TPC-H 基准(加入文本/图像向量数据),提出 SQL+VS 联合查询;
- 开发 CPU/GPU 模块化执行引擎,覆盖多种部署形态;
- 反直觉发现:关系型组件从 GPU 加速获益远大于向量搜索本身;
- 在 NVLink 互联下,关系和向量搜索均在 GPU 上更快,与现有架构结论相反。
- PCIe 数据传输开销: 在 PCIe 配置下,数据传输占总耗时 40%~97%,印证 GPU 向量搜索的 IO 瓶颈。
- 可信度: ⭐⭐⭐⭐ (arXiv 2026-05, 含大规模实验)
- 是否需精读: 是——反直觉结论对工程选型有直接指导意义
2. SVFusion: CPU-GPU Co-Processing Architecture for Large-Scale Real-Time Vector Search
- 来源: arXiv · 2026-01
- 核心观点:
- 层级式向量索引架构,CPU-GPU 协同处理 + workload-aware 向量缓存;
- 在大规模动态数据流场景下,吞吐量平均提升 20.9×,延迟降低 1.3×~50.7×,同时保持高召回率;
- 解决 GPU 显存有限 + 动态更新两大难题。
- 可信度: ⭐⭐⭐⭐ (含 SOTA 对比实验)
- 是否需精读: 是——工程落地价值高,覆盖动态更新场景
3. GPU-Accelerated Graph Vector Search: Taxonomy & Empirical Study
- 来源: arXiv · 2026-02
- 核心观点:
- 建立 GPU 加速图向量搜索的详细分类体系(6 种算法 × 8 个数据集);
- 距离计算是首要计算瓶颈,CPU-GPU 数据传输是大规模场景下延迟的主导因素;
- 明确了 GPU 优化策略与硬件执行单元的映射关系。
- 可信度: ⭐⭐⭐⭐ (实验充分,分类严谨)
- 是否需精读: 中——可作为向量系统 GPU 优化的survey参考
4. Filtered ANN Search in Vector Databases
- 来源: arXiv · 2026-02
- 核心观点:
- 提出 MoReVec 关系数据集(含两张表,768维向量),填补过滤式 ANN 基准空白;
- 揭示现有向量数据库在带属性过滤的 ANN 查询上的系统性缺陷。
- 可信度: ⭐⭐⭐⭐
- 是否需审稿: 可参考该基准来评估向量数据库选型
5. Comprehensive Survey on Vector Database (v4, 2026-03)
- 来源: arXiv · cs.DB · 最新版 2026-03
- 覆盖内容: 向量数据库全栈——存储技术、索引方法、分布式架构、与 LLM 的协同框架(LLMs for VDB + VDBs for LLMs)
- 可信度: ⭐⭐⭐⭐⭐ (综述性质,引用广泛)
- 是否需审稿: 适合作为知识库主题页的背景材料
候选条目
- Instaclustr: Best Open Source Vector DB 2026 — 综述性,可作参考但创新性一般
- Awesome Vector Database (GitHub) — 持续更新的awesome list,标记了 2026 年新条目
- CSDN: 2026年国产时序数据库选型指南 — TDengine、涛思数据等国产时序 DB 对比,适合国内技术选型参考,但非代码级解读
⚙️ BACKEND · LLM 推理引擎与 KV Cache
⭐ 高价值条目
1. A Survey on Inference Engines for LLMs (arXiv:2505.01658)
- 来源: arXiv · Under review · 106 pages · 46 figures
- 核心观点: 系统梳理 LLM 推理引擎的优化与效率研究方向,覆盖从算法到系统的全栈内容
- 可信度: ⭐⭐⭐⭐⭐ (综述性质,ICLR under review)
- 是否需精读: 是——高质量综述,适合作为推理系统知识库主题页的骨架
2. KV Cache Transform Coding for Compact Storage in LLM Inference
- 来源: arXiv · ICLR 2026 录用
- 核心观点: 通过变换编码压缩 KV Cache 存储,在不损失精度前提下显著降低显存占用
- 可信度: ⭐⭐⭐⭐⭐ (顶会录用)
- 是否需精读: 是——LLM 推理系统工程必读
3. DUAL-BLADE: Dual-Path NVMe-Direct KV-Cache Offloading for Edge LLM Inference
- 来源: arXiv · ICDCS 2026 录用
- 核心观点:
- 双路径 NVMe 直连 KV Cache 卸载,用于边缘 LLM 推理;
- 解决边缘设备显存不足的核心瓶颈。
- 可信度: ⭐⭐⭐⭐ (顶会录用)
- 是否需精读: 是——边缘推理 + 卸载方向的重要论文
4. VeriCache: Turning Lossy KV Cache into Lossless LLM Inference
- 来源: arXiv · 2026-05
- 核心观点: 有损 KV Cache 通过验证机制恢复无损推理质量,O(n) 内存随 Context 增长的难题给出新解法
- 可信度: ⭐⭐⭐⭐
- 是否需精读: 中——是 KV Cache 压缩方向的新思路
5. KV Cache Optimization Strategies: Systematic Review
- 来源: arXiv · 2026-03 · 系统性综述
- 五大方向: Cache eviction / Cache compression / Hybrid memory / Novel attention / Combination
- 可信度: ⭐⭐⭐⭐⭐
- 是否需审稿: 适合作为 KV Cache 优化方向的知识库导航页
6. Agent Memory: Persistent Q4 KV Cache for Multi-Agent LLM Inference on Edge
- 来源: arXiv · 2026-03
- 核心观点:
- Q4 量化 KV Cache 持久化方案,支持多 Agent 并发推理;
- 在 Apple M4 Pro (10.2GB cache) 上,3 个 Agent 8K context 可运行;
- TTFT (Time to First Token) 降低最多 136× (Gemma)。
- 可信度: ⭐⭐⭐⭐
- 是否需精读: 是——边缘多 Agent 场景直接相关
7. Albireo: Scaling LLM Inference Beyond Amdahl's Limits
- 来源: arXiv · 2026-06
- 核心观点:
- 通过计算与 I/O 重叠、序列并行采样,消除张量并行中的非可扩展开销;
- 固定 GPU 预算下的最优 TP degree (tet) 可被提升;
- 实验显示超线性扩展:T(t) ≥ 2×T(t/2)。
- 可信度: ⭐⭐⭐⭐
- 是否需精读: 是——分布式推理方向硬核论文
8. OptiKIT: Automated Enterprise LLM Optimization
- 来源: arXiv · 2026-01 · 2× GPU throughput 提升
- 可信度: ⭐⭐⭐⭐ (企业级框架)
- 评价: 面向非专家团队的自动化优化平台,设计思路值得关注
候选条目
- SparKV: Overhead-Aware KV Cache Loading for Edge Inference — 云端 KV 流式+端侧计算的混合方案,TTFT 降低 1.3-5.1×
- Zylos Research: LLM Inference Optimization and Quantization 2026 — FP8 是 2026 年 Hopper GPU 的生产级标准;vLLM + SGLang 的技术选型分析
- GitHub: xlite-dev/Awesome-LLM-Inference — 带代码的高质量论文列表,持续更新
☁️ CLOUD-NATIVE · Istio 与平台工程
⭐ 高价值条目
1. Istio @ KubeCon EU 2026: Ambient Multicluster + Gateway API Inference Extension
- 来源: CNCF 官方公告 · 2026-03
- 核心更新:
- Ambient Multicluster β — 无 sidecar 的多集群服务网格;
- Gateway API Inference Extension β — 网格能力扩展到 AI 推理负载;
- agentgateway (实验) — Istio 数据面引入 AI Agent 网关组件。
- 评价: 这是 Istio 首次将服务网格概念延伸到 AI 推理基础设施,标志性信号
- 可信度: ⭐⭐⭐⭐⭐ (CNCF 官方)
- 是否需精读: 是——平台工程 + AI Infra 融合的里程碑事件
2. Beyond Kubernetes: Platform Engineering Trends 2026
- 来源: Medium · Platform Engineering
- 核心观点:
- 轻量级容器运行时 + 灵活编排器 + GitOps 原生交付工具正在挑战 Kubernetes 主导地位;
- CNCF 标准化 CRI 以解耦编排层与容器运行时;
- 边缘计算和多云架构推动"超越 Kubernetes"趋势。
- 可信度: ⭐⭐⭐
- 是否需审稿: 可作为平台工程趋势的背景参考
3. Service Mesh 市场数据
- 来源: DataIntelo: Service Mesh Market Report 2034
- 数据点: 2025 年市场规模 $1.8B → 2034 年 $13.6B (CAGR 25.1%);Kubernetes-based 占 2025 年类型份额 63.4%
- 可信度: ⭐⭐⭐ (市场报告)
📝 CSDN · 高价值条目(严格筛选)
本轮检索 CSDN 整体质量偏低,仅保留以下条目:
1. 2026年国产时序数据库选型指南
- 标签: database · CSDN · 国产数据库
- 内容摘要: TDengine(涛思数据)、AntDB、IoTDB 等国产时序数据库对比;多模架构融合实践;写入吞吐与存储成本分析
- 收录理由: 国产时序 DB 选型参考,覆盖 2026 年国内竞争格局
- 是否需精读: 否(偏选型,非代码级)
2. 集中式 vs 分布式:2026数据库选型决策树
- 标签: database · CSDN · 选型
- 内容摘要: MySQL/PostgreSQL/Oracle 与分布式数据库选型对比,适合作为选型决策的checklist参考
- 收录理由: 选型框架整理,但无深度实现分析
3. 2026年揭秘:为什么国内大厂纷纷弃坑MySQL押注PostgreSQL
- 标签: database · CSDN · PostgreSQL
- 内容摘要: 国内大厂从 MySQL 向 PostgreSQL 生态迁移现象分析(openHalo 等国产数据库均基于 PG)
- 收录理由: 行业趋势信号,PostgreSQL 生态在国产化场景中的主导地位
本轮 CSDN 未发现满足以下条件的文章:
- ❌ 源码分析 / 内核解读
- ❌ 环境+命令+复现过程
- ❌ 真实排障经验
- ❌ 版本对比(需有具体版本号、环境配置)
🔬 REPRODUCTION · 可复现条目
推荐关注(含代码/基准)
| 条目 | 来源 | 亮点 | 优先级 |
|---|---|---|---|
| SVFusion | arXiv | CPU-GPU协同,代码+实验齐全 | 高 |
| Agent Memory Q4 KV Cache | arXiv | 边缘多Agent,有量化代码 | 高 |
| Albireo | arXiv | 分布式推理消融实验 | 中 |
| SparKV | arXiv | 端侧卸载框架代码 | 中 |
📦 Substack · AI Engineering 高质量来源
⭐ 每日/每周固定追踪
1. Comparative Analysis of RAG Architectures 2026
- 作者/专栏: Michael Allanham
- 来源: Substack
- 核心观点: Pipeline RAG / Agentic RAG / GraphRAG 三路对比;2026 年 RAG 已从 Chat 演变为 Agentic 系统的基础设施
- 收录理由: 三种 RAG 架构的清晰对比框架,适合作为知识库 RAG 主题页的选型参考
- 原文链接: https://micheallanham.substack.com/p/comparative-analysis-of-rag-architectures
2. Top 5 Agentic AI Frameworks to Watch in 2026
- 作者/专栏: Future AGI
- 来源: Substack
- 核心观点: Gartner 预测 2026 年底 40% 企业应用将嵌入任务特定 AI Agent;5 大框架横向对比 + 选型指南
- 收录理由: Agent 框架选型实用指南
- 原文链接: https://futureagi.substack.com/p/top-5-agentic-ai-frameworks-to-watch
3. RAG Reimagined: 5 Breakthroughs
- 作者/专栏: Gradient Flow
- 来源: Substack
- 核心观点: GraphRAG 实用性分析(知识图谱构建门槛仍高);多模态 RAG、长文档 RAG 生产实践
- 收录理由: RAG 2026 实用现状评估,避免 hype
- 原文链接: https://gradientflow.substack.com/p/rag-reimagined-5-breakthroughs-you
4. AI Agents Don't Need Vector Search Anymore (Agentic Search Stack 2026)
- 作者: Abdullah Grewal
- 来源: Medium
- 核心观点: Agent-as-retriever 模式(Anthropic Claude Code 已在用)取代传统向量检索 RAG;即时加载(JIT loading)替代预索引
- 收录理由: RAG 范式转变的重要信号——需持续跟踪验证
- 原文链接: https://buzzgrewal.medium.com/ai-agents-dont-need-vector-search-anymore-inside-the-agentic-search-stack-replacing-rag-in-2026-58efcabe4f6f
5. Lesson 44: Evaluating Agentic RAG Reliability
- 作者/专栏: AI Mastery
- 来源: Substack
- 核心观点: Ragas + Gemini LLM Judge 自动化评估 Pipeline;持续评估作为推理的副产物而非离线批量任务
- 收录理由: 生产 RAG 评估的最佳实践总结
- 原文链接: https://aiamastery.substack.com/p/lesson-44-evaluating-agentic-rag
🏷️ 分类标签汇总
database | vector-search | gpu-cpu-coprocessing | inference-engineering | kv-cache |
rag-2026 | agentic-rag | graphrag | cloud-native | istio | platform-engineering |
csdn-filter | substack | arxiv-2026 | edge-inference
📁 建议写入路径
| 类别 | 路径建议 |
|---|---|
| 向量数据库 GPU 优化 | vecdb/gpu-acceleration/index.md 或 vecdb/gpu-cpu-coprocessing/svfusion.md |
| LLM 推理系统工程 | inference-engineering/kv-cache-optimization/survey-2026.md |
| RAG 2026 范式转变 | rag/paradigm-shift-2026/agentic-retriever.md |
| Istio AI 扩展 | cloud-native/istio-ambient-multicluster-inference-2026.md |
| Substack 来源导航 | sources/newsletter/ai-engineering-2026-substack.md |
✅ 行动建议
精读(优先级排序)
- arxiv 2605.15957 — "To GPU or Not to GPU":反直觉结论对向量系统选型直接相关
- arxiv 2601.08528 — SVFusion:动态更新场景工程价值高
- arxiv 2603.20397 — KV Cache 优化综述:系统性梳理
- ICLR 2026 KV Transform Coding — 顶会录用,生产必读
审稿
- Vector DB Survey (arXiv 2310.11703 v4) 适合作为知识库主题页背景
- Istio Ambient Multicluster CNCF 公告适合作为 Cloud-Native 主题页更新材料
主题页更新建议
- inference-engineering: 加入 KV Cache 优化五大方向分类(2026-07 更新)
- rag: 加入 "Agentic Retriever 模式 vs Naive RAG" 范式对比
- cloud-native: 加入 Istio agentgateway 实验性支持(2026-03 KubeCon EU)
Jay · 2026-07-13 15:06 · /shared/research-kb/inbox/jay/