知识库草稿 · Jay · 2026-07-01 下午简报

主题

第三次检索 · 推理引擎深度更新 + 向量数据库 2026-05/06 动态 + arXiv KV Cache 新论文 + Cloud-Native LLM Serving + O'Reilly AI Agent Stack 2026 三层内存架构


一、推理引擎工程(高价值)

1. LMCache · 首个跨引擎跨查询 KV Cache 共享方案(⭐⭐⭐⭐⭐)

  • 来源:arXiv 2510.09665v2,vLLM + SGLang 原生集成
  • 核心问题:传统 LLM 推理将各引擎和查询独立处理,导致 GPU 内存中 KV Cache 无法跨请求复用;现有方案无法高效地跨引擎和跨查询共享 KV Cache
  • 解决方案:LMCache 提出标准化 KV Cache Connector 接口,解耦 KV Cache 管理和推理引擎后端:
  • 与 vLLM scheduler 集成:cache hit 时改变 prefilled token 数量,直接影响调度决策
  • 与 vLLM model runner 集成:在推理前后执行 KV Cache 的加载和存储
  • 支持跨引擎(vLLM ↔ SGLang)和跨查询的 KV Cache 共享
  • 支持 hierarchical storage(GPU → CPU → SSD)
  • 定位:企业级 KV Cache 基础设施层,是推理集群从"孤立 token 处理器"走向"分布式存储计算协同"的关键组件
  • 可信度:高(arXiv,已开源,生产就绪)
  • 工程价值:⭐⭐⭐⭐⭐ 极高。对多模型服务、推理成本优化、跨请求缓存复用有根本性影响
  • 后续行动:建议精读,核实与 vLLM 0.7 / SGLang 最新版本的集成细节

2. SwiftCache · 异构 KV Cache 共享,P99 TTFT 降低 69%(⭐⭐⭐⭐⭐)

  • 来源:arXiv 2606.16135
  • 核心问题:HBM 容量有限,长上下文推理时 KV Cache 必须 offload 到 CPU 内存或 SSD,reload 延迟成为瓶颈;同时多模型共享 GPU 时 KV Cache 利用率低
  • 解决方案:SwiftCache 两层优化: 1. 异构模型 GPU 内存共享:低 KV Cache 需求的模型将空闲 GPU 内存贡献给高需求模型的 prefix cache,通过 NVLink 跨模型共享,避免 PCIe 传输 2. 层级激活策略:仅在本地 GPU 内存中保留当前激活层的 KV Cache,减少 HBM 压力
  • 关键数据:P99 TTFT 降低 69%,最大上下文长度扩展 3.98 倍(vs vLLM / SGLang)
  • 可信度:arXiv 预印本,需核实实验设置
  • 工程价值:⭐⭐⭐⭐⭐ 极高。多租户推理场景直接受益
  • 后续行动:建议追踪正式发表或代码开源

3. KVServe · 服务感知 KV Cache 压缩(arXiv 2605.13734)

  • 来源:arXiv 2605.13734v1
  • 核心观点:将 KV Cache 压缩视为服务级优化问题,在 prefill/decode 两个阶段分别处理
  • 可信度:arXiv 预印本
  • 工程价值:⭐⭐⭐⭐ 高。KV Cache 压缩是 2026 推理工程的核心方向之一
  • 后续行动:建议与 LMCache、VeriCache 条目联合分析

4. VeriCache · 有损 KV Cache 的无损推理转化(arXiv 2605.17613)

  • 来源:arXiv 2605.17613v1
  • 核心问题:KV Cache 体积庞大(长上下文的主要瓶颈),有损压缩会损失推理质量
  • 核心方案:提出将有损 KV Cache 转化为无损推理结果的技术路径
  • 可信度:arXiv 预印本
  • 工程价值:⭐⭐⭐⭐ 高。与 KVServe、KV Cache Transform Coding(ICLR 2026)形成 KV Cache 压缩完整图景
  • 后续行动:建议对比 ICLR 2026 的 KV Cache Transform Coding(已有早期版本 2511.01815)

5. Online Scheduling for LLM Inference with KV Cache Constraints(⭐⭐⭐⭐)

  • 来源:arXiv 2502.07115v5
  • 核心内容
  • 理论建模:LLM 推理中 KV Cache 约束下的调度问题
  • 提出 batching + scheduling 算法,最小化推理延迟
  • 引入 hindsight optimal benchmark(整数规划,计算已知未来信息下的最优延迟)
  • 证明确定性在线算法在任意到达过程下无法达到常数竞争比
  • 提出多项式时间在线调度算法,在特定条件下可达常数竞争比
  • 可信度:高(理论证明扎实)
  • 工程价值:⭐⭐⭐⭐ 高。为 vLLM/SGLang 调度器提供理论指导框架
  • 后续行动:建议精读,关注与今日第 2 次检索中"LLM Serving 需要数学优化"条目的互补关系

6. Kareto · KV Cache 自适应多目标分层存储优化器(arXiv 2603.08739)

  • 来源:arXiv 2603.08739v1
  • 核心问题:GPU HBM 容量有限,需要将 KV Cache offload 到 CPU DRAM 和 Disk,但需要动态管理异构存储资源以平衡成本、吞吐量和延迟
  • 解决方案
  • 建模为多目标优化问题:在存储配置空间中寻找成本、吞吐量、延迟的 Pareto 前沿
  • 引入 Kareto:KV-cache Adaptive REsource managemenT Optimizer
  • eviction policy + KV block 访问模式的细粒度自适应调优
  • 支持 GPU HBM / CPU DRAM / Disk 三层动态配置
  • 可信度:arXiv 预印本
  • 工程价值:⭐⭐⭐⭐ 高。与 LMCache(跨引擎)和 Kareto(分层存储)构成 KV Cache 基础设施完整图景
  • 后续行动:建议核实与 LMCache 的功能边界(前者跨引擎共享,后者分层存储优化)

7. Tutti · SSD-Backed KV Cache 长上下文实用化方案(arXiv 2605.03375)

  • 来源:arXiv 2605.03375
  • 核心问题:长上下文下 KV Cache 体积远超 GPU 内存,prefix caching 必须借助外部存储
  • 方案:为 SSD-backed KV Cache 提供实用化设计
  • 可信度:arXiv 预印本
  • 工程价值:⭐⭐⭐⭐ 高。补充 Kareto(CPU DRAM 层)到 SSD 层的完整 offloading 路径

二、向量数据库 2026-05/06 重要动态

8. pgvector 0.8.2 CVE 安全补丁(⭐⭐⭐⭐⭐)🔴 立即行动

  • 来源RankSquire - Vector Database News May 2026
  • CVE 编号:CVE-2026-3172
  • 漏洞:cross-relation data exposure(跨关系数据泄露)
  • 影响:生产环境运行 PostgreSQL + pgvector 的团队需立即打补丁
  • 紧迫性:🔴 APPLY NOW — 安全漏洞在多租户场景下可能导致数据跨租户泄露
  • 工程价值:⭐⭐⭐⭐⭐ 所有使用 pgvector 的生产系统必须处理

9. Qdrant v1.18 · TurboQuant 量化引擎正式发布(⭐⭐⭐⭐)

  • 来源RankSquire May 2026
  • 新功能
  • TurboQuant 量化:新量化引擎,压缩率显著提升
  • 动态命名向量(Dynamic Named Vectors)
  • io_uring 优化:Linux 异步 I/O 优化,降低 I/O 开销
  • v1.18.1 minor:多向量支持
  • 选型优势
  • 1M vectors:~850 QPS,p95 延迟 ~8ms(官方 benchmark)
  • 过滤查询(HNSW + payload index 联合遍历):Qdrant 实现优于 Milvus 默认 post-filter
  • Binary quantization 支持:向量压缩 32 倍(vs float32)
  • 可信度:高(具体版本号和发布日期)
  • 工程价值:⭐⭐⭐⭐ 高。TurboQuant 对大规模 RAG 生产部署有直接成本影响

10. Milvus v3.0.0-beta · 零拷贝数据湖查询(⭐⭐⭐⭐)

  • 来源RankSquire May 2026
  • 核心功能:支持零拷贝查询外部数据湖数据,无需数据迁移
  • v2.6.16 GA:需注意 DELETE WORKLOADS 行为变更
  • 定位:数十亿级向量场景 + 需要与数据湖集成的团队
  • 可信度:高(具体版本号)
  • 工程价值:⭐⭐⭐⭐ 高。数据湖集成能力是 2026 企业 RAG 架构的关键需求

11. pgvectorscale 2026 性能数据(⭐⭐⭐⭐⭐)

  • 来源Tiger Data / Firecrawl benchmark
  • 关键数据
  • 50M vectors:471 QPS @ 99% recall
  • 比 Qdrant 快 11.4 倍,与 Pinecone 持平
  • p95 延迟比 Pinecone s1 低 28 倍(@ 99% recall)
  • 技术路径:DiskANN + Statistical Binary Quantization,向量存磁盘,高召回率保持
  • 工程价值:⭐⭐⭐⭐⭐ 极高。彻底改变"pgvector 只适合小规模"的认知,10M+ vectors 场景现在有 PostgreSQL 原生方案
  • 建议写入路径vector-db-benchmark-2026 主题页数据点更新

三、Cloud-Native LLM Serving(高价值)

12. Red Hat + DeepLearning.AI · vLLM 免费课程(2026-06-03)⭐⭐⭐⭐

  • 来源Red Hat Developers Blog + YouTube DeepLearning.AI
  • 发布:2026-06-03,Red Hat 与 DeepLearning.AI 合作
  • 讲师:Cedric Clyburn(Red Hat Senior Developer Advocate)+ Sergey Kliger
  • 核心内容
  • vLLM PagedAttention + continuous batching 实战
  • KV Cache 原理及管理
  • Prefix caching 实战(metrics endpoint 实时观测 cache hits)
  • 并发请求模拟 + 延迟/吞吐量 benchmark
  • VLM(视觉语言模型)服务
  • 亮点:完全免费,有实测演示(paged attention 和 prefix caching live 观测)
  • 工程价值:⭐⭐⭐⭐ 高。适合团队内部培训;prefix caching 在多请求共享系统 prompt 场景(客服、知识库 RAG)有直接收益
  • 链接https://developers.redhat.com/blog/2026/06/03/learn-optimize-deploy-and-benchmark-llms-vllm-new-free-course

13. llm-d · Red Hat KServe 集成生产级推理(2026-04-21)⭐⭐⭐⭐

  • 来源llm-d.ai Blog
  • 核心内容
  • llm-d v0.7:生产级硬化版本
  • 生产级 LLM 推理架构:KServe + llm-d + vLLM 三层集成
  • Native KV Cache Offloading to Any Filesystem:KV Cache offload 到任意文件系统
  • Predicted-Latency Based Scheduling:基于预测延迟的调度算法
  • 异构 GPU 供应商支持:NVIDIA / AMD / 其他
  • v0.7 关键改进:从功能原语到生产硬化的完整转变
  • 可信度:高(Red Hat + Tesla 工程团队背书)
  • 工程价值:⭐⭐⭐⭐ 高。企业级 KServe 用户值得评估,异构 GPU 支持对国内昇腾等国产芯片有参考价值
  • 链接https://llm-d.ai/blog

四、Substack / 技术博客高价值条目

14. O'Reilly Radar · The AI Agents Stack (2026 Edition) · 三层内存架构(⭐⭐⭐⭐⭐)

  • 来源O'Reilly + Addy Osmani · Loop Engineering Jun 22, 2026
  • 发布时间:2026-06
  • 可信度:⭐⭐⭐⭐ 高(Addy Osmani,Google Chrome 负责人,AI 工程领域权威)
  • 核心洞察——三层内存架构(2024 年只有一层"向量数据库+RAG",2026 年已是独立三层):
  • L1 记忆(Memory):代理自身跨步骤/会话/用户的持久状态,而非外部知识
    • Mem0(AI 应用内存层,GitHub stars 和包下载量强劲)
    • Letta(MemGPT 继承者,UC Berkeley Sky Computing Lab)
    • Zep(时序知识图谱引擎,追踪事实有效时间窗口和过期状态)
    • LangGraph Checkpointing + Custom Stores
  • L2 上下文窗口(Context Window):上下文工程取代提示工程成为核心学科
    • Gemini 1M+ token,Claude 200K
    • Memory blocks:命名结构化字段,代理可在每轮读写和覆盖自身状态
  • L3 睡眠时计算(Sleep-time Compute):代理在空闲时间处理信息(研究阶段)
  • 核心观点:"大多数团队把 memory 做过头了。先从 Postgres 中的对话历史加结构化 system prompt 开始。只有当历史超过上下文限制时才加向量搜索。只有当代理需要跨会话学习时才加 agentic memory 管理。"
  • 补充观点
  • pgvector 成为不需要专用向量数据库团队的默认选择
  • GraphRAG 成为第二检索选项(Neo4j 领先)
  • Context engineering 是 2026 核心工程学科
  • 工程价值:⭐⭐⭐⭐⭐ 极高。O'Reilly 级别综述,三层内存框架是理解 2026 Agent 架构的核心模型
  • 后续行动:建议审稿入库,适合作为 AI Agent 架构主题页的 2026 年重大更新

15. The AI Evaluation Substack · 2026 June Digest(⭐⭐⭐⭐)

  • 来源AI Evaluation Substack,2026-06-26
  • 可信度:⭐⭐⭐⭐(专业 AI 评估 newsletter)
  • 核心条目
  • ResearchClawBench:40 个任务横跨 10 个科学领域,基于真实隐藏论文,评估 Agent 端到端自主研究能力
    • 7 个自主 Agent × 17 个原生 LLM 的评测结果:当前系统在科学综合方面远未达到可靠
    • 现代 AI 能使用工具并生成精致报告,但在实验协议、证据匹配和科学核心识别上持续失败
  • 2026 评估核心挑战:组织日益昂贵和复杂的 Agentic 评估以实现复用的主要挑战仍未解决
  • 关键教训:评估编排是基础设施问题,而非模型问题
  • 工程价值:⭐⭐⭐⭐ 高。ResearchClawBench 是 Agent 科学研究能力评估的新基准,对构建 Agentic RAG 评估体系有参考价值
  • 链接https://aievaluation.substack.com/p/2026-june-ai-evaluation-digest

16. RAG 2026 Survey · Agentic RAG 全景综述(arXiv 2501.09136v4,2026-04)⭐⭐⭐⭐

  • 来源arXiv 2501.09136v4,cs.AI,2026-04-01
  • 可信度:arXiv 学术综述,覆盖 Agentic RAG 全景
  • 核心章节
  • Agent 协调、控制与涌现行为
  • 超越输出质量的评估方法论
  • 记忆管理与长期适应
  • 计算成本、效率与可持续性
  • 自主 RAG 系统的安全、信任与治理
  • 跨领域泛化
  • 工程价值:⭐⭐⭐⭐ 高。可作为知识库 Agentic RAG 主题页的结构性参考
  • 后续行动:建议精读§12开放研究问题章节

五、CSDN 高价值条目

17. CSDN · vLLM vs SGLang vs llama.cpp vs MLX vs Ollama 2026 五强对比(🟡 中等)

  • 来源:CSDN / YouTube 视频,2026-06
  • 内容:2026 年本地大模型推理框架五强深度对比视频
  • 评价:CSDN 内容质量参差,该条目属于汇总类,无实测数据,建议参考上方 DeployBase / Spheron / Yotta Labs 的实测数据

六、安全条目(⭐⭐⭐⭐⭐)🔴

18. arXiv 2606.02643 · RAG 推理成本攻击(Inference Cost Attacks for RAG)⭐⭐⭐⭐⭐

  • 来源arXiv 2606.02643,cs.CR / cs.AI / cs.DB
  • 发表:ACM Web Conference 2026 (WWW '26),2026-04-13~17,Dubai
  • 核心问题:RAG 系统面临新型攻击——攻击者通过操控检索结果或查询模式,迫使受害 RAG 系统执行远超必要的高成本推理
  • 可信度:⭐⭐⭐⭐⭐ 极高。ACM WWW 2026 录用论文,属于新兴安全研究方向
  • 工程价值:⭐⭐⭐⭐⭐ 极高。RAG 安全评估必须覆盖推理成本攻击
  • 后续行动:建议精读原论文,关注攻击向量描述和防御建议

七、分类标签

#LLM-Serving #推理引擎 #KV-Cache #LMCache #SwiftCache #KVServe #VeriCache #Kareto #Tutti #vLLM #SGLang #向量数据库 #pgvector #pgvectorscale #Qdrant #Milvus #CVE-2026-3172 #安全 #RAG-攻击 #Inference-Cost-Attack #Cloud-Native #KServe #llm-d #Red-Hat #O'Reilly #AI-Agent #三层内存架构 #Mem0 #Letta #Zep #Agentic-RAG #评估 #ResearchClawBench #arxiv


八、建议写入路径

  • 本次写入/shared/research-kb/inbox/jay/2026-07-01-1505-evening-briefing-inference-vecdb-k8s-arxiv-jul2026.md

九、后续行动建议

优先级 行动 理由
🔴 精读 arXiv 2606.02643 RAG 推理成本攻击(WWW 2026) ACM WWW 2026 录用,安全必读
🔴 精读 LMCache(2510.09665) 跨引擎 KV Cache 基础设施,2026 推理工程重大突破
🔴 精读 O'Reilly AI Agents Stack 2026 三层内存架构 Addy Osmani,权威综述,AI Agent 架构必读
🔴 行动 pgvector 0.8.2 CVE-2026-3172 补丁 生产系统立即处理,安全漏洞
🟡 追踪 SwiftCache P99 TTFT -69% 数据核实 跨模型 KV Cache 共享,3.98x 上下文扩展
🟡 精读 ResearchClawBench(AI Evaluation Jun Digest) Agent 科学研究能力评估新基准
🟡 核实 Qdrant v1.18 TurboQuant 量化数据 生产选型参考
🟡 核实 pgvectorscale 471 QPS benchmark(50M vectors) 向量数据库选型重大更新数据点
🟡 精读 Agentic RAG Survey §12 开放研究问题 知识库 Agentic RAG 主题页结构参考
🟡 评估 llm-d v0.7 KServe 集成生产评估 企业级 KServe 用户参考

Jay · 2026-07-01 15:05 CST · /shared/research-kb/inbox/jay/2026-07-01-1505-evening-briefing-inference-vecdb-k8s-arxiv-jul2026.md