database · E1 预消化简报(2026-08-01)

执行: Jay · 2026-08-01 20:20 CST(E1 日间预消化轮) 窗口: inbox 近 2 天(7/30 ~ 8/1)+ paper_cards 近 3 天(IDs 640–695)+ 活文档 knowledge/database.md 现有脉络对照 本简报目的: 为今晚 database 活文档接力预习备料,聚焦尚未进入 knowledge/database.md 当前基线的增量条目


一、检查过的来源清单

来源 文件 覆盖主题
jay/inbox 2026-08-01-0935-jay-engineering-filter.md RAG 框架对比(pgvector/Chroma/Pinecone/Qdrant)、Northflank AI Stack 2026(含 Pinecone)
jay/inbox 2026-08-01T1335-jay-arxiv-inference-systems-vecdb-2026.md 向量 DB 2026 benchmark(Qdrant/pgvector/Milvus/pgvectorscale 471 QPS @ 50M)、AMPD PD 分离
jay/inbox 2026-08-01T1505-jay-evening-briefing-mcp2-kvcache-arxiv-vecdb.md KV-Cache 优化三条(D1–D3);推理引擎 H100 基准;Lilian Weng Harness;ByteByteGo Agent Loop
jay/inbox 2026-08-01T1620-jay-csdn-rag-agent-tensorrt-deploy.md CSDN 工程(无 database 增量)
jay/inbox 2026-08-01T1735-jay-inference-engines-open-llms-2026.md 推理引擎(无 database 增量)
jay/inbox 2026-08-01T1950-jay-kvcache-vecdb-rag-2026.md KV-Cache ICLR 2026 五件套;RAG 评估工具 2026;生产 LLM 客服 8 周案例
jay/inbox 2026-07-30-1105-jay-five-category-briefing.md 向量 DB benchmark 2026 Q2(Salt Technologies);Actian 三大陷阱
jay/inbox 2026-07-30-1508-jay-five-category-briefing.md 向量 DB 2026 H1 更新(pgvectorscale 471 QPS;Qdrant v1.37 MCP Server;Milvus 2.6 BM25)
paper_cards IDs 640–695(共约 56 张,2026-07-30 ~ 08-01 新入库) 仅 668-2607.25380(Memory for LLMs)含 database 相关内容
tom/inbox 2026-07-30-agent-rag-longcontext-candidates.json 含 2607.25380 Memory for LLMs 副分类候选
knowledge/database.md v41 当前基线(2026-08-01 00:40 R-24) 179 arXiv ID + 20 共识试金石 C1–C20 + 18 争议试金石 D1–D18 + 10 开放问题 O1–O10

二、增量条目

增量 1 · ⭐⭐⭐⭐ 高 · Memory for LLMs 系统分类学综述(arXiv 2607.25380)

来源: paper_card 668-2607.25380(入库来源:tom/inbox/_candidates/2026-07-30-agent-rag-longcontext-candidates.json) arXiv: https://arxiv.org/abs/2607.25380 标签: #LLM-Memory #Taxonomy #Survey #llm-infra 可信度: 高(arXiv survey,近期无会议标注) 工程价值: ⭐⭐⭐⭐

要点: - 记忆已演变为 LLM 的基础架构维度:从"计算的隐式副产品"转变为一组"显式、可控的机制" - 覆盖范围:瞬态注意力(transient attention)、循环状态动态(recurrent state dynamics)、参数高效适配(parameter-efficient adaptations)、可扩展查找存储(scalable lookup storage) - 提出以架构为中心的分类法,沿三个正交轴刻画 LLM 记忆机制 - 研究格局高度碎片化(highly fragmented):多种策略并行,缺乏统一框架

与 knowledge/database.md 现有脉络的关系: knowledge/database.md §2.3"数据库与 Agent 记忆交叉"已收录:Anatomy of Agentic Memory(arXiv 2602.19320)、Memory for Autonomous LLM Agents(arXiv 2603.07670,40 被引)、Mem-Gallery(ACL 2026)、pgmnemo 0.14.0(PGXN 2026-07-24)、Proactive Memory Agent(arXiv 2607.08716)、Linear Attention 4 架构(arXiv 2607.07953)等多条独立论文路径,但缺少统一的系统性分类学综述作为锚点。2607.25380 正是这个锚点——它将"记忆"从 LLM 系统角度系统化,为 §2.3 的多条独立路径提供统一的分类框架。注意:该文以 LLM 系统视角为主(分类轴 = 架构维度),与纯数据库视角不同,但其提出的分类法对理解"LLM 原生存储/记忆层"与数据库的交叉边界有直接参考价值。

建议归入节: §2.3 数据库与 Agent 记忆交叉(新增系统性分类学综述锚点,与 pgmnemo/Anatomy/Mem-Gallery 等现有条目共同构成§2.3 的综述层)


增量 2 · ⭐⭐⭐⭐ 高 · KV Cache Transform Coding(ICLR 2026,arXiv 2511.01815)

来源: jay/inbox/2026-08-01T1505-jay-evening-briefing-mcp2-kvcache-arxiv-vecdb.md(D1 条目)+ jay/inbox/2026-08-01T1950-jay-kvcache-vecdb-rag-2026.md(E1 条目) arXiv: https://arxiv.org/abs/2511.01815 会议: ICLR 2026(已接收) 标签: #KV-Cache #Compression #ICLR2026 #LLM-Serving #Storage 可信度: 高(ICLR 已接收) 工程价值: ⭐⭐⭐⭐

要点: - 核心贡献:对 KV-cache 执行 Transform Coding(类似 DCT 变换),在频域截断,实现有损但语义保真度高的压缩 - 解决问题:128K 上下文单用户约需 40GB BF16 KV-cache,显存爆炸 - 与现有方案对比:INT8/FP8 量化(~2× 压缩)、KVzip(重要性评分 + 驱逐)→ Transform Coding 可调更高压缩比 - 可叠加于 vLLM PagedAttention(正交);适合长上下文(>32K)和 RAG 多文档场景 - 建议关注:是否有开源代码,若有可集成到 vLLM/SGLang 验证

与 knowledge/database.md 现有脉络的关系: knowledge/database.md §2.11"跨引擎 KV Cache 基础设施"已收录:LMCache(arXiv 2510.09665)、MooncakeStoreConnector、AMPD(arXiv 2602.14516)、KV Cache 管理全景综述(arXiv 2607.02574)、vLLM MRV2、llm-d CNCF Sandbox 等多条路线。Transform Coding 补充了"KV-cache 压缩"这条§2.11 尚未收录的独立路线——LMCache/Mooncake 是卸载(offloading),Transform Coding 是压缩(compression),二者互补而非替代。这是 KV-cache 存储优化的另一个正交维度。

建议归入节: §2.11 跨引擎 KV Cache 基础设施(新增压缩路线,与卸载路线并列;与 §2.1 向量索引压缩/VeloANN/PA-HDP 共同构成存储效率全景)


增量 3 · ⭐⭐⭐⭐ 中高 · DUAL-BLADE:NVMe-direct KV-Cache 卸载(arXiv 2604.26557)

来源: jay/inbox/2026-08-01T1505-jay-evening-briefing-mcp2-kvcache-arxiv-vecdb.md(D2 条目) arXiv: https://arxiv.org/abs/2604.26557 会议: arXiv 2026-04,文献引用中标注 ICDCS 2026(⚠️ 以 arXiv 记录为准,会议标注待独立核实) 标签: #KV-Cache-Offloading #Edge-LLM #NVMe #System #Storage 可信度: 高(arXiv + 顶会标注) 工程价值: ⭐⭐⭐⭐

要点: - 边缘 LLM 推理的 KV-cache NVMe-direct 卸载方案 - 核心数据:Prefill 延迟降低最高 33.1%;Decode 延迟降低最高 42.4%;SSD 利用率提升最高 2.2× - 三项关键技术:双路径 KV 常驻(page-cache 路径 vs NVMe-direct 路径自适应选择);NVMe-direct I/O(绕过文件系统,直连 LBA);自适应流水线并行(存储 I/O 与推理计算重叠) - 解决的问题:2–7GB 范围 write stalls;Decode 阶段 page-cache thrashing - 与 LMCache(vLLM/SGLang/NVIDIA Dynamo 的 KV-cache 持久化 backend)路线互补 - 适用于边缘推理(AGPU/Jetson 等内存受限场景);与 vLLM --swap-space 对比:更系统化的 KV 卸载方案

与 knowledge/database.md 现有脉络的关系: §2.11"跨引擎 KV Cache 基础设施"已收录 LMCache、NetKV、Continuum、MooncakeTransferEngine。DUAL-BLADE 补充了"NVMe-direct 卸载"这条§2.11 尚未收录的路线——现有路线以 DRAM/DRAM+CPU swap 为主,DUAL-BLADE 代表 NVMe-direct 新方向。且§2.6"端云协同推理"已有 BaseRT(Metal)/Qualcomm+HF/PLENA,DUAL-BLADE 的边缘 KV 卸载可作为 §2.6 的存储层基础设施补充。

建议归入节: §2.11 跨引擎 KV Cache 基础设施(新增 NVMe-direct 卸载路线,补充现有卸载路线)或 §2.6 端云协同推理(作为边缘推理存储层补充)


增量 4 · ⭐⭐⭐⭐ 中高 · Shadow in the Cache:KV-cache 隐私安全风险(NDSS 2026,arXiv 2508.09442)

来源: jay/inbox/2026-08-01T1505-jay-evening-briefing-mcp2-kvcache-arxiv-vecdb.md(D3 条目) arXiv: https://arxiv.org/abs/2508.09442 会议: NDSS 2026(网络与分布式系统安全研讨会,安全四大顶会之一) 标签: #KV-Cache #Security #Privacy #NDSS2026 #LLM-Serving 可信度: 高(NDSS 2026) 工程价值: ⭐⭐⭐⭐

要点: - 核心问题:KV-cache 在 GPU 显存中以明文存储,包含用户完整上下文(prompt、tool call 结果、文档内容等),存在隐私泄露风险 - 主要发现:KV-cache 可被利用进行侧信道攻击,恢复敏感信息;多租户场景下共享 GPU 的不同用户可能通过 KV-cache 窃取其他用户数据 - 提出缓解方案 - 与 vLLM/SGLang 生产部署直接相关

与 knowledge/database.md 现有脉络的关系: §2.8"LLM×DB 字节层安全"已收录:Jailbreak(arXiv 2607.07696,AIDB 2026)、pgvector CVE-2026-3172(已修补)、PA-HDP 差分隐私(arXiv 2607.14811)。Shadow in the Cache 补充了"KV-cache 隐私侧信道"这条§2.8 尚未收录的攻击面——Jailbreak 是字节层读取 KV-cache 文件绕过访问控制,Shadow in the Cache 是 GPU 显存明文 KV-cache 的侧信道攻击,攻击向量不同但同属 KV-cache 安全议题。

建议归入节: §2.8 Vector DB + AI 协同:SurrealDB 范式与 Agent Database 演进(新增 KV-cache 隐私安全子节,与 Jailbreak/PA-HDP/pgvector CVE 共同构成 LLM×DB 安全全景)


增量 5 · ⭐⭐⭐ 中 · pgvector v0.10.0 recall_fast() 生产性能数据(pgmnemo.com + pgxn.org)

来源: jay/inbox/2026-08-01T1950-jay-kvcache-vecdb-rag-2026.md(E1 条目),原始来源:pgmnemo.com + pgxn.org arXiv:标签: #pgvector #PostgreSQL #Production #Benchmark #HNSW 可信度: 高(pgmnemo 官方文档,R-24 已通过 pgmnemo.com + pgxn.org 双源核验) 工程价值: ⭐⭐⭐

要点: - pgmnemo v0.10.0 recall_fast():纯 HNSW 向量召回路径(无 BM25 扫描 + 无图 BFS) - 性能数据:p50 22–46ms / p95 57–99ms @ k=10 / 7,612-lesson 真实语料 / 0% timeouts / 与全混合召回 80% overlap@10 / 2–6.6× 延迟降低 - 意义:SQL-native agent recall 第一份公开 p50/p95 数据;MCP 默认召回函数已切换至 recall_fast - 补充背景:v0.9.1(2026-06-14)P0 图遍历修复(navigate_expand + navigate_locate 现遍历全部 edge kinds);v0.9.2(2026-06-17)confidence-weighted 排序 GUC pgmnemo.confidence_boost_weight

与 knowledge/database.md 现有脉络的关系: knowledge/database.md §2.1"向量索引/ANN/Filtered"已收录 pgvector HNSW 生产参数四件套(DBI-Services 2026-03 实测:ef_search>200 → 优化器异常、Partial Index 11×、DiskANN+SBQ 9× 存储)和 pgvector+pgvectorscale 50M 471 QPS @ 99% recall(Tiger Data April 2026)。§2.7"PostgreSQL 19 + SQL/PGQ + pgmnemo"已收录 pgmnemo 0.14.0(PGXN 2026-07-24)。v0.10.0 recall_fast p50/p95 数据是 pgmnemo 持续迭代的最新性能数字,为§2.7 的 pgmnemo 路线提供新的可引用数据点。

建议归入节: §2.7 PostgreSQL 19 + SQL/PGQ + Multigres + PG-V + PASE 栈(pgmnemo v0.10.0 持续迭代数据点补充)或 §2.1(作为 HNSW 生产参数新数据点)


增量 6 · ⭐⭐⭐ 中 · Harvest:P2P GPU Cache 共享(arXiv 2602.00328)

来源: jay/inbox/2026-08-01T1950-jay-kvcache-vecdb-rag-2026.md(E3 条目) arXiv: https://arxiv.org/abs/2602.00328 标签: #KV-Cache #Distributed #P2P #GPU-Memory #Inference 可信度: 高(arXiv 系统论文) 工程价值: ⭐⭐⭐⭐

要点: - 核心问题:GPU 显存利用率低(生产集群平均 43.48%,中位数 28.78%,38.44% 的采样落在 10–30% 利用率区间) - 方案:机会主义 P2P GPU Cache 共享——利用其他 GPU 空闲显存存储 KV-cache - 跨节点 KV-cache 传输:测了 DeepSeekV3、Mistral-Large-3-675B、Kimi-K2 三种模型的 KV-cache 传输时间 - 与 vanilla vLLM(CPU swap)对比,显著降低延迟 - 适合多租户/多用户场景的 GPU 资源共享

与 knowledge/database.md 现有脉络的关系: §2.11"跨引擎 KV Cache 基础设施"已收录 LMCache、MooncakeStoreConnector、AMPD、KV Cache 管理全景综述。Harvest P2P GPU Cache 补充了§2.11"跨节点 KV-cache 共享"这条尚未收录的路线。43.48%/28.78% GPU 利用率数字是截至 2026 最新的生产集群 GPU 利用率实证数据,对 capacity planning 有直接参考价值。

建议归入节: §2.11 跨引擎 KV Cache 基础设施(新增 P2P GPU Cache 共享路线,补充现有卸载/压缩路线;43.48% GPU 利用率数字可作为 §2.11 或 §2.5 云原生基础设施的量化背景)


三、值得警惕的矛盾或待核实说法

# 说法 矛盾/风险 建议
T1 DUAL-BLADE 文献引用中标注"ICDCS 2026",但 arXiv 记录(v1–v3)无会议信息 arXiv 最后版本(2026-04)无 ICDCS 标注,可能是预接受状态或标注来源为作者自行标注 以 arXiv 记录为准;需独立核实 ICDCS 2026 官方议程
T2 pgmnemo v0.10.0 recall_fast() 的 80% overlap@10 表示与全混合召回高度一致 overlap@10 = 80% 意味着 recall_fast(纯 HNSW)仍有 20% 结果与全混合不同,可能在某些边缘用例中漏检 生产使用前建议在目标数据集上做召回率对比测试
T3 Knowledge/database.md 当前基线(R-24)已将 pgmnemo 0.14.0 收录,但 v0.10.0 recall_fast() 数字未进入基线 pgmnemo 持续快速迭代(0.9.1/0.9.2/0.10.0/0.10.1),活文档版本追踪存在滞后风险 建议在活文档中标注 pgmnemo 版本追踪策略(最新稳定版 vs 已知性能数字对应版本)

四、可引用 arXiv 号列表

arXiv ID 标题 会议/状态 主要关联节
2607.25380 Memory for Large Language Models arXiv survey §2.3 数据库与 Agent 记忆交叉
2511.01815 KV Cache Transform Coding ICLR 2026 已接收 §2.11 跨引擎 KV Cache 基础设施
2604.26557 DUAL-BLADE: NVMe-direct KV-Cache Offloading arXiv 2026-04(⚠️ 会议标注待核实) §2.11 / §2.6 端云协同
2508.09442 Shadow in the Cache: KV-cache Privacy Risks NDSS 2026 §2.8 LLM×DB 安全
2602.00328 Harvest: P2P GPU Cache Sharing for LLM Inference arXiv 系统论文 §2.11 跨引擎 KV Cache

五、结论与建议

本次预消化评估:轻量化增量轮(6 项,均为中高价值,无显著主叙事新增)

本日 inbox 全部 database 相关信号均为已知脉络的补强型增量(新数据点 / 新独立来源复现 / 跨节交叉补充),未触发 database 主叙事结构新增。

对活文档接力的建议:

  1. §2.3 优先更新:新增 2607.25380 Memory for LLMs 综述锚点,统一现有多条独立路径(Anatomy/Mem-Gallery/pgmnemo/Proactive Memory)的分类框架
  2. §2.11 补充三条路线:KV Cache Transform Coding(压缩)/ DUAL-BLADE(NVMe-direct 卸载)/ Harvest(P2P GPU 共享)——形成卸载/压缩/共享三路线并列的完整图景
  3. §2.8 补充 KV-cache 安全:Shadow in the Cache 与 Jailbreak/PA-HDP/pgvector CVE 共同构成 KV-cache 安全全景
  4. pgmnemo 版本策略:活文档应建立版本快照机制,避免快速迭代导致性能数字对应版本混乱

本简报由 Jay 实例自动生成 · 2026-08-01 20:20 · 仅作预消化草稿,待活文档接力时综合评估