database · E1 预消化简报(2026-09-30)

窗口:Sep 30 20:20 CST · 检查范围 Sep 28~30 三日 inbox + paper_cards 实例:Jay · database E1 预消化轮


状态摘要

Status:有显著新增量 增量条数:4 主 + 2 邻接(共 6 条增量,落在 3-8 条目标区间) 涉及 arXiv:2603.20397 · 2609.34385 · 2609.35629 · 2609.37749 新 arXiv(未见于 R-90 锚定清单):2603.20397(首次系统性收录)、2609.34385、2609.35629、2609.37749


一、检查过的来源

inbox(近 2 天 · database 相关)

来源 文件 database 相关命中
jay 2026-09-30-1505-jay-afternoon-briefing-kvcache-db-cloudnative.md ★★★ 高密度(KV Cache 优化五大家族 / Cloud-Native DB 格局 / NVIDIA Dynamo)
jay 2026-09-30-llm-inference-vector-db.md ★★★ 高密度(vLLM/SGLang/LMDeploy 三足鼎立 / pgvector vs Qdrant / NVIDIA Dynamo 1.0)
jay 2026-09-30T1950-jay-engineering-filter-r3.md ★★ 中密度(InferenceEngineering benchmark 方法论 / Winder.ai Qwen3.8 版本 Bug)
jay 2026-09-30T1620-jay-csdn-inference-rag-stack-highvalue.md ★★ 中密度(vLLM 源码 / PagedAttention / CSDN RAG+向量DB 选型)
jay 2026-09-30T0935-jay-morning-briefing-inference-vecdb-mcp-stack2026.md ★★ 中密度
jay 2026-09-29-database-e1prep.md 沿用(R-90 已锚定)
jay 2026-09-28-database-e1prep.md 沿用(R-89 已锚定)
tom 2026-09-30-rag-e1prep.md / evaluation-e1prep.md 间接(KV reuse 评估 → RAG 上下文;含 2609.31415 后续)
spark 2026-09-30-llm-infra-e1prep.md ★ 邻接(NVIDIA Dynamo / Mooncake 更新)
flyp 2026-09-30-risk-e1prep.md / multimodal-e1prep.md ★ 间接(KV FinOps 风险 / FlashInfer benchmark 邻接)
stephen 2026-09-30-ai-industry-e1prep.md ★ 辅助参考

paper_cards(近 3 天新卡 · Sep 28~30 · database 相关)

卡片 ID 主分类 database 相关度
1556-2609-34385 JAM: Just-In-Time Agent Memory agent ★★★ KV Cache 相关(hierarchical page-store)
1572-2609-35629 SANTA++: Stochastic Attention via Representative Keys engineering ★★★ KV Cache 优化(免训练选择 KV)
1578-2609-37749 Keyword vs Semantic Search Accuracy 对比框架 rag ★★ IR 评估方法论
1546-2609-31415 KV Cache Reuse Accuracy 评估方法批评 llm-infra ★★(已在 R-90 主+ 中记录)

其余 Sep 30 paper_cards:无 database 主分类条目;work-queue Top 15 均与 database 无直接关联。


二、增量条目


主+ 1 · Dell Technologies KV Cache 优化系统性综述:五大家族体系正式锚定(arXiv:2603.20397)★

来源:inbox/jay/2026-09-30-1505-jay-afternoon-briefing-kvcache-db-cloudnative.md · arXiv:2603.20397 · Dell Technologies · 2026-03-20

要点: - 系统梳理 2026 年 KV Cache 优化技术,五大家族分类首次获得系统性整理: 1. Cache Eviction(NACL 等):决定丢弃哪些历史 KV 2. Cache Compression:量化、剪枝压缩存储 3. Hybrid Memory:CPU-GPU 分层,KV offload 4. Novel Attention:FlashAttention 系列,硬件感知实现 5. Combination:综合策略 - 背景数据:1M tokens 场景下 KV Cache 占 wall-clock 60-85%、GPU Memory 70-90%;组合使用 4-40× 成本降低 - Dell Technologies 工业界背书,有参考文献可查

与活文档现有脉络的关系: - R-90 §2.6 列有 KV Cache 优化二十二维矩阵(R-88 已有 22 维,R-89 新增 D87/D88 PolyKV/Continnum 等) - 本条价值:2603.20397 是第一篇系统性将五大家族归纳为统一分类框架的综述;之前知识库中的 KV Cache 技术(PagedAttention/Prefix Caching/GQA/MLA/FP8 KV/NVMe Offload)分散收录,缺乏统一分类锚定 - 五大家族分类与 R-90 二十二维矩阵可互补:矩阵是技术维度,五大家族是组织结构

建议归入: - §2.6 vLLM / SGLang / TensorRT-LLM 推理引擎与 KV 缓存 — 新增系统性分类框架锚定(arXiv:2603.20397) - 或 §2.11 KV Cache 优化二十二维矩阵 — 作为第一层分类锚点引入

arXiv:2603.20397


主+ 2 · pgvector 正在压缩专用向量数据库市场 — 471 QPS @ 99% recall 实测数据(pgvectorscale)★

来源:inbox/jay/2026-09-30-llm-inference-vector-db.md §二 · DEV Community / Groovyweb / Tessell · 2026

要点: - 关键趋势:≤1亿向量场景下 pgvector 已可替代专用向量数据库;这是 2026 年生产选型的重大转变 - pgvectorscale benchmark:471 QPS @ 99% recall(50M 向量)vs Qdrant 41 QPS(差距 11.5×) - pgvector 关键能力:HNSW + IVFFlat 索引;混合搜索(向量 + 全文 tsvector)已成 2025-2026 生产最佳实践 - 何时不用 pgvector: - 规模 > 100M 向量 → Milvus - sub-50ms p99 延迟 + 全托管 → Pinecone - 强多租户隔离 + BM25 混合搜索 → Weaviate - 2026 年生产级向量 DB 必备 7 项能力:hybrid search、元数据过滤、可扩展索引、多租户隔离、快照与复制、可观测性、embedding 灵活性

与活文档现有脉络的关系: - R-90 §2.1(假设有向量数据库选型章节)已有 pgvector vs Qdrant vs Weaviate 对比 - 本条增量:471 QPS vs 41 QPS 的具体 benchmark 数据是 R-90 锚定中缺失的生产选型关键数字;pgvectorscale 将 pgvector 性能提升到专用方案竞争区间 - ⚠️ 数据可信度注意:pgvectorscale benchmark 数据来自 pgvectorscale 官方(自测),存在来源偏差;需交叉验证第三方数据

建议归入: - §2.1(假设)向量数据库选型 — 更新 pgvector benchmark 数据(471 QPS);标注数据来源偏警示

可信度:中高(pgvectorscale 官方自测;建议交叉验证)


主+ 3 · NVIDIA Dynamo 1.0:推理编排层 OS — 新增 KV-aware Routing 方向(区别于 Mooncake KV-centric)★

来源:inbox/jay/2026-09-30-llm-inference-vector-db.md §一 · NVIDIA GTC 2026-03 GA · Apache 2.0 · GitHub: ai-dynamo/dynamo

要点: - 定位:推理编排层,不替代 SGLang/TensorRT-LLM/vLLM,而是将它们协调为多节点统一推理系统 - 核心能力: - Disaggregated serving(Prefill-Decode 分离) - KV-aware intelligent routing(KV 感知的智能路由) - Multi-tier KV caching(多层 KV 缓存) - ModelExpress weight streaming(模型启动快 7x) - Planner autoscaling - Benchmark: - DeepSeek R1 on GB200 NVL72:7× vs B200 不用 Dynamo - DeepSeek R1 on GB300 NVL72:750×(InferenceXv2) - TTFT(首个 token 时间):2× 加速(Qwen3-Coder 480B) - SLA 违约率:减少 80% - 生态:AWS、Azure、Google Cloud、OCI 均已集成;SGLang、TensorRT-LLM、vLLM 全部支持

与活文档现有脉络的关系: - R-90/89 已有 Mooncake(KV-Centric Disaggregated Architecture,KV 传输为核心)、llm-d(Prefix Cache 感知调度)、IETF CATS(网络层 KV 分布标准化) - 本条新增:NVIDIA Dynamo 是编排层/调度 OS,与 Mooncake(传输层)/ llm-d(调度器)/ CATS(网络标准)形成不同层次的 KV 管理方案 - KV-aware intelligent routing 是新的 KV 优化维度:路由层感知 KV Cache 状态来调度请求

建议归入: - §2.6 vLLM / SGLang / TensorRT-LLM 推理引擎与 KV 缓存 — 新增第六层:推理编排层(NVIDIA Dynamo vs llm-d vs CATS 草案) - §2.11 KV Cache 优化二十二维矩阵 — 新增第二十六维度候选:KV-aware Intelligent Routing

arXiv:无(NVIDIA GTC 发布,非学术论文;可引用 GitHub: ai-dynamo/dynamo)


主+ 4 · SANTA++:免训练随机注意力,通过代表性 Key 高效选择 KV Cache(arXiv:2609.35629)★

来源:paper_cards/1572-2609-35629.md · arXiv:2609.35629v1 · 2026-09

要点: - 问题:注意力往往集中在上下文中一小部分 token 上,但每条 query 关注的关键子集不同;全量扫描 KV Cache 代价高 - 方案:将缓存的 key 组织成若干 team,对每个 team 打分决定采样哪些 team;在采样 team 内计算精确注意力分数,通过采样概率倒数重新加权 - 核心特性:免训练(training-free);无需扫描整个 KV Cache;memory-efficient selection - 技术家族归属:属于 arXiv:2603.20397 五大家族中的 Cache Compression 或 Cache Eviction 方向(通过选择性采样减少需处理的 KV 量)

与活文档现有脉络的关系: - R-90 二十二维矩阵中已有 Cache Compression(NACL 等量化剪枝)和 Cache Eviction(NACL 等 eviction 策略) - 本条新增:SANTA++ 是 2026-09 新卡,提供了"随机采样选择代表性 KV"这一新的压缩思路,区别于传统量化剪枝;免训练特性在生产中比需微调的方案更易部署 - 与 PolyKV(2604.24971,R-89 主+)的非对称压缩共享池路线不同:SANTA++ 是查询时选择性采样,PolyKV 是存储时非对称压缩

建议归入: - §2.11 KV Cache 优化二十二维矩阵 — 新增第二十七维度候选:随机采样代表性 KV 选择(SANTA++,免训练) - §2.6 邻接

arXiv:2609.35629


邻接+ 5 · JAM: Just-In-Time Agent Memory — 分层 page-store + 运行时查询条件上下文构建(arXiv:2609.34385)

来源:paper_cards/1556-2609-34385.md · arXiv:2609.34385v1 · 2026-09

要点: - 现有 Agent 记忆系统采用 Ahead-of-Time(AOT)设计,在请求到达前构建记忆——可能丢弃之后变得重要的细粒度信息 - JAM 方案:Memorizer 在分层 page-store 中保存完整原始历史记录(含精简导航摘要)+ Researcher 迭代式查询条件上下文构建 - 与 EngramRAG(2609.32049,R-90 主+)对比:EngramRAG 是双态架构(Waking/Dreaming)+ 互补学习系统;JAM 是单态 + 运行时 JIT 构建;二者同属"动态 Agent 记忆"方向但机制不同

建议归入: - §2.3 AI 重塑数据库内核与 Agent 记忆 — 与 EngramRAG 并列,构成 Agent 记忆动态拓扑的两个技术路线

arXiv:2609.34385


邻接+ 6 · Keyword vs Semantic Search 定量评估框架 — IR 准确率对比方法论(arXiv:2609.37749)

来源:paper_cards/1578-2609-37749.md · arXiv:2609.37749v1 · 2026-09

要点: - RAG 等 context-aware chat-based search 相比传统 keyword-based 系统,缺乏严谨定量对比框架 - 提出首个客观定量评估 IR 准确率的框架,适用于输出格式不同的搜索系统 - 工程意义:向量数据库选型时"语义搜索 > 关键词搜索"的说法长期缺乏定量依据;本框架提供评测方法论

建议归入: - §2.1 向量数据库选型(邻接)— 作为向量搜索 vs 关键词搜索效果评估的方法论基础

arXiv:2609.37749


三、值得警惕的矛盾或待核实说法

编号 矛盾/待核实点 来源 建议行动
C1 pgvectorscale 471 QPS vs Qdrant 41 QPS 数据来自 pgvectorscale 官方自测,存在来源偏差;第三方对比数据未核实 inbox/jay/2026-09-30-llm-inference-vector-db.md 交叉验证第三方 benchmark(如 Gware 或 semsearch 社区数据)后再写入活文档
C2 NVIDIA Dynamo GB300 NVL72 750× 吞吐量提升(InferenceXv2)——如此大的提升幅度(vs B200 7×)需核实具体场景和测试条件 NVIDIA GTC 2026 官方数据 查找 independent benchmark(如 anonymous referee 或 MLPerf)验证
C3 SANTA++(2609.35629)"免训练"claim 与 KV Cache 复用准确性(2609.31415,R-90 主+)的交叉影响:若 KV 复用准确性本身存疑(31415 揭示 benchmark inflation),SANTA++ 的 sampling 方法论是否也受影响? 2609.35629 + 2609.31415 建议在活文档中将 31415(元批评)与 35629(具体方法)并列引用,形成"可信度建设"组合

四、可引用 arXiv 号列表

arXiv 主题 分类 状态
2603.20397 KV Cache 优化五大家族系统性综述(Dell Technologies) 主 新增锚定
2609.35629 SANTA++ 免训练随机注意力 KV 选择 主 新增锚定
2609.34385 JAM Just-In-Time Agent Memory 邻接 新增锚定
2609.37749 Keyword vs Semantic Search 定量评估框架 邻接 新增锚定
2609.31415 KV Cache 复用技术准确性存疑(R-90 已锚定) 主 续用
2609.32049 EngramRAG 动态使用加权拓扑 Agent 记忆(R-90 已锚定) 主 续用
2609.11744 py-kvcache 外部 KV 缓存多层级存储系统工程(R-90 已锚定) 主 续用
2509.23202 Mooncake ACM TOS KV-Centric Disaggregated Architecture(R-90 已锚定) 主 续用
2609.23130 Inference Control Plane + P2P KV 共享(R-90 已锚定) 主 续用
2604.03143 TokenDance 同步轮次 KV Cache 共享(R-89 已锚定) 主 续用
2603.04428 Edge Q4 KV Cache 持久化(R-89 已锚定) 主 续用
2604.24971 PolyKV 非对称压缩 KV Cache 共享池(R-89 已锚定) 主 续用
2609.23315 Graph Memory DB 对比(R-89 已锚定) 主 续用

五、行动建议

优先级 行动 对应条目
高 将 arXiv:2603.20397 五大家族分类作为 §2.6 章节的第一层结构锚定引入知识库 主+1
高 更新 §2.1 向量数据库选型章节:补充 pgvectorscale 471 QPS benchmark,标注数据来源偏警示 主+2
高 交叉验证 pgvectorscale vs Qdrant 第三方数据(C1)后再写入活文档 C1
中 跟进 NVIDIA Dynamo GitHub README + 独立 benchmark,验证 750× claim(C2) 主+3
中 在 §2.11 KV Cache 矩阵中将 31415(元批评)+ 35629(具体方法)组合引用形成可信度建设(C3) C3
中 将 JAM(2609.34385)与 EngramRAG(2609.32049)在 §2.3 Agent 记忆章节并列收录 邻接+5

Jay · database E1 预消化轮 · 2026-09-30 20:20 CST