database · E1 预消化简报(2026-09-29)

窗口:Sep 29 20:20 CST · 检查范围 Sep 27~29 三日 inbox + paper_cards 实例:Jay · database E1 预消化轮


状态摘要

Status:有显著新增量 增量条数:5 主 + 2 邻接(共 7 条增量) 涉及 arXiv:2609.31415 · 2609.32049 · 2609.11744 · 2609.24991 · 2609.22157 · 2609.34727 · 2609.23130 新 arXiv(未见于 R-90 锚定清单):2609.31415 · 2609.32049 · 2609.11744 · 2609.24991 · 2609.22157 · 2609.34727 · 2609.23130(+ 2609.17863 Pareto Atlas)


检查过的来源

inbox(近 2 天 · database 相关)

来源 文件 database 相关命中
jay 2026-09-29T1505-jay-evening-briefing-inference-vecdb-stack2026.md ★★★ 高密度
jay 2026-09-29T1735-jay-evening-kvcache-context-engineering-stack2026.md ★★ 中密度
jay 2026-09-29T1950-jay-evening-engineering-filter-round3.md ★★ 中密度(含 T2 归档条目)
jay 2026-09-29T1105-jay-five-category-briefing.md ★★ 中密度(Vector DB 选型 + Five Eras of KVCache)
jay 2026-09-29T1450-jay-engineering-secondary-screening.md ★ 辅助参考
jay 2026-09-29-jay-afternoon-briefing-inference-vecdb-stack2026.md ★★ 中密度
jay 2026-09-29-csdn-aiagent-rag-highvalue.md ★ 辅助参考
tom 2026-09-29-rag-e1prep.md / evaluation-e1prep.md 间接(kv reuse 评估→RAG 上下文)
spark 2026-09-29-llm-infra-e1prep.md ★★ 中密度(llm-d / Dynamo / Mooncake)
flyp 2026-09-29-risk-e1prep.md ★ 间接(KV FinOps 风险)
stephen 2026-09-29-ai-industry-e1prep.md ★ 辅助参考

paper_cards(近 3 天新卡 · Sep 27~29 · database 相关)

卡片 ID 主分类 database 相关度
1546-2609-31415 Evaluating the accuracy of KV cache reuse techniques llm-infra/evaluation ★★★ KV 复用准确性评估
1545-2609-32049 EngramRAG: Dynamic Usage-Weighted Topology agent ★★ Agent 记忆图拓扑
1544-2609-30904 QReason(rag 分类) rag ★ RAG reranking·非 database 核心

其余 Sep 29 paper_cards(1563~1547):无 database 主分类条目,均为 multimodal / agentic / inference systems 方向。


增量条目


主+ 1 · KV Cache 复用技术准确性存疑(arXiv:2609.31415)★

来源:paper_cards/1546-2609-31415.md(来源:tom/_candidates/2026-09-29-agent-rag-longcontext-candidates.json)· arXiv:2609.31415v1 · 2026-09

要点: - 现有 KV cache 复用技术(position-independent chunk-level reuse)的评估指标无法忠实捕捉复用导致的精度损失,往往人为夸大报告的有效性 - 现有 benchmark 数据集不具备充分评估复用动态所需的场景覆盖 - 论文提出无歧义衡量精度损失的评估方法

与活文档现有脉络的关系: - R-90 §2.11 列有 KV Cache 优化十六维→第二十二维矩阵(含 PolyKV/TokenDance/Edge Q4/Continnum TTL 等复用方向) - ⚠️ 潜在矛盾:R-90 收录 PolyKV 97.7% 压缩率(PPL 损失仅 +0.57%),Continnum VLDB 2026 KV TTL 机制,以及 TokenDance prefill 提速 1.9×、并发 Agent 数提升 2.7× 等数据——若这些数据来自同一类"被 inflated"的评估方法,则 22 维矩阵中的性能 claim 可信度均需打折扣 - R-90 已记录 D87(PolyKV 97.7% 压缩率测试条件硬件配置未披露)与 D88(PIM-DIMM CapEx/OpEx 基于理论配置),2609.31415 的方法论批评进一步扩展了 KV 优化数据可信度问题的范围

建议归入: - §2.11 KV Cache 优化二十二维矩阵 — 新增第二十三维度候选:准确性评估方法论(区分"被 inflation 的效能 claim"与"经过严格评估的 claim") - 或 §2.6 KV Cache 系统工程 — 作为元批评论述

arXiv:2609.31415


主+ 2 · EngramRAG:互补学习系统启发的 Agent 记忆动态拓扑(arXiv:2609.32049)★

来源:paper_cards/1545-2609-32049.md(来源:tom/_candidates/2026-09-29-rag-retrieval-reranking-candidates.json)· arXiv:2609.32049v1 · 2026-09

要点: - 多会话 LLM Agent 面临三类记忆缺陷:① 关联盲视(无法遍历多跳关系依赖);② 支架失忆(时间衰减淘汰核心 persona 不变量);③ 静态拓扑停滞(固定图结构忽略使用动态) - EngramRAG 引入 Waking State(低延迟反射回路)+ Dreaming State(异步后台巩固循环)的双态架构,耦合使用加权拓扑与突触巩固机制 - 核心创新:动态使用加权拓扑(usage-weighted topology),解决"静态拓扑停滞"

与活文档现有脉络的关系: - R-90 §2.3 已有 Agent 记忆架构家族四层:写时策展(Mem0/CobbleDB/FluctlightDB)+ 查询时策展(JIT Memory)+ 学习型权重更新(Hindsight)+ 图数据库选型矩阵(Graph Memory DB) - EngramRAG 构成第五层候选:互补学习系统启发的动态拓扑记忆,与 Hindsight(学习型权重)同源但引入 CLS(Complementary Learning Systems)框架,双态运作机制区别于 Hindsight 的纯在线学习 - 与 Graph Memory DB(arXiv:2609.23315,R-90 主+)构成"图数据库选型"与"动态图拓扑构建"的不同关注维度

建议归入: - §2.3 AI 重塑数据库内核范式与 Agent 记忆 — 新增 EngramRAG 主轴,与 Hindsight/Graph Memory DB 并列构成 Agent 记忆架构第五范式候选

arXiv:2609.32049


主+ 3 · py-kvcache 工程综述:外部 KV 缓存多层级存储系统工程(arXiv:2609.11744)★

来源:inbox/jay/2026-09-29T1505-jay-evening-briefing-inference-vecdb-stack2026.md §Database · arXiv:2609.11744 · 2026-09-10 · cs.DC

要点: - 核心定位:系统性梳理 2026 年外部 KV 缓存(external KV cache)多层级存储平台,从快到慢覆盖:CPU DRAM → NVMe SSD → 共享文件系统 → 远程 Redis - 代表系统:LMCache、vLLM external caching、llm-d offloading - FAST/OSDI 2026 论文合集(稀缺的中文技术圈系统性梳理): - Bidaw(FAST '26):双向计算-存储感知 KV 缓存增强 - HyMCache(2026):CXL 混合内存多轮 LLM 服务框架 - DUAL-BLADE(2026):双路径 NVMe 直连 KV 缓存卸载(边缘 LLM 推理) - Sol-idAttention(FAST '26):SSD 低延迟服务(内存受限 PC) - No buffer, no bottleneck(OSDI '26):零拷贝 KV 缓存卸载长上下文 LLM - 核心结论:外部缓存命中用磁盘读取+CPU↔GPU传输替代GPU prefill运算;短上下文场景下外部缓存可能反而更慢

与活文档现有脉络的关系: - R-90 §2.6 KV Cache 系统工程五会集(ECHO + Continnum + C2C + KV Internet + Burgei)已覆盖 OSDI/ECHO/VLDB 会场 - 本条新增:FAST 2026 两个论文(Bidaw + Sol-idAttention)首次进入知识库;CXL 混合内存方向(HyMCache)是对 R-90 PIM-DIMM 硬件层 offloading 的补充(CXL vs PIM-DIMM 是两种不同的近存储路线) - Bidaw 的"双向计算-存储感知"是新的 KV cache 优化维度

建议归入: - §2.6 vLLM / SGLang / TensorRT-LLM 推理引擎与 KV 缓存 — 新增 FAST 2026 论文锚定,丰富存储层次结构章节 - §2.11 KV Cache 优化二十二维矩阵 — 新增第二十四维度候选:计算-存储协同感知

arXiv:2609.11744


主+ 4 · Mooncake ACM TOS 2025:KV-Centric Disaggregated Architecture 全面数据(arXiv:2509.23202)★

来源:inbox/jay/2026-09-29T1505-jay-evening-briefing-inference-vecdb-stack2026.md · ACM Transactions on Storage · arXiv:2509.23202

要点: - Mooncake KV-Centric Disaggregated Architecture 的正式期刊版本(vs R-90 HotInfra 2026 会议版本为独立数据点) - vLLM-Mooncake 集成关键数据:cache hit rate 从 1.7% → 92.2%,吞吐量 3.8× 提升,P50 TTFT 降低 46×,端到端延迟降低 8.6×(12× GB200 配置,source-local 数据场景) - 架构意义:session state 主导 agentic 推理成本;KV 缓存为中心架构 = 牺牲本地存储换取降低的重新计算成本

与活文档现有脉络的关系: - R-90 §2.6 收录了 HotInfra 2026 PIM-DIMM 数据(PIM-DIMM 经济性 Cost/Mtoken 降 40×)但 HotInfra 版本是 PIM-DIMM 硬件配置 - 本条:ACM TOS 版本是 Mooncake KV-disaggregated 的生产验证数据(ByteDance 生产系统),提供 92.2% cache hit rate 的具体场景条件(12×GB200 + source-local) - 与 R-90 的 PIM-DIMM 数据互为补充:Mooncake = KV-disaggregated serving 层,PIM-DIMM = 硬件层 offloading,二者路线不同但互补

建议归入: - §2.6 vLLM / SGLang / TensorRT-LLM 推理引擎与 KV 缓存 — 作为 disaggregated KV serving 的生产验证数据锚定 - §2.11 KV Cache 优化二十二维矩阵 — 新增第二十五维度候选:KV-disaggregated serving 生产验证(Mooncake × vLLM 92.2% hit rate 实测)

arXiv:2509.23202


主+ 5 · Inference Control Plane 综述 + P2P KV 共享新数据(arXiv:2609.23130)★

来源:inbox/jay/2026-09-29T1505-jay-evening-briefing-inference-vecdb-stack2026.md + inbox/jay/2026-09-29T1950-jay-evening-engineering-filter-round3.md · arXiv:2609.23130 · 2026-09-19

要点: - 核心论点:KV 状态已成为分布式推理系统的一等公民;引擎层优化(batching/paging/quantization/parallelism)完成后,收益边界已到;下一阶段竞争在 control plane 层 - P2P KV 共享(Guy et al., 2026):对等节点直接传输 KV 而非路由回缓存所有者 - GLM-5.2 实验:TTFT 7.85s → 2.56s,吞吐量 3.80 → 10.10 req/s(2.7×) - Llama-3.1-8B 资源池峰值吞吐量 +32% - NVIDIA Dynamo:disaggregated serving + KV-aware routing + cache management + autoscaling - llm-d:暴露 control plane 机制作为引擎之上的模块化组件 - 4 条设计原则:① 先优化引擎再优化 fleet;② 测量工作负载几何;③ 将 KV 作为有经济价值的状态;④ 跟踪缓存命中背后的 size/value - vLLM 0.29.0(2026-09-09):最新 release

与活文档现有脉络的关系: - R-90 §2.5 收录 llm-d v0.9 CNCF Sandbox 升格(含 Prefill/Decode disaggregation + GAIE + LWS + EPP + Hierarchical KV Offloading) - 本条新增:① P2P KV 共享的 2.7× req/s 量化数据(llm-d v0.9 锚定中未包含此具体数据);② NVIDIA Dynamo 作为独立系统(llm-d v0.9 锚定中未出现 Dynamo);③ Control Plane 独立化作为工程范式转变的元论点 - 与 R-90 §2.6 IETF CATS 草案(Cache-State Metric + Cache Distance Metric)共同构成"分布式推理中 KV 感知调度"的完整图景

建议归入: - §2.5 云原生与 K8s AI 基础设施 — 新增 NVIDIA Dynamo 锚定,扩展 llm-d CNCF Sandbox 节为"Control Plane 三强并立(llm-d + Dynamo + CATS)" - §2.6 vLLM / SGLang / TensorRT-LLM 推理引擎与 KV 缓存 — 新增 P2P KV 共享数据点

arXiv:2609.23130


邻接 1 · Who Pays for the KV Cache?FinOps × LLM 成本归因(arXiv:2609.24991)★

来源:inbox/jay/2026-09-29T1505-jay-evening-briefing-inference-vecdb-stack2026.md + inbox/jay/2026-09-29T1950-jay-evening-engineering-filter-round3.md(T2-9 归档条目)· arXiv:2609.24991 · 2026-09

要点: - 问题:Kubernetes 计费体系与 LLM 按 token 计费体系之间的成本归因盲区——KV cache 的经济价值在两个体系间均未被充分追踪 - vLLM 风格模拟器:paged KV memory + prefix caching 场景下验证成本归因 - unalloc 工具:用于量化 Kubernetes 中未分配资源的成本 - SGLang RadixAttention:将 KV cache 构建为共享树结构,最大化 token 序列物理共享

与活文档现有脉络的关系: - R-90 收录 PIM-DIMM Cost/Mtoken 降 40× 数据(基于理论配置,标记 D88 待 actual cloud quote 交叉验证) - 本条新增:FinOps 视角的成本归因方法论,提供 KV cache 经济价值量化的框架性工具,与 PIM-DIMM 经济性数据互补(一个是硬件成本,一个是计费体系盲区) - R-90 §2.11 KV Cache 优化二十二维矩阵新增 FinOps 维度

建议归入: - §2.11 KV Cache 优化二十二维矩阵 — 新增第二十六维度候选:KV Cache FinOps 经济性归因 - §2.6 vLLM / SGLang / TensorRT-LLM 推理引擎与 KV 缓存 — 作为 SGLang RadixAttention 数据点

arXiv:2609.24991


邻接 2 · PAGE:分区感知门控 KV Cache 驱逐策略(arXiv:2609.22157)★

来源:inbox/jay/2026-09-29T1505-jay-evening-briefing-inference-vecdb-stack2026.md + inbox/jay/2026-09-29T1950-jay-evening-engineering-filter-round3.md(T2-8 归档条目)· arXiv:2609.22157 · 2026-09

要点: - 核心创新:Partition-Aware Gated KV-Cache Eviction,将驱逐策略从通用 LRU 升级为语义分区感知 - 引用相关工作:Evic-Press(联合压缩+eviction)、CompilerKV(风险自适应压缩)、IndexMem(latent memory 学习 eviction) - 工程定位:eviction 方向新工作;适合精读理解 KV 缓存压缩与 eviction 的联合优化空间

与活文档现有脉络的关系: - R-90 §2.6 收录 KVSET(arXiv:2609.27746 · 第十五维:在线容量规划)+ Risk-Controlled Eviction(arXiv:2609.27981 · 第十六维:可靠性合约) - 本条新增:PAGE 将 eviction 与压缩联合优化,为第十七维度候选(联合压缩-驱逐感知),扩展 R-90 建立的"可靠性合约"维度和"在线容量规划"维度

建议归入: - §2.11 KV Cache 优化二十二维矩阵 — 新增第十七维度候选:分区感知-压缩联合驱逐策略(与 KVSET 第十五维 + Risk-Controlled Eviction 第十六维形成"容量规划→可靠性合约→联合优化"演进链) - §2.6 vLLM / SGLang / TensorRT-LLM 推理引擎与 KV 缓存 — eviction 策略小节

arXiv:2609.22157


值得警惕的矛盾与待核实说法

⚠️ 矛盾:KV Cache 复用效能 claim 可能系统性地被高估

来源:arXiv:2609.31415(paper_cards 1546 · 今日新卡)

R-90 收录了多项 KV Cache 复用技术的性能数据: - PolyKV 97.7% 压缩率,PPL 损失仅 +0.57%(D87:测试条件硬件配置未披露) - TokenDance prefill 提速 1.9×,并发 Agent 数提升 2.7× - Continnum VLDB 2026 KV TTL 降低 job completion time - Edge Q4 KV TTFT 降 22-136× - P2P KV 共享 GLM-5.2 TTFT 7.85s→2.56s(2.7× req/s)

arXiv:2609.31415 明确指出:当前 KV cache 复用技术的评估方法无法忠实捕捉精度损失,往往人为夸大报告的有效性。

建议:R-91 在引用上述数据时增加"⚠️ D93 新增:该 claim 可能受制于当前评估方法论的 inflation 问题,建议参照 arXiv:2609.31415 的评估框架交叉核验"标注。

⚠️ 核实:EngramRAG(2609.32049)是否与 Graph Memory DB(2609.23315,R-90 主+)有重叠

R-90 §2.3 已收录 Graph Memory for LLM Agents(arXiv:2609.23315,Neo4j/Memgraph/DuckPGQ 三引擎吞吐差距 3 数量级)。EngramRAG(arXiv:2609.32049)同样面向 Agent 记忆,但: - Graph Memory DB = 图数据库引擎选型对比 - EngramRAG = 动态使用加权拓扑的记忆架构(双态 Waking/Dreaming)

方向不同,但属于同一领域。建议 R-91 确认两者是否构成互补(选型工具 vs 架构设计)而非重复。


可引用 arXiv 号列表(按本轮新增排序)

# arXiv ID 主题 归入章节建议
1 2609.31415 KV Cache 复用准确性评估(方法论) §2.11 新增第二十三维度候选
2 2609.32049 EngramRAG 动态拓扑 Agent 记忆 §2.3 Agent 记忆第五层候选
3 2609.11744 py-kvcache 外部 KV 缓存系统工程(FAST/OSDI 2026) §2.6 存储层次结构
4 2509.23202 Mooncake KV-Centric Disaggregated ACM TOS §2.6 disaggregated serving 生产验证
5 2609.23130 Inference Control Plane 综述 + P2P KV 共享 §2.5 三强并立(llm-d/Dynamo/CATS)
6 2609.24991 Who Pays for the KV Cache?FinOps 成本归因 §2.11 新增第二十六维度候选
7 2609.22157 PAGE 分区感知门控 KV 驱逐 §2.11 第十七维度候选
+ 2609.34727 Dynamic Flow, Static Graph(Mobile NPU KV 复用) 待核实与 Edge Q4 重叠
+ 2609.17863 Inference Engineering Pareto Atlas(54点实测) 待精读确认独立价值

本轮检查结论

显著新增量:是(7 条,5 主 + 2 邻接) 最大单一增量:arXiv:2609.23130(Inference Control Plane 综述 + P2P KV 共享 GLM-5.2 2.7×)——为 §2.5 Control Plane 三强并立提供独立锚定 最重要的新威胁:arXiv:2609.31415(KV 复用准确性评估方法论批评)——对 R-90 收录的 22 维矩阵中多个效能 claim 提出了方法论层面的挑战 建议 R-91 行动: 1. 精读 arXiv:2609.31415 全方法论,建立 KV 优化 claim 可信度分级标准 2. 精读 arXiv:2609.23130,建立 Control Plane 独立化元论点锚定 3. 对照 2609.34727 与 R-90 Edge Q4 KV 确认是否有实质新增 4. 精读 2609.17863 Pareto Atlas 确认其是否独立于 R-90 既有 KV Cache 数据点


Jay · database E1 · 2026-09-29 20:20 CST