database · E1 预消化简报(2026-10-01)

窗口:Oct 1 20:20 CST · 检查范围 Sep 29~Oct 1 三日 inbox + paper_cards 实例:Jay · database E1 预消化轮


状态摘要

Status:有显著新增量 增量条数:4 主 + 3 邻接(共 7 条增量,落在 3-8 条目标区间) 涉及 arXiv:2608.22752 · 2609.36322 · 2608.19758 · 2609.34385(R-92 已锚定,延续引用) 新 arXiv(未见于 R-92 锚定清单):2608.22752(首次收录)· 2609.36322(首次收录)


一、检查过的来源

inbox(近 2 天 · database 相关)

来源 文件 database 相关命中
jay 2026-10-01T1506-jay-afternoon-briefing-database-backend-cloudnative-oct01.md ★★★ 高密度(KVTC ICLR 2026 · SAW-INT4 · VeriCache · Qdrant p50/p99 基准 · SGLang 400K GPU · KubeCon AI Track · llm-d GAIE · MCP 7月修订)
jay 2026-10-01T1335-jay-github-trending-ax-llmd-csdn-db-tei.md ★★★ 高密度(llm-d GAIE/EPP · TEI 2026 Blackwell · CSDN TiDB/达梦/TDSQL 迁移 · smolagents · vLLM PD-disaggregation · AI 数据栈统一预测)
jay 2026-10-01-jay-engineering-filter-oct01.md ★★ 中密度(SGLang Mamba state cache bug · RadixAttention vs PagedAttention 选型)
jay 2026-10-01T1050-jay-engineering-filter.md ★ 邻接(FlashInfer · AI-Dynamo · 向量 DB 选型)
jay 2026-10-01-ai-engineering-github-trending-hf-mcp-vecdb-inference.md ★ 邻接(向量 DB · MCP)
jay 2026-09-30-database-e1prep.md 沿用(R-92 已锚定)
jay 2026-09-29-database-e1prep.md 沿用(R-92 已锚定)
jay 2026-09-30-1505-jay-afternoon-briefing-kvcache-db-cloudnative.md 沿用(R-92 已锚定)
jay 2026-09-30-llm-inference-vector-db.md 沿用(R-92 已锚定)
tom 2026-10-01-agent-rag-longcontext-candidates.json(card 1586/1593/1598 等) 间接(KUPAS MASTER · Org-Agent · APM-Bench → Agent 记忆)
spark 2026-10-01-llm-infra-e1prep.md ★ 邻接(llm-d 更新 · NVIDIA Dynamo)
flyp 2026-10-01-risk-e1prep.md ★ 间接(KV FinOps 风险)

paper_cards(近 3 天新卡 Sep 29~Oct 1 · database 相关)

卡片 ID arXiv 标题 主分类 database 相关度
1077-2608-22752 2608.22752 The Compaction Cliff in Long-Running AI Agent Memory agent ★★★ KV Cache / Agent 记忆压缩悬崖
1596-2609-36322 2609.36322 Periodic Weak Spots: Phase Sensitivity from Chunked KV-Cache Compression llm-infra ★★★ KV Cache 优化(相位敏感性问题)
1039-2608-19758 2608.19758 FlashPrefill V2: Block-Sparse Prefill Attention for Long-Context LLM Serving llm-infra ★★★ KV Cache / Prefill 优化
1587-2609-37559 2609.37559 APM-Bench: Cross-session Persistent Memory for Video Assistants multimodal ★ Agent 记忆跨会话基准
1598-2609-34392 2609.34392 Org-Agent: Towards Organizational Agents agent ★ Agent 记忆跨用户扩展

其余 Sep 29~Oct 1 paper_cards:无直接 database 主分类条目;work-queue Top 15 中无 database 直接关联条目。


二、增量条目


主+ 1 · The Compaction Cliff in Long-Running AI Agent Memory:Knowledge Triage 框架与 AgentArtifactCorpus(arXiv:2608.22752)★★

来源:paper_cards/1077-2608-22752.md · arXiv:2608.22752v1 · OpenAlex 更新 2026-08-31 · tom inbox 2026-08-25/26 candidates

要点: - 核心问题:现有 Agent 记忆系统在长时运行中面临"压缩悬崖"(Compaction Cliff)——随着对话/任务轮次增加,记忆压缩策略(如固定窗口、摘要)导致早期重要信息被不可逆丢弃,且无差异化保留机制 - Knowledge Triage 框架:对 agent 知识库的每一条目按类型分类,每种类型配置独立保留策略——这是对传统"统一 TTL 或统一压缩"做法的根本性改进 - AgentArtifactCorpus:配套分类器 + 参考实现已开源,可直接集成到现有 Agent 记忆管线 - 与 Compaction Cliff 的关系:该现象揭示了当前 KV Cache eviction 策略(属于 Dell 五大家族第一类 Cache Eviction)在长时 Agent 场景下的具体失效模式

与活文档现有脉络的关系: - R-92 §2.3 已有 JAM(2609.34385 · 运行时 JIT page-store)与 EngramRAG(2609.32049 · CLS 双态架构)——二者描述了记忆系统的架构设计 - 本条增量:2608.22752 揭示了记忆压缩策略本身的系统性失效(压缩悬崖),这是独立于 JAM/EngramRAG 架构设计的运维层问题;三类共同构成 Agent 记忆的"架构-压缩-运营"三维覆盖 - 建议在 §2.3 中作为"第三类"(运维层保留策略)与 JAM/EngramRAG 并列;或在 §2.11 KV Cache 27 维矩阵的 Cache Eviction 维度中引用,作为 eviction policy 在长时 Agent 场景的实证案例

建议归入: - §2.3 AI 重塑数据库内核与 Agent 记忆 — 新增第三路线:压缩悬崖与 Knowledge Triage(区别于 JAM 运行时 JIT + EngramRAG CLS 双态) - §2.11 KV Cache 优化矩阵 — 作为 Cache Eviction 维度在长时 Agent 场景的实证案例(第二十七维度邻接)

arXiv:2608.22752


主+ 2 · Periodic Weak Spots:分块 KV-Cache 压缩的相位敏感性(arXiv:2609.36322)★★

来源:paper_cards/1596-2609-36322.md · arXiv:2609.36322v1 · 2026-09 · tom inbox 2026-10-01 candidates

要点: - 背景:分块 KV-Cache 压缩(fixed stride 将连续 token 窗口压缩为更少缓存条目)是长上下文推理的常用降低显存方法 - 发现:此类压缩引入新的位置坐标——token 的"相位"(phase,即相对于压缩窗口边界的位置);存在系统性不对称:同一信息在某一相位下易于检索,在另一相位下却难以检索 - 核心概念:相位敏感性(Phase Sensitivity)——检索性能随压缩窗口边界的周期性波动 - 影响:在大型开源权重模型中,相位敏感性导致压缩后信息检索可靠性不可预测,对依赖 KV Cache 命中率的 Agent 工作流(如 RAG prefix caching、多轮对话)有直接冲击 - 技术归属:属于 Dell 五大家族"Cache Compression"子类;但引入了全新的"相位"维度,是之前 27 维矩阵未覆盖的现象

与活文档现有脉络的关系: - R-92 SANTA++(2609.35629 · 免训练随机采样代表性 KV)属于 Cache Compression 方向;2609.36322 揭示了分块压缩方法论本身的系统性盲点 - SANTA++ 采样 team 时,若恰好在"难检索相位"采样,可能放大误差——两篇可组合引用(D92 可信度警示的延续) - 建议在 §2.11 扩展第二十八维候选:相位感知压缩(Phase-Aware Compression),或作为 Cache Compression 子类的新型失效模式记录

建议归入: - §2.11 KV Cache 优化矩阵 — 新增第二十八维度候选:分块压缩相位敏感性(新型失效模式) - §2.6 vLLM / SGLang / TensorRT-LLM 推理引擎 — 作为长上下文场景的 KV 压缩可靠性警示

arXiv:2609.36322


主+ 3 · FlashPrefill V2:PackGQA + Warp Specialization + Pingpong Pipeline 的块稀疏 Prefill 注意力(arXiv:2608.19758)★★

来源:paper_cards/1039-2608-19758.md · arXiv:2608.19758v1 · OpenAlex 更新 2026-08-28 · tom inbox 2026-08-21 candidates

要点: - 核心改进:引入均值修正项(mean correction term)有效抑制稀疏近似误差,使性能下降在极端稀疏度下仍可控 - 稀疏注意力算子重新设计:使用 PackGQA(打包组注意力内存访问)+ Warp Specialization( warp 专用化)+ Pingpong Pipelining(乒乓流水线) - 定位:面向长上下文 LLM serving 的 Prefill 阶段优化;属于 Dell 五大家族"Novel Attention"子类(FlashAttention 系列演进) - 与 FlashPrefill V1 的关系:V1 的近似误差累积问题在 V2 中通过均值修正项得到系统性解决

与活文档现有脉络的关系: - R-92 Dell 五大家族中"④ Novel Attention"已收录 FlashAttention 系列;FlashPrefill V2 是该家族的最新成员 - 与 KVTC(ICLR 2026 · 媒体压缩变换编码用于 KV Cache)的交叉:二者都关注 prefill 阶段 KV 压缩,但 KVTC 侧重跨对话共享,FlashPrefill V2 侧重单请求内的稀疏注意力 - 建议在 §2.6 补充 FlashPrefill V2 作为 Novel Attention 方向的最新进展,与 FA-4(已有)形成版本演进记录

建议归入: - §2.6 vLLM / SGLang / TensorRT-LLM 推理引擎 — Novel Attention 子类最新成员(FlashPrefill V2)

arXiv:2608.19758


主+ 4 · Qdrant P50 ~2.1ms / P99 ~6.3ms 生产基准:pgvector vs Qdrant 选型决策树再校准 ★

来源:inbox/jay/2026-10-01T1506-jay-afternoon-briefing-database-backend-cloudnative-oct01.md · Alpha Corp / Qdrant 官方 benchmark + Tiger Data 独立测试

要点: - 关键数据(多源交叉印证): | 规模 | P50 延迟 | P99 延迟 | QPS | 来源 | |------|---------|---------|-----|------| | 1M · 1536维 | ~2.1ms | ~6.3ms | ~1,200 | Tiger Data 独立测试 | | 50M · 90% recall | 4.74ms | 5.79ms | — | Qdrant 官方 v1.17 | | 1M · 1536维 | ~4.2ms | ~12ms | — | CORE Systems 2026 benchmark | - 关键洞察:Qdrant 在 50M 规模下 P99 延迟控制在 6ms 以内,尾部延迟控制极强;p95/p99 优先于平均延迟是生产选型正确顺序 - pgvector 定位更新:Simon Frey 金句——"The best vector database is the one you already have"(2026 生态转向信号);≤1 亿向量 pgvector 够用,但 p99 敏感场景(交互式 RAG)Qdrant 有优势 - Benchmark 避坑:剔除 tiny dataset(缓存掩盖真实行为)、剔除无过滤条件测试、剔除只报平均延迟

与活文档现有脉络的关系: - R-92 §2.1 已有 pgvectorscale 471 QPS @ 99% recall vs Qdrant 41 QPS 数据(注意:471 QPS 是 QPS 指标,Qdrant ~6ms P99 是延迟指标,二者衡量维度不同不能直接比) - 本条增量:Tiger Data 独立实测数据(~2.1ms P50 / ~6.3ms P99)提供了 Qdrant 独立第三方验证,弥补了 C1(pgvectorscale 自测偏警示)的验证空白 - ⚠️ 可信度警示:P50 ~2.1ms 数据来自 Tiger Data 独立测试(来源可信度中高),与 Qdrant 官方数据差异显著(4.74ms vs 2.1ms P50)——需进一步核实测试条件是否一致

建议归入: - §2.1 向量数据库选型 — 补充 Qdrant 独立第三方基准数据(P50/P99 延迟),与 pgvector 471 QPS 形成互补维度

arXiv:无(工业 benchmark)


邻接+ 5 · llm-d GAIE + EPP:Gateway API 推理扩展 + Prefix Hash Routing 对 KV Cache 命中率的影响(3-5x 提升)★

来源:inbox/jay/2026-10-01T1335-jay-github-trending-ax-llmd-csdn-db-tei.md · CNCF Blog + Red Hat Blog + CoreWeave Blog · 2026

要点: - GAIE(Gateway API Inference Extension):Kubernetes Gateway API 的推理扩展规范,不再使用默认 round-robin 负载均衡 - EPP(Endpoint Picker):根据 prompt 前缀哈希(prefix hash)计算路由,导向已缓存该前缀的 Pod——相同 system prompt → 同一 Pod → KV Cache 重用 - 关键数据(CoreWeave 博客):EPP 相比传统 K8s Service 路由,KV Cache 命中率提升 3-5x;结合 Disaggregated Serving,整体吞吐量提升可达 7x - 与 NVIDIA Dynamo KV-aware Routing 对比:Dynamo = 多节点编排层(GB300 NVL72 750x claim)vs llm-d = K8s 数据平面中间件;EPP 是应用层前缀哈希路由,Dynamo KV-aware Routing 是网络层感知路由

建议归入: - §2.5 云原生与 K8s AI 基础设施 — llm-d GAIE/EPP 扩展作为 CNCF 标准路由层,与 IETF CATS(网络标准)/ llm-d CNCF Sandbox / NVIDIA Dynamo 形成四层 KV 路由矩阵


邻接+ 6 · MCP 2026-07-28 重大修订:协议层无状态化 + 生产部署规模(10,000+ servers / 97M 月度 SDK 下载)★★

来源:inbox/jay/2026-10-01T1506-jay-afternoon-briefing-database-backend-cloudnative-oct01.md · MCP 官方博客 + Wikipedia · 2026-07-28

要点: - 核心变更:移除协议层会话跟踪 → MCP 在协议层变为无状态;协议版本、客户端身份、能力信息移至每个请求的 _meta 参数 - 影响:Anthropic David Soria Parra:"most substantial change since authorization"——这是 MCP 协议自加入 authorization 以来最大幅度修订 - 生产规模数据:10,000+ MCP servers 已部署;月度 SDK 下载 97M+;Salesforce Headless 360 自 Launch 处理 450 万次 MCP 调用 - 生态影响:无状态化使 MCP 更适合云原生/Serverless 场景,与 llm-d GAIE / K8s 生态形成协同

建议归入: - §2.5 云原生与 K8s AI 基础设施 — MCP 无状态修订作为协议层重大更新;与 llm-d GAIE / K8s 生态协同 - 标注:MCP 属于 §2.5 邻接(标准协议层,而非数据库核心主题)


邻接+ 7 · CSDN 国产数据库迁移实战:TiDB / 达梦 DM8 / TDSQL 分片选型(PingCAP/TDSQL/达梦)★

来源:inbox/jay/2026-10-01T1335-jay-github-trending-ax-llmd-csdn-db-tei.md §三 · CSDN 2026 · pingcap.com

要点: - TiDB 血泪经验:事务必须短小(大批量更新需分批提交)、避免跨分片 JOIN(用冗余字段/汇总表替代)、AUTO_RANDOM 主键打散写入热点、乐观事务重试机制 - 达梦 DM8 WAL 环形校验码:核电站安全级设计,磁盘扇区级损坏时自动跳过坏块;代价:写入性能比 MySQL 低约 18%,电力行业故障率 < 0.002% - TDSQL 分片键三原则:离散度高、覆盖高频查询条件、避免热点(禁止自增ID做分片键);Range 分片 → 大促写热点;Hash 分片 → 写入均匀 - 生产决策框架:recall@k → p95/p99 延迟 → QPS → 成本/1k 查询(正确顺序)

建议归入: - §2.1 向量数据库选型(邻接)— 作为传统关系型数据库迁移经验参照;Simon Frey 金句印证 pgvector"已有数据库够用"逻辑


三、值得警惕的矛盾或待核实说法

编号 矛盾/待核实点 来源 建议行动
C1 Qdrant P50 ~2.1ms( Tiger Data 独立测试)vs ~4.74ms(Qdrant 官方 v1.17)—— 测试条件(数据集规模、维度、硬件)是否一致存疑;差异达 2.3× inbox/jay/2026-10-01T1506 briefing 核实 Tiger Data 测试具体配置后再写入活文档;优先信 Qdrant 官方数据(测试条件可控)
C2 FlashPrefill V2 的 PackGQA / Warp Specialization / Pingpong Pipeline 组合与 FA-4 完整技术报告(已有)的关系:两者是否存在技术重叠或替代关系待核实 paper_card 2608.19758 交叉比对 FA-4(已有 R-86 锚定)与 FlashPrefill V2 的算子实现差异后再归类
C3 llm-d EPP 3-5x KV Cache 命中率提升(CoreWeave 博客)—— 自测数据,生产环境效果待独立验证 inbox/jay/2026-10-01T1335 与 R-92 C93(Dynamo 750× claim 同为自测)合并建立"厂商自测数据可信度警示" SOP

四、可引用 arXiv 号列表

arXiv 主题 分类 状态
2608.22752 The Compaction Cliff in Long-Running AI Agent Memory · Knowledge Triage 主 新收录
2609.36322 Periodic Weak Spots: Phase Sensitivity from Chunked KV-Cache Compression 主 新收录
2608.19758 FlashPrefill V2: Block-Sparse Prefill Attention 主 新收录
2609.34385 JAM: Just-In-Time Agent Memory(R-92 已锚定) 主 续用
2609.32049 EngramRAG: CLS 双态动态拓扑 Agent 记忆(R-92 已锚定) 主 续用
2609.35629 SANTA++: 免训练随机采样代表性 KV 选择(R-92 已锚定) 主 续用
2603.20397 Dell KV Cache 五大家族系统性综述(R-92 已锚定) 主 续用
2609.31415 KV Cache 复用准确性评估方法论质疑(R-92 已锚定) 主 续用
2511.01815 KVTC: KV Cache Transform Coding ICLR 2026(R-92 已锚定邻接) 邻接 续用

五、行动建议

优先级 行动 对应条目
高 将 2608.22752(Compaction Cliff / Knowledge Triage)作为 §2.3 Agent 记忆第三路线录入,与 JAM / EngramRAG 并列 主+1
高 将 2609.36322(Periodic Weak Spots / Phase Sensitivity)作为 §2.11 KV Cache 第二十八维度候选录入 Cache Compression 子类 主+2
高 核实 C1(Qdrant P50 2.1ms vs 4.74ms 差异来源)后再将独立基准数据写入 §2.1 C1
中 FlashPrefill V2(2608.19758)录入 §2.6 Novel Attention 子类,与 FA-4 比对避免重复 主+3
中 llm-d GAIE/EPP 录入 §2.5 四层 KV 路由矩阵(与 CATS/Dynamo/llm-d 形成对比) 邻接+5
中 MCP 无状态修订录入 §2.5 邻接(标准协议),建立 C3 厂商自测数据可信度警示 SOP 邻接+6
低 CSDN TiDB/达梦/TDSQL 迁移经验作为 §2.1 邻接补充(已有国产 DB 选型框架) 邻接+7

六、候选(κ)状态

候选(κ):RAG 评估体系(★第四十五维持) R-92 维持★;本轮(Oct 1)增量主+1/2/3 聚焦 §2.3 Agent 记忆运维层 / §2.11 KV Cache 相位敏感性 / §2.6 Novel Attention,与候选(κ)正交;候选(κ)★第四十五维持。


Jay · database E1 预消化轮 · 2026-10-01 20:20 CST