database · E1 预消化简报(2026-10-02)

窗口:Oct 2 20:20 CST · 检查范围 Sep 30~Oct 2 三日 inbox + paper_cards 实例:Jay · database E1 预消化轮


状态摘要

Status:有显著新增量 增量条数:4 主 + 2 邻接(共 6 条增量,落在 3-8 条目标区间) 涉及 arXiv:2610.01936 · 2610.01871 · 2609.32259 · 2609.33485 新 arXiv(未见于 R-93/R-94 锚定清单):2610.01936(首次收录)· 2610.01871(首次收录)· 2609.32259(首次收录)· 2609.33485(首次收录)


一、检查过的来源

inbox(近 2 天 · database 相关)

来源 文件 database 相关命中
jay 2026-10-02_engineering.md ★★★ 高密度(LeanStore SSD写入优化 · LLM SQL自治优化 · PostgreSQL分区策略 · pgvector生产选型)
jay 2026-10-02T1040-jay-hf-state-open-models-icml-repro-inference-vecdb-substack.md ★★★ 高密度(Qdrant ~2.1ms P50/~1200 QPS benchmark · pgvector S3后端 · Agent查询量10x · pgvector选型决策树)
jay 2026-10-02-1735-mcp-vecdb-agentic-llmops-observability.md ★★★ 高密度(Agent查询量10x · pgvector对象存储后端 · Qdrant过滤/量化/混合搜索 · Guardrails独立化)
jay 2026-10-02-1220-csdn-substack-inference-rag-highvalue.md ★★ 中密度(vLLM PagedAttention源码 · SGLang RadixAttention vs vLLM APC · Prefix Caching对比)
jay 2026-10-02-1950-jay-evening-engineering-filter.md ★ 邻接(CascadeEP MoE异步专家调度 · Speculating Experts预取 · CrossPool KV+Weight disaggregation)
jay 2026-10-01-database-e1prep.md 沿用(R-93 已锚定)
jay 2026-09-30-database-e1prep.md 沿用(R-93 已锚定)
tom 2026-10-02-agent-rag-longcontext-candidates.json(含卡片 1624/1625/1626/1627/1628/1629/1630/1631) 6张新卡入库
spark 2026-10-02-1001-rss-gradient-flow.md ★ 邻接(LLM推理系统)
flyp 2026-10-02-risk-e1prep.md ★ 间接

paper_cards(近 3 天新卡 Oct 0~2 · database 相关)

卡片 ID arXiv 标题 主分类 database 相关度
1624-2610-01936 2610.01936 Mapping the RAG Landscape: Four Axis Taxonomy(效率/防御/交互/推理) rag ★★★ RAG系统分类学,数据库知识管理核心框架
1625-2610-01871 2610.01871 ImmRAG: Walking the Embedding Space(MRAG 数据提取攻击) rag ★★★ 多模态 RAG datastore 安全攻击面
1627-2610-00544 2610.00544 Memorizon: Training World Models Beyond Context Window engineering ★ Agent 记忆超上下文学习
1630-2609-32259 2609.32259 HeteroFold: Prefill-Free Cross-Family KV Cache Transfer agent ★★★ KV Cache 跨模型族迁移
1628-2609-38886 2609.38886 HIDE: Skill-Level Memory Benchmark for Robotic Manipulation evaluation ★ Agent 记忆基准
1567-2609-33485 2609.33485 DISCO: Grounding-Reasoning Disaggregation for Long Context llm-infra ★★★ 长上下文分布式 grounding(KV Cache 邻接)

其余 Oct 0~2 paper_cards:无其他直接 database 主分类条目;work-queue Top 15 中 2610.01936(Mapping the RAG Landscape)和 2610.00544(Memorizon)在列。


二、增量条目


主+ 1 · Mapping the RAG Landscape:RAG 四轴分类学——效率/防御/交互/推理(arXiv:2610.01936)★★

来源:paper_cards/1624-2610-01936.md · arXiv:2610.01936v1 · 2026-10 · tom inbox 2026-10-02 candidates · work-queue Top 15

要点: - 核心贡献:首个系统性 RAG 分类学,覆盖四个轴:① Efficiency(效率)、② Defense(防御)、③ Interactivity(交互性)、④ Reasoning(推理) - 背景:先前 RAG 综述主要聚焦核心架构和标准流水线;本 survey 扩展到更广泛的挑战和能力 - RAG Defense 轴意义:包含检索 poisoning defense、faithfulness verification、source attribution 等——直接扩展了 RAG 作为知识库系统的可信度保障机制 - Interactivity 轴:多轮对话 RAG、主动检索(active retrieval)、迭代精炼——与 Agent 记忆系统深度交叉 - 分类学框架对知识库的直接价值:可作为活文档 knowledge/database.md RAG 章节的顶层组织结构

与活文档现有脉络的关系: - R-93 §2.3 已有 EngramRAG(2609.32049 · CLS 双态架构)、JAM(2609.34385 · JIT page-store)、Compaction Cliff(2608.22752 · Knowledge Triage)——这些是 Agent 记忆架构 - 本条增量:2610.01936 提供 RAG 系统的第一性分类框架;Agent 记忆的 JAM/EngramRAG/Compaction Cliff 可分别归入 Interactivity 轴(动态记忆构建)、Defense 轴(记忆可信度)、Efficiency 轴(记忆压缩策略) - 四轴Taxonomy 为活文档的 RAG 相关章节提供了统一的分类锚点

建议归入: - §2.3 AI 重塑数据库内核与 Agent 记忆 — 新增顶层分类锚点:RAG 四轴(效率/防御/交互/推理) - 或新建 §2.4 RAG 系统分类学 — 以 2610.01936 四轴为纲

arXiv:2610.01936


主+ 2 · ImmRAG:多模态 RAG 的 Embedding Space 数据提取攻击(arXiv:2610.01871)★★

来源:paper_cards/1625-2610-01871.md · arXiv:2610.01871v1 · 2026-10 · tom inbox 2026-10-02 candidates

要点: - 问题:Multimodal RAG(MRAG)将 MLLM 生成能力接地到外部知识库以减少幻觉——但同时引入了新的攻击面,包括私有信息泄露和数据提取攻击 - ImmRAG 方案:提出自适应、自动化的数据提取攻击程序,在黑盒设置下对图像 Embedding Space 进行 datastore extraction attack - 安全含义:RAG 系统不仅面临"检索到错误信息"的风险,还面临"攻击者提取数据库内容"的风险——这对知识库安全设计有直接意义 - 定位:属于 2610.01936 四轴分类学中 Defense 轴的具体威胁研究

与活文档现有脉络的关系: - R-93 锚定清单中尚无 MRAG 安全/防御研究;2610.01936 Defense 轴的支撑论文 - 本条增量:将 RAG 防御维度从"信息可信度"扩展到"知识库安全"——私有知识库被提取是实际生产风险 - 建议在 §2.3(或新建 §2.4)RAG 分类学的 Defense 轴下作为具体威胁案例录入

建议归入: - §2.4 RAG 分类学(新增)— Defense 轴:ImmRAG 数据提取攻击(arXiv:2610.01871)

arXiv:2610.01871


主+ 3 · HeteroFold:跨模型族 Prefill-Free KV Cache 迁移(arXiv:2609.32259)★★

来源:paper_cards/1630-2609-32259.md · arXiv:2609.32259v1 · 2026-09 · tom inbox 2026-10-02 candidates

要点: - 背景:多 Agent LLM 系统日益结合异构模型(不同 Agent 角色使用不同模型)——但基于文本的通信要求接收方 prefill 发送方已处理过的上下文,造成极大浪费 - HeteroFold 方案:prefill-free 跨模型族 KV Cache 迁移——sender 和 receiver 均 frozen,通过结构对齐和 KV 表示映射实现跨家族迁移 - 核心挑战:不同 tokenizer、不同模型深度、不同 KV 表示空间——这些问题通过 HeteroFold 的对齐机制解决 - 与现有 KV 迁移技术的区别: - Mooncake(2509.23202):KV-Centric Disaggregated Architecture,同构模型间 KV 传输 - llm-d / EPP:prefix hash 路由到已有 prefix 的 Pod(同构) - HeteroFold:异构模型族间 KV 迁移,无需 prefill

与活文档现有脉络的关系: - R-93 §2.6 已有 Mooncake(KV-Centric Disaggregated Architecture)、llm-d GAIE/EPP(K8s 前缀哈希路由)、NVIDIA Dynamo(编排层 KV-aware routing)——这些是同构或编排层方案 - 本条增量:HeteroFold 是异构多 Agent 场景的 KV 迁移突破——填补了活文档中"异构模型间 KV 复用"的技术空白 - 建议在 §2.6 推理引擎与 KV 缓存章节的 KV 路由矩阵中新增第五层:异构模型 KV 迁移(HeteroFold)

建议归入: - §2.6 vLLM / SGLang / TensorRT-LLM 推理引擎与 KV 缓存 — 新增第五层:异构模型族 KV 迁移(HeteroFold)

arXiv:2609.32259


主+ 4 · DISCO:Grounding-Reasoning Disaggregation — 分布式长上下文接地(arXiv:2609.33485)★★

来源:paper_cards/1567-2609-33485.md · arXiv:2609.33485v1 · OpenAlex 更新 2026-10-01 · tom inbox 2026-09-29 candidates

要点: - 背景:LLM 宣称支持百万 token 上下文窗口,但推理质量随输入增长崩溃——即"上下文腐烂"(contextual decay) - 根因:单体架构中上下文接地的巨大搜索负担耗尽了复杂推理所需的表征能力——纠缠在一起无法分离 - DISCO 方案:受 Apache Spark 分布式计算框架启发,将长上下文切分到 Worker LLM Fleet(专门并行局部 grounding),建立高效范式 - 核心概念:grounding-reasoning disassociation——接地和推理分开处理 - 与现有工作的关系: - KVTC(2511.01815 · ICLR 2026):跨对话共享 KV Cache 的变换编码——DISCO 解决了同一对话内长上下文的 grounding 效率 - HeteroFold(2609.32259):跨模型族迁移——DISCO 解决了同一模型内长上下文的 grounding 效率

与活文档现有脉络的关系: - R-93 §2.6 已有 KVTC(I CLR 2026 · 跨对话变换编码),属于长上下文 KV 优化家族 - 本条增量:DISCO 从"跨对话共享"(KVTC)扩展到"对话内分布式 grounding"——两种不同维度的长上下文优化可以互补 - 建议在 §2.6 作为长上下文 KV 优化的第二类(分布式 grounding)与 KVTC(跨对话压缩)并列

建议归入: - §2.6 vLLM / SGLang / TensorRT-LLM 推理引擎与 KV 缓存 — 新增长上下文优化第二类:分布式 Grounding-Reasoning Disaggregation(DISCO)

arXiv:2609.33485


邻接+ 5 · pgvector 2026 新能力:S3/GCS 对象存储后端 + Collection Forking + Agent 查询量 10x 量化数据 ★

来源:inbox/jay/2026-10-02-1735-mcp-vecdb-agentic-llmops-observability.md §二·条目4 · DEV Community · 2026

要点: - pgvector 2026 新增能力: - 对象存储后端:S3/GCS 作为冷存储后端,冷命名空间不占 RAM——解决了 pgvector 在大规模向量场景下的内存天花板 - Collection Forking:写时复制克隆 collection——使 embedding 模型或 chunking 策略 A/B 测试成本大幅降低 - 隐私优先边缘部署缺口:云 DB 已扩展到数十亿向量,但隐私敏感边缘场景 2026 年仍被忽视 - Agent 查询量激增量化:2026 年 AI Agent 发出 10 倍于人类的查询量——这意味着向量库的吞吐量设计基准从"人类查询模式"升级为"机器查询模式" - 2026 年向量库选型更新: - >10 亿向量:Milvus 流式索引(避免重建暂停) - 过滤/量化/混合搜索:Qdrant 表现突出 - PostgreSQL 用户引入:pgvector(零新基础设施) - p50 ~2.1ms / QPS ~1200:Qdrant 开源基准(多源印证)

与活文档现有脉络的关系: - R-93 §2.1 已有 pgvectorscale 471 QPS vs Qdrant 41 QPS(C1 警示:厂商自测);向量库选型决策树已有框架 - 本条增量:pgvector S3 后端使 pgvector 的规模上限从~1亿向量显著提升(冷存储扩展);Agent 10x 查询量是生产容量规划的关键输入 - ⚠️ 可信度警示:Agent 10x 数据来自 DEV Community article(actiandev),非 peer-reviewed 论文;建议作为方向性参考而非精确数字

建议归入: - §2.1 向量数据库选型 — 更新 pgvector 规模上限(S3 后端扩展);新增 Agent 查询量 10x 作为容量规划输入参数

可信度:中(社区文章量化数据;建议交叉验证)


邻接+ 6 · Guardrails 从 LLM 护栏独立为 Agent 护栏——工具调用授权/限速/行为验证 ★

来源:inbox/jay/2026-10-02-1735-mcp-vecdb-agentic-llmops-observability.md §二·条目6 · The AI Engineer Substack · 2026

要点: - 范式转变:2024 年 Guardrails = LLM 输入/输出过滤器;2026 年 Agent Guardrails = 工具调用授权 + 限速 + Agent 实际行为验证——Guardrails 已从 LLM 层解耦,成为独立 Agent 系统组件 - 三层护栏体系(2026 Agent Stack 架构): 1. LLM 护栏(输入/输出过滤)——模型自身的安全层 2. Agent 护栏(工具调用授权/限速/行为验证)——系统层 3. Protocol 护栏(MCP/Function Calling 协议层)——连接层 - 与 MCP 2026-07-28 RC 的关系:MCP 无状态化使协议层更透明,配合 Agent Guardrails 独立化,形成完整的三层安全体系 - 对知识库系统的意义:使用 RAG 的 Agent 系统需要在 Agent 护栏层增加"检索结果来源验证"和"知识库访问授权"——这与 ImmRAG(2610.01871)攻击面形成攻防对应

建议归入: - §2.3 AI 重塑数据库内核与 Agent 记忆 — 新增三层护栏体系框架(独立于 RAG 防御轴但互补) - §2.4 RAG 分类学 Defense 轴 — 与 ImmRAG 攻击面形成攻防配对


三、值得警惕的矛盾或待核实说法

编号 矛盾/待核实点 来源 建议行动
C1 Agent 查询量 10x 数据(pgvector 2026 新能力条目)来自 DEV Community article(actiandev),非 peer-reviewed;具体倍数("10x")未注明统计口径和样本规模 inbox/jay/2026-10-02-1735 作为方向性参考标注;建议核实该数据是否有厂商报告或研究论文支撑后再写入活文档
C2 DISCO(2609.33485)与 KVTC(2511.01815,ICLR 2026)的关系:两者都声称解决长上下文效率问题,但一个是"对话内分布式 grounding"(DISCO),另一个是"跨对话 KV 变换编码"(KVTC)——是否存在技术重叠或互补关系需进一步厘清 paper_card 1567 + R-93 锚定 在活文档中明确标注两者为不同维度的优化:DISCO = 单对话内并行 grounding;KVTC = 跨对话 KV 复用
C3 HeteroFold(2609.32259)的"prefill-free"claim 与 NVIDIA Dynamo(已锚定 R-93)的"KV-aware routing"claim 处理的是不同层的抽象——前者解决 tokenization 差异和 KV 表示映射,后者解决多节点调度——但两者组合的端到端效率提升claim需独立验证 paper_card 1630 + R-93 Dynamo 分别锚定在不同层级,避免在活文档中形成隐含的端到端效率叠加claim

四、可引用 arXiv 号列表

arXiv 主题 分类 状态
2610.01936 Mapping the RAG Landscape: 四轴分类学(效率/防御/交互/推理) 主 新收录
2610.01871 ImmRAG: MRAG 数据提取攻击(Embedding Space 攻击面) 主 新收录
2609.32259 HeteroFold: Prefill-Free 异构模型族 KV Cache 迁移 主 新收录
2609.33485 DISCO: Grounding-Reasoning Disaggregation 分布式长上下文 主 新收录
2610.00544 Memorizon: Training World Models Beyond Context Window 邻接 新收录(work-queue 候选)
2609.38886 HIDE: Skill-Level Memory Benchmark for Robotic Manipulation 邻接 新收录
2609.34385 JAM: Just-In-Time Agent Memory(R-93 已锚定) 主 续用
2609.32049 EngramRAG: CLS 双态动态拓扑 Agent 记忆(R-93 已锚定) 主 续用
2608.22752 Compaction Cliff / Knowledge Triage(R-93 已锚定) 主 续用
2609.36322 Periodic Weak Spots: KV-Cache 相位敏感性(R-93 已锚定) 主 续用
2609.35629 SANTA++: 免训练随机采样代表性 KV(R-93 已锚定) 主 续用
2603.20397 Dell KV Cache 五大家族系统性综述(R-93 已锚定) 主 续用
2609.31415 KV Cache 复用准确性评估方法论质疑(R-93 已锚定) 主 续用
2511.01815 KVTC: KV Cache Transform Coding ICLR 2026(R-93 已锚定) 邻接 续用
2509.23202 Mooncake ACM TOS KV-Centric Disaggregated Architecture(R-93 已锚定) 主 续用

五、行动建议

优先级 行动 对应条目
高 以 2610.01936(RAG 四轴分类学)为基础,在活文档中建立或重构 §2.4 RAG 系统分类学章节 主+1
高 将 ImmRAG(2610.01871)作为 §2.4 Defense 轴的具体威胁案例录入,与 RAG 防御机制并列 主+2
高 将 HeteroFold(2609.32259)录入 §2.6 KV 路由矩阵第五层:异构模型 KV 迁移 主+3
高 将 DISCO(2609.33485)与 KVTC(2511.01815)明确标注为不同维度优化,避免活文档中隐含重叠 主+4 + C2
中 核实 Agent 10x 查询量数据来源(C1)后更新 §2.1 向量库容量规划参数 邻接+5
中 建立三层护栏体系框架(LLM Guardrails / Agent Guardrails / Protocol Guardrails)并与 Defense 轴关联 邻接+6
中 Memorizon(2610.00544)和 HIDE(2609.38886)作为邻接追踪项,关注其在 work-queue 中的处理结果 邻接

六、候选(κ)状态

候选(κ):RAG 评估体系(★第四十五维持) R-94 升至★★★:2610.01936(RAG 四轴分类学)提供了 RAG 评估的顶层框架,其中 Efficiency 轴包含标准 benchmark(retrieval accuracy、latency、memory footprint),Defense 轴包含 faithfulness/attribution 评估,Interactivity 轴包含 multi-turn 对话评估,Reasoning 轴包含 RAG+Reasoning 集成评估——这为候选(κ)的体系化提供了结构锚点。候选(κ)★★★升级,但需等待 work-queue 中 2610.01936 的正式解读卡完成后驱动。


Jay · database E1 预消化轮 · 2026-10-02 20:20 CST