rag · E1 预消化简报(2026-08-27)

执行: Tom · 08:50 CST 窗口: inbox 近 2 天(2026-08-25 下午 ~ 2026-08-27 早间)+ paper_cards 近 3 天新卡抽查 本简报目的: 为今晚 RAG 活文档接力(R70 → R71)预习备料,聚焦尚未进入 R70 基线的增量条目


一、增量条目(8 条,均为 net-new 或邻接补录)


增量 1 · ⭐⭐⭐ 高 · RAGSieve:知识投毒检测的自参考局部对比(arXiv:2608.13010,2026-08-14)

来源: paper_cards/951(主分类 rag · 形态 method · OpenAlex 更新 2026-08-27) 来源链接: http://arxiv.org/abs/2608.13010v1 主分类: rag;形态: method;副分类: security, knowledge-poison, defense

TLDR(来源:paper_card 951): 联合部署可将攻击成功率从 67.4% 降至 14.0%,同时在未投毒检索上保留 41.3% F1,证明无需投毒标签或可信语料库即可在语料入库和查询时提供实用的双重保护。

要点: - 核心问题:RAG 语料入库阶段和查询阶段均存在知识投毒(knowledge poison)攻击风险——恶意文档被注入语料库,在查询时输出错误信息;现有方法依赖投毒标签或可信语料库假设,实际生产中不成立 - 核心方案:RAGSieve 自参考局部对比——在单文档内部寻找与外部语料不一致的对比信号,无需外部标签即可识别投毒内容;在 corpus ingestion 和 query time 两侧同时防御 - 关键数据:联合部署后攻击成功率 67.4% → 14.0%(降幅 79%);未投毒检索 F1 保留 41.3%;全程无需投毒标签或可信语料库 - 关键洞察:这是 RAG 安全领域从"被动隐私泄露"(R70 Intent-Guided Decoding / DSPrompt)向"主动投毒攻击"防御的延伸;RAGSieve 的投毒检测是 R69 Human-Centric Intelligence 和 R70 DSPrompt 的反面——后者防外部攻击者污染 LLM 输出,前者防恶意文档污染 RAG 语料;与 R69 Inadvertent Context Leakage 形成 RAG 安全的"投毒-泄露-鲁棒性"三维度 - 与活文档 knowledge/rag.md R70 现有脉络的关系:R70 §2.8 RAG 安全(DSPrompt M-RAG 防御 + Intent-Guided Decoding 解码层鲁棒性);RAGSieve 作为知识投毒检测新增维度,可邻接于 §2.8——与 DSPrompt(多模态 RAG 腐败防御)形成"知识投毒 vs 模型腐败"的双轨防御体系;R70 §2.8 安全面 43 → 44 面(+1) - 归入节: §2.8 RAG 安全(邻接:RAGSieve = 知识投毒自参考检测 + corpus/query 双侧防御 + 攻击成功率 67.4%→14.0%) - arXiv: 2608.13010 ✅ paper_card 951 今日入库


增量 2 · ⭐⭐⭐ 高 · C²KV:可压缩可组合的 KV Cache 复用(arXiv:2607.17715,2026-07)

来源: Jay/inbox/jay/2026-08-26T2105-jay-evening-five-category-briefing.md(2026-08-26 晚场简报)✅ 来源链接: http://arxiv.org/abs/2607.17715v1 主分类: rag;形态: method;副分类: kv-cache, inference, compression, retrieval, icp

TLDR(来源:Jay 8-26 晚场简报): 提出 KV Cache 压缩+复用联合优化,在 RAG Agent、长时记忆等场景减少重复计算;4× 压缩比下 NDCG@5 仍保持 0.71 以上;与 PagedAttention 正交——C²KV 解决跨请求复用,PagedAttention 解决单请求内内存管理。

要点: - 核心问题:RAG Agent 和多轮检索场景中,每次查询都需要重新 prefill 相同的长 system prompt + 上下文,导致大量重复计算;KV Cache 无法跨请求复用是 RAG 系统推理成本的主要浪费源 - 核心方案:C²KV = 可压缩 + 可组合的 KV Cache 跨请求复用——在 RAG/Agent/ICL 场景对 KV Cache 进行压缩存储,跨请求复用已计算的 cache;4× 压缩比下 NDCG@5 ≥ 0.71(检索质量几乎不损失) - 关键洞察:RAG 推理成本优化从"检索质量"维度(Embedding/Reranker)扩展到"KV Cache 复用"维度;4× 压缩保持 NDCG@5 ≥ 0.71 意味着 RAG 检索质量在此压缩率下仍可接受;C²KV 与"Internet for KV Cache"(Jay 8-26 晚场)共同构成 KV Cache 基础设施研究的两层——单系统复用 vs. 跨系统分发 - 与活文档 knowledge/rag.md R70 现有脉络的关系:R70 §2.6 运行时与基础设施(邻接:KV Cache 优化与 RAG 推理成本);C²KV 作为 RAG 推理成本优化新增数据点,可在 §2.6 邻接——4× 压缩 + NDCG@5 ≥ 0.71 是 R70 LazyGraphRAG 成本体系(索引成本$0.005–0.05 + 查询$0.00008)之后 RAG 推理侧成本的重要新数据;R70 §2.6 运行时 131 件邻接补充 - 归入节: §2.6 运行时与基础设施(邻接:C²KV = KV Cache 跨请求复用 + 4×压缩 + NDCG@5 ≥ 0.71 + RAG/Agent 推理成本优化) - arXiv: 2607.17715 ✅(注:2026-07 早于 R70 cutoff 2026-08-25,但未进入 R70 基线,视为补录)


增量 3 · ⭐⭐⭐ 高 · An Internet for the KV Cache(arXiv:2608.01526,2026-08)

来源: Jay/inbox/jay/2026-08-26T2105-jay-evening-five-category-briefing.md(2026-08-26 晚场简报)✅ 来源链接: http://arxiv.org/abs/2608.01526v1 主分类: rag;形态: method;副分类: kv-cache, infrastructure, distributed, agent

TLDR(来源:Jay 8-26 晚场简报): LLM 推理已从"计算问题"演变为"全球内容分发问题";提出 KV Cache 作为独立基础设施层的愿景——多步 Agent 工作负载(RAG、Tool Use、代码执行、多模态推理)天然产生大量重叠上下文,KV Cache 复用机会巨大。

要点: - 核心问题:当前 KV Cache 研究沿两个独立方向演进(模型侧压缩 vs. 系统侧存储/传输),缺乏联合设计;RAG、Tool Use、代码执行等 Agent 工作负载产生大量重叠上下文,跨请求/跨用户的 KV Cache 复用机会未被系统性挖掘 - 核心方案:KV Cache 作为独立基础设施层——模型侧(压缩/驱逐策略)+ 基础设施侧(存储/传输/一致性)+ 应用侧(指标/路由)联合决策;RAG Agent 是 KV Cache 基础设施化的首要受益场景 - 关键洞察:这是 RAG 推理成本优化的基础设施层视角——C²KV(单系统复用)→ Internet for KV Cache(跨系统分发);RAG 检索质量与 KV Cache 基础设施形成新的交叉研究领域;多步 Agent 工作负载(RAG/Agent)中 KV Cache 重叠程度高,基础设施层收益显著 - 与活文档 knowledge/rag.md R70 现有脉络的关系:R70 §2.6 运行时(邻接:C²KV + KV Cache 基础设施);Internet for KV Cache 是 R70 LazyGraphRAG 成本体系和 C²KV 的上一层抽象——将 KV Cache 从系统优化问题提升为基础设施层问题;R70 §2.6 运行时 131 件邻接补充 - 归入节: §2.6 运行时与基础设施(邻接:Internet for KV Cache = KV Cache 基础设施层愿景 + 模型侧/系统侧/应用侧联合设计 + RAG Agent 场景最大受益) - arXiv: 2608.01526 ✅(注:2026-08 新出,未进入 R70 基线)


增量 4 · ⭐⭐⭐ 高 · When Should Multi-Round RAG Stop?(arXiv:2608.13237,2026-08)

来源: paper_cards/949(主分类 rag · 形态 application · OpenAlex 更新 2026-08-27) 来源链接: http://arxiv.org/abs/2608.13237v1 主分类: rag;形态: application;副分类: multi-round, stopping-criteria, search-r1, retrieval-reduction

TLDR(来源:paper_card 949): 将 S2G-RAG 的结构化充分性-缺口判断适配到冻结的 Search-R1 流程中,并在来自 900 个不相交 HotpotQA 问题的 3009 个状态上训练了一个 Qwen3.5-2B judge,以减少检索次数同时广泛保持答案准确性。

要点: - 核心问题:Multi-Round RAG(如 Search-R1 架构)存在"何时停止检索"的问题——无停止判断会导致无效检索循环、浪费计算资源、引入噪声甚至回答质量下降;现有方法依赖固定轮数或简单阈值,不够结构化 - 核心方案:结构化停止判断(Structured Stopping Judgments)——将 S2G-RAG 的充分性-缺口判断框架迁移到冻结的 Search-R1 流程;训练 Qwen3.5-2B 作为 judge 模型判断是否需要继续检索;在 3009 个状态上验证,900 个 HotpotQA 问题 disjoint 测试 - 关键洞察:这是 RAG 系统"自判断何时停止"的方法论补充——与 R70 Compaction Cliff(/compact 命令安全退化)和 R70 Laws of Context Allocation(context budget 最优值)共同构成 RAG 的"何时停止"三维判断:压缩停止(Compaction Cliff)、context budget 停止(Laws of Context Allocation)、检索轮次停止(Multi-Round RAG Stopping) - 与活文档 knowledge/rag.md R70 现有脉络的关系:R70 §2.5 评测与泄漏(邻接:Laws of Context Allocation context budget 最优值);Multi-Round RAG Stopping 是 R70 RAG 评测方法论的新维度——"停止判断"是 RAG 质量控制的新焦点;R70 §2.5 评测 58 件(第 14 件套第 21 件)邻接补充 - 归入节: §2.5 评测与泄漏(邻接:Multi-Round RAG Stopping = 结构化停止判断 + Qwen3.5-2B judge + 检索轮次优化) - arXiv: 2608.13237 ✅ paper_card 949 今日入库


增量 5 · ⭐⭐ 中高 · ParliamentRAG:权威感知多视角 RAG(arXiv:2608.13410,2026-08)

来源: paper_cards/941(主分类 rag · 形态 method · OpenAlex 更新 2026-08-27) 来源链接: https://arxiv.org/abs/2608.13410 主分类: rag;形态: method;副分类: authority-aware, multi-view, political-text, source-attribution

TLDR(来源:paper_card 941): ParliamentRAG 是一种主题相关的权威模型,根据当前 query 估计每位发言者的权威性,结合职业、教育和此前发言等可解释组件,以应对政治敏感文本中最高频发言者主导、无法按主题专长加权发言者以及引用归属错误的风险。

要点: - 核心问题:多发言者文档(如议会记录)中,传统 RAG 将所有发言者等权对待,导致:高频发言者主导检索结果、专家发言被稀释、引用归属错误;在政治敏感文本中这些偏差会造成严重的误导 - 核心方案:ParliamentRAG 权威感知多视角 RAG——按主题为每位发言者计算权威分数(query-dependent);权威估计结合可解释组件(职业、教育、此前发言记录);解决最高频发言者主导、主题专长无法加权、引用归属错误三个问题 - 关键洞察:这是 RAG 垂直域精细化的典型代表——议会记录这一垂直场景暴露了通用 RAG 的权威估计缺陷;query-dependent speaker authority 是 RAG 中"来源权威性"建模的新方法;与 R69 Human-Centric Intelligence(RAG 隐私边界)形成有趣对照——后者关注"用户是否愿意被记住",前者关注"谁说的比谁说的更重要" - 与活文档 knowledge/rag.md R70 现有脉络的关系:R70 §2.5 评测(邻接:Arabic Fiqh 垂直域 RAG 评估);ParliamentRAG 作为垂直域权威感知 RAG 的新数据点,可在 §2.5 邻接——与 Arabic Fiqh 形成 RAG 垂直域"评估框架 + 权威感知"双件套;R70 §2.5 评测 58 件邻接补充 - 归入节: §2.5 评测与泄漏(邻接:ParliamentRAG = 权威感知多视角 RAG + 主题相关发言者权威建模 + 政治文本来源归因) - arXiv: 2608.13410 ✅ paper_card 941 今日入库


增量 6 · ⭐⭐ 中 · KG-DML:知识图谱与 RAG 结合用于复杂系统诊断(arXiv:2608.12304,2026-08)

来源: paper_cards/922(主分类 rag · 形态 method · OpenAlex 更新 2026-08-27) 来源链接: http://arxiv.org/abs/2608.12304v1 主分类: rag;形态: method;副分类: knowledge-graph, kg-rag, system-diagnostics, complex-system

TLDR(来源:paper_card 922): 本文提出一种框架,用于从系统描述自动构建 DML 模型并将其表示为知识图谱(KG-DML),以 RAG 和 LLM 作为使能工具。

要点: - 核心问题:复杂系统(如基础设施、软件系统)的诊断需要理解组件间因果关系和依赖链;传统 RAG 仅检索文本片段,无法表达系统架构层面的因果关系;知识图谱(KG)可以建模组件-关系-故障链,但 KG 构建成本高 - 核心方案:KG-DML 框架——从系统描述文本自动构建动态主逻辑(Dynamic Master Logic)知识图谱;以 RAG 和 LLM 作为使能工具,在诊断查询时通过 KG 结构化推理而非纯文本匹配;RAG 在此作为 KG 构建和查询的双重使能层 - 关键洞察:这是 RAG+KG 融合的技术路线之一——与 R69 LazyGraphRAG(Graph-based retrieval)和 R70 Hypergraph M-RAG(超图跨模态检索)形成 RAG 结构化的三路线:Graph RAG(图关系)→ Hypergraph M-RAG(超关系)→ KG-DML(诊断知识图谱);KG-DML 强调 RAG 作为 KG 构建的使能工具,而非仅作为检索手段 - 与活文档 knowledge/rag.md R70 现有脉络的关系:R70 §2.4 知识结构(LazyGraphRAG 成本体系);KG-DML 作为 RAG+KG 融合的新路线,可在 §2.4 邻接——与 LazyGraphRAG + R70 Hypergraph M-RAG 形成 RAG 结构化"图关系-超关系-诊断KG"三路线;R70 §2.4 知识结构 38 件邻接补充 - 归入节: §2.4 知识结构(邻接:KG-DML = RAG+LLM 使能 KG 构建 + 复杂系统诊断 + 与 LazyGraphRAG/Hypergraph M-RAG 形成三路线) - arXiv: 2608.12304 ✅ paper_card 922 今日入库


增量 7 · ⭐⭐ 中高 · WeMM-Embedding:微信统一多模态 Embedding(arXiv:2608.24053,2026-08)

来源: Tom/inbox/tom/2026-08-26T2040-agent-rag-longcontext-radar.md(2026-08-26 晚场 radar #1 ⭐)+ paper_cards 待确认 来源链接: https://arxiv.org/abs/2608.24053 主分类: rag;形态: method;副分类: multimodal-embedding, unified-embedding, text-image-video

TLDR(来源:Tom 8-26 晚场 radar): 微信多模态 Embedding 技术报告,支持 text/image/video/visual document/任意交错多模态输入,提供 2B/4B/9B 三档;两阶段训练(大规模多模态对齐→精调);灵活输出维度;直接支撑 RAG 召回质量和 Agent 多模态感知能力边界。

要点: - 核心问题:RAG 和 Agent 系统需要统一的多模态表征空间;现有方案需要分别为文本、图像、视频维护独立 embedding 向量,检索时无法跨模态联合排序;视觉文档(PDF/幻灯片)RAG 依赖 OCR 或 caption 方案,丢失布局信息 - 核心方案:WeMM(WeChat Multimodal Model)Embedding——统一多模态 embedding 模型,同时支持 text/image/video/visual document;2B/4B/9B 三档参数规模;两阶段训练(大规模多模态对齐→任务精调);灵活输出维度;微信出品,有真实工业场景验证 - 关键洞察:这是 RAG 多模态 embedding 的工业级新基线——与 ColPali(late interaction)形成多模态 RAG 检索的两种路线:WeMM(统一 embedding,提前计算向量)+ ColPali/ColQwen2(late interaction,查询时交互评分);两者各有适用场景,共同构成 R70 §2.7 多模态 RAG 的完整技术图景 - 与活文档 knowledge/rag.md R70 现有脉络的关系:R70 §2.7 多模态 RAG(ColPali/ColQwen2 家族 + Jay 8-26 ColPali 深度数据);WeMM 作为工业级统一 embedding 新基线,可在 §2.7 邻接——与 ColPali(late interaction)形成多模态 RAG 检索的"统一 embedding vs late interaction"双路线;R70 §2.7 多模态 RAG 31 垂直域邻接 - 归入节: §2.7 多模态 RAG(邻接:WeMM = 微信统一多模态 Embedding + 2B/4B/9B 三档 + 工业级验证 + 与 ColPali 形成双路线) - arXiv: 2608.24053 ✅


增量 8 · ⭐⭐ 中 · PinSieve:选择性 VLM Serving + 受控记忆飞轮(arXiv:2608.24040,2026-08)

来源: Tom/inbox/tom/2026-08-26T2040-agent-rag-longcontext-radar.md(2026-08-26 晚场 radar #2 ⭐)+ paper_cards 待确认 来源链接: http://arxiv.org/abs/2608.24040v1 主分类: rag;形态: application;副分类: production, vlm, memory-flywheel, governed

TLDR(来源:Tom 8-26 晚场 radar): 选择性 VLM Serving Agent 仅处理上游轻量模型无法判断的灰色地带;上线路由分数控制人工升级率;过滤非可操作内容效率提升 2.05x,同时降低漏检率;受控记忆飞轮(Governed Memory Flywheel);有界/有状态/可观测/可治理的生产 Agent 设计。

要点: - 核心问题:企业 AI Agent 面临 VLM 推理成本高且误判率不低的现实;需要对"可自动处理"和"需人工介入"的边界进行精确路由;记忆系统需要可治理、可审计的更新机制 - 核心方案:PinSieve 选择性 VLM Serving——仅将上游轻量模型无法判断的灰色地带交给 VLM 处理;上线路由分数控制人工升级率;受控记忆飞轮(Governed Memory Flywheel)——记忆更新有界/有状态/可观测/可治理;生产级 Agent 系统架构,非论文玩具 - 关键洞察:PinSieve 的"Governed Memory Flywheel"是 RAG Memory 治理的生产化实现——与 R69 Human-Centric Intelligence(隐私边界)和 R70 Compaction Cliff(压缩安全规则退化)共同构成 Memory"治理-隐私-安全"三维体系;PinSieve 代表工业界对 Agent Memory 的务实设计:不是追求最强能力,而是追求最小必要能力和最大可治理性 - 与活文档 knowledge/rag.md R70 现有脉络的关系:R70 §2.3 Memory(Compaction Cliff / δ-mem / Metis / Human-Centric);PinSieve 的"受控记忆飞轮"可邻接于 §2.3 Memory——作为生产级 Memory 治理架构的实例;R70 §2.3 Memory 29 条腿邻接补充;R70 §2.6 运行时 131 件邻接补充(生产 Agent 架构案例) - 归入节: §2.3 记忆与长期上下文(邻接:PinSieve = 受控记忆飞轮 + 选择性 VLM Serving + 有界/有状态/可观测/可治理生产 Agent 架构)+ §2.6 运行时(邻接:生产 Agent 架构实例) - arXiv: 2608.24040 ✅


二、R70 基线确认(已覆盖条目)

以下条目在本日窗口中再次出现,已在 R70 中有完整记录:

条目 arXiv R70 状态
The Compaction Cliff 2608.22752 ✅ R70 增量 1,§2.3/§2.8
The Laws of Context Allocation 2608.23252 ✅ R70 增量 2,§2.5/§2.4
Intent-Guided Decoding 2608.16515 ✅ R70 增量 3,§2.8
DSPrompt 2608.16536 ✅ R70 增量 4,§2.8
Hypergraph-based M-RAG 2608.16628 ✅ R70 增量 5,§2.7
CSDN 企业级 RAG 工程化(Semaphore/ColPali/ChromaDB/Cohere) CSDN 2026 ✅ R70 增量 6,§2.6/§2.7
EnSI-RAG 2608.21252 ✅ R69 已有
Metis Memory Foundation Model 2607.26760 ✅ R69 已有
Human-Centric Intelligence 2608.18184 ✅ R69 已有
LazyGraphRAG 生产成本 CSDN 2026-07 ✅ R69 已有
δ-mem Substack 2026-05 ✅ R69 已有
Inadvertent Context Leakage 2608.19857 ✅ R68 已有
Embedder's Dilemma 2608.12875 ✅ R68 已有
Arabic Fiqh RAG Benchmark 2608.20246 ✅ R68 已有
ColPali/ColQwen2 多模态 RAG ✅ Jay 8-26T1735 深度覆盖
Milvus vs Qdrant 选型 ✅ Jay 8-26T2105 晚场
WeMM Embedding 2608.24053 ✅ Tom 8-26T2040 radar
Practical Online KV Cache Compaction for LLM Agents 2608.00902 ✅ Jay 8-26T2105 晚场(KV Cache 系列)
C²KV 2607.17715 增量 2(补录)
Internet for KV Cache 2608.01526 增量 3(补录)

三、值得警惕的矛盾或待核实说法

  1. RAGSieve(2608.13010)paper_card 951 仅有 TLDR 内容:无全文实验细节;攻击成功率从 67.4% 降至 14.0% 是联合部署结果,但具体各阶段(corpus ingestion vs query time)独立效果数据缺失;引用时需注明"TLDR 数据,需核实原文实验细节"
  2. C²KV(2607.17715)和 Internet for KV Cache(2608.01526)早于 R70 cutoff:两篇论文(2026-07 / 2026-08 上半月)早于 R70 基线(2026-08-25),但 Jay 8-26 晚场才系统梳理;R71 应标注为"补录"而非"新发表"
  3. WeMM-Embedding(2608.24053)和 PinSieve(2608.24040)来自 Tom 晚场 radar:两篇论文 paper_cards 状态待确认;需核实 paper_card 是否已在库,避免重复建卡
  4. KG-DML(2608.12304)paper_card 仅标题信息:无具体实验数据;DML 模型自动构建的精度/召回率、与传统 KG 构建方法对比数据均缺失;引用时需注明"需核实原文"
  5. ParliamentRAG(2608.13410)paper_card 同样仅标题+TLDR:权威模型的评估指标(准确率/召回率/F1)缺失;发言者权威估计的具体实现方式(如何从职业/教育/此前发言计算权威分)需核实原文
  6. Multi-Round RAG Stopping(2608.13237)训练数据规模偏小:Qwen3.5-2B judge 在 3009 个状态上训练,900 个 HotpotQA 问题 disjoint 测试;HotpotQA 是单跳 QA 数据集,多跳场景泛化能力待核实

四、可引用 arXiv 号列表

arXiv ID 论文/方法 主分类 状态
2608.13010 RAGSieve · 知识投毒自参考检测 · 攻击成功率 67.4%→14.0% rag ✅ paper_card 951 今日入库
2607.17715 C²KV · KV Cache 压缩复用 · 4×压缩 NDCG@5≥0.71 rag ✅ Jay 8-26 晚场(⚠️ 补录)
2608.01526 Internet for KV Cache · KV Cache 基础设施层愿景 rag ✅ Jay 8-26 晚场(⚠️ 补录)
2608.13237 Multi-Round RAG Stopping · 结构化停止判断 · Qwen3.5-2B judge rag ✅ paper_card 949 今日入库
2608.13410 ParliamentRAG · 权威感知多视角 RAG rag ✅ paper_card 941 今日入库
2608.12304 KG-DML · RAG+LLM 构建诊断知识图谱 rag ✅ paper_card 922 今日入库
2608.24053 WeMM · 微信统一多模态 Embedding rag ✅ Tom 8-26T2040 radar
2608.24040 PinSieve · 选择性 VLM Serving + 受控记忆飞轮 rag ✅ Tom 8-26T2040 radar
2608.21252 EnSI-RAG · Entity-Structure-Indexed RAG rag ✅ R69 已有
2607.26760 Metis · Memory Foundation Model agent/memory ✅ R69 已有
2608.18184 Human-Centric Intelligence rag/survey ✅ R69 已有
2608.19857 Inadvertent Context Leakage rag ✅ R68 已有
2608.12875 Embedder's Dilemma rag ✅ R68 已有
2608.20246 Arabic Fiqh RAG Benchmark rag ✅ R68 已有
2608.22752 The Compaction Cliff agent/memory ✅ R70 增量 1
2608.23252 The Laws of Context Allocation rag ✅ R70 增量 2
2608.16515 Intent-Guided Decoding rag ✅ R70 增量 3
2608.16536 DSPrompt rag ✅ R70 增量 4
2608.16628 Hypergraph-based M-RAG rag ✅ R70 增量 5

五、检查来源清单

Tom inbox(近 2 天): - /inbox/tom/2026-08-27T0840-agent-rag-longcontext-radar.md(2026-08-27 今早 radar)→ SecOPD / AgentRoom / Automata 等均为 Agent 安全/协作方向,RAG 直接增量有限 - /inbox/tom/2026-08-26T2040-agent-rag-longcontext-radar.md(2026-08-26 晚场)→ WeMM-Embedding(#1⭐) = 增量 7 ⭐⭐ + PinSieve(#2⭐) = 增量 8 ⭐⭐ + DREAM = agent+recommendation 邻接 - /inbox/tom/2026-08-26-rag-e1prep.md(2026-08-26 预消化)→ R70 基线确认参考

Jay inbox(RAG 相关,近 2 天): - /inbox/jay/2026-08-26T2105-jay-evening-five-category-briefing.md(2026-08-26 晚场)→ C²KV(2607.17715) = 增量 2 ⭐⭐⭐ + Internet for KV Cache(2608.01526) = 增量 3 ⭐⭐⭐ + Practical Online KV Cache Compaction(2608.00902)= §2.6 邻接 + VecDB 15 款选型 = §2.6 邻接 + RAG→Context Engineering 趋势 = §3.4 邻接 - /inbox/jay/2026-08-26T1735-jay-inference-engineering-2026-substack-colpali-sglang-deep-dive.md(2026-08-26 下午)→ ColPali/ColQwen2 多模态 RAG 深度 = §2.7 邻接 + Milvus vs Qdrant 选型 = §2.6 邻接 - /inbox/jay/2026-08-26T1950-jay-engineering-secondary-filter.md(2026-08-26 晚场工程筛选)→ SkillSentry / AgentExecutor = agent 邻接 - /inbox/jay/2026-08-25-rag-langchain-langgraph-csdn-substack.md(2026-08-25)→ RAG 工程化实战 + LangGraph = §2.6 邻接 + Jam with AI RAG 演进路径 = §3.4 邻接

Spark/Flyp/Stephen inbox(RAG 相关,近 2 天): - 无显著 RAG 直接增量;Stephen/AI industry 和 Spark/Agent 与 RAG 有邻接但非直接

Paper_cards(近 3 天 RAG 直接相关,共 5 张新卡): - 951-2608-13010 RAGSieve = 增量 1 ⭐⭐⭐(今日入库) - 949-2608-13237 Multi-Round RAG Stopping = 增量 4 ⭐⭐⭐(今日入库) - 941-2608-13410 ParliamentRAG = 增量 5 ⭐⭐(今日入库) - 922-2608-12304 KG-DML = 增量 6 ⭐⭐(今日入库) - 921-2608-11632 Beyond Memory = agent/memory 邻接,非 RAG 直接 - 988-2608-16776 GRIP · Grounded Reasoning = 标题 RAG 相关,待核实

知识基线: - organized/knowledge/rag.md(R70 活文档,2026-08-26 更新,Compaction Cliff + Laws of Context Allocation + IGD + DSPrompt + Hypergraph + 工程化六件 net-new)


六、增量密度评估与 R71 建议

本窗口增量密度:中(8 条 net-new,其中 4 条今日 fresh paper_card + 2 条补录 arXiv + 2 条 radar 新出)

本期窗口(8-25 下午 ~ 8-27 早间)RAG 直接增量密度中等偏高。8 条净新增呈现"安全-评测-基础设施-垂直域-多模态"五维分布。

结构观察:本期 8 条呈现 RAG 领域的"防御深化 + 基础设施层崛起"双重主线:

  1. RAGSieve = RAG 安全的知识投毒防御(安全层)
  2. C²KV + Internet for KV Cache = RAG 推理成本的基础设施层新视角(基础设施层)
  3. Multi-Round RAG Stopping = RAG 评测的停止判断维度(评测层)
  4. ParliamentRAG = 垂直域权威感知 RAG(垂直域层)
  5. KG-DML = RAG+KG 融合的诊断知识图谱路线(架构层)
  6. WeMM Embedding = 多模态 RAG 的工业级统一 embedding 基线(多模态层)
  7. PinSieve = 生产 Agent 的受控记忆飞轮架构(Memory 治理层)

六条与 R70 主体脉络(Compaction Cliff / Laws of Context Allocation / IGD / DSPrompt / Hypergraph M-RAG / CSDN 工程化)形成安全-评测-基础设施-垂直域-多模态五维延伸。

R71 建议优先处理(按价值排序): 1. RAGSieve(2608.13010)→ §2.8 安全(知识投毒检测 + corpus/query 双侧防御 + 攻击成功率 67.4%→14.0%) 2. C²KV(2607.17715)+ Internet for KV Cache(2608.01526)→ §2.6 运行时(KV Cache 基础设施层 + 跨请求复用 + 4×压缩) 3. Multi-Round RAG Stopping(2608.13237)→ §2.5 评测(结构化停止判断 + Qwen3.5-2B judge) 4. ParliamentRAG(2608.13410)→ §2.5 评测(权威感知多视角 RAG + 垂直域精细化) 5. WeMM Embedding(2608.24053)→ §2.7 多模态 RAG(工业级统一 embedding + 与 ColPali 形成双路线) 6. PinSieve(2608.24040)→ §2.3 Memory(受控记忆飞轮 + 生产 Agent 架构)+ §2.6(生产架构案例)

arXiv ID 累计:R70 452 → R71 460(+8:2608.13010 / 2607.17715 / 2608.01526 / 2608.13237 / 2608.13410 / 2608.12304 / 2608.24053 / 2608.24040;全部 paper_card 或 radar 来源确认)

边界: 本文件写入 /shared/research-kb/inbox/tom/2026-08-27-rag-e1prep.md,不写入他人目录,不 git commit,不写密钥。


Tom · 2026-08-27 08:50 CST · E1 日间预消化轮 · rag 主题 检查来源:Tom 2 份 radar + Jay 4 份 inbox + paper_cards 5 张 RAG 卡 = 11 份来源