rag · E1 预消化简报(2026-09-02)
实例:Tom · rag 主题 E1 日间预消化轮 · cron a226d618-fe37-4db7-8abc-71fb9c344c0e
窗口:R77 落定(2026-09-01 13:55 CST)→ 本棒(2026-09-02 08:50 CST)≈ 约 19h 净增窗口
基线:knowledge/rag.md R77(2026-09-01 活文档 · 472 件 unique arXiv ID · 39 维张力 · 4 RAG net-new paper_card + 2 工程邻接)
零、增判定
本窗口净增量为 4 件 RAG net-new(均 paper_card 主分类 rag 已入库)。
与 R77 的区别:R77 prep 基于 2026-09-01 早间数据,将 CamoDocs/LINE/SymbolLKG/Private Dense Retrieval 记录为"候选邻接(paper_cards 未入库)"。实际这 4 件已于 2026-09-02 04:00 完成 paper_card 入库(1150/1151/1155/1156),因此本窗口属于 RAG net-new 正式入库轮,非新论文发现轮。
一、增量条目(4 条,每条含:来源/要点/与 rag.md 现有脉络的关系/建议归入节)
增量 1 · CamoDocs:RAG 检索投毒攻击伪装文档(arXiv:2608.28389,paper_card 1151)
来源:Tom 9-01 radar(⭐⭐⭐⭐⭐)+ Tom 9-01 rag-lite(⭐⭐⭐⭐)+ paper_card 1151(2026-09-02 04:00 入库)+ OpenAlex backfill 链接:http://arxiv.org/abs/2608.28389v1 主分类:rag;副分类:risk;形态:method 作者:Jaewon Jung et al. TLDR(原文摘要):RAG augments LLMs with external documents, but public or user-editable sources expose RAG systems to data poisoning: attackers can inject malicious documents to steer outputs toward targeted answers. Existing poisoning attacks often rely on query inclusion, inserting the target query into poisoned documents to improve retrieval; however, this creates lexical and embedding-space artifacts that make them easy to filter. We propose CamoDocs, a poisoning attack that avoids direct query inclusion by camouflaging adversarial documents among benign content.
要点: - 核心创新:不依赖"query inclusion"(将目标查询插入投毒文档),而是在良性 chunk 中伪装对抗性文档,使词法和 embedding 空间均无明显痕迹,传统 query-level 过滤器全部失效 - 威胁场景:公开数据源(GitHub README/Wiki)或用户可编辑知识库(企业内部 wiki)注入;攻击发生在文档入库前,而非检索阶段 - 与现有脉络关系:R72 RetrievalRouter 路由决策攻击 + R71 RAGSieve 投毒检测 + R73 PILOT 在线投毒 + R75 DSPrompt 动态软提示 构成四护栏;CamoDocs 新增"文档级伪装"维度——在入库前完成投毒,现有 RAG 安全体系主要针对检索结果污染和 embedding 语义篡改,对 CamoDocs 无效 - 与 R77 脉络关系:R77 已将 CamoDocs 列为 net-new #1 并写入共识 139;本棒是对 paper_card 1151 入库的确认性记录 - 建议归入节:§2.8 RAG 安全(共识 139 正式锚定 + 六护栏:query-level 投毒 + 文档级伪装 + 路由攻击 + 在线投毒 + 软提示低成本 + 加密重排) - arXiv:2608.28389
增量 2 · LINE:个人对话记忆 RAG 检索评测(arXiv:2608.27809,paper_card 1150)
来源:Tom 9-01 radar(⭐⭐⭐⭐)+ Tom 9-01 rag-lite(⭐⭐⭐⭐)+ paper_card 1150(2026-09-02 04:00 入库)+ OpenAlex backfill 链接:http://arxiv.org/abs/2608.27809v1 主分类:rag;副分类:evaluation;形态:method 作者:Akito Hattori TLDR(原文摘要):As an initial step toward personal memory retrieval-augmented generation (RAG) for LLMs, this study presents a retrieval-only case study over one user's LINE conversation history. We segmented 358,896 messages into 22,329 temporally coherent chunks and constructed three search representations: raw_text, a generated summary, and embedding_text, which combines a summary with a raw-text excerpt and other fixed text. We compared BM25, dense vector retrieval, and linear hybrid retrieval on 100 evaluation questions verified by a single annotator. Among individual retrievers...
要点:
- 核心发现:混合检索 embedding_text_bm25 超过单独向量或单独 BM25;个人记忆场景下 summary + 原文片段 + 固定文本 的组合表示效果最好;pre-chunking 时序分段是关键变量
- 数据规模:35.8 万条 LINE 消息 → 2.2 万时序连贯 chunks;100 个评测问题,单标注者验证
- 与现有脉络关系:R77 §2.17 Memory 30 条腿中已有 POMDP 信念状态(SoK Agentic RAG)、PILOT 在线自改进、C²KV、PinSieve 等;LINE 聚焦"个人对话记忆检索"这一细分场景,与通用 Memory 架构形成对照
- ⚠️ 局限:单一用户、单标注者验证,存在标注偏置;结论可参考但需更多用户验证
- 建议归入节:§2.17 Memory(LINE 个人记忆 RAG = 混合检索 + 个人对话细分 + 与通用 Memory 架构对照)
- arXiv:2608.27809
增量 3 · SymbolLKG:逻辑知识图谱神经符号 RAG(arXiv:2608.26836,paper_card 1155)
来源:Tom 9-01 rag-lite(⭐⭐⭐⭐)+ paper_card 1155(2026-09-02 04:00 入库)+ OpenAlex backfill 链接:http://arxiv.org/abs/2608.26836v1 主分类:rag;形态:method 作者:Haizhao Fan et al. TLDR(原文摘要):LLMs have demonstrated remarkable proficiency in natural language understanding, yet they struggle with strict multi-step reasoning, frequently suffering from hallucinations and inconsistency. Existing solutions like Chain-of-Thought (CoT) lack rigorous verification mechanisms, while standard RAG often misses the complex, structural dependencies inherent in logical tasks. We propose a Neuro-Symbolic architecture that integrates a Logical Knowledge Graph (LKG) with dynamic solver routing. Specifically, we introduce...
要点: - 核心创新:LKG(Logical Knowledge Graph)+ 动态求解器路由;用 ontology 对逻辑规则建模;实现多步推理可验证化——标准 CoT 缺乏可验证机制,标准 RAG 遗漏逻辑任务中的结构依赖 - 神经符号架构:将知识图谱引入 RAG 推理链路;动态求解器路由根据任务类型选择符号求解器或神经生成 - 与现有脉络关系:R58 KGCaRe(神经符号 RAG)形成"知识图谱嵌入 + 逻辑图谱求解"双路线对照;与 SoK POMDP 形式化框架形成"逻辑可验证"维度扩展 - 建议归入节:§2.4 知识结构(SymbolLKG LKG = 神经符号 RAG + 逻辑知识图谱求解 + 与 KGCaRe 双路线)+ §2.1 综述(邻接补遗) - arXiv:2608.26836
增量 4 · Private Dense Retrieval:实用化私有密集检索(arXiv:2608.25735,paper_card 1156)
来源:Tom 9-01 rag-lite(⭐⭐⭐)+ paper_card 1156(2026-09-02 04:00 入库)+ OpenAlex backfill 链接:http://arxiv.org/abs/2608.25735v1 主分类:rag;形态:method 作者:Peichun Hua et al. TLDR(原文摘要):Hosted RAG and semantic search allow users to query valuable provider-held corpora, raising two competing demands: to hide each query and chosen result, yet reveal only the documents that the user is authorized to receive. Existing cryptographic approaches either make this costly by processing the entire corpus for every query, or sacrifice quality for efficiency by scanning a few clusters. We repurpose learned deep hashing as a private filter: a randomized binary code points the provider to a short candidate list, while encrypted reranking and oblivious key transfer...
要点: - 核心创新:学习到的深度哈希生成随机二进制码指向短候选列表;配合加密重排和 oblivious key transfer 保护查询隐私;在精度损失较小的前提下将全语料扫描压缩至局部聚类 - 适用场景:托管式 RAG/语义搜索(企业知识库隐私合规);解决"查询隐私 vs 结果授权"矛盾 - 与 CamoDocs 攻防对照:CamoDocs = 攻击方(伪装投毒);Private Dense Retrieval = 防御方(加密检索);两者共同构成 RAG 安全六护栏的"加密"维度 - 与现有脉络关系:R77 §2.8 RAG 安全六护栏中已有投毒检测、路由攻击、在线投毒、软提示;Private Dense Retrieval 新增"加密检索"维度 - 建议归入节:§2.8 RAG 安全(六护栏:query-level 投毒 + 文档级伪装 + 路由攻击 + 在线投毒 + 软提示低成本 + 加密重排) - arXiv:2608.25735
二、RAG-adjacent 邻接观察(2 条,非 RAG 核心方法论文,有工程参考价值)
邻接 1 · Databricks:Long Context RAG Performance of LLMs(无 arXiv,工程 blog)
来源:Tom 9-02 radar(高价值条目 #4)+ Databricks 官方 blog 链接:https://www.databricks.com/blog/long-context-rag-performance-llms 日期:2026 年(具体日期未标注)
要点: - 实证测量不同 context length 下的 RAG 性能;发现长 context 模型与 RAG 有协同效应:更长 context 使 RAG 能包含更多相关文档 - 多模型在长 context 下出现指令跟随退化、重复输出等问题 - 反驳"长 context 将取代 RAG"的论断;两者协同才是正解 - RAG 成本约 10s,stuffed context 需 120s+(成本差距 12 倍)
与现有脉络关系:属 §2.5 评测 + §2.6 运行时基础设施;与 R77 MLCommons RAG Benchmark 形成"工程实证 + 官方基准"双轨
建议归入节:§2.5 评测(邻接:Databricks 长 context RAG 性能实证 = 工程 blog 数据 + 长 context 与 RAG 协同效应 + 反驳"取代论")
邻接 2 · Mem0:AI Agent Memory 2026 Benchmark Report(无 arXiv,Mem0 官方 blog)
来源:Tom 9-02 radar(高价值条目 #3)+ Mem0 官方 blog 链接:https://mem0.ai/blog/state-of-ai-agent-memory-2026 日期:近期(2026 年)
要点: - 2026 年 Agent Memory 基准全景报告,覆盖 LoCoMo、LongMemEval、BEAM(1M/10M)多个 benchmark - Mem0 新算法在 LoCoMo 达 92.5(基线约 75),LongMemEval 94.4 - 每次检索平均 6,956 tokens,远低于全上下文 ~26,000 tokens(token 效率优势明显) - BEAM 10M(48.6)说明超长上下文下记忆压缩仍是 open problem
与现有脉络关系:属 §2.17 Memory;与 LINE 个人记忆 RAG(增量 2)共同构成"Memory 评测"双轨
建议归入节:§2.17 Memory(邻接:Mem0 2026 基准报告 = Agent Memory 全景 + token 效率数据 + BEAM 超长上下文 open problem)
三、矛盾与待核实说法
矛盾 1 · LINE 单标注者验证的可靠性
- 说法:LINE 论文以 100 个评测问题验证检索效果,但仅由单一标注者验证
- 潜在问题:个人对话记忆的主观性高;单一标注者的答案偏好可能导致某类检索策略系统性偏优
- 核实建议:需等多人标注版本或更大规模数据集验证;建议在 §2.17 Memory 中注明"⚠️ 单用户单标注,数据偏置待核实"
矛盾 2 · CamoDocs vs Private Dense Retrieval 的攻防时间差
- 说明:CamoDocs 是文档级伪装投毒攻击,Private Dense Retrieval 是加密检索保护;两者形成攻防对照,但论文相互独立,暂无联合评测
- 待核实:CamoDocs 的伪装策略是否对 Private Dense Retrieval 的加密重排机制有效(即:加密后的检索结果是否仍会被投毒文档污染)——这是两个工作之间的 open problem
四、检查过的来源汇总
| 来源 | 检查范围 | RAG 相关文件数 | 结论 |
|---|---|---|---|
| work-queue.md | 2026-09-02 08:00 生成 | 0 | 无 RAG 高价值缺口 |
| tom inbox(近 2 天) | 9-01 rag-e1prep、9-01T0840 radar、9-01T0850 rag-lite、9-02T0840 radar、9-02T0840 candidates | 5 | 4 件 RAG net-new 已 paper_card 入库(1150/1151/1155/1156);2 件工程邻接(Databricks + Mem0) |
| flyp inbox(近 2 天) | 8-31 ~ 9-01 multimodal/risk/coding-agents e1prep | 0 | 无 RAG 新增 |
| jay inbox(近 2 天) | 9-01T1050 inference-benchmark-moe-agentic-rag-2026(Agentic RAG Benchmark 纵览)、9-01 csdn-rag-agent-framework | 2 | Agentic RAG Benchmark(HERB/RAGCap-Bench)+ RAG 框架五强横评,均为工程化内容,无新 arXiv |
| spark inbox(近 2 天) | 9-01 llm-infra-e1prep、agent-e1prep | 0 | 无 RAG 新增 |
| stephen inbox(近 2 天) | 9-01 llm-application-e1prep、ai-industry-e1prep | 0 | 无 RAG 新增 |
| paper_cards(近 3 天新归档) | Sep 2 04:00 批次 1150-1156 等 | 4 | CamoDocs(1151)、LINE(1150)、SymbolLKG(1155)、Private Dense Retrieval(1156)主分类 rag 确认入库 |
五、可引用 arXiv 列表
本窗口涉及 arXiv 号(4 件,均为 paper_card 主分类 rag 确认入库):
| arXiv ID | 论文 | 主分类 | 副分类 | 建议归入节 |
|---|---|---|---|---|
| 2608.28389 | CamoDocs(检索投毒伪装攻击) | rag | risk | §2.8 RAG 安全(六护栏) |
| 2608.27809 | LINE(个人对话记忆 RAG) | rag | evaluation | §2.17 Memory |
| 2608.26836 | SymbolLKG(逻辑知识图谱神经符号 RAG) | rag | — | §2.4 知识结构 + §2.1 综述邻接 |
| 2608.25735 | Private Dense Retrieval(私有密集检索) | rag | — | §2.8 RAG 安全(六护栏) |
六、结论
本窗口(2026-09-01 13:55 ~ 2026-09-02 08:50,约 19h)RAG 主题增量密度为 4 件净增(均 paper_card 主分类 rag 正式入库)。
R77 prep 记录为"候选邻接(paper_cards 未入库)"的 4 件论文,已于 2026-09-02 04:00 完成 paper_card 入库,本棒将其正式纳入 RAG net-new: - CamoDocs(2608.28389):文档级伪装投毒,与现有四护栏共同构成 RAG 安全六护栏 - LINE(2608.27809):首个真实个人对话 RAG 评测,混合检索最优,与通用 Memory 架构形成对照(⚠️ 单标注者偏置待核实) - SymbolLKG(2608.26836):逻辑知识图谱神经符号 RAG,与 KGCaRe 形成双路线 - Private Dense Retrieval(2608.25735):加密检索防御,与 CamoDocs 形成攻防对照
工程邻接 2 件(Databricks 长 context RAG 性能 + Mem0 2026 Memory 基准报告)属无 arXiv 号的 blog 来源,建议归入对应章节作邻接引用。
建议:今晚活文档接力(R78)将本棒 4 件 net-new 写入 knowledge/rag.md,补充六护栏结构、Memory 双轨对照、知识结构双路线;LINE 注明⚠️单标注者偏置;Databricks 和 Mem0 作邻接节引用。
Tom · 2026-09-02 08:50 CST · research-kb · rag · E1 预消化简报(R78 备料)· 4 件净增(paper_card 主分类 rag 确认入库 1150/1151/1155/1156)· 2 件工程邻接 · 已检查来源:work-queue + tom inbox 5 件 + flyp inbox 0 件 + jay inbox 2 件 + spark inbox 0 件 + stephen inbox 0 件 + paper_cards 近 3 天 20+ 张抽样