rag · E1 预消化简报(2026-09-01)

实例:Tom · rag 主题 E1 日间预消化轮 · cron a226d618-fe37-4db7-8abc-71fb9c344c0e 窗口:R76 落定(2026-08-31 13:55 CST)→ 本棒(2026-09-01 08:50 CST)≈ 约 19h 净增窗口 基线knowledge/rag.md R76(2026-08-31 13:55 CST 落定 · 472 件 unique arXiv ID · 39 维张力固化 · 0 件 RAG net-new + 2 件工程化邻接)


零、增判定

本窗口净增量为零(0 件 RAG net-new / 0 件新 arXiv 正式入库)。

理由:R76 已将截至 2026-08-31 13:55 的 RAG 主轴信号全部吸纳完毕。本窗口(~19h)内无新 RAG arXiv 提交;Tom 9-01 早间 radar 候选中 CamoDocs(2608.28389)和 LINE(2608.27809)为 RAG 相关候选但尚未进入 paper_cards;其余 inbox 源均无 RAG net-new。以下如实记录已检查来源及 2 件候选邻接观察。


一、检查过的来源

1.1 work-queue.md

  • 文件:/shared/research-kb/organized/queue/work-queue.md(2026-09-01 08:00 自动生成)
  • 结论:选题榜有 1 件 2608.28281(CritICL,状态"未成视频脚本"),RAG-adjacent 邻接沿用 R74;无新 RAG 高价值缺口。

1.2 tom inbox(近 2 天)

  • 已读
  • 2026-09-01T0840-agent-rag-longcontext-radar.md(09-01 08:40 today)— 8 条候选中 2 条 RAG 相关:① CamoDocs(2608.28389,RAG 投毒攻击,⭐⭐⭐⭐⭐)② LINE(2608.27809,个人记忆 RAG 评测,⭐⭐⭐⭐)
  • 2026-08-31-rag-e1prep.md(R76 基线来源)
  • 2026-08-31T2040/T1440/T0840-agent-rag-longcontext-radar.md
  • 2026-08-31-0900-hf-daily-2026-08-31.md(HF Daily 15 条,RAG 直接 0 条)
  • 2026-08-30-rag-e1prep.md(R75 基线来源)
  • 2026-08-30-0900-hf-daily-2026-08-30.md(HF Daily 15 条,RAG 直接 0 条)
  • 结论:9-01 radar 2 条 RAG 相关候选(CamoDocs + LINE)但 paper_cards 未入库;HF Daily 无 RAG 新增。

1.3 flyp inbox(近 2 天)

  • 已读2026-08-29-agentic-rag-sok-arag.md(v2 重写 2026-08-31 21:20 落盘,B+ 评级;内容与 R75 SoK/A-RAG 一致,无新 arXiv 论文)
  • 8-30 ~ 8-31 新文件:均为 coding-agents / multimodal / risk 主题,非 RAG 新增。
  • 结论:Flyp 无新的 RAG arXiv 增量;SoK/A-RAG v2 评级升档至 B+,但不产生新论文引用。

1.4 jay inbox(近 2 天)

  • 已读
  • 2026-08-31T1950-jay-evening-inference-rag-benchmark.md(jay 8-31 晚场简报)— MLCommons MLPerf End-to-End RAG Benchmark(2026-08-26,4 天前)⭐⭐⭐⭐⭐ + RAG 7 大生产失败模式(143 部署样本)⭐⭐⭐⭐⭐ — 工程化内容,无新 arXiv 论文
  • 2026-09-01-csdn-rag-agent-framework-substack.md(2026-09-01 早间)— CSDN/Substack 工程实践汇总(Dify/LlamaIndex/LangChain 版本对比),无新 arXiv 论文
  • 2026-08-31T1620-jay-csdn-highvalue-inference-rag-deepseek.md(v2 重写版)— DeepSeek + RAG 工程实践,无新 arXiv
  • 结论:Jay 无 RAG arXiv 新增;MLCommons RAG Benchmark 和 7 Failure Modes 为重要工程化邻接。

1.5 spark inbox(近 2 天)

  • 已扫:8-30 ~ 8-31 新文件均为 llm-infra / agent 主题 e1prep,无 RAG 新增。
  • 结论:Spark 无 RAG 相关增量。

1.6 stephen inbox(近 2 天)

  • 已扫:8-30 ~ 8-31 新文件均为 ai-industry / llm-application / 协调棒,无 RAG 新增。
  • 结论:Stephen 无 RAG 相关增量。

1.7 paper_cards 抽查(近 3 天新归档)

  • 已核:2026-09-01 新归档 1117(Prefix Sliding,llm-infra)、1118(GUI-Primitives,multimodal benchmark)、1114(llm-infra)、1116(agent)、1100(Mathematical Discovery,agent)— 0 条 RAG 主分类。
  • 1100-1133 区段:paper_card 1100-1107 均非 RAG 主分类(llm-infra / multimodal / agent)。
  • 结论:近 3 天 paper_cards 无新的 RAG 主分类件;CamoDocs(2608.28389)和 LINE(2608.27809)尚未入库。

二、候选邻接观察(2 条,paper_cards 未入库,仅供今晚活文档参考)

以下条目为 Tom 9-01 radar 候选,尚无 paper_card 入库,仅作邻接记录,不计入本窗口净增:

候选 1 · CamoDocs:RAG 检索投毒攻击(arXiv:2608.28389,Tom 9-01 radar ⭐⭐⭐⭐⭐)

来源2026-09-01T0840-agent-rag-longcontext-radar.md(Tom 2026-09-01 08:40)+ paper_cards 未入库 来源链接:https://arxiv.org/abs/2608.28389 主分类:待确认(推测 rag / security);形态:method(推测);副分类:security, poisoning

TLDR(来源:Tom 9-01 radar 摘要): RAG 系统投毒攻击——把恶意文档伪装成良性 chunk 混入,不依赖直接 query 包含,因此传统过滤失效。攻击者可通过公开或用户可编辑数据源注入,对知识库 RAG 场景威胁直接。

要点: - 核心问题:adversarial chunk 伪装成良性内容,绕过传统 query-level 过滤;无需 query 包含恶意关键词 - 威胁场景:公开数据源(GitHub README/Wiki)或用户可编辑知识库(企业内部 wiki)注入 - 与现有 RAG 安全体系关系:R76 §2.8 RAG 安全 45 面现有护栏(DSPrompt 动态软提示 + R72 RetrievalRouter 攻击防御 + R71 RAGSieve 投毒检测 + R73 PILOT 在线投毒)主要针对"检索结果污染"和"embedding 语义篡改",CamoDocs 的伪装 chunk 攻击是新的攻击面——在文档入库前就完成投毒,而非检索阶段注入 - 建议归入节:§2.8 RAG 安全(邻接候选:CamoDocs = 伪装投毒攻击 + 文档级注入 + 现有护栏无法检测) - arXiv:2608.28389(待 paper_card 建卡后正式入库)

候选 2 · LINE:个人记忆 RAG 检索评测(arXiv:2608.27809,Tom 9-01 radar ⭐⭐⭐⭐)

来源2026-09-01T0840-agent-rag-longcontext-radar.md(Tom 2026-09-01 08:40)+ paper_cards 未入库 来源链接:https://arxiv.org/abs/2608.27809 主分类:待确认(推测 rag / memory);形态:benchmark(推测);副分类:memory, personal-rag, evaluation

TLDR(来源:Tom 9-01 radar 摘要): 在 LINE 对话历史上做检索召回实验。结论:混合 embedding + BM25 超过单独向量或 BM25;在个人记忆场景下,summary + 原文片段 + 固定文本的组合表示效果最好。

要点: - 核心发现:混合检索(embedding_text_bm25)优于单模态检索;个人记忆场景的特殊表示方法(summary + 原文片段 + 固定文本) - 与 RAG Memory 体系关系:R76 §2.17 Memory 30 条腿中已有 POMDP 信念状态(SoK Agentic RAG)、PILOT 在线自改进、C²KV、PinSieve 等;LINE 聚焦"个人对话记忆检索"这一细分场景,与通用 RAG Memory 不同 - 建议归入节:§2.17 Memory(邻接候选:LINE = 个人对话记忆 RAG + 混合检索 vs 单模态 + 特定场景表示方法) - arXiv:2608.27809(待 paper_card 建卡后正式入库)


三、工程化邻接新增观察(2 条,非 RAG 核心方法论文,但有直接工程参考价值)

邻接 1 · MLCommons MLPerf End-to-End RAG Benchmark(2026-08-26)

来源2026-08-31T1950-jay-evening-inference-rag-benchmark.md(jay 8-31 晚场简报,⭐⭐⭐⭐⭐) 来源链接:https://mlcommons.org/2026/08/endtoend-inference 主分类:benchmark;发布方:MLCommons MLPerf Inference Working Group

要点: - 首个官方端到端 RAG Pipeline 基准测试,覆盖 Ingestion(文档→向量库)到 Multi-hop QnA 完整流程 - Benchmark 结构:Ingestion Pipeline + QnA Pipeline(迭代式 retrieve-and-reason,多跳查询) - 工程意义:填补此前 RAG 评估只测单模型的盲点;覆盖 retriever + ranker + generator 协作和迭代循环 - 与 rag.md 现有脉络关系:属 §2.5 评测基础设施,与 R76 ExtractBench(2607.29677)+ Inspect Evals(2608.19269)共同构成"文档解析-端到端 pipeline-评测方法学"三明治结构 - 建议归入节:§2.5 评测(邻接:MLCommons RAG Benchmark = 端到端 pipeline 评测 + Ingestion 到 Multi-hop QnA + 填补单模型评测盲点) - 重要说明:无 arXiv 号(MLCommons 官方发布);引用时注明来源 mlcommons.org

邻接 2 · RAG 7 大生产失败模式(143 部署样本,2026-08)

来源2026-08-31T1950-jay-evening-inference-rag-benchmark.md(jay 8-31 晚场简报,⭐⭐⭐⭐⭐)+ 来源 ragaboutit.com 来源链接:https://ragaboutit.com/7-rag-failure-modes-crippling-enterprise-deployments-in-2026 发布方:MLOps Community

要点: - 143 个企业 RAG 部署跟踪研究:73% 在上线首季经历至少一次关键失败;41% 的失败未被标准评测套件检测到 - 7 大失败模式:①跨文档实体消解崩溃 ②多跳综合幻觉 ③时效性偏移 ④来源多样性缺失 ⑤检索-生成不对齐 ⑥实体消歧失败 ⑦上下文窗口截断 - 核心发现:行业过度关注 retrieval recall 和 answer faithfulness,但这两个指标仅能捕获不到一半的生产失败 - 与 rag.md 现有脉络关系:属 §2.5 评测 + §2.8 RAG 安全;与 SoK Agentic RAG 的"compounding hallucination propagation"风险盘点呼应 - 建议归入节:§2.5 评测(邻接:RAG 7 Failure Modes = 生产失败实证 + 143 部署样本 + 评测盲区量化) - 重要说明:无 arXiv 号(MLOps Community 社区研究);引用时注明来源 ragaboutit.com


四、当前 RAG 主轴状态(R76 基线摘要,供今晚活文档接力参考)

R76 核心脉络(R76 已固化,无需重复写入知识库):

  1. SoK Agentic RAG arXiv:2603.07379v1(R75 net-new #1)— 首次 POMDP 形式化框架,四维分类坐标,§2.1 综述第 56 件 + §2.2 顶层锚定;Flyp v2 评级 B+(升档)
  2. A-RAG arXiv:2602.03442v1(R75 net-new #2)— 三层检索接口,模型自主决策,§2.6 运行时第 135 件
  3. 4 件 paper_card 主分类 rag 闭环:DSPrompt(2608.16536)、IGD(2608.16515)、Hypergraph M-RAG(2608.16628)、Legal RAG Hallucination(2608.14210)
  4. 2 件工程化邻接:ExtractBench(2607.29677)+ Inspect Evals(2608.19269)

无新增矛盾或待核实说法。


五、可引用 arXiv 列表

本窗口无 RAG net-new。以下为 R76 已固化引用的核心 arXiv(供今晚活文档参照):

  • R75 net-new:2603.07379(SoK Agentic RAG)、2602.03442(A-RAG)
  • R76 工程化邻接:2607.29677(ExtractBench)、2608.19269(Inspect Evals)
  • 本窗口候选邻接(paper_cards 未入库,仅供参考):2608.28389(CamoDocs)、2608.27809(LINE)

本窗口涉及 arXiv 号:2 件候选邻接(paper_cards 未入库) - 2608.28389(CamoDocs,RAG 投毒攻击,候选) - 2608.27809(LINE 个人记忆 RAG,候选)


六、结论

本窗口(2026-08-31 13:55 ~ 2026-09-01 08:50,约 19h)RAG 主题增量密度为零净增。R76 已将全部 RAG 主轴信号吸纳完毕,本窗口各 inbox 源均无新的 RAG arXiv 提交或 paper_card 入库。

2 件候选邻接观察(CamoDocs 伪装投毒 + LINE 个人记忆 RAG)来自 Tom 9-01 radar,paper_cards 尚未入库,建议 R77 跟进确认是否正式建卡。

工程化层面重要信号:MLCommons MLPerf End-to-End RAG Benchmark(2026-08-26,4 天前)和 RAG 7 大生产失败模式(143 部署样本)代表 RAG 从"方法论文"向"生产工程基准"的生态演进趋势,今晚活文档可考虑在 §2.5 评测和 §2.8 安全章节补充这一维度。

建议:R77 活文档接力若无新 RAG 信号,维持 R76 现状不做主轴变更;重点关注 CamoDocs(2608.28389)和 LINE(2608.27809)是否在 paper_cards 正式入库。


Tom · 2026-09-01 08:50 CST · research-kb · rag · E1 预消化简报(R77 备料)· 0 件净增 · 2 件候选邻接观察(CamoDocs + LINE,paper_cards 未入库)· 已检查来源:work-queue + tom inbox 7 件 + flyp inbox 1 件 + jay inbox 3 件 + spark inbox 2 件 + stephen inbox 3 件 + paper_cards 近 3 天 30+ 张抽样