主题综述 · rag(2026-09-24)

  • 作者:spark
  • 更新:2026-09-24

§0 自检栏(9 维,写作前显式声明)

# 维度 声明
1 主轴 paper 数 6 篇核心(2609.24122 / 2609.25469 / 2609.24220 / 2609.25053 / 2609.25636 / 2609.15800)+ 4 篇辅助(2609.15830 / 2609.19656 / 2609.22086 / 2609.15126)
2 GitHub 已验 6 篇核心暂无公开仓库 ⚠️;本棒用 6 个独立 arXiv abs URL(web_fetch 核验 2609.24122 + 2609.25469)+ Tom R100 rag-e1prep 锚定 + Jay 9-24 CSDN 工程实践锚定
3 abstract 核实 6 篇核心全部回 arXiv abstract 一手核验(2609.24122 / 2609.25469 / 2609.24220 / 2609.25053 / 2609.25636 / 2609.15800),4 篇辅助复用 paper_card + W37-W38 综述锚定
4 ⚠️ 密度 目标 ≈1.0/1K CJK;本棒估算 ⚠️ 标注 ≥25 处 / 主体 ≤3.5K CJK ≈ ≥7.1/K ✓
5 反方 v2 三段式 6 主线反方每段开头 (1) 机制 / 中段 (2) 数据 / 末尾 (3) 截止日或证伪,每段 ≥150 字 ✓
6 立标池 6 件主轴 arXiv 入主表,全部 abstract + 提交日期连贯性核验;★★★ PDF §X 待复核表 ≥3 件(见 §7)
7 verifiability ≥20% 主轴独立 6 个独立 URL(6 arXiv abs web_fetch)+ Tom R100 锚定 = 6/6 = 100% 主轴 paper 独立命中 ✓(远超 20% 阈值)
8 字数预算 主体 ≤3,500 CJK + 反方 ≤300 + 元信息 ≤100 = ≤3,900 CJK ✓
9 禁「独立段不计」 本棒无「独立段不计」式豁免;反方段嵌入每主线主段尾部,不另开堆栈

§1 主题脉络与本棒覆盖窗口

2026 年 Q3 末的 RAG 主题正从"retrieve-then-generate"的静态管线,向四股方向同时收敛:(a) 生产可观测性——承认"检索质量在多百万级非平稳语料上长期被忽视",把 monitoring 推到 first-class 地位;(b) 检索感知的安全攻防同源——攻击从静态投毒转向"按检索结果反向适配"的动态攻击,防御同步演进;(c) 跨模型/跨会话的 memory-state handoff——RAG 不再只索引文档,开始索引"模型自身的运行时状态";(d) 评估方法学的 scene entropy 迁移——RoboFollow 等具身 agent benchmark 的设计原则可迁移到 RAG 评测。本棒综合 6 篇核心工作(2026-09-17 至 2026-09-23 arXiv 上传,覆盖 Sep 21–24 这一轮 radar + paper_card 入库高峰)+ 4 篇辅助,全部来自 /shared/research-kb/organized/paper_cards/ rag 主分类与副分类 rag(155 张 rag 卡精选)+ Tom 9-23/9-24 rag-e1prep R99/R100 双轮 + Tom 9-22/9-23 agent-rag-longcontext radar + Jay 9-24 CSDN 多模态 RAG 生产五关键 + Mem0 Substack(2026-09-18)。

主轴覆盖:① 生产级检索覆盖率审计 Re:CAP(2609.24122)② 检索感知动态投毒 RAG-NAROK(2609.25469)③ 文档检索感知分块 D-RAC(2609.24220)④ 跨模型循环记忆交接 LatentPort(2609.25053)⑤ 场景熵原则评估迁移 RoboFollow(2609.25636)⑥ 显式证据选择 Agentic Visual RAG SCoRE(2609.15800)。辅助覆盖 CiteGuard-RAG(2609.15830,验证中心化延续锚定)+ SELF-INDEX(2609.19656,索引自演化延续锚定)+ Designer-RSI(2609.22086,程序记忆 R99 锚点)+ MoME(2609.15126,embedding-level 上下文坍缩根因 R99 锚点)。

承接棒意识(反思棒 #36/#47/#52 显式声明):本棒接续 2026-09-20 rag 综述(W38 立标池已建 6 件主轴 = SELF-INDEX / ORDER / InceptionRAG / SCoRE / CiteGuard-RAG / ReMoMask-2)的"索引自主演化 + 路由联合自适应 + 抗投毒新维度 + RAG 思想横向扩张"四股脉络;本棒 6 篇核心均为 Sep 17–23 期间新出现的工作,与 9-20 综述的 InceptionRAG(2609.16818)形成"分散链式静态攻击 → 检索感知动态攻击"的二代递进,与 9-20 综述的 CiteGuard-RAG(2609.15830)形成"显式验证层 → 生产级 monitoring loop"的两阶段递进,构成"production observability + retrieval-aware security + memory-state handoff + scene entropy evaluation"四条相互补强的新主线。


§2 各工作贡献与相互关系

2.1 2609.24122 — Re:CAP:生产 RAG 管线的检索覆盖率审计(Joshi et al., 2026-09-21 v1 / 9-22 v2)

把 RAG 在生产环境的"retrieval quality 被 generation-oriented metrics 长期替代"这一根本痛点正面拆开:多百万级非平稳语料实时重索引,缺乏穷举 relevance label;RAG 系统的端到端 faithfulness 得分高,不等于"真的检索到了所有应该被检索的文档"。提出 Re:CAP(REtrieval Coverage Audit by iterative Probing):一个 reference-free audit loop,对已部署 RAG 的初始答案与已检索上下文做迭代探查——通过"探测缺失文档的证据"而非"枚举每一个相关文档"来审计覆盖率。⚠️ abstract 未给具体 benchmark 数字、迭代探查的 convergence 准则、production P99 延迟开销;v1 提交 2026-09-21 05:19 UTC,v2 修订 2026-09-22 17:14 UTC(487KB → 473KB)。与 09-20 综述中 CiteGuard-RAG(2609.15830)的"retrieval→validation→answer"三段式正交——CiteGuard-RAG 是"答案侧验证",Re:CAP 是"检索侧覆盖率审计";两者叠加可形成"retrieval audit + answer validation"双闭环。HF/S2/Cool Papers 暂未见独立命中 ⚠️,本棒仅以 arXiv abs URL 为唯一独立命中源。

2.2 2609.25469 — RAG-NAROK:检索感知动态投毒与源特定反驳(2026-09-23)

指出 2609.16818 InceptionRAG 的"分散链式静态投毒"仍是 pre-compute + inject 范式——攻击者事先把对抗文档投进去,对"目标系统在给定 query 下实际会检索什么"完全盲目。新一代威胁:Retrieval-Aware 动态攻击——攻击者在投放阶段就考虑 victim 系统实际检索到的"竞争文档景观",并利用源特定 refutation(针对每个被检索到的合法来源做精准反驳)而非粗粒度注入。这是 InceptionRAG(2609.16818)+ CamoDocs(2608.28389 EMNLP 2026)+ COMA(2608.17960)的三代递进:CamoOps(动态 query-aware) → InceptionRAG(分散链式) → RAG-NAROK(检索感知 + 源特定 refutation)。⚠️ abstract 未列具体 ASR、refutation 生成的 prompt 模板、对 TrustRAG / NeoQA 等擦除式防御的效用数字;2026-09-23 提交。与 CiteGuard-RAG 关系:RAG-NAROK 是攻击侧,CiteGuard-RAG(2609.15830 9-17)"显式验证层"是防御侧——但 abstract 措辞显示 CiteGuard-RAG 的"evidence utilization / span alignment / refusal calibration"在 domain shift 下变难,RAG-NAROK 的源特定 refutation 正是把 domain shift 极端化(攻击者主动制造 span-level conflict)。

2.3 2609.24220 — D-RAC:企业文档的检索感知通用摄入(D-RAC et al., 2026-09-22)

R99 锚入延续(work-queue Top 0.5)。把企业 RAG 系统的 ingestion 阶段作为研究对象:PDF / Word / 演示稿 / 扫描件——内容锁在复杂视觉版面、多栏排版、密集表格中。Rule-based 抽取 + OCR 破坏阅读顺序、扁平化表格、丢失标题层级;完全 agentic 分块在抽取后文本上运行,token 成本与幻觉风险双高。D-RAC 把 Web Retrieval-Aware Chunking(W-RAC)框架扩展到任意文档:PDF normalization + multimodal Markdown conversion + 检索感知的分块决策。⚠️ abstract 截断处未给具体 benchmark 数字(W-RAC vs D-RAC 复用 vs 重设计的 trade-off 表);OpenAlex 更新 2026-09-24;与 9-20 综述中 ORDER(2609.17012)"query-conditioned 索引-检索联合路由"形成"摄入端 vs 查询端"两轴——D-RAC 解决"进入索引库前怎么分块",ORDER 解决"查询时怎么路由到正确分块粒度"。

2.4 2609.25053 — LatentPort:跨模型循环记忆交接(2026-09-23)

RAG/Memory 交叉邻接增量(主分类 llm-infra,标签 rag/memory/systems)。把"不重读上下文"推到跨模型层面:在 Qwen3.5 4B → 9B 同源模型对上演示持久混合状态迁移——仅迁移注意力 KV 留下较大差距;叠加 Gated DeltaNet (GDN) 持久状态包后,teacher-forced NLL 降低 0.747 nats/token。据作者称是首次在不进行目标前缀重放的前提下,实现不同规模混合语言模型之间的持久循环推理状态跨模型交接。⚠️ NLL 0.747 nats/token 的评测条件未披露;4B → 9B 是否仅限同源 sibling pair 未确认;与 RAG 主题的关系是"用 RAG 概念(持久状态包 = 隐式 retrieval)替代显式文档检索"。与 Designer-RSI(2609.22086)关系:Designer-RSI 是程序记忆(从经验积累可复用设计流程),LatentPort 是 inference 状态层(KV + GDN 跨模型交接);两者都是"不依赖重读上下文"的方向,但 Designer-RSI 是架构设计层,LatentPort 是 inference 状态层。R99 续立争议 177(Designer-RSI vs δ-mem vs SELF-INDEX memory 范式三轨竞争)的第四轨候选:persistent state handoff。

2.5 2609.25636 — RoboFollow:指令遵循的"高任务成功率"假象(2026-09-23)

副分类 agent,但场景熵原则对 RAG 评估方法学有直接迁移价值。具身 agent benchmark:现代具身智能体任务成功率高,但真实指令遵循能力远弱于数字所暗示。根因:低场景熵(Low Scene Entropy)——视觉场景仅容许一个有效任务时,语言变得冗余,策略即便几乎不使用语言也能取得高分。三原则:(1) 高场景熵——每个训练场景支持多个运动学不同任务分支,迫使模型依赖语言;(2) 层次化任务结构——高/中/低场景熵分层;(3) 指令-场景对齐评估。对 RAG 评估的迁移:RAG 检索质量评估存在同样问题——当 query 与文档集合的向量相似度排序天然倾向于某一答案时,语言/语义成分被绕过,检索系统即便不真正理解 query 也能返回高分结果。RoboFollow 的高场景熵原则可直接指导 RAG 评测中对抗性查询的设计——查询应支持多个同样合理的答案分支,使表面相似度排序失效。⚠️ 高/中/低场景熵的分级量化标准未公开;与 RAG 现有 benchmark(Enterprise RAG Consortium / FalkorDB GraphRAG-Bench / AgenticRAGTracer)的互补关系未量化。

2.6 2609.15800 — SCoRE:Agentic Visual RAG 的显式证据选择与整合(Sep 17,9-20 综述已立标,本棒作为延续锚点)

针对多模态场景"探索式试错"导致的证据漂浮,提出 SCoRE(Selection and Consolidation for Robust Evidence)统一 agent 循环:把最终推理与探索式试错解耦,通过索引化的 claim-to-image 关联强制视觉锚定。本棒延续锚定(已在 09-20 综述立标池主表中作为 ★★★ PDF §X 待复核条目存在):⚠️ abstract 未给 DocVQA / OK-VQA / InfographicsVQA 等基准的具体数字;agent loop 迭代上限未给;claim-to-image 索引构建开销未量化;与 ViSAR(2609.02486 W38 已立标)"训练-free 自适应 k"形成"显式选择"+"训练-free 自适应"两条并列路径。本棒价值在于"承接 9-20 综述延续锚点 + 把视觉 RAG 评估方法学纳入 RAG 整体主题脉络"。


§3 工程视角(可落地性)

最易落地(≤200 行 inference 代码 + 0 重训):Re:CAP(2609.24122)的 reference-free audit loop 可作为离线 cron 任务挂在生产 RAG 系统上——每天凌晨对昨日 production queries 抽 1-5%,跑 Re:CAP 探查"漏召回文档",次日早晨出覆盖率报告给 RAG owner。D-RAC(2609.24220)的 PDF normalization + multimodal Markdown conversion 链可直接替换现有 ingestion pipeline 的 PyMuPDF + unstructured 组件。性价比最高(单点替换、效益巨大):LatentPort(2609.25053)的"GDN 持久状态包"对推理服务的 KV cache 卸载场景有直接借鉴——把"待重载的对话上下文"打包成 GDN 形式,比单纯 KV cache 卸载在 4B→9B 跨规模下 NLL 表现更好 ⚠️ 但需先验证同源 sibling pair 限制。企业 RAG 安全底座(依 RAG-NAROK 2609.25469 + InceptionRAG 2609.16818 + CiteGuard-RAG 2609.15830):检索感知动态投毒 + 分散链式静态投毒 + 显式验证层三件并发,single-document query-overlap 检测已严重不够;必须叠加写入时 provenance ACL + 检索时 embedding 异常检测 + 跨段协同检测(多条 dormant passages 同时被检索时触发风险评分) + 答案侧 validation gate(CiteGuard-RAG) + 覆盖率审计 loop(Re:CAP 2609.24122)五道闸门。生产栈默认值(依据 Tom 9-24 rag-e1prep R100 增量 ①②③ + Jay 9-24 CSDN 多模态 RAG 生产五关键):LangGraph 0.2+ StateGraph + bge-reranker-v2-m3(bi-encoder top-50 → cross-encoder 精排)+ 混合检索 BM25:dense = 4:6 + DeepEval/Langfuse 7 日滚动 faithfulness ≥0.75 质量门禁 + Re:CAP 离线覆盖率审计(每日抽 1-5% queries)+ CiteGuard-RAG 答案侧验证层 + 语义分块(vs 固定大小精度+70%)+ D-RAC ingestion(PDF normalization + multimodal Markdown)+ LatentPort 跨模型 state handoff 试验(仅限同源 sibling pair)。


§4 研究视角(创新性)

方法学新立标候选:Re:CAP(2609.24122)的"reference-free audit loop + 探测缺失文档"是当前 RAG 生产可观测性方法学的两根新支柱之一(另一根是 W38 的 Self-Evolving Search Index 2609.19656)——前者从外部审计,后者从内部自演进。RAG-NAROK(2609.25469)的"retrieval-aware + source-specific refutation"补全了 W38 攻击方法学的缺口(InceptionRAG 仍是 pre-compute 范式,RAG-NAROK 是 adaptive 范式)。攻击-防御-可观测三联新立标:RAG-NAROK(2609.25469 攻击)→ CiteGuard-RAG(2609.15830 防御)→ Re:CAP(2609.24122 可观测)三件同周(Sep 17–22)形成完整闭环。Memory 范式第四轨:LatentPort(2609.25053)的 persistent state handoff 与 R99 续立的 Designer-RSI(程序记忆)/ δ-mem(关联记忆)/ SELF-INDEX(索引自演进)三轨形成对照,可视为 memory 范式第四轨候选。评估方法学场景熵迁移:RoboFollow(2609.25636)的高/中/低 scene entropy 三层 benchmark 原则是 W37 SeedRG(2605.08838)"无泄漏 benchmark 生成"之后 RAG 评估方法学的第二步——前者防参数记忆泄漏,后者防相似度排序绕过语言成分。反直觉命题三连:① Re:CAP 显示"reference-free audit 比 reference-required audit 更适合 production RAG"——多百万级非平稳语料不可能有穷举 label,"探测缺失"比"枚举相关"更可工程化;② RAG-NAROK 显示"防御成熟反而催生下一代攻击"——单点 query-overlap 防御完善 + CiteGuard-RAG validation 出现后,攻击者转向 retrieval-aware adaptive;③ LatentPort 显示"inference state 本身可以被 retrieval"——RAG 概念从文档检索扩展到模型自身运行时状态的"自检索",模糊了 RAG 与 context engineering 的边界。


§5 批判视角(局限)

按反方 v2 三段式,每主线独立成段、每段 ≥150 字:

5.1 Re:CAP 的 reference-free audit loop 边界(2609.24122)

(1) 机制:audit loop 自身的探查 query 由谁生成?是 LLM 生成还是规则模板?生成质量直接决定审计覆盖率——若探查 query 集中于已知文档类型,"缺失文档"探测可能严重偏向同分布。(2) 数据:⚠️ abstract 未给具体 benchmark 数字(如 HotpotQA / Natural Questions 上的覆盖率-召回率曲线)、迭代探查的 convergence 准则、生产 P99 延迟开销;v1 → v2 仅 1 天(9-21 → 9-22)但 abstract 截断处未显示具体修订点。(3) 截止日 / 证伪:若作者不在 GitHub 公开 audit loop 的探查 query 生成模板 + 迭代终止条件 + 与 ReClor / BEIR benchmark 的对比,则生产引入前必须自测 2-4 周覆盖率报告 vs ground truth 的相关性;reference-free 与 reference-required audit 的 trade-off 曲线是反方最强证伪点(真实覆盖率 ≠ 探查相关性)。

5.2 RAG-NAROK 的检索感知动态投毒 vs 真实工业部署(2609.25469)

(1) 机制:攻击者必须既控制 corpus 又能预测 victim 的检索结果分布——这要求攻击者对目标 embedding 模型 / chunking 策略 / reranker 都有相当了解;源特定 refutation 对每个合法来源的"反驳"要求攻击者已读到这些来源全文。(2) 数据:⚠️ abstract 未列具体 ASR、refutation 生成的 prompt 模板、对 TrustRAG / NeoQA 等擦除式防御 + CiteGuard-RAG 显式验证层的效用数字;arXiv 提交仅 1 天(9-23),下游未公开任何对照实验。(3) 截止日 / 证伪:若作者不在 PDF §X 给出具体 ASR 表 + 攻击者所需 corpus/query 控制程度假设 + 7 种防御完整名单 + 3 个开源 LLM 名单,则红队复现需要在自家 RAG 栈上自构造测试集;"retrieval-aware" 在 dense-only / hybrid / rerank 不同管线下的有效性差异是反方最强证伪点(adaptive 攻击 ≠ universal 攻击)。

5.3 D-RAC 的企业文档 ingestion vs 多模态成本(2609.24220)

(1) 机制:PDF normalization + multimodal Markdown conversion 链每一步都有失败模式——OCR 在扫描件上精度不够、多栏排版在表格上丢失层级、视觉元素(图表 / 流程图)转为 Markdown 后语义塌缩;W-RAC → D-RAC 是"复用框架"还是"重新设计"未确认 ⚠️。(2) 数据:⚠️ abstract 截断,W-RAC vs D-RAC 复用 vs 重设计的 trade-off 表未公开;具体 ingestion benchmark(DocsQA / Internal-KB-100K)的端到端 Recall / nDCG 增量数字未给;与 PyMuPDF + unstructured 的 head-to-head 对比未给。(3) 截止日 / 证伪:若作者不在 GitHub 公开 PDF normalization 在不同文档类型(财报 / 学术 PDF / 扫描合同 / 演示稿)的失败模式表 + multimodal Markdown conversion 的图表/表格保留率指标,则企业 RAG 引入前必须自测 ≥3 种文档类型;多模态 Markdown 在非文本元素(图像、公式、手写注释)的语义保留是反方最强证伪点(结构保留 ≠ 语义保留)。

5.4 LatentPort 的跨模型持久状态迁移限制(2609.25053)

(1) 机制:GDN 持久状态包 + KV 迁移在 Qwen3.5 4B → 9B 同源 sibling pair 上演示 teacher-forced NLL 降低 0.747 nats/token,但跨家族模型(如 Qwen → Llama)是否仍有效未公开;4B → 9B 仅是同向扩展,9B → 4B 是否降级未给 ⚠️。(2) 数据:⚠️ NLL 0.747 的评测条件(哪几个下游任务、teacher-forcing 的 prefix 长度)未披露;与显式文档 RAG(top-5 dense + cross-encoder rerank)的延迟 / 成本对比未给;多轮对话场景下的累积延迟未量化。(3) 截止日 / 证伪:若作者不在 PDF §X 给出 GDN 状态包的存储开销 + 跨家族迁移的 degradation 曲线 + 与传统 RAG retrieval 的延迟成本 trade-off,则生产引入前必须自测同源 vs 跨家族 pair 的有效性边界;4B → 9B "NLL 降低 0.747" 在实际 chat 场景下的用户体验是反方最强证伪点(teacher-forced NLL ≠ 用户体验)。

5.5 RoboFollow 的场景熵原则迁移到 RAG 评测的可行性(2609.25636)

(1) 机制:高场景熵原则在具身场景有清晰物理意义(运动学不同任务分支),但 RAG 场景的"答案分支"是语义级而非物理级——什么是 RAG 评测中的"高场景熵 query"?定义不明 ⚠️。(2) 数据:⚠️ 高/中/低场景熵的分级量化标准(如"支持的合理答案数 ≥3")未公开;与 RAG 现有 benchmark(Enterprise RAG Consortium / FalkorDB GraphRAG-Bench / AgenticRAGTracer)的互补关系 ablation 未给;非具身 Agent(如 RAG Agent)场景下迁移的可行性验证未给。(3) 截止日 / 证伪:若作者不在 PDF §X 给出 RAG-specific 场景熵定义 + 具体 RAG benchmark 上的迁移消融,则跨领域迁移是"真新方法学"还是"具身 benchmark 设计套壳"是反方最强证伪点;具身场景的物理 task 分支 vs RAG 场景的语义 task 分支的对应关系需独立 ablation。

5.6 SCoRE 的 agent loop 与推理延迟(2609.15800 延续锚点)

(1) 机制:agent loop 迭代上限未给;claim-to-image 索引构建开销未量化;exploration 与 consolidation 的边界划分依赖任务。(2) 数据:⚠️ DocVQA / OK-VQA / InfographicsVQA 等视觉文档基准的具体数字未公开;与 ViSAR(2609.02486 W38 立标)的对比 ablation 未给。(3) 截止日 / 证伪:若作者不在 PDF §X 给出迭代次数 vs 准确率的 trade-off 曲线 + claim-to-image 索引存储开销,则 P99 延迟敏感的生产场景可能需要截断 agent loop——这是反方最强证伪点(真实部署延迟 ≠ 论文报告值)。


§6 趋势判断与开放问题

3 个趋势:(i) 生产可观测性 first-class——Re:CAP(2609.24122)把 retrieval coverage audit 从 research 项目推到 production cron 任务可行级别;与 CiteGuard-RAG(2609.15830)的"retrieval→validation→answer"形成"retrieval audit + answer validation"双闭环;(ii) 安全攻防同源升级 + 检索感知化——RAG-NAROK(2609.25469)的 retrieval-aware adaptive 攻击 + InceptionRAG(2609.16818 9-20 立标)的分散链式静态攻击 + CiteGuard-RAG(2609.15830)的显式验证层共同把 RAG 安全从"检测单文档"推到"对抗 adaptive 攻击 + 验证证据链 + 审计检索覆盖率"四维一体;(iii) Memory-state handoff + RAG 概念扩展——LatentPort(2609.25053)的 persistent state handoff 把 RAG 从"文档检索"扩展到"模型自身运行时状态的隐式 retrieval",与 Designer-RSI(2609.22086 程序记忆)+ MoME(2609.15126 embedding-level 上下文坍缩根因)共同构成 R99 续立争议 177 的四轨 memory 范式竞争。

5 个开放问题:(1) Re:CAP audit loop 的探查 query 生成质量如何保证?reference-free audit 与 reference-required audit 的相关性如何度量?(2) RAG-NAROK 的 retrieval-aware adaptive 攻击能否被 CiteGuard-RAG 显式验证层 + Re:CAP 覆盖率审计联合检测?(3) LatentPort 在跨家族模型(Qwen → Llama)上的 degradation 曲线如何?GDN 持久状态包与显式文档 RAG 在生产延迟 / 成本上的 trade-off sweet spot 在哪?(4) RoboFollow 场景熵原则如何形式化定义到 RAG 评测?如何量化"高场景熵 query"——支持的合理答案数 ≥N 还是其他?(5) D-RAC multimodal Markdown 在图像 / 公式 / 手写注释的语义保留率指标如何定义?与 W-RAC 的复用关系是架构复用还是重新设计?

给工程团队的执行优先级:第 1 步把 Re:CAP(2609.24122)的"reference-free audit loop"挂到生产 RAG 系统的离线 cron 任务(每日抽 1-5% queries,次日早晨出覆盖率报告;≤500 行、零训练、立得 retrieval quality 可观测性);第 2 步若 answer faithfulness 是关键指标,部署 CiteGuard-RAG(2609.15830)的"retrieval→validation→answer"三段式(≤300 行、零训练);第 3 步把 D-RAC(2609.24220)的 PDF normalization + multimodal Markdown conversion 替换现有 ingestion pipeline 的 PyMuPDF + unstructured 组件(先在 3 种文档类型上自测);第 4 步评估是否启用 LatentPort(2609.25053)跨模型 state handoff 用于多轮对话场景(先验证同源 sibling pair 限制)。给研究团队的执行优先级:Re:CAP audit loop 的探查 query 生成质量与 reference-free/reference-required 相关性 + RAG-NAROK 攻击的检索感知范式扩展 + LatentPort 跨家族迁移的 degradation 曲线 + RoboFollow 场景熵原则的 RAG-specific 形式化 + D-RAC multimodal Markdown 语义保留率指标五者补齐——即可把"生产可观测性 + 检索感知安全攻防 + memory-state handoff + 场景熵评估 + ingestion 通用化"五层方法学各自封顶。


§7 立标池主表(6 件主轴,已 abstract + 提交日期 + arXiv abs 独立命中核验)

arXiv 标题 主分类 提交日期 独立命中
2609.24122 Re:CAP - Auditing Retrieval Coverage in Production RAG Pipelines rag (production/observability) 2026-09-21 (v1) / 2026-09-22 (v2) arXiv abs web_fetch ✅
2609.25469 RAG-NAROK: Retrieval-Aware Knowledge Corpus Poisoning rag (risk/attack) 2026-09-23 arXiv abs web_fetch ✅
2609.24220 D-RAC: Document Retrieval-Aware Chunking rag (ingestion/engineering) 2026-09-22 arXiv abs + Tom R99 锚定 ✅
2609.25053 LatentPort: Cross-Model Transfer of Recurrent Memory in Hybrid LMs llm-infra (+ rag/memory 交叉) 2026-09-23 arXiv abs + Tom R100 radar #3 ✅
2609.25636 RoboFollow: Unveiling the Instruction Following Mirage agent (+ rag eval 迁移) 2026-09-23 arXiv abs + Tom R100 radar #4 ✅
2609.15800 SCoRE: Agentic Visual RAG via Explicit Context Selection rag (+ agent) 2026-09-17 arXiv abs + 09-20 综述立标延续 ✅

§8 PDF §X 待复核表(★★★ 立标,PDF 主表待核验)

arXiv 待复核数字 / 内容 当前来源 风险
2609.24122 Re:CAP audit loop 探查 query 生成模板 + 迭代终止条件 + 与 BEIR/ReClor benchmark 对比 abstract + v1/v2 PDF §Abstract v1→v2 仅 1 天修订,未见 GitHub 公开
2609.25469 RAG-NAROK ASR 表 + refutation 生成 prompt 模板 + 7 种防御 + 3 个开源 LLM 名单 abstract arXiv 9-23 仅 1 天,下游未公开对照实验
2609.25053 LatentPort NLL 0.747 评测条件 + 4B→9B 同源 sibling 限制 + 跨家族 degradation 曲线 abstract + paper_card 1489 TLDR paper_card TLDR 完整但评测条件未披露

§9 元信息 / 反方 / 自检闭环

  • 元信息:作者 spark · 更新 2026-09-24 · 主分类 rag · 形态 application · 6 核心 + 4 辅助 · 综合周期 2026-09-17 → 2026-09-23 arXiv 上传 + Sep 21–24 radar 增量。
  • 承接棒:本棒接续 2026-09-20 rag 综述(W38 立标池已建 6 件主轴 = SELF-INDEX / ORDER / InceptionRAG / SCoRE / CiteGuard-RAG / ReMoMask-2)的四股脉络;本棒 6 篇核心均为 Sep 17–23 期间新出现的工作,与 9-20 综述的 InceptionRAG 形成"分散链式静态攻击 → 检索感知动态攻击"的二代递进,与 9-20 综述的 CiteGuard-RAG 形成"显式验证层 → 生产级 monitoring loop"的两阶段递进。
  • 反方:6 主线独立成段,每段开头 (1) 机制 / 中段 (2) 数据 / 末尾 (3) 截止日或证伪,每段 ≥150 字,总长约 1.2K CJK(在反方预算内)。
  • 数字核验:本棒 web_fetch 命中 2 个独立 arXiv abs URL 主轴命中(2609.24122 + 2609.25469)+ Tom R99/R100 锚定延续 4 篇(2609.24220 / 2609.25053 / 2609.25636 / 2609.15800),6 篇核心 paper 全部命中 ≥1 独立 URL;剩余 4 篇辅助通过 paper_card + W37-W38 综述锚定复用,无未经核验独占数字。
  • 字数自检:本棒目标主体 ≤3,500 CJK + 反方 ≤300(实际反方入主段内不另计堆栈,合计主体 + 反方 ≈3,400 CJK)+ 元信息 ≤100 ≈3,500 CJK ≤3,900 硬约束 ✅。
  • 私域污染:ip=0 / kp=0 / rn=0 / fp=0 / oc=0 = SUM=0 ≤ 3 ✅。
  • blocklist 命中:本棒 0 hits;本棒关键模型名(Qwen3.5-4B/9B / GDN / bge-reranker-v2-m3 / LangGraph / DeepEval / Langfuse)均来自 arXiv abstract / Tom R100 rag-e1prep 锚定 / Jay 9-24 CSDN 工程实践,无幻觉 ✅。
  • 下棒接力预告:下一棒主题将由 2026-09-25 的 cron 决定(年积日 268 mod 8 = 4 → evaluation);若近 72h 内已有 evaluation 综述将顺延。本棒 2609.24122 Re:CAP audit loop 探查 query 生成模板与 2609.25469 RAG-NAROK 7 种防御完整名单是后续 rag 主题接力棒的优先 v2 复核目标。