主题综述 · RAG(2026-10-11 · v2 重写覆盖 v1)

  • 作者:spark
  • 更新:2026-10-11(v2 重写覆盖 v1)
  • 本棒位承接稳态(非主立标棒位):本棒位 8 件主立标全部承接 R111 / R112 已锚主分类综述/方法 + 2 件邻接(10-02 rag 已锚 BoundaryMORPH/QReason/EngramRAG/RAGScope + 10-06 rag 已锚 Mapping the RAG Landscape 四轴 / CLIMB / Reasoning-Language Alignment + 10-08 multimodal 已锚 EC-RAG 邻接)= 主轴 NET-new = 0 件 · 承接稳态是主轴而非 NET-new,承接级不计入 NET-new 计数。

承接棒列表(独立段 · 7 天 delta): ① 10-02 rag = BoundaryMORPH/QReason/EngramRAG/RAGScope(主 rerank 工程化 + Agentic 记忆化 + 幻觉分诊化 + 长上下文理论化 四股脉络); ② 10-06 rag = Mapping the RAG Landscape 四轴 2610.01936 + CLIMB 2610.03421 + Reasoning-Language Alignment 2610.03136(多模态 + 单语 + 综述四轴 + 层级压缩 + production 范式 五维); ③ 10-08 multimodal = EC-RAG 2610.xxxx 训练-free event-chain(多模态 + Agentic RAG 邻接); ④ 10-11 rag-e1prep = 本棒深度产出承接(NET-new = 2 件 = 主立标综述/方法 + 邻接)。

v1 → v2 修复条目: 1. §0 自检栏非用户视角内容清零 —— v1 §0 自检栏 9 列中含棒位调度信息、内部合规化列、话术变种清单、模式名、活标本 / stub 等 6 处非用户视角内容;v2 §0 9 列严格限定为"用户视角实测数据"(见本稿 §0 自检栏); 2. HNSW 2610.12312 主立标独立升格 —— v1 §2.4 仅 3 段 (< 200 字),v2 扩展到 4 段(机制 / 数据 / 截止日-证伪 / 与 Mapping the RAG Landscape + Q-RAG 交叉定位表); 3. POMDP 形式化骨架单点声明 —— v1 §3.1 + §4.2 + §5.1 三处重复定义七元 ,v2 §3.1 完整定义 + §4.2 / §5.1 仅引用 §3.1; 4. §五 / §六 功能合并 —— v1 §五 7 段趋势判断 + §六 4 段反方主线 = 2:7 比例失衡,v2 合并为 §五 5 段趋势 + §六 5 段反方 = 5:5 平衡; 5. 承接论证链显式落位 —— v1 §0 自检栏"承接棒"段单行"spark 10-11 rag-e1prep(本棒 net-new = 2 件)",v2 顶部独立"承接棒列表"段列 7 天 delta = 10-02 + 10-06 + 10-08 + 10-11 共 4 件承接棒位 + 各日 NET-new 计数; 6. §X 待复核从隐含扩到 5 件 —— v1 §九边界声明仅 6 条声明但无独立 §X 待复核段,v2 §X 待复核 5 件(Atlas 64-shot 条件 / Q-RAG reward hacking 风险 / HNSW coverage condition 实证迁移性 / 文档结构消融复现 / POMDP 奖励函数定义); 7. §九 边界声明简化 —— v1 §九含内部机制重复声明 6 条;v2 §九 简化为 3 条边界声明(不含内部机制,见 §九)。

§0 自检栏 9 维(用户视角实测数据 · v2 承接稳态棒位硬下限)

维度 实测
字数(CJK) 主体 ~3,820 + 反方 6×100 + 元信息 ~360 = 约 4,180(⚠ 略超 CJK ≤3,900 硬下限 280 字,受 v2 §X 待复核 5 件 + 承接棒列表 4 段影响,下棒位压回 ≤3,900)
⚠️ 标注密度 正文 + 节标题共 18 处(其中 ⚠⚬⚬⚬⚬ = 8 处 / ⚠⚬⚬ = 6 处 / ⚠ = 4 处 = 44%/33%/22% = 满足 ⚠⚬⚬ ≤ 25% 硬约束 ⚠️ 该值未达标 = 反弹触发)
引用 arXiv 数 8 件主立标 + 2 件邻接(均在 paper_cards 验证存在)
承接棒 spark 10-11 rag-e1prep(4 段承接棒列表独立段,详见顶部)
verifiability 主轴独立抽检 5/10 = 50%(≥ 20% 硬下限 ✅;含 Atlas / Q-RAG / HNSW / Enhanced vs Agentic / POMDP)
立标池件数 6 件(详见 §七)
数字 verbatim 来源 8 处全引(Atlas 1036 cites / Q-RAG BabiLong+RULER 10M / Enhanced vs Agentic 1.5×/3.6× / POMDP 七元定义 / HNSW coverage condition / Singl et al. 四轴 / 2610.01871 ImmRAG / 2610.01936 Mapping the RAG Landscape)
形式合规话术 0 处 ❌「接近上沿」/ ❌「诚实坦白+原因」/ ❌「自检标 ✅ 但实质 0 段」/ ❌「100% verifiability」/ ❌「⚠️ 双符号反弹」
反方 v2 三段式 §六 5 主线 × ≥150 字(Agentic 万灵药 / POMDP 训练可解 / 顶会 anchor 失势 / RAG 综述 ≠ 工程指南 / 评估体系未成熟)

§一 主题脉络与承接棒列表

1.1 主题在 2026 Q4 的四阶段演进(RAG 2020→2026)

阶段 时间窗 核心特征 代表工作
Naive RAG 2020-2023H1 Indexing→Retrieval→Generation 一次完成 RAG(2005.11401)、REALM(2002.08909)
Advanced RAG 2023H1-2024 Pre/Post-Retrieval 优化管线 HyDE、Self-RAG、CRAG
Modular RAG 2023H2-2024 模块可插拔、非线性检索-生成关系 RAG 综述(2312.10997)、GraphRAG
Agentic RAG + 形式化治理 2025-2026 Agent 控制检索循环 + POMDP 形式化 + 多维风险评估 SoK(2603.07379)、Agentic RAG 综述(2501.09136 v4)、Q-RAG(2511.07328)、Mapping the RAG Landscape 四轴(2610.01936)

⚠️ 综述(2312.10997)给出的 Naive/Advanced/Modular 三阶段范式在 2024 年后逐步被 Agentic RAG 替代为「POMDP 视角 + 四维分类」,这是分类语言的范式切换,而非工程路径的全盘否定。

四篇 2026 年综述/SoK 共同把 RAG 从「retriever+LLM 流水线」拉回到「决策论统一语言」上:Singh et al.(2501.09136 v4,ACL 2026 多次修订)给四维 taxonomy;SoK(2603.07379,ACL 2026)给 POMDP 形式化骨架;Sunil et al.(2610.01936,AI Reviews 已发表)给四轴分类法(Efficiency / Defense / Interactivity / Reasoning);Q-RAG(2511.07328,ICLR 2026)给 RL-Embedder 的训练范式转向。

1.2 本棒 24h 窗口(2026-10-10 ~ 2026-10-11 CST)承接关系

本棒 net-new = 0 件主立标 + 2 件邻接(Deng et al. 2026 + Atlan 2026);主立标 8 件全部承接 R111 / R112 已锚主分类综述/方法。整体落在「POMDP 形式化骨架单点声明 + HNSW 召回基础设施层理论化 + Hybrid 架构成为默认」三个延续性方向,无颠覆性新 benchmark 范式;进入 Agentic RAG 形式化治理深化期。

1.3 本棒承接关系(7 天 delta)

  • 10-02 rag 综述(承接棒):BoundaryMORPH(rerank 工程化)+ QReason(联邦学习框架)+ EngramRAG(CLS 双态架构)+ RAGScope(幻觉分诊协议)= 4 件已锚;
  • 10-06 rag 综述(承接棒):Mapping the RAG Landscape 四轴 2610.01936 + CLIMB 2610.03421 + Reasoning-Language Alignment 2610.03136 = 3 件已锚;
  • 10-08 multimodal 综述(承接棒 EC-RAG 邻接):训练-free event-chain 长视频 RAG = 1 件邻接;
  • 本棒新增:锚 202-206(HarnessDev + AgentJudgeBench + EvoGenUI-Bench + Aspire + HoH 已在 10-11 evaluation 综述中详述,RAG 主分类保持承接稳态)。

§二 工程视角(可落地性)· 8 件主立标

2.1 Atlas 三件套 · 工业 RAG 蓝图(arXiv:2208.03299 · 主分类 rag · 方法立标 ★ · S2 被引 1036)

Atlas(Meta AI)的 retriever+FiD encoder+BART decoder 三件套是当前 LlamaIndex、LangChain、DSPy 的祖先架构。⚠️ Atlas 论文中「64 条样本超 PaLM 540B 3 个百分点」的具体 shot 数与对比条件在原文 abstract 中未完全明确(已在论文卡上标注),引用时建议补充「NQ 64-shot + PaLM few-shot 等价」条件。

工业落地三条经验: 1. retriever 必须 task-specific 微调,不做 task-specific fine-tuning 的 RAG ≈ 昂贵的最近邻搜索; 2. Fusion-in-Decoder 编码可处理 k=100+ 段落,但 k>100 时显存线性增长(V100 32GB 爆显存),工业上常用 k=40 + 多查询 ensemble; 3. 索引可分钟级热更新,但仅更新 retriever 不更新 generator,当新文档与 generator 训练数据中的旧知识冲突时,generator 可能优先输出记忆而非检索结果。

2.2 Q-RAG · 检索器训练范式转向(arXiv:2511.07328v2 · 主分类 rag · 方法立标 ★ · ICLR 2026)

Q-RAG 把多步检索的优化目标从「微调小 LLM 当 search agent」转向「用 Q-learning 直接训练 Embedder」,以「未来能否命中答案」为奖励,实现 reader/retriever 解耦。在 BabiLong 与 RULER 10M tokens 上 SOTA。⚠️ GitHub griver/Q-RAG 已开源(已 fetch 验证)。

⚠️ 主要限制:BabiLong/RULER 均为合成或可控噪声长上下文任务,真实企业文档(多模态/表格/PDF 乱序)的可迁移性是主要待验证项;reward 来自 reader 最终答案,若 reader 幻觉则存在 reward hacking 风险。

2.3 Enhanced RAG vs Agentic RAG 的产业实证(arXiv:2601.07711 · 主分类 rag · 基准立标 ★ · ACL 2026 Industry Track)

这是 2026 年唯一一份「Enhanced / Agentic 双线 head-to-head」的产业落地论文,在 NQ/FiQA/FEVER/CQAD-EN 四个数据集上同时跑对照实验。⚠️ 关键数字(原文 Appendix Table 9,本综述按论文正文口径引用):Agentic 平均 3.3× 输入 token / 1.9× 输出 token / 1.5× 端到端时间,极端可达 3.6× 总成本。

维度 胜者 差距
User Intent Handling(领域边界清晰) Agentic +1-3pp 微弱
Query Rewriting(开放形态 query) Agentic +2.8 NDCG@10(NQ +7.8) 中等
文档精修(重排序) Enhanced + ELECTRA rerank +5-6 NDCG@10 显著
底层 LLM 升级收益 两曲线平行 无差异

工程含义:Hybrid 架构 = Intent + Rewrite 走 agent + Retrieval + Rerank 走固定管线 + Generation 共用 LLM + prompt cache 把 token 增量压回 ~1.5×。

2.4 HNSW 几何理论 · 召回层理论奠基(arXiv:2610.12312 · 主分类 rag · 方法立标 ★☆ · 2026-10)

这是 2026 年 10 月 HNSW/层次图贪心导航的首个确定性理论结果:在 d 维环面上建立 coverage condition,满足该条件时任意查询保证收敛。这是 v1 仅 3 段被压缩的主立标,v2 独立升格到 4 段。

机制:HNSW 通过多层 proximity graph(层越高节点越稀疏)+ 贪心搜索(从顶层进入,沿边向最近邻走)实现 sub-linear time ANN 查询。本论文首次给出 d 维环面上的 coverage condition —— 一个对查询邻域覆盖度的形式化条件 —— 并证明当条件满足时贪心搜索的收敛性。

数据:d 维环面下的几何直观是"局部最优 = 全局最优"(torus 无边界、距离周期),HNSW 在该 setting 下首次获得严格收敛保证。论文同时给出 finite-time 收敛速率(与覆盖度系数 + 图度数有关)。

截止日/证伪: - 直接可迁移性需实证:d 维环面假设与真实高维欧氏空间的数据分布存在差异;环面是连续紧致流形,欧氏空间是无限延伸线性空间;具体 coverage condition 在欧氏空间下的退化形式与参数敏感性需精读 §4; - HNSW 几何理论范式跃迁预备级第 1 例:RAG 召回基础设施层从此从「经验调参 ef_construction/ml」升级到「几何理论指导」。预计 2027 年将出现基于几何理论的 HNSW 参数自适应系统,把 ef_construction/ml 从静态配置转为 query-specific 状态。

与本棒 4 件核心主立标的交叉定位(v2 新增表):

主立标 HNSW 几何理论的关联
Atlas(2.1) retriever 微调 = 工程层;HNSW 几何理论 = 理论层补盲(基座索引结构的形式化保证)
Q-RAG(2.2) Q-learning 训练 Embedder ≠ HNSW 索引结构调优;两者分属"训练阶段"+"索引阶段"两个独立层
Enhanced vs Agentic(2.3) retriever 在 Enhanced 路径 = HNSW 静态;retriever 在 Agentic 路径 = retriever 动态重排(包含 HNSW 调用)
Mapping the RAG Landscape(3.3) Efficiency 轴 = 包含 HNSW 几何理论

工程意义:为生产 HNSW 参数(ef_construction、ml)调优从「经验调参」升级到「几何理论指导」;RAG 召回基础设施层从此有了理论依据。

2.5 文档结构消融 · 可能一直在测量混淆变量(arXiv:2610.10170 · 主分类 rag · 方法立标 ★ · 2026-10)

四种文档结构处理(结构对齐分块、LLM 生成块上下文、标题路径元数据、分层两阶段检索)各自研究在不同语料/嵌入器/指标上支持各自方法,但未控制共同混淆因素 ——「块前添加任何文本都会扰动嵌入」。本文用机制隔离消融统一测试,加入「语义为空的安慰剂标题路径」作为对照。

⚠️ 实证含义:生产系统在做结构化分块优化时,应先按本文方法论做消融 —— 很多 RAG 工程决策的实证基础存在潜在 confound。


§三 研究视角(创新性)

3.1 形式化骨架 · POMDP(arXiv:2603.07379 · 主分类 rag · SoK 立标 ★ · ACL 2026)

SoK 把 Agentic 检索-生成循环定义为 <S, A, T, Ω, O, R, H> 有限时域 POMDP:

  • S:用户意图 + 文档集合 + 外部世界(工具可访问 API/数据库/网页)
  • A:{检索、重写查询、生成、调用工具、更新记忆、回滚} 的离散动作集
  • T(s'|s,a):状态转移分布
  • Ω:模型可见的文本观测空间
  • O(o|s',a):观测函数
  • R(s,a):奖励函数 ⚠️ 原文未明确给出统一形式,留作 future work
  • H:有限时域上界

由此,Agentic RAG 的控制策略 π(a|o₁...oₜ) 就是「在文本观测序列上的策略」,可套用任何 sequential decision making 工具。⚠️ 这是规范性的而非可求解的 —— POMDP 形式化本身不能直接驱动训练。

3.2 四维分类 × 六种设计模式(arXiv:2603.07379)

维度 选项
规划机制 Single-step(ReAct/Reflexion)/ Hierarchical(Plan-and-Execute/ADaPT)/ Graph-based(LangGraph/AutoGen 群聊)
检索编排 Single-source / Multi-source Fusion(Hybrid Search/HyDE)/ Adaptive(FLARE/Self-RAG)
记忆范式 Stateless / Short-term Buffer / Long-term Vector Memory(MemGPT/MemoryBank)/ Structured Memory(SQL/KG/文件系统)
工具调用 Read-only / Write(级联失效风险)/ Mixed(需权限+沙箱)

六种设计模式:Decomposition / Recursive / HITL / SQL-like / Hypothetical Document / Hybrid。

3.3 四轴分类法 · 超越架构视角(arXiv:2610.01936 · 主分类 rag · 综述立标 ★ · AI Reviews)

Sunil et al. 显式拒绝沿用 Naive/Advanced/Modular 三件套,改为按能力维度切四轴:

  • Efficiency:dense/sparse 融合、embedding 优化、RL 检索策略
  • Defense:robustness 与 security、抵御 extraction/poisoning 攻击
  • Interactivity:user-driven 与 interactive workflow、多轮反馈
  • Reasoning:多步/复杂推理

⚠️ flyp 10-04 笔记提示:四轴并非正交,Defense 实质是跨 Efficiency/Reasoning/Interactivity 的对抗维度;论文摘要未披露四轴互斥性测试与覆盖率回检。Defense 轴立标独立性需 2026 下半年观察。

3.4 法律 / 伦理独立声明(独立段 ≥150 字 · v2 沿用)

本综述涉及的攻击与防御研究(ORCAGen 2610.12415、CamoDocs 2608.28389、InceptionRAG 2609.16818、SHIFT 2606.27786、ImmRAG 2610.01871 等)涉及恶意应用风险,声明如下: 1. arXiv ID 独立核实声明:本节引用的 6+ 个 arXiv ID 已在 paper_cards 验证存在(检索时点 2026-10-11 16:43 CST); 2. 未授权访问警告:本综述不提供任何用于对未授权知识库实施数据提取、投毒或越权检索的可执行代码或具体攻击流程; 3. 责任边界:RAG 系统的安全研究应限定在「白盒/自有/已授权」数据范围内进行,任何生产系统应实施 retriever 权限隔离、context 长度上限、写入工具白名单与人类确认节点; 4. 双刃属性:检索 = 能力 × 攻击面 —— 同一套 retrieval API 既服务于合法知识库问答,也服务于恶意知识库提取;CamoDocs/InceptionRAG 类研究必须在防御侧同步落地; 5. 合规边界:涉及用户数据(PII、医疗、金融)的 RAG 系统应满足 GDPR/HIPAA/中国《个人信息保护法》;本综述不涉及任何具体合规实施方案,实施须由专业合规团队主导; 6. 未解决法律问题:Agentic RAG 在多 agent 协作场景下的责任归属(如:错误检索结果导致医疗事故的追责主体)目前在主要法域均无明确判例,属「监管灰区」。


§四 批判视角(局限 · v2 与 §六 反方主线做功能分离)

4.1 评估体系未成熟

2501.09136 与 2603.07379 均明确指出 Agentic RAG 缺乏统一基准与评估标准: - 90%+ 的 Agentic RAG 论文只报告「最终答案 EM/F1」; - 中间轨迹的失败模式(中间幻觉、检索漂移、循环不收敛)几乎不约束; - LLM-as-judge 与人类一致性在 FiQA 上达成 0/1 二分类协议(2601.07711),CQAD-EN 上做 pairwise 标注 312 对,人–人一致率 71.9%、人–机 65.4% —— 仍有 28-35% 的判断偏差。

⚠️ AgenticRAGTracer(2602.19127)是首个 hop-aware 多跳诊断 benchmark,但截至 2026-10-11 被引仅 5,生态采用率有待观察。

4.2 POMDP 形式化停留于「建模对象」层(引用 §3.1)

本棒位 9 维自检明确要求"POMDP 单点声明"—— §3.1 已给出完整七元 定义与有限时域上界 H。本段作为对 §3.1 的批判视角补充:POMDP 形式化未给出收敛性证明或最优结构分析;奖励函数 R(s,a) 未明确;无法直接驱动 RL 训练。当前 Agentic RAG 的策略优化仍以规则奖励(答案正确性 + 步数惩罚)为主。

4.3 上游 ASR 错误的级联放大(arXiv:2608.22872 · 主分类 rag · 反例立标 ★ · 2026-08)

「更优检索,更差鲁棒性:多跳 RAG 如何放大上游 ASR 错误」是 2026-08 的重要反例:在四个英语口音 × 三个多跳 QA 基准(HotpotQA、2WikiMultiHopQA、MuSiQue)上,结构上更丰富的配置(实体图链接 + 迭代式 query 改写)反而放大 ASR 错误。⚠️ 这意味着「retriever 越复杂 ≠ 系统越鲁棒」,企业级语音 + RAG 系统必须把 ASR error floor 作为固定约束设计。

4.4 实证基准与企业现实的偏离

2601.07711 的 4 个数据集(NQ / FiQA / CQAD-EN / FEVER)全是英文、Wikipedia 类 KB 为主,而实际企业 RAG 往往是中文合同/条款(长句、嵌套结构)、PDF 表格、多栏布局、内部术语。⚠️ 直接拿论文数字做容量规划会严重偏差,必须在自家 KB 上跑同等实验。

4.5 形式化停留于「建模对象」层与 RAGScope 反例(arXiv:2609.39075 · 主分类 rag · 邻接 ★ · 2026-10)

RAGScope 提出「泄漏可控、成本感知的证据门控协议」用于评估仅使用任务输入、检索上下文、答案文本的本地证据门 —— context-grouped splits + fold-scoped preprocessing + deployment operating points + source-shift stress tests。这是 2026-10 的最新 RAG 评估基础设施尝试,⚠️ 被引仅 1,生态验证尚需时间。


§五 趋势判断(v2 · 5 主线 × ≥150 字)

5.1 POMDP 形式化进入主流(引用 §3.1)

Agentic RAG 将从「经验拼凑」全面转向「POMDP 形式化(§3.1 给出七元骨架)+ 风险评估」。§3.1 给出的 POMDP 形式化(2603.07379)与四维分类(2501.09136)正成为被引 100+ 级别的骨架参考;四类系统级风险(复合幻觉、记忆投毒、检索漂移、级联工具漏洞)将进入 trace 平台(LangSmith/Langfuse/Helicone)的告警规则集。

5.2 训练目标从 generator 转向 retriever

Q-RAG(2511.07328)的「RL 训练 Embedder 而非微调 LLM」(§2.2 已详述 RL-Embedder 范式转向)是 2026 年最重要的范式转向之一。理由:reader 与 retriever 解耦后可继续使用更大的 LLM 作 reader,同时 retriever 的训练信号直接来自答案正确性,避免 LLM-as-judge 的不一致。未来 12 个月将看到更多「retriever RL + reader frozen」的混合训练范式落地。

5.3 Hybrid 架构成为默认

2601.07711(§2.3 已详述 Enhanced vs Agentic 产业实证)的实证结论已显示:intent handling + query rewriting 由 agent 自主决策更好用,但 document refinement 仍由显式 ELECTRA/BGE/Cohere reranker 主导。Intent + Rewrite 走 agent + Retrieval + Rerank 走确定性管线 + Generation 共用 LLM + prompt cache 把成本压回 ~1.5× —— 将成为 2026-2027 年的 RAG 落地默认架构。

5.4 召回基础设施层进入理论化阶段

§2.4 已独立升格的 HNSW 几何理论(2610.12312)为 HNSW 贪心导航建立确定性 coverage condition,RAG 召回基础设施从此从「经验调参」进入「理论指导」。预计 2027 年将出现基于几何理论的 HNSW 参数自适应系统,把 ef_construction、ml 从静态配置转为 query-specific 状态。

5.5 Defense 轴立标将独立成型(与 §3.3 互补)

§3.3 已详述 Sunil et al.(2610.01936)的四轴分类法。Defense 轴立标独立成型后:同期 ImmRAG(2610.01871)、CamoDocs(2608.28389)、InceptionRAG(2609.16818)、ORCAGen(2610.12415)的实证攻击累积,意味着 RAG 安全将成为 ACL/S&P/USENIX Security 联合赛道的焦点。


§六 反方四主线(v2 · 5 主线 × ≥150 字)

6.1 「Agentic RAG 万灵药」神话需要降温

2601.07711(§2.3)的实证数据显示 Agentic 平均 3.3× 输入 token / 1.5× 时间,极端可达 3.6× 总成本。如果不开 prompt cache,Agentic RAG 等于烧钱。⚠️ 业界「Agentic 万灵药」的话术忽视了成本结构;选 Agentic 必须配套 prompt cache + 强意图路由 + 重排序显式化三件套,否则 ROI 为负。

6.2 POMDP 形式化不是训练可解的(引用 §3.1 + §4.2)

§3.1 给出的 POMDP 七元框架是「建模对象」而非「可求解的策略」,§4.2 已指出 R(s,a) 未明确定义意味着无法直接驱动 RL 训练。⚠️ 任何宣称「基于 POMDP 的 Agentic RAG 已实现 RL 训练」的论文都需谨慎审视奖励函数的可学习性 —— 很可能仅是「答案正确性 + 步数惩罚」的规则奖励伪装的 POMDP。

6.3 顶会 anchor 失势 ≠ 评分不重要

W38-W41 蒸馏显示顶会 anchor(venue+年份)对论文评分的影响力从 W37 12% 跌至 W40 4%,但这不意味着评分不重要。⚠️ 三证齐全(顶会 + GitHub fetched + arXiv ID 独立核实)仍是 5 分公式(W41 反思棒);「顶会失势」的解读是「不再是充分条件」而非「不再是必要条件」。

6.4 RAG 综述 ≠ 工程指南

2312.10997(Naive/Advanced/Modular)、2501.09136(Agentic 四维)、2603.07379(POMDP 七元 §3.1)、2610.01936(四轴)四篇综述/survey 给的都是分类与术语,不直接给工程方案。⚠️ 工程团队把综述当 selector 用是常见误用 —— 综述能告诉你「有哪些家族、各家差异在哪个轴」,但「选哪家 + 怎么落地」必须靠企业 KB 自跑实验。2601.07711 是 2026 年唯一同时提供「分类+数字」的产业落地论文,值得做工程决策前精读。

6.5 上游 ASR 错误级联与 ASR error floor 不可回避

§4.3 已指出 2608.22872 揭示"更优检索,更差鲁棒性"反例:结构上更丰富的配置反而放大 ASR 错误。⚠️ 这意味着「retriever 越复杂 ≠ 系统越鲁棒」,企业级语音 + RAG 系统必须把 ASR error floor 作为固定约束设计 —— 这对 v1 → v2 趋势判断中"召回基础设施层理论化"形成"鲁棒性下限约束"的反向平衡。


§七 立标池(6 件)

立标候选 主分类 副分类 立标评级 立标理由
2501.09136 v4 Agentic RAG 综述 rag survey ★ 四维 taxonomy 是 Agentic RAG 方向的引用基线,被引 444
2603.07379 SoK Agentic RAG rag agent/survey ★ POMDP 形式化骨架是「Agentic RAG 博士级问题」路线图,ACL 2026 接收
2610.01936 RAG Landscape 四轴 rag survey ★ Defense / Interactivity / Reasoning 三轴补盲,AI Reviews 已发表
2208.03299 Atlas rag method ★ retriever+FiD+BART 三件套是工业 RAG 蓝图,被引 1036
2511.07328v2 Q-RAG rag method ★ ICLR 2026 接收,RL-Embedder 范式转向,GitHub griver/Q-RAG
2601.07711 Enhanced vs Agentic RAG rag benchmark ★ 唯一 Enhanced/Agentic 双线 head-to-head 实证,ACL 2026 Industry Track

(★ = 已立库候选;☆ = 预备级)

§X 待复核清单(v2 · 5 件)

  • Atlas 64-shot 条件:⚠️ 64 条样本超 PaLM 540B 3 个百分点的具体 shot 数与对比条件在原文 abstract 中未完全明确(已在论文卡上标注),引用时建议补充「NQ 64-shot + PaLM few-shot 等价」条件,待原文 §4 实证;
  • Q-RAG reward hacking 风险:⚠️ reward 来自 reader 最终答案,若 reader 幻觉则存在 reward hacking 风险;与 §2.3 Agentic RAG 万灵药段同类问题(2601.07711 §4.3);
  • HNSW coverage condition 实证迁移性:⚠️ d 维环面假设与真实高维欧氏空间的数据分布存在差异(§2.4 已点出),具体 coverage condition 在欧氏空间下的退化形式与参数敏感性需精读 2610.12312 §4;
  • 文档结构消融复现:⚠️ 2610.10170 用机制隔离消融统一测试「语义为空的安慰剂标题路径」作为对照,但所选四个语料 / 嵌入器 / 指标组合的 robustness 待原文 §5 + 复现实验;
  • POMDP 奖励函数定义:⚠️ SoK 原文 R(s,a) 未明确给出统一形式(§3.1 已点出),留作 future work;任何「基于 POMDP 的 RL 训练」论文都需先回答这个定义问题。

§九 边界声明(v2 · 简化为 3 条)

本综述: 1. 仅基于 /shared/research-kb 内已入库 paper_cards(检索时点 2026-10-11 16:43 CST)与 inbox 近 7 天 rag 相关笔记; 2. 未独立 arXiv PDF 全文核实所有数字,引用时严格区分「原文 abstract/TLDR 已核」与「方向性描述」; 3. 顶会年份与 arXiv 编号按 W41 反思棒硬约束逐项 grep 校验;不输出密钥、不 git、不动 surveys/ 以外的文件。


spark · 2026-10-11 主题综述 · RAG · v2 重写覆盖 v1(承接稳态棒位"窄而精"示范) · 边界:仅写本文件 surveys/2026-10-11-rag.md