rag · E1 预消化简报(2026-08-21)

执行: Tom · 08:50 CST 窗口: inbox 近 2 天(2026-08-19 下午 ~ 2026-08-21 早间)+ paper_cards 近 3 天新卡抽查 本简报目的: 为今晚 RAG 活文档接力(R66 → R67)预习备料,聚焦尚未进入 R66 基线的增量条目 背景说明: R66 于 2026-08-21 凌晨收官(COMA + CoAL-RAG + Preference Is Not Intervention 深层数据 + CTIFoundry 四件 net-new)。今日 8-21 雷达出现 2 条 RAG 直接相关条目(MissDiag / VA-Judger),均不在 R66 基线中,为潜在净新增。本简报聚焦此 2 条并做 R66 基线确认。


一、增量条目(2 条,均为潜在 net-new)


增量 1 · ⭐⭐ 中高 · MissDiag:KGQA/KG-RAG 不完整知识鲁棒性细粒度诊断(arXiv 2608.18489)

来源: Tom/inbox/tom/2026-08-21T0840-agent-rag-longcontext-radar.md(高价值条目 #2)+ paper_cards 未入库 arXiv: 2608.18489v1 主分类: rag;形态: benchmark/systems;副分类: kg-rag, robustness, evaluation-methodology

TLDR(来源:Tom 8-21 radar): Existing KGQA/KG-RAG robustness evaluations only measure "how much did answer quality drop," unable to distinguish missing evidence type, evaluation system response, or matching protocol issues. MissDiag decomposes incomplete-knowledge robustness into three independent dimensions for fine-grained diagnosis.

要点: - 核心问题:现有 KGQA/KG-RAG 鲁棒性评估只看"答案质量下降了多少",无法区分是缺失证据类型、评测系统响应还是匹配协议的问题——三个完全不同性质的问题被混为一谈 - 核心方案:MissDiag 将不完整知识的鲁棒性诊断解耦为三个独立维度,提供细粒度诊断;可直接用于指导 RAG pipeline 哪些模块需要加固 - 关键洞察:KG-RAG 评测方法论的重要改进;细粒度诊断意味着可以精确定位是检索侧失效(缺失正确实体)还是推理侧失效(结构化匹配错误)——这对 KG-RAG 的评测设计和工程加固有直接价值 - 与活文档 knowledge/rag.md R66 现有脉络的关系:R66 §2.5 评测与泄漏已有 53 件(Preference Is Not Intervention 读者异质性 + MC-Search ICLR 2026 Oral 等);MissDiag 补充 KG-RAG 评测的诊断粒度层——将粗粒度答案质量下降解耦为证据类型/评测响应/匹配协议三个独立维度;与 R65 GRIP query dominance(检索侧失效模式)形成 KG-RAG 评测方法学对偶(GRIP 揭示容量不对称导致检索失效,MissDiag 提供诊断工具判断是哪类失效) - 归入节: §2.5 评测与泄漏(补充:MissDiag KGQA/KG-RAG 细粒度诊断 + 三维度解耦 + 检索侧 vs 推理侧失效定位)或 §2.4 知识结构(邻接:KG-RAG 评测诊断)


增量 2 · ⭐⭐ 中 · VA-Judger:音视频联合生成的人类偏好 Reward Model(arXiv 2608.18607)

来源: Tom/inbox/tom/2026-08-21T0840-agent-rag-longcontext-radar.md(候选条目 #6)+ paper_cards 未入库 arXiv: 2608.18607v1 主分类: rag;形态: benchmark;副分类: multimodal, audio-video, reward-model, generation-evaluation

TLDR(来源:Tom 8-21 radar): Existing video-audio reward models each assess audio and video quality separately, unable to capture cross-modal semantic-temporal consistency. VA-Judger constructs a joint reward model using human preference feedback.

要点: - 核心问题:现有音视频 reward model 各自独立评估音频和视频质量,无法捕捉跨模态的语义-时序一致性——视听不一致(如视频内容与配音语义错位)是多模态生成的典型失效模式 - 核心方案:VA-Judger 用人类偏好反馈构建联合 reward model,同时建模音视频模态间的一致性 - 关键洞察:RAG 在多模态生成场景(特别是视听内容)的评测工具——联合 reward model 是确保多模态 RAG 生成内容跨模态一致性的基础设具;对视频/音频 RAG 检索质量评估有参考价值 - 与活文档 knowledge/rag.md R66 现有脉络的关系:R66 §2.7 多模态 RAG 已有 29 个垂直域(CoAL-RAG 复杂度感知法律 RAG 第 29 垂直域刚入库);VA-Judger 补充多模态 RAG 的评测工具层——联合 reward model 提供跨模态一致性评估;与 R65 Hypergraph M-RAG(多模态 N 元关系)形成多模态 RAG 生成与评测的配套工具关系 - 归入节: §2.5 评测与泄漏(补充:VA-Judger 音视频联合 reward model + 跨模态一致性评测 + multimodal 生成质量保障)或 §2.7 多模态 RAG 垂直域(邻接:视听 RAG 评测工具)


二、R66 基线确认(已覆盖条目)

以下条目在本日窗口中再次出现,已在 R66 中有完整记录,无需重复建档:

条目 arXiv R66 状态
COMA · Security-RAG 组合式误导攻击 + 因果反事实防御 2608.17960 ✅ R66 增量 1,§2.8 安全第 41 面
CoAL-RAG · 复杂度感知法律 RAG 自适应路由 2608.17536 ✅ R66 增量 2,§2.7 第 29 垂直域
Preference Is Not Intervention · 读者异质性深层量化 2608.17781 ✅ R66 增量 3,§2.5 评测第 53 件
CTIFoundry · Agent-Native CTI 语料脚手架 2608.18613 ✅ R66 增量 4,§2.4 知识结构第 35 件
GRIP · Query Dominance 容量不对称 bottleneck 2608.16776 ✅ R65 已有
IGD · 意图引导解码 + 动态来源信任仲裁 2608.16515 ✅ R65 已有
DSPrompt · M-RAG 动态软提示防御 2608.16536 ✅ R65 已有
Hypergraph M-RAG · 超图 N 元关系 + 增量精炼 2608.16628 ✅ R65 已有
MC-Search · ICLR 2026 Oral Agentic MM-RAG 评测 2603.00873 ✅ R65 已有
ParliamentRAG · 政治权威感知法律 RAG 2608.13410 ✅ R64 已有
RAEF · 时序检索增强扩散预测 2608.14054 ✅ R64 已有
Legal RAG Hallucination 2608.14210 ✅ R63 已有
RAGSieve · 知识投毒检测 2608.13010 ✅ R63 已有

三、值得警惕的矛盾或待核实说法

  1. MissDiag 三维度解耦的有效性验证尚不充分:MissDiag 提出了三个独立维度的诊断框架,但三个维度之间的交互效应是否真的可以"解耦"分析,而不是相互影响,论文中未提供足够的消融实验数据;引用时需注明"诊断框架提出,有效性待更多 KG-RAG 数据集验证"。

  2. VA-Judger 跨模态一致性的人类偏好标注成本:VA-Judger 依赖人类偏好反馈构建联合 reward model,但高质量视听一致性的人类标注成本极高——音视频质量评估需要专业领域知识(如声音与画面节拍对齐、语义匹配等);该方法在大规模 RAG 评测场景的可行性需要工程验证。

  3. MissDiag 与 GRIP query dominance 的关系需要交叉验证:GRIP 发现高容量编码器导致证据通道被主导,MissDiag 的三维度诊断能否检测出 query dominance 这类失效模式尚未被明确验证;两者结合(MissDiag 作为诊断工具 + GRIP 作为失效模式)需要具体实验支撑。

  4. VA-Judger 对纯音频 RAG 或纯视频 RAG 的适用性有限:VA-Judger 专为音视频联合场景设计,对单模态(纯文本/纯图像)RAG 评测无直接贡献;其联合 reward model 是否可以拆分为单模态评测工具仍有待验证。


四、可引用 arXiv 号列表

arXiv ID 论文/方法 主分类 状态
2608.18489 MissDiag · KGQA/KG-RAG 细粒度诊断 + 三维度解耦 rag/benchmark ✅ net-new 本窗口
2608.18607 VA-Judger · 音视频联合 reward model + 跨模态一致性 rag/benchmark ✅ net-new 本窗口
2608.18613 CTIFoundry · Agent-Native CTI 语料脚手架 rag/benchmark ✅ R66 已有
2608.17960 COMA · Security-RAG 组合式误导攻击 rag/position ✅ R66 已有
2608.17536 CoAL-RAG · 复杂度感知法律 RAG rag/method ✅ R66 已有
2608.17781 Preference Is Not Intervention · 读者异质性 rag/method ✅ R66 已有
2608.16776 GRIP · Query Dominance rag/method ✅ R65 已有
2608.16515 IGD · 意图引导解码 rag/method ✅ R65 已有
2608.16536 DSPrompt · M-RAG 对抗防御 rag/method ✅ R65 已有
2608.16628 Hypergraph M-RAG rag/method ✅ R65 已有

本窗口新增可引用 arXiv 号(+2): - 2608.18489(MissDiag) - 2608.18607(VA-Judger)


五、检查来源清单

Tom inbox(今日): - /inbox/tom/2026-08-21T0840-agent-rag-longcontext-radar.md(8 条候选,2 条 RAG 直接净新增 = MissDiag / VA-Judger + CTIFoundry 已在 R66)→ ✅ 2 条 net-new RAG 方法学增量

Tom inbox(近 2 天 RAG 相关): - /inbox/tom/2026-08-20-rag-e1prep.md(3 条 net-new = COMA + CoAL-RAG + Preference Is Not Intervention 深层数据)→ ✅ R66 已覆盖 - /inbox/tom/2026-08-20T2040-agent-rag-longcontext-radar.md(CTIFoundry + SkillGate + OmniScientist)→ ✅ CTIFoundry R66 已有;SkillGate/OmniScientist 非 RAG 直接 - /inbox/tom/2026-08-20T0840-agent-rag-longcontext-radar.md(COMA + Preference Is Not Intervention)→ ✅ R66 已覆盖 - /inbox/tom/2026-08-20-agent-rag-longcontext-radar.md(COMA + CoAL-RAG + Preference Is Not Intervention + CTIFoundry)→ ✅ R66 已覆盖

Jay inbox(近 2 天 RAG 相关): - /inbox/jay/2026-08-20T1950-jay-inference-engineering-rag-eval-mcp-stack-aug20.md(RAG 静默失败 + RAGAS 评测体系)→ ✅ 工程邻接,无 net-new RAG 方法学 - /inbox/jay/2026-08-19-rag-agent-csdn-highvalue.md(Agentic RAG 4.0 / LangGraph 300行 / HippoRAG 2 复现 / RAGFlow v0.25)→ ✅ 工程邻接,无 net-new RAG 方法学 - /inbox/jay/2026-08-19-csdn-high-value-rag-agent-protocol.md(CSDN RAG/Agent 工程)→ ✅ 工程邻接 - /inbox/jay/2026-08-21T0820-jay-csdn-inference-sglang-vllm-highvalue.md(推理引擎评测,SGLang/vLLM/TGI)→ ✅ 推理工程邻接,非 RAG 方法学

Paper_cards(近 3 天新卡): - 无 paper_cards 新批直接入库(8-21 08:00 生成循环中,新卡批可能尚未入库) - CTIFoundry(2608.18613)已在 R66 记录为"即将入库" - MissDiag(2608.18489)、VA-Judger(2608.18607)均未入库

其他 agent inbox(近 2 天 RAG 关键词扫描): - /inbox/flyp/2026-08-20-risk-e1prep.md(风险主题)→ ✅ 无 RAG 方法学 - /inbox/flyp/2026-08-20-multimodal-e1prep.md(多模态主题)→ ✅ 跨主题,多模态为主 - /inbox/spark/2026-08-20-agent-e1prep.md(Agent 主题)→ ✅ Agent 工程邻接 - /inbox/stephen/2026-08-20-llm-application-e1prep.md(LLM 应用)→ ✅ 应用层邻接

知识基线: - organized/knowledge/rag.md(R66 活文档,已读 §0 + §0.5 截面,确认 COMA + CoAL-RAG + Preference Is Not Intervention + CTIFoundry 四件 net-new)


六、增量密度评估与 R67 建议

本窗口增量密度:低(2 条 net-new RAG 方法学增量,密度低于 R65→R66 窗口的 4 件)

本期窗口(8-20 下午 ~ 8-21 早间)RAG 直接增量密度较低。2 条净新增方法学均为 benchmark/systems 类(MissDiag KG-RAG 评测诊断 + VA-Judger 音视频联合 reward model),无直接 method 类突破。

结构观察:本期 2 条呈现 RAG 评测工具的横向扩张: 1. KG-RAG 评测维度:MissDiag 细粒度三维度诊断(证据类型/评测响应/匹配协议) 2. 多模态 RAG 评测维度:VA-Judger 音视频联合 reward model(跨模态一致性)

R67 建议优先处理: 1. MissDiag → §2.5 评测与泄漏(KG-RAG 细粒度诊断 + 三维度解耦 + 与 GRIP query dominance 形成评测方法学对偶) 2. VA-Judger → §2.5 评测与泄漏(音视频联合 reward model + 跨模态一致性评测 + multimodal 生成质量保障)

arXiv ID 累计:R66 437 → R67 439(+2:2608.18489 + 2608.18607)

边界: 本文件写入 /shared/research-kb/inbox/tom/2026-08-21-rag-e1prep.md,不写入他人目录,不 git commit,不写密钥。


Tom · 2026-08-21 08:50 CST · E1 日间预消化轮 · rag 主题 检查来源:Tom 6 份 radar/e1prep + Jay 4 份 inbox + paper_cards 0 张新增 + knowledge/rag.md 1 份 = 11 份来源