rag · E1 预消化简报(2026-08-18)
执行: Tom · 08:50 CST 窗口: inbox 近 2 天(2026-08-17 ~ 2026-08-18 早间)+ paper_cards 近 3 天新卡抽查 本简报目的: 为今晚 RAG 活文档 R63 → R64 接力预习备料,聚焦尚未进入 R63 基线的增量条目 背景说明: R63 于 2026-08-18 早间收官(含 Legal RAG Hallucination 2608.14210 评测立标 + Agent Memory ≠ RAG 设计原则 + δ-mem 第三条路 + OWASP LLM04 + CSDN RAG 生产实战)。今日窗口增量密度中等:4 条 net-new 条目,其中 2 条实质 RAG 方法学增量(ParliamentRAG + RAEF),2 条 RAG 邻接增量(Query via RL + Search-R1 stopping criteria 补档)。
一、增量条目(4 条)
增量 1 · ⭐⭐⭐ 高 · ParliamentRAG:政治文档多视角 RAG + 说话人权威感知(arXiv 2608.13410)
来源: Tom/inbox/tom/2026-08-18-agent-rag-longcontext-radar.md(高价值条目 #2)+ paper_cards(2606.16817 同批次卡) arXiv: 2608.13410v1 主分类: rag;形态: systems/benchmark;副分类: domain-rag, authority-weighting, political-documents
TLDR(来源:Tom 8-18 radar 整理): 针对意大利众议院会议记录,解决 RAG 三类风险——高频发言人主导( dominance bias)、话题专家权重缺失(expertise gap)、引文误归因(citation error)。核心机制:话题依赖的权威模型(topic-dependent authority model),按议题动态分配不同发言人的引用权重。
要点: - 核心问题:政治文档中,高频发言人(议会党团领袖)天然主导检索结果,即使其并非特定议题的真正专家;RAG 输出的答案因此系统性偏斜 - 核心方案:ParliamentRAG 提出 topic-dependent authority model——每个议题/子话题预计算一个权威向量(基于历史发言质量、委员会归属、书面质询记录),检索时将权威权重注入 reranking 阶段 - 三类风险处理: - dominance bias → 发言频率惩罚项 - expertise gap → 话题-专家匹配矩阵 - citation error → 引文上下文验证链 - 数据集:意大利众议院 2018-2024 年全体会议记录,附专家标注的 ground-truth 权威标签 - 关键洞察:垂直域 RAG 中,"谁说的"与"说什么"同等重要;权威感知是法律/医疗/政策 RAG 的通用需求,不仅是政治场景 - 与活文档 knowledge/rag.md R63 现有脉络的关系:R63 §2 已收录领域 RAG 垂直化趋势(医疗/法律);本文档以政治文档权威感知 RAG 补充 §2 领域 RAG 案例——是 Legal RAG Hallucination 2608.14210(法律 RAG 幻觉评测)后的又一个高风险垂直域案例;与 R63 Legal RAG 幻觉评测形成高风险垂直 RAG 双件套(法律 + 政治) - 归入节: §2 领域 RAG 垂直化(补充:ParliamentRAG 政治文档权威感知 RAG + 话题依赖权威模型 + 三类风险处理机制)
增量 2 · ⭐⭐⭐ 高 · RAEF:时间序列预测的检索增强扩散模型(arXiv 2608.14054)
来源: Tom/inbox/tom/2026-08-18-agent-rag-longcontext-radar.md(候选条目 #5 RAEF) arXiv: 2608.14054 主分类: rag;形态: method/application;副分类: time-series, retrieval-augmented-generation, diffusion-model
TLDR(来源:Tom 8-18 radar 候选 #5 整理): RAEF 将检索增强生成引入时间序列预测任务。核心思路:给定历史时间序列上下文 + 检索到的相似历史模式序列,用扩散模型生成预测。方法包含双重不确定性估计( Aleatoric + Epistemic),在 Electricity、Weather、Traffic 三个时间序列基准上验证。
要点: - 核心问题:时间序列预测的经典方法(ARIMA、Prophet)与深度学习方法(LSTM、Transformer)均依赖内插,对罕见事件/分布外预测能力弱;检索增强提供外推能力 - 核心方案:RAEF = Retrieval-Augmented Epidemiological Forecasting,检索相似时间序列模式作为条件输入,引导扩散模型的条件生成;模型学会何时依赖内部知识、何时依赖检索知识 - 不确定性估计:Aleatoric(数据固有噪声)与 Epistemic(模型不确定性)双重分解,输出预测置信区间 - 实验基准:Electricity(用电负荷)、Weather(气象)、Traffic(交通)三个真实世界数据集 - 与活文档 knowledge/rag.md R63 现有脉络的关系:R63 中无时间序列 RAG 专项条目;本文档是首个时间序列 RAG 应用条目,归入 §2.12 RAG 替代/扩展范式(检索增强扩展到非文本模态);与 R63 §2 多模态 RAG 邻接(视觉/视频/表格之后的又一非文本 RAG 扩展方向) - 归入节: §2.12 RAG 替代与扩展范式(补充:RAEF 时间序列检索增强扩散预测 + 双重不确定性估计 + 非文本模态扩展)
增量 3 · ⭐⭐ 中 · Query Formulation via RL:LLM 为不同检索器定制 Query 策略(arXiv 2606.16817)
来源: paper_cards/026-2606-16817(主分类 rag)+ Cool Papers cs.IR(2026-08-17 收录) arXiv: 2606.16817v1 主分类: rag;形态: method;副分类: query-formulation, rl, retriever-awareness
TLDR(来源:paper_cards/026): 本文首次系统分析 LLM 如何通过强化学习学习针对不同 retriever 调整 query 表述策略,并揭示 RL 能有效教会 LLM 根据特定 retriever 特性定制 query。
要点: - 核心问题:同一个 query 表述在不同 retriever(dense / sparse / hybrid)上表现差异显著;现有 RAG 系统使用统一 query,忽视了 retriever 适配性 - 核心方案:用 RL 训练 LLM 生成 retriever-specific query,reward function 包含 retrieval quality(recall/P@K) + answer correctness 两个维度;GRPO 类方法 - 关键洞察:不同 retriever 需要不同的 query 表述策略——例如 sparse retriever(BM25)偏好精确关键词,dense retriever 偏好自然语言完整句;RL 能学到这种隐式策略差异 - 与活文档 knowledge/rag.md R63 现有脉络的关系:R63 §2.3 检索单元 44 件中有 Query Rewriting / HyDE / Query Decomposition 等 query 优化方法;本文档以 RL-based retriever-aware query formulation 补充 §2.3——是现有 query 优化方法的强化学习化,体现 RAG 训练范式的新方向 - 归入节: §2.3 检索单元(补充:Query Formulation via RL + retriever-aware query 生成 + GRPO 类 reward)
增量 4 · ⭐⭐ 中 · Search-R1 续:多轮 RAG 停止判断的结构化方法(arXiv 2608.13237)
来源: Cool Papers cs.IR(2026-08-17)+ stephen/ai-industry-e1prep(沿用 v47 标注) arXiv: 2608.13237v1(已有 v1 版本) 主分类: rag;形态: method/benchmark;副分类: multi-turn-rag, stopping-criteria, search-agent
TLDR(来源:Cool Papers cs.IR 2026-08-17 整理): 多轮检索增强生成(RAG)需要在证据不断累积时判断何时停止搜索。由于已部署策略由每条轨迹上的首个 STOP 决定——这是一个结构化决策,需要在证据充分性与检索效率之间取得平衡。
要点: - 核心问题:Multi-turn RAG 的停止时机是一个未被系统研究的结构化决策问题;过早停止导致答案不完整,过晚停止造成 token 浪费和推理成本激增 - 核心方案:为 Search-R1 设计的结构化停止判断框架——评估当前检索上下文的证据充分性(answer coverage score)+ 与已有答案的增量信息(marginal relevance);当增量信息低于阈值时触发停止 - 与活文档 knowledge/rag.md R63 现有脉络的关系:R63 中已有 Search-R1 基础条目(paper_cards 序列号待查);本文档以停止判断的结构化方法补充 Search-R1——解决了 multi-turn RAG 的最后一个关键工程问题;与 R63 §2.6 运行时(129 件已有框架方法)邻接 - 归入节: §2.6 运行时(补充:Search-R1 停止判断结构化方法 + 证据充分性 + 边际相关性阈值)
二、R63 基线确认(已覆盖条目)
以下条目在本日窗口中再次出现,已在 R63 中有完整记录,无需重复建档:
| 条目 | arXiv | R63 状态 |
|---|---|---|
| Legal RAG Hallucination(#1 高价值) | 2608.14210 | ✅ R63 评测立标(paper_cards/965 + 5 件 fresh web_search) |
| Agent Memory Is Not RAG(Substack) | — | ✅ R63 §2.17 Memory 视角补充 |
| δ-mem 第三条路(Substack) | — | ✅ R63 立基础延展 |
| OWASP LLM04 | — | ✅ R63 §2.8 RAG 安全邻接 |
| CSDN RAG 生产实战(LangChain 0.3.14 / ChromaDB 0.6.0) | — | ✅ R63 §2.12 工程邻接 |
| PathRouter(paper_card 009) | 2606.16409 | ✅ R63 §2 GraphRAG 方法 |
| SCAR(paper_card 006) | 2606.16661 | ✅ R63 §2 检索策略 |
| V-RAGBench / VideoRAG(paper_card 007) | 2606.13141 | ✅ R63 §2 多模态 RAG 基准 |
| StructQuery(Cool Papers 2608.13384) | 2608.13384 | ✅ R63 §2.3 检索单元(stephe v47 确认沿用) |
三、值得警惕的矛盾或待核实说法
-
ParliamentRAG 泛化性存疑:论文实验仅在意大利众议院单一数据集验证;topic-dependent authority model 是否适用于其他议会/会议场景(如英国下议院、美国国会)未经测试。引用时需注明"单一数据集验证"。
-
RAEF 时间序列基准规模:论文在 Electricity/Weather/Traffic 三个数据集上验证,但均为公共时序基准,与金融/医疗等高风险时序预测场景差距显著;Claim 级可信度应为"实验验证,需行业数据进一步验证"。
-
Query via RL(2606.16817)RL 训练成本:论文未披露 RL 训练所需 compute budget;retriever-specific query 策略的 marginal gain 是否值得额外训练成本,需与 R63 §2.3 已有 query rewriting 方法做效率对比。
-
Search-R1 停止判断阈值敏感性:边际相关性阈值(marginal relevance threshold)需人工设定;在不同领域(法律/医疗/技术文档)阈值差异可能很大,需避免将单一阈值作为通用标准。
四、可引用 arXiv 号列表
| arXiv ID | 论文/方法 | 主分类 | 状态 |
|---|---|---|---|
| 2608.13410 | ParliamentRAG · 政治文档权威感知 RAG | rag/systems | ✅ net-new 本窗口 |
| 2608.14054 | RAEF · 时间序列检索增强扩散预测 | rag/method | ✅ net-new 本窗口 |
| 2606.16817 | Query Formulation via RL for Different Retrievers | rag/method | ✅ net-new 本窗口 |
| 2608.13237 | Search-R1 停止判断结构化方法 | rag/method | ✅ net-new 本窗口(补档) |
| 2608.14210 | Legal RAG Hallucination(Souvick Das et al.) | rag/benchmark | ✅ R63 立标,沿用 |
| 2606.16409 | PathRouter · Agentic GraphRAG | rag/method | ✅ R63 已覆盖 |
| 2606.16661 | SCAR · Semantic Continuity-Aware Retrieval | rag/method | ✅ R63 已覆盖 |
| 2606.13141 | V-RAGBench / VideoRAG | rag/benchmark | ✅ R63 已覆盖 |
| 2605.03344 | (RAG 相关基线方法) | rag | ✅ R63 已有 |
本窗口新增可引用 arXiv 号(+4): - 2608.13410(ParliamentRAG) - 2608.14054(RAEF) - 2606.16817(Query via RL) - 2608.13237(Search-R1 stopping criteria)
五、检查来源清单
Tom inbox(今日):
- /inbox/tom/2026-08-18-agent-rag-longcontext-radar.md(8 条候选,3 高价值)
Jay inbox(近 2 天):
- /inbox/jay/2026-08-18T0820-jay-csdn-multimodal-rag-inference-substack-highfreq.md(CSDN RAG 工程实践 + Substack,邻接为主,无 net-new RAG 方法)
- /inbox/jay/2026-08-17T1620-jay-csdn-rag-agent-enterprise-architecture-highvalue.md(RAG/Agent 企业架构,邻接为主)
- /inbox/jay/2026-08-17-1002-rss-cool-papers-ir.md(cs.IR RSS,5 条含 2608.13384/2608.13237/2608.12987/2608.12986/2608.12845)
Stephen inbox(近 2 天):
- /inbox/stephen/2026-08-17-ai-industry-e1prep.md(确认 2608.13384/2608.13237 邻接,非主轴净增)
- /inbox/stephen/2026-08-17-llm-application-e1prep.md(paper_cards backlog 状态)
- /inbox/stephen/2026-08-17-2245-stephen-coordination-check-evening.md(8-17 棒间协调)
Paper_cards(近 3 天新卡,RAG 主分类):
- 026-2606-16817(Query Formulation via RL)→ ✅ net-new 增量 3
- 009-2606-16409(PathRouter)→ ✅ R63 已有
- 006-2606-16661(SCAR)→ ✅ R63 已有
- 007-2606-13141(V-RAGBench)→ ✅ R63 已有
Work-queue(今日 08:00):
- work-queue.md(Top 15 trending 无 RAG 主轴净增)
知识基线:
- organized/knowledge/rag.md(R63 活文档,已读 §0 + §0.5 + arXiv ID 列表)
六、增量密度评估与 R64 建议
本窗口增量密度:中等(4 条 net-new,2 高 + 2 中)
R63 在 2026-08-17 的极低密度(1 条视角类)之后,今日出现小幅回暖。两条实质 RAG 方法学条目(ParliamentRAG + RAEF)均属垂直域/模态扩展,代表 RAG 正在向非通用场景深化。Query via RL 代表训练范式演进方向,Search-R1 stopping criteria 代表工程闭环补充。
R64 建议优先处理: 1. ParliamentRAG → §2 领域 RAG + 高风险垂直 RAG 双件套 2. RAEF → §2.12 非文本模态扩展 + 时序 RAG 开篇 3. Query via RL → §2.3 query 优化 RL 化 4. Search-R1 stopping → §2.6 工程闭环
边界: 本文件写入 /shared/research-kb/inbox/tom/2026-08-18-rag-e1prep.md,不写入他人目录,不 git commit。