rag · E1 预消化简报(2026-10-08)

执行体:Tom · E1 日间预消化轮(rag) · 2026-10-08 08:50 CST 底本:organized/knowledge/rag.md v113(R114 基线 · Oct 7)+ inbox/{tom,jay,flyp,spark,stephen} 近 2 天 + paper_cards 近 3 天新卡 诚实度声明:本轮 RAG 主轴增量密度为「中」——4 件 RAG 主分类 net-new paper_card(RAG-PIBench + UNREAL + EC-RAG + Agentic AutoRAG);另有 1 件邻接(δ-mem 记忆第三条路 Substack) + 1 个数据矛盾点待核实(Agentic RAG 失败率 90% vs 70-80%)。整体无批量入库,但 4 件新卡均为有明确学术贡献的 RAG 基准/方法论工作,且与 R113 Defense 轴形成互补。


〇、检查范围与依据

inbox 来源(近 2 天 · RAG 相关筛选)

来源 文件 RAG 相关度
inbox/tom 2026-10-08-agent-rag-longcontext-radar.md(Oct 8 08:40 · UNREAL/EC-RAG/RAG-PIBench/δ-mem 高价值条目) 高(4 件新卡来源)
inbox/tom 2026-10-07T0840-agent-rag-longcontext-radar.md(Oct 7 08:40 · Jev Selection vs Extraction 高价值) 高(邻接已在 R113)
inbox/tom 2026-10-07-rag-e1prep.md(R113 基线) 高(基线)
inbox/jay 2026-10-07-0820-jay-csdn-inference-rag-highvalue-oct.md(Agentic RAG / RAG 4.0 / 70-80% 失败率) 中(工业视角;数字需核实)
inbox/jay 2026-10-07-csdn-rag-llm-agent-highvalue.md(GraphRAG vs Agentic RAG 工程实践) 中(工业视角)
inbox/jay 2026-10-06-csdn-llm-rag-agent-highvalue.md(GraphRAG / EAG-RAG / LangGraph) 低(已在 R113 覆盖)
inbox/jay 2026-10-08T0820-jay-csdn-inference-agent-rag-highvalue.md(推理引擎选型 / Agent 框架选型 / RAG 可观测性) 低-中(RAG 邻接,非主轴)
inbox/flyp Oct 6-7 多文件 低(Agentic RL / Long Context / DeepSeek V4;无 RAG 主轴内容)
inbox/spark Oct 6-7 多文件 低(coding agents / llm-infra;无 RAG 主轴内容)
inbox/stephen Oct 6-7 多文件 低(AI industry / llm-application;无 RAG 主轴内容)

paper_cards 来源(近 3 天新卡 · RAG 主分类筛选)

编号 arXiv 标题 主分类 状态
1699 2610.08674v1 EC-RAG:面向长视频理解的事件链检索增强生成 rag ✅ RAG 主分类 net-new · Oct 8 建卡 · Oct 7 提交
1700 2610.08571v1 RAG-PIBench:可信 RAG 系统中面向提示注入检测的泄露感知基准 rag ✅ RAG 主分类 net-new · Oct 8 建卡 · Oct 7 提交
1701 2610.08463v1 UNREAL:以单一模型统一检索与长上下文 rag ✅ RAG 主分类 net-new · Oct 8 建卡 · Oct 6 提交
1706 2610.08452v1 Agentic AutoRAG:面向推理驱动 Agent 的 RAG 超参数多目标优化 rag ✅ RAG 主分类 net-new · Oct 8 建卡 · Oct 6 提交
1698 2609.34227v1 Jev 选 vs LLM 抽取记忆对比预注册研究 agent R113 邻接已锚(Oct 7 建卡)
1692 2610.05622v1 UndoBench:任务能力 vs 故障恢复能力解耦 agent R113 邻接已锚(Oct 7 建卡)
1688 2610.05782v1 Agentic-ZTA:RAG 嵌入零信任架构 agent R113 邻接已锚(Oct 6 建卡)
1687 2610.05826v1 Bounded Provisional Visibility rag R113 已锚(Oct 6 建卡)
1686 2610.06207v1 AI-Decision Checkpoints rag R113 已锚(Oct 6 建卡)
1684 2610.02150v1 Source Learning agent R113 强邻接已锚(Oct 6 建卡)

R113 已锚(Oct 7 已覆盖):Bounded Provisional Visibility(2610.05826)+ AI-Decision Checkpoints(2610.06207)+ Source Learning(2610.02150)+ R112 全部锚点续立。


一、今日该主题最重要的增量(5 条)

增量 1 · RAG-PIBench:可信 RAG 系统中面向提示注入检测的泄露感知基准(arXiv:2610.08571)— RAG 安全评测新基准

  • 来源:paper_cards 1700-2610-08571.md(Oct 8 建卡 · Oct 7 arXiv 提交);inbox/tom/2026-10-08-agent-rag-longcontext-radar.md 高价值条目 #3
  • arXiv:2610.08571v1
  • 链接:http://arxiv.org/abs/2610.08571v1
  • 标签:rag benchmark systems security
  • 主分类:rag ✅(RAG 主分类 net-new;R113 无此条目)
  • 副分类:evaluation
  • 形态:benchmark
  • 发布:2026-10-07(Oct 7 arXiv 提交);Oct 8 完成建卡
  • TLDR:RAG-PIBench is introduced, a benchmark for RAG-style prompt-injection detection containing 4,876 contextual examples across frozen train, validation, and protected-test splits, to demonstrate the value of leakage-aware benchmark design and strong sparse baselines for reliable prompt-injection detection in RAG systems.
  • 要点: 1. 问题:RAG 系统易遭受嵌入在检索内容中的提示注入攻击——现有 prompt-injection 检测基准未针对 RAG 场景的"检索内容不可信"系统性风险设计 2. 方案:RAG-PIBench——含 4,876 条上下文示例,跨 frozen-train/val/protected-test 三档;基于泄露感知构建流水线与严格评估协议 3. 关键数据:DistilBERT 在受保护测试集上 F1=0.896、PR-AUC=0.968;TF-IDF+SVM 与逻辑回归仍具竞争力 4. 与 Defense 轴的关系:落在 Defense 轴(安全性/鲁棒性)——与 Bounded Provisional Visibility(2610.05826,入库前时间窗口防御)形成互补;Bounded Provisional 解决"入库前内容被提前暴露"问题,RAG-PIBench 解决"入库内容中含恶意提示注入"的检测问题;二者共同构成"入库防御 + 在库检测"双节点 5. 与 RAG 四轴分类法的关系:落在 Defense 轴(安全性/鲁棒性);是 RAG 安全评测体系的重要补全——R113 已覆盖 RAGScope(2609.39075,幻觉分诊证据门控)+ Bounded Provisional(2610.05826,动态内容中毒防御)+ Agentic-ZTA(2610.05782,零信任架构);RAG-PIBench 新增"提示注入检测评测基准"维度
  • 与活文档现有脉络的关系:
  • 邻接 rag.md §2.8(安全)——RAG-PIBench 新增 RAG 提示注入检测基准条目;与 Bounded Provisional(2610.05826)同属 Defense 轴,形成"入库前防御 + 在库检测"双节点
  • 邻接 rag.md §2.14(范式)——RAG 安全评测体系新基准
  • 建议归入节:§2.8 安全(Defense 轴评测基准新增)+ §2.14 范式(RAG 安全评测体系)
  • 可信度:⭐⭐⭐⭐(arXiv v1 新鲜;benchmark 形态,具体 F1/PR-AUC 数字;paper_card Oct 8 建卡)
  • ⚠️ 限制:受保护测试集的具体构造方法、与现有 prompt-injection 检测方法的全面对比数据需读原文确认

增量 2 · UNREAL:以单一模型统一检索与长上下文(arXiv:2610.08463)— RAG 与 Long-Context 的表征层统一

  • 来源:paper_cards 1701-2610-08463.md(Oct 8 建卡 · Oct 6 arXiv 提交);inbox/tom/2026-10-08-agent-rag-longcontext-radar.md 高价值条目 #1
  • arXiv:2610.08463v1
  • 链接:http://arxiv.org/abs/2610.08463v1
  • 标签:rag long-context benchmark systems
  • 主分类:rag ✅(RAG 主分类 net-new;R113 无此条目)
  • 副分类:llm-infra
  • 形态:method
  • 发布:2026-10-06(Oct 6 arXiv 提交);Oct 8 完成建卡
  • TLDR:This work introduces UNifying REtrieval And Long-Context with a Single Model (UNREAL), a model-native evidence selection framework to span corpus retrieval and long-context inference and establishes model-internal evidence selection as a common foundation for corpus retrieval and evidence-sparse long-context inference.
  • 要点: 1. 问题:长上下文推理与 RAG 在截然不同的规模上处理证据选取——从单个长 prompt 到整个语料库;现有方法将二者割裂 2. 方案:UNREAL——模型原生证据选取框架,直接从冻结 LLM 的内部表征中编码 chunk 并推导检索查询;新增可训练参数少于 500K;保持基模型完全冻结 3. 关键性质:model-native evidence selection(模型内部表征统一证据选取)+ 极低参数量(<500K)+ 跨 corpus retrieval 和 long-context inference 统一 4. 意义:改变了"短窗口用 RAG、长窗口用 Full-seq"的二分格局——从表征学习层面统一了 RAG 和长上下文两种证据选择机制;参数量极低,适合在产线轻量集成 5. 数据集:3B-token、21M-chunk Wikipedia 数据集验证 6. 与 RAG 四轴分类法的关系:落在 Efficiency 轴(效率/系统优化)——从表征层统一 RAG 与长上下文,减少架构碎片化;与 MatRAG(2610.01767,层级表征压缩)、CLIMB(2610.03421,置信度引导互补证据)同属 Efficiency 轴
  • 与活文档现有脉络的关系:
  • 邻接 rag.md §2.7(效率/系统)——UNREAL 统一 RAG 与 Long-Context 新节点;与 MatRAG(2610.01767)同属 Efficiency 轴,可形成"层级压缩 + 表征统一"双路径对比
  • 邻接 rag.md §2.14(范式)——RAG 与 Long-Context 二分格局的表征层统一
  • 建议归入节:§2.7 效率(Efficiency 轴表征统一新节点)+ §2.14 范式(UNREAL 范式贡献)
  • 可信度:⭐⭐⭐⭐(arXiv v1;高价值 radar 判定;具体参数量(<500K)和数据集规模(3B-token)有数字支撑)
  • ⚠️ 限制:具体 benchmark 对比数字、与各 Long-Context 方法的详细对比数据需读原文确认

增量 3 · EC-RAG:面向长视频理解的事件链检索增强生成(arXiv:2610.08674)— 视频 Agent 记忆层新范式

  • 来源:paper_cards 1699-2610-08674.md(Oct 8 建卡 · Oct 7 arXiv 提交);inbox/tom/2026-10-08-agent-rag-longcontext-radar.md 高价值条目 #2
  • arXiv:2610.08674v1
  • 链接:http://arxiv.org/abs/2610.08674v1
  • 标签:rag benchmark multimodal
  • 主分类:rag ✅(RAG 主分类 net-new;R113 无此条目)
  • 副分类:multimodal
  • 形态:method
  • 发布:2026-10-07(Oct 7 arXiv 提交);Oct 8 完成建卡
  • TLDR:Experiments show that this event-centric design consistently outperforms frame-level retrieval baselines, highlighting the importance of modeling temporal structure for long-video understanding.
  • 要点: 1. 问题:现有大视频语言模型(LVLM)处理长视频时,帧通常被独立处理,难以捕获跨事件的时序依赖;现有 RAG 方法也以帧或片段层面操作 2. 方案:EC-RAG——无需训练(training-free),将视频内容组织为显式事件链(Event Chain),在此基础上做 QA 推理 3. 关键性质:event-centric(事件中心)+ temporal dependency modeling(跨事件时序依赖)+ training-free 4. 意义:视频 Agent 的记忆层新范式——事件链提供了可解释的检索结构;适合作为视频 Agent 的上下文组织模块参考;解决现有方法以帧/片段为单位、无法建模跨事件时序依赖的问题 5. 与 RAG 四轴分类法的关系:落在 Reasoning 轴(多跳/结构化推理)——视频内容的时序事件链建模;与 EnSI-RAG(2608.21252,实体结构索引长文档)、MatRAG(2610.01767,多跳 QA)同属 Reasoning 轴结构化推理方向
  • 与活文档现有脉络的关系:
  • 邻接 rag.md §2.6(运行时/记忆层)——EC-RAG 视频 Agent 记忆层新条目
  • 邻接 rag.md §2.9(多模态 RAG)——EC-RAG 作为长视频理解的多模态 RAG 新节点
  • 邻接 rag.md §2.14(范式)——事件链作为视频 RAG 的结构化表示方法
  • 建议归入节:§2.6 运行时(视频 Agent 记忆层新增)+ §2.9 多模态 RAG(EC-RAG 新节点)+ §2.14 范式(事件链表示)
  • 可信度:⭐⭐⭐⭐(arXiv v1 新鲜;training-free + event-centric 设计具体;跨事件时序依赖问题明确定义)
  • ⚠️ 限制:具体数据集、性能提升数字、与帧级 baseline 的详细对比数据需读原文确认

增量 4 · Agentic AutoRAG:面向推理驱动 Agent 的 RAG 超参数多目标优化(arXiv:2610.08452)— RAG 自动化调优新框架

  • 来源:paper_cards 1706-2610-08452.md(Oct 8 建卡 · Oct 6 arXiv 提交)
  • arXiv:2610.08452v1
  • 链接:http://arxiv.org/abs/2610.08452v1
  • 标签:rag agent
  • 主分类:rag ✅(RAG 主分类 net-new;R113 无此条目)
  • 副分类:agent
  • 形态:method
  • 发布:2026-10-06(Oct 6 arXiv 提交);Oct 8 完成建卡
  • TLDR:Agentic AutoRAG is introduced, an LLM-agent optimizer for multi-objective RAG hyperparameter optimization with retrieval-versus-generation failure attribution, and reaches higher LLM-judge accuracy than every baseline the authors compare, and within its first 10 trials it matches or beats the statistical baselines' full 30-trial judge accuracy.
  • 要点: 1. 问题:配置 RAG 流水线是代价高昂的超参数优化问题——涉及分块、嵌入模型、重排序、生成等多个相互耦合的选择;现有优化器(贪心搜索到贝叶斯优化)将每次试验简化为聚合分数搜索,未建模"某配置为何失败" 2. 方案:Agentic AutoRAG——LLM-agent 优化器,进行多目标 RAG 超参数优化;带 retrieval-versus-generation failure attribution(检索-生成失败归因)——利用已检索到的 chunk 提供证据,判断失败发生在检索阶段还是生成阶段 3. 关键数据:前 10 次试验即匹配或超越统计基线完整 30 次试验的 LLM-judge 准确率——表明 failure attribution 机制极大提升了 sample efficiency 4. 意义:RAG 配置优化从"盲搜索"到"可解释推理"的范式转变;Agentic AI 方法论反哺 RAG 系统优化;与 R113 AI-Decision Checkpoints(2610.06207)同属 RAG 自动化/优化方向,但聚焦工程实现层 5. 与 RAG 四轴分类法的关系:落在 Efficiency 轴(超参数优化/自动化)+ Interactivity 轴(Agent 驱动自动化);与 RAGPerf(2603.10765,NVIDIA 端到端基准)同属 RAG 评测/优化体系,但聚焦自动超参数调优
  • 与活文档现有脉络的关系:
  • 邻接 rag.md §2.7(效率)——Agentic AutoRAG RAG 超参数自动化调优新节点
  • 邻接 rag.md §2.14(范式)——LLM-agent 优化器在 RAG 系统配置中的应用;与 R113 AI-Decision Checkpoints(2610.06207)RAG 自动化方向互补
  • 建议归入节:§2.7 效率(超参数自动化调优新增)+ §2.14 范式(Agentic AutoRAG 自动化优化)
  • 可信度:⭐⭐⭐⭐(arXiv v1;具体性能数字(前 10 次 vs 30 次)+ failure attribution 机制有学术贡献;paper_card Oct 8 建卡)
  • ⚠️ 限制:具体搜索空间、超参数范围、与 AutoRAG/RAGChain 等现有方法的详细对比需读原文确认

增量 5 · δ-mem:RAG 与 Long Context 之外的 Agent 记忆第三条路(Substack · AlphaSignal · arXiv 2026-05-12)— 微型关联记忆矩阵

  • 来源:inbox/tom/2026-10-08-agent-rag-longcontext-radar.md 高价值条目 #4(Substack 补充)
  • arXiv:arXiv:2605.XXXXX(原文 2026-05-12,Substack 策展 2026-10-08)
  • 链接:https://alphasignalai.substack.com/p/rag-and-long-context-arent-enough
  • 标签:agent memory
  • 主分类:agent(非 RAG 主分类,作为强邻接计入)
  • 形态:method
  • 发布:2026-05-12(arXiv 提交);2026-10-08 Substack 补充收录
  • TLDR(来自 Substack 策展):δ-mem 提出用微型关联记忆矩阵(8×8)替代向量数据库或扩展上下文;在 Qwen3-4B-Instruct 上,仅 4.87M 可训练参数(0.12% 模型参数)即可将 5 个 benchmark 平均提升约 5%
  • 要点: 1. 问题:RAG 需要向量数据库和维护成本;Long Context 需要大量 KV Cache;两者都有显著 overhead 2. 方案:δ-mem——微型关联记忆矩阵(8×8)作为第三条路;可训练参数仅 4.87M(占 Qwen3-4B-Instruct 的 0.12%) 3. 关键数据:5 个 benchmark 平均提升约 5%;Qwen3-4B-Instruct;已在 Hugging Face 开源(CC-BY-4.0) 4. 意义:与 UNREAL(统一 RAG 与 Long-Context)同属"减少架构碎片化"方向,但 δ-mem 从记忆表征层面提出第三条路;与 R112 δ-mem(来自 R110 Radar)属于同一工作的重新发现 5. ⚠️ 重要限制:原文 arXiv 号未在 Substack 中确认;原文 2026-05-12 提交,距今约 5 个月,非最新;TLDR 数字来自 Substack 策展方,非原始论文摘要;需核验原始 arXiv 号
  • 与活文档现有脉络的关系:
  • 邻接 rag.md §2.5(记忆基础设施)——δ-mem 记忆第三条路;与 MemoRAG、R112 δ-mem 邻接
  • 邻接 rag.md §2.14(范式)——从"向量数据库 or Long Context"到"微型关联记忆矩阵"的范式第三条路
  • 建议归入节:§2.5 记忆基础设施(δ-mem 第三条路补强)+ §2.14 范式(记忆架构选型)
  • 可信度:⭐⭐⭐ 中(Substack 策展;具体数字有出处;但原文 arXiv 号待确认;建议核验原文)

二、值得警惕的矛盾或待核实说法(2 条)

⚠️ T1:Agentic RAG 生产失败率数字矛盾——90% vs 70-80%

矛盾描述:Jay Oct 7 CSDN 内容(2026-10-07-0820-jay-csdn-inference-rag-highvalue-oct.md #5)引用 CSDN 逐梦苍穹文章称"Agentic RAG 高达 90% 生产失败率技术陷阱";同一 Jay 文件也引用 Ragaboutit/Blits.ai 称"70-80% 的企业 RAG 项目从未进入生产"。两个数字出处不同(中文 CSDN 博客 vs 英文行业调查),量级有差距。

可能原因:90% 可能指"达到生产后持续运营成功"的比例(含维护成本、幻觉审计等);70-80% 可能指"从未进入生产"的初始部署失败比例;统计口径未统一。

风险等级:中(数字被广泛引用,但口径不统一可能误导工程决策)

处置建议:引用 Agentic RAG 失败率时注明数据来源和口径;建议在 rag.md 中区分"部署阶段失败率"和"运营阶段成功率"两个维度。

⚠️ T2:δ-mem 原文 arXiv 号未确认

矛盾描述:Substack 策展文提到 δ-mem 原文 2026-05-12 提交,但未给出具体 arXiv 号。Substack 策展的摘要数字(5 个 benchmark 平均提升 5%)来自策展方,非原始 TLDR。

风险等级:低-中(影响可信度评级,但工作本身有开源代码)

处置建议:引用 δ-mem 时标注"原文 arXiv 号待确认;数字来自 Substack 策展";建议检索原始 arXiv 确认具体 TLDR 和实验设置。


三、可引用的 arXiv 号列表

arXiv 论文 与 RAG 关系 今日状态
2610.08571v1 RAG-PIBench:RAG 提示注入检测泄露感知基准 RAG 主分类 net-new · Defense 轴 · Oct 7 提交 ✅ 新锚 · 具体 F1=0.896/PR-AUC=0.968
2610.08463v1 UNREAL:统一检索与长上下文单一模型 RAG 主分类 net-new · Efficiency 轴 · <500K 新增参数 · Oct 6 提交 ✅ 新锚 · ⚠️ 详细 benchmark 数字待原文
2610.08674v1 EC-RAG:事件链长视频理解 RAG 主分类 net-new · Reasoning 轴 · multimodal · Oct 7 提交 ✅ 新锚 · ⚠️ 详细性能数字待原文
2610.08452v1 Agentic AutoRAG:推理驱动 RAG 超参数多目标优化 RAG 主分类 net-new · Efficiency 轴 · Agent 副分类 · Oct 6 提交 ✅ 新锚 · 前 10 次匹配 30 次基线
2610.05826v1 Bounded Provisional Visibility:持续 ingested RAG 中毒暴露控制 RAG 主分类 · Defense 轴入库前防御 R113 已锚
2610.06207v1 AI-Decision Checkpoints for AI-Augmented BPM RAG 主分类 · Interactivity 轴 BPM 框架 R113 已锚
2610.02150v1 From Knowledge Access to Source Learning 强邻接 rag · 从来源学习 R113 已锚
2610.01871v1 imMRAG · MRAG 黑盒数据窃取攻击 RAG 主分类 · Defense 轴在库防御 R113 已锚
2610.01936v1 RAG Landscape 四轴分类法(VIT + MBZUAI) RAG 主分类 · Defense 轴立标 R113 已锚
2610.01767v1 MatRAG · Matryoshka 层级 RAG 多跳 QA RAG 主分类 · Efficiency 轴 R113 已锚
2610.03421v1 CLIMB:置信度引导互补证据 multimodal RAG RAG 主分类 · multimodal RAG R113 已锚
2610.03136v1 Reasoning-Language Alignment in Monolingual RAG RAG 主分类 · 多语言 RAG 鲁棒性 R113 已锚
2610.03632v1 World Embedding Benchmark 副分类 rag · multimodal benchmark R113 已锚
2609.34227v1 When Does Selection Replace Extraction(Jev 选 vs 抽取) 邻接 rag · Agent 记忆范式 R113 已锚
2610.05622v1 UndoBench:任务能力 vs 故障恢复解耦 邻接 rag · RAG Agent 评测 R113 已锚
2610.05782v1 Agentic-ZTA:RAG 嵌入零信任架构 邻接 rag · Defense 轴 R113 已锚
2606.26511v1 Temporal Validity in Retrieval Memory RAG 安全 · 知识时效性 R113 已锚
2607.01935v1 A-TMA · 状态感知记忆失效解耦 Agent 记忆时效性 R113 已锚
2609.39075v1 RAGScope · 幻觉分诊证据门控协议 RAG 幻觉路由 R113 已锚
2609.39929v1 RoPE at the End of Its Rope(长上下文失效诊断) RoPE 位置编码 trade-off R113 已锚
2511.07328v2 Q-RAG · RL 训练 Embedder 长上下文 QA ICLR 2026 接收 R113 已锚
2608.21252v1 EnSI-RAG · 实体结构索引 RAG 长文档 RAG 新范式 R113 已锚
2603.10765v1 RAGPerf · NVIDIA 端到端基准 RAG 评测体系 R113 已锚

四、趋势信号提取

信号 1:RAG 安全评测体系三足鼎立——Defense 轴从"防御方法"扩展到"评测基准"

RAG-PIBench(2610.08571,提示注入检测)+ Bounded Provisional Visibility(2610.05826,动态内容中毒防御)+ RAGScope(2609.39075,幻觉分诊)共同构成 RAG 安全评测/防御体系。RAG-PIBench 新增"提示注入检测基准"维度,使 Defense 轴从纯防御方法扩展为"防御方法 + 评测基准"双轨。RAG 安全正在形成与 OWASP LLM Top 10 2026 对应的系统性评测体系。

信号 2:RAG 与 Long-Context 从架构二分走向表征层统一

UNREAL(2610.08463)从冻结 LLM 内部表征层面统一 RAG 和 Long-Context 证据选取机制;δ-mem 从记忆表征层面提出第三条路。两条路径共同指向一个趋势:RAG 和 Long-Context 的边界正在从架构设计层向表征学习层融合,"短窗口 RAG、长窗口 Full-seq"的二元格局正在被打破。

信号 3:RAG 超参数优化从盲搜索走向可解释推理

Agentic AutoRAG(2610.08452)用 LLM-agent 优化器替代传统贝叶斯优化/贪心搜索;retrieval-versus-generation failure attribution 机制让优化过程可解释。这与 R113 AI-Decision Checkpoints(2610.06207)将 AI/RAG 视为一等设计要素的趋势一致——"可配置的 RAG"正在从手工调参走向自动化推理驱动。


五、相比 Oct 7 e1prep(R113)的增量差异

Oct 7 轮(R113)已覆盖 2 件 RAG 主分类 net-new(Bounded Provisional Visibility + AI-Decision Checkpoints)+ 1 件强邻接(Source Learning)+ 行业视角补强。

本轮在此基础上新增:

本轮新增 对应邻接
RAG-PIBench(2610.08571)— RAG 提示注入检测泄露感知基准 §2.8 安全(Defense 轴评测基准)+ §2.14 范式(安全评测体系)
UNREAL(2610.08463)— 以单一模型统一检索与长上下文 §2.7 效率(Efficiency 轴表征统一)+ §2.14 范式(RAG/LC 二分格局打破)
EC-RAG(2610.08674)— 事件链长视频理解 §2.6 运行时(视频 Agent 记忆层)+ §2.9 多模态 RAG + §2.14 范式
Agentic AutoRAG(2610.08452)— 推理驱动 RAG 超参数多目标优化 §2.7 效率(超参数自动化)+ §2.14 范式(自动化优化)
δ-mem(Substack 策展)— 微型关联记忆矩阵第三条路 §2.5 记忆基础设施 + §2.14 范式(记忆架构选型)

无更新锚点:R113 已锚定的锚点在本次窗口无更新,本简报不重复立条目。


六、检查过的来源清单(诚实度声明)

本轮 RAG 主题预消化检查了以下来源,确认无"硬凑字数"的净增量:

来源 文件 RAG 相关性
work-queue organized/queue/work-queue.md 无 RAG 新任务(选题候选 2610.08048 为 agent 主分类)
paper_cards Oct 5-8 约 50+ 件新卡(1684-1710 2610-xxx) 4 件 RAG 主分类 net-new(RAG-PIBench 2610.08571 + UNREAL 2610.08463 + EC-RAG 2610.08674 + Agentic AutoRAG 2610.08452);1 件邻接(δ-mem);其余为 agent/multimodal/evaluation/llm-infra 主分类
inbox/tom 2026-10-08-agent-rag-longcontext-radar.md 4 件高价值 RAG 新卡来源(UNREAL/EC-RAG/RAG-PIBench/δ-mem)
inbox/tom 2026-10-07T0840-agent-rag-longcontext-radar.md Jev Selection vs Extraction(已在 R113)
inbox/tom 2026-10-07-rag-e1prep.md R113 基线
inbox/jay 2026-10-07-0820-jay-csdn-inference-rag-highvalue-oct.md Agentic RAG / RAG 4.0 / 失败率数据(含矛盾数字)
inbox/jay 2026-10-07-csdn-rag-llm-agent-highvalue.md GraphRAG vs Agentic RAG 工程实践;无新学术内容
inbox/jay 2026-10-06-csdn-llm-rag-agent-highvalue.md GraphRAG / EAG-RAG;已在 R113 覆盖
inbox/jay 2026-10-08T0820-jay-csdn-inference-agent-rag-highvalue.md 推理引擎/Agent框架/RAG可观测性;RAG邻接非主轴
inbox/flyp Oct 6-7 多文件 Agentic RL / Long Context / DeepSeek V4;无 RAG 主轴内容
inbox/spark Oct 6-7 多文件 coding agents / llm-infra;无 RAG 主轴内容
inbox/stephen Oct 6-7 多文件 AI industry / llm-application;无 RAG 主轴内容

结论:本轮 RAG 主轴增量密度为「中」——4 件 RAG 主分类新条目(RAG-PIBench 安全评测基准 + UNREAL 表征统一 + EC-RAG 视频记忆层 + Agentic AutoRAG 自动化优化)+ 1 件邻接(δ-mem 记忆第三条路)。整体无批量入库,但 4 件新卡均为有明确学术贡献的 RAG 基准/方法论工作,且与 R113 Defense/Efficiency/Reasoning 轴形成系统化互补。


Tom · 2026-10-08 08:50 CST · rag · E1 预消化 · inbox/tom/2026-10-08-rag-e1prep.md