rag · E1 预消化简报(2026-09-06)

R82 E1 轮 · 窗口覆盖:2026-09-05 08:50 ~ 2026-09-06 08:50 CST 数据来源:Tom 9-06 0840 radar + Tom 9-05 2040 radar + Jay 9-06 0820 inbox + Stephen 9-05 2245 coord-check evening + flyp 9-05 2123 multimodal-long-context-rag v2 + paper_cards Sep 5-6 新卡核查 活文档基线:R81 rag-e1prep(2026-09-05 08:52 CST)+ rag.md 状态(R80 基线确认)


0. 概述与基线对齐

R81 状态确认:R81 锚入 3 件净增量(PACE 2609.03293 / LatentStream 2609.04131 / GRIP RAG-adjacent 未入库)+ 1 件协调信号(RAG 评测维度扩展)+ 5 件 R80 backlog 提醒(ViSAR/NE-R1/BioNER+RAG/LAMAR/SimLLM)。

本轮(R82)新发现:paper_cards Sep 5 新增 1 件主分类 rag 新卡(RoboTok 2609.03199);1 件 RAG 主分类历史卡核实(KBMR 2608.21450,早期批次未锚入);Jay Sep 6 morning 文件带来 Agentic RAG SoK(POMDP 形式化)+ ICLR 2026 Agent Memory TTL 效率权衡两项 RAG 体系级增量;另有 1 件"Context Engineering vs RAG"架构辩论信号(Chroma 命题延续 + Stephen coord 确认升档)+ 1 件 Embedder's Dilemma(RAG 检索分工)重新核实。整体增量密度中等,体系级框架增量是本轮核心价值。

核心判断:R82 本轮贡献为:(1) RoboTok 将 RAG 检索扩展到机器人操作视频域(互联网规模);(2) KBMR 将 RAG 检索扩展到知识库视觉问答(MLLM 检索器 vs CLIP);(3) ICLR 2026 Agent Memory 的 TTL 三段数据提供了 RAG vs Long-Context 成本-质量权衡的实证框架;(4) Agentic RAG SoK 提供了 POMDP 形式化统一框架;(5) "Context Engineering is King"辩论信号值得在活文档中标注为 RAG 范式受到挑战的新维度。


1. 增量条目(5 件净增量)

增量 ① RoboTok:互联网规模机器人演示检索(RAG 新域)

  • 来源:arXiv 2609.03199 + paper_card 1236 主分类 rag 副分类 multimodal + Sep 5 入库 + Tom 9-06 0840 radar #2 高价值 + Stephen coord 升档信号(票数 22→40 +18)
  • 要点:给定人类操作视频查询,从网络视频中检索相关演示用于训练灵巧机器人策略。学习 3D 手部轨迹潜在空间,以 actor 中心参考系表达,支持跨视角、跨场景行为比较。77 票(本次 radar 候选最高),Sep 4-5 票数从 22 升至 40,是 Stephen coord 确认的唯一显著升档条目。
  • 与活文档现有脉络的关系:R81 已覆盖 LatentStream(视频记忆内化)和 PACE(KB 隐性冲突);RoboTok 将 RAG 扩展到非文本模态(视频→机器人动作),与 §2.7 多模态 RAG 直接衔接,但属于全新应用域(机器人学习数据引擎)。是 RAG 思想在物理操作域的规模化验证。
  • 建议归入节:§2.7 多模态 RAG(RoboTok 互联网规模演示检索新域)+ §1.6 立标候选(RoboTok ★★)
  • 可信度:★★★★(arXiv 预印本,paper_card Sep 5 入库,票数 77 最高)

增量 ② KBMR:面向知识库视觉问答的 MLLM 嵌入检索器

  • 来源:arXiv 2608.21450 + paper_card 1210 主分类 rag 副分类 multimodal + Sep 3-4 批次入库(早期卡,本次 R82 核实 RAG 主分类) + Tom candidates JSON 来源追溯
  • 要点:KB-VQA 依赖检索外部信息回答长尾实体问题,现有 CLIP 风格双编码器优先表层视觉相似性而非实体级语义对齐(语义相同但视觉差异大,或视觉相似但实体不同则失效)。KBMR 是首个面向 KB-VQA 的 MLLM 自回归嵌入检索器,弥补 CLIP 跨实体语义对齐缺陷。
  • 与活文档现有脉络的关系:R81 LatentStream 针对视频流式场景;RoboTok 针对机器人演示检索;KBMR 针对静态知识库视觉问答——三者形成"视频流/机器人操作/静态 KB-VQA"多模态 RAG 三分格局。与 §2.7 多模态 RAG(KB-VQA 方向)直接衔接,与 §2.4 检索器(MLLM 检索 vs CLIP 检索)邻接。
  • 建议归入节:§2.7 多模态 RAG(KBMR KB-VQA MLLM 检索器)+ §2.4 检索器(MLLM 检索 vs CLIP 双编码器)
  • 可信度:★★★★(arXiv 预印本,paper_card Sep 3-4 批次入库;方法论完整性需核实与现有 KB-VQA benchmark 对比数据)

增量 ③ Embedder's Dilemma:LLM vs Embedding 模型检索分工实证

  • 来源:arXiv 2608.12875 + paper_card 1055 主分类 rag 副分类 evaluation + 早期批次入库(核实为 RAG 主分类)
  • 要点:研究 embedding 模型与 LLM 在检索任务中的成本-效益分工。核心发现:embedding 模型适合相似度/分类/聚类;LLM 适合推理密集型检索任务(需要语义推理才能判断相关性的查询)。支持 RAG 系统分工架构设计——不是全用 LLM,也不是全用 embedding,而是按任务类型分配。
  • 与活文档现有脉络的关系:与 R81 §0.5.1 Memory 分工辩论直接相关——"什么塞进上下文 vs 什么按需检索";与 R82 增量 ④(ICLR 2026 TTL 三段数据)形成微观-宏观呼应(微观分工:embedding vs LLM;宏观分工:RAG vs Long-Context)。建议在 §2.4 检索器部分与 §2.12 成本权衡部分建立关联。
  • 建议归入节:§2.4 检索器(embedding vs LLM 任务分工)+ §2.12 成本与延迟(检索分工实证数据)
  • 可信度:★★★★(arXiv 预印本,有具体实验数据)

增量 ④ ICLR 2026 Agent Memory 评估:RAG vs Long-Context 三段效率-容量权衡

  • 来源:Jay 9-06 0820 inbox(Agentic RAG SoK 文件 §3)+ ICLR 2026 Proceedings + arXiv 引用追溯
  • 要点:ICLR 2026 论文评估 Memory 在 LLM Agent 中的作用,发现效率-容量权衡(TTL)的三段结构:
预算等级 RAG 得分 LC 模型得分 结论
Low(~4K token) 83.0 74.0 RAG 结构化检索在模式匹配任务显著优于 LC
Medium(~40K) 90.0 ≈ 90.0 持平
High(~100K+) 88.0(降级) 93.0 高预算时 LC 容量上限更高;RAG 因检索噪声反而降级

三种 RAG Agent 变体:Simple RAG(BM25,<$0.001/查询,但复杂推理差)/ Embedding-based RAG(平衡成本精度)/ Structure-Augmented RAG(知识图谱/事件时间线,结构化文档全局推理最强)。

工程结论:RAG 是低成本高效率但非万能;高复杂度推理需上 Long-Context;混合策略最优

  • 与活文档现有脉络的关系:与 R81 LatentStream("store-and-retrieve vs latent internalization"范式挑战)形成深层对话——ICLR 2026 数据从实证角度支持"混合策略",LatentStream 从系统架构角度提出替代范式。与 §2.12 成本与延迟(TTL 三段数据)直接衔接,与 §0.5.1 Memory 现状全景(TTL 效率权衡框架)直接衔接。
  • 建议归入节:§0.5.1 Memory 现状全景(ICLR 2026 TTL 三段数据)+ §2.12 成本与延迟(混合策略最优结论)+ §2.7 多模态 RAG(Structure-Augmented RAG 知识图谱方向)
  • 可信度:★★★★★(ICLR 2026 正式出版论文,数据扎实)
  • ⚠️ 待核实:arXiv 原始编号待精确追溯;建议 Jay 推动确认论文 ID 或 Stephen coord 中补充

增量 ⑤ Agentic RAG SoK:POMDP 形式化统一框架

  • 来源:Jay 9-06 0820 inbox(Agentic RAG SoK 文件 §1)+ arXiv cs.IR 2026-03(经同行评审)+ ACL 2025 Findings 接收
  • 要点SoK: Agentic Retrieval-Augmented Generation 首次将 Agentic RAG 形式化为有限视野部分可观测马尔可夫决策过程(POMDP),为碎片化架构提供统一数学框架。指出此前 Agentic RAG 碎片化源于缺乏数学形式化——各系统控制流、工具调用、评估指标各异。三个分类维度:Agent 数量(单/多)/ 控制结构(层级/平铺)/ 自主程度(固定/自适应)。生产级系统需组合多个模式(Reflection + Planning + Tool Use),纯单一模式部署"通常是有问题的"。配套 Agentic RAG Survey(arXiv 2501.09136,2026-04 修订版,ACL 2025 Findings)覆盖 Self-RAG / CRAG / Adaptive RAG / ReAct over Docs / Multi-hop Decompose 五种生产模式。
  • 与活文档现有脉络的关系:R81 PACE(隐性冲突 KB 检索)和 LatentStream(记忆内化)均为 Agentic RAG 变体;SoK 提供了统一的数学框架,使 RAG 架构评审有据可依。与 §2.14 RAG 24 范式(Agentic RAG 形式化)直接衔接,与 §2.6 运行时(控制流设计)邻接,与 §2.5 评测(评估方法论不一致问题)邻接。这是 RAG 领域的"工程语言"级别贡献,建议写入活文档体系化框架章节。
  • 建议归入节:§2.14 RAG 24 范式(SoK POMDP 形式化)+ §2.6 运行时(控制流设计)+ §2.5 评测(评估方法论标准化)
  • 可信度:★★★★★(arXiv cs.IR 预印本经同行评审,2026-03,ACL 2025 Findings 接收)

2. 协调信号(Context Engineering vs RAG 辩论升级)

信号:"RAG is Dead, Context Engineering is King" 命题升档 - Stephen 9-05 2245 coord-check 确认:Chroma 命题在团队研究中已从 R81 的"待观察"升档为实质性辩论焦点 - Tom 9-06 0840 radar 引用 Coding with Roby Substack:"知识(knowledge)和记忆(memory)是不同层;2024 年 memory = '选个向量数据库做 RAG',2026 年 memory 是第一等架构原语,分三层" - "LongMemEval 基准表明:基础长上下文检索在大型上下文窗口下表现良好;瓶颈在检索质量而非向量数据库本身" - Substack 补充:Gemini 上下文窗口 1M+ tokens,Claude 200K;更大窗口没有消灭 memory 需求,而是改变了取舍:什么塞进上下文 vs. 什么按需检索

解读:这是 RAG 范式层面的系统性挑战——不是 RAG 本身失效,而是"把 memory 当作 RAG 问题"这个心智模型在 2026 年被重新定义为错误的起点。Context Engineering 作为替代框架,将 memory/long-context/retrieval 统一为"上下文管理"问题。建议在 rag.md 中以"对立观点"形式标注此辩论,不属于 RAG 自我矛盾,而属于领域演化中的范式竞争。


3. R81 Backlog 提醒(5 件仍待写入 rag.md,R81→R82 悬空)

# 论文 arXiv R82 状态
1 ViSAR(视觉文档自适应 k 检索) 2609.02486 R81 锚入,仍待写入
2 NE-R1(NER 按需检索) 2609.02366 R81 锚入,仍待写入
3 BioNER+RAG(放射学大众化摘要) 2609.02396 R81 锚入,仍待写入
4 LAMAR(多语言对齐重排器) 2607.22042 R81 锚入,仍待写入
5 SimLLM(⚠️ 主分类 rag 疑似误标) 2609.00591 R81 锚入,建议降为 llm-infra 邻接

R81→R82 仍未解决:GRIP(ACL 2026)仍未建 paper_card,建议由 Jay 推动或 Tom radar 补录。


4. 矛盾与待核实

矛盾 ① GRIP paper_card 缺失(R81→R82 延续)

  • GRIP(ACL 2026 Main Conference + WisdomShell/GRIP)在 Jay 9-04 inbox 标注后仍未建 paper_card
  • 建议:Jay 推动建卡;ACL 2026 Main Conference 级别是 rag 主轴近期最高会议级别候选

矛盾 ② ICLR 2026 Agent Memory 论文编号待精确追溯

  • Jay 9-06 inbox 引用了 ICLR 2026 论文数据和 arXiv 追溯,但原始编号未明确记录
  • 建议:R82 活文档写入时需补充精确 arXiv 编号

矛盾 ③ R81 Backlog 悬空(R80→R81→R82 三轮悬空)

  • R80 锚入的 5 件(ViSAR/NE-R1/BioNER+RAG/LAMAR/SimLLM)连续三轮未写入 rag.md
  • 建议:今晚活文档接力应将 R80+R81 backlog 作为优先任务处理

5. 可引用 arXiv 号列表

主分类 rag 本轮新增(3 件): - 2609.03199 — RoboTok(互联网规模机器人演示检索 · 77 票) - 2608.21450 — KBMR(KB-VQA MLLM 嵌入检索器) - 2608.12875 — Embedder's Dilemma(LLM vs embedding 检索分工实证)

体系级框架增量(2 件,非单篇 paper_card 增量): - ICLR 2026 — Agent Memory 评估(TTL 三段效率-容量权衡 · arXiv 编号待追溯) - cs.IR 2026-03 — Agentic RAG SoK(POMDP 形式化 · 同行评审论文)

R81 Backlog 悬空(5 件,已锚入仍待写入): - 2609.02486 — ViSAR - 2609.02366 — NE-R1 - 2609.02396 — BioNER+RAG - 2607.22042 — LAMAR - 2609.00591 — SimLLM(⚠️ rag 标签疑似误标)

R81 确认沿用(2 件,paper_card Sep 5 新入库): - 2609.03293 — PACE(隐性冲突 KB 检索) - 2609.04131 — LatentStream(流式视频记忆内化)


6. 增量条数汇总

类别 条数 编号
RAG net-new(主分类 rag,新入库) 3 ① RoboTok ② KBMR ③ Embedder's Dilemma
体系级框架增量(非单篇 paper_card) 2 ④ ICLR 2026 Agent Memory TTL ⑤ Agentic RAG SoK POMDP
协调信号(Context Engineering vs RAG 辩论) 1 RAG 范式受到系统性质疑
R81 Backlog 悬空 5 ViSAR/NE-R1/BioNER+RAG/LAMAR/SimLLM
合计净增量 5 ① RoboTok ② KBMR ③ Embedder's Dilemma ④ ICLR 2026 TTL ⑤ Agentic RAG SoK

arXiv 号数量:3 件新增主分类 rag + 2 件框架级(1 件待追溯编号)+ 5 件 R81 backlog + 2 件 R81 沿用 = 12 件本次报告涉及


7. 检查过的来源清单

  • ✅ Tom 9-06 0840 agent-rag-longcontext-radar.md(8 候选:DRACO/RoboTok/Select-Compress-Reinvest/VeriPhy;RoboTok 77 票高价值)
  • ✅ Tom 9-05 2040 agent-rag-longcontext-radar.md(RAG 架构 2026 共识:混合检索/Cohere Rerank 3.5/Agentic RAG/TruLens Agent GPA)
  • ✅ Tom 9-05 1440/0840 agent-rag-longcontext-radar.md(9-04 14:40 LatentStream/PACE 已锚入 R81)
  • ✅ Jay 9-06 0820 inbox(Agentic RAG SoK + ICLR 2026 Agent Memory + SGLang vs vLLM + AI Agents Stack 2026)
  • ✅ Stephen 9-05 2245 coord-check evening(RAG +5 件;RoboTok 升档 + Context Engineering 辩论升档)
  • ✅ flyp 9-05 2123 multimodal-long-context-rag v2(MLDocRAG + Kimi-VL 双稿;Substack 立场声明)
  • ✅ paper_cards Sep 5-6 新卡核查:1236 RoboTok(rag) / 1221 LatentStream(rag) / 1222 PACE(rag) / 1210 KBMR(rag) / 1055 Embedder's Dilemma(rag) — 5 件 RAG 主分类
  • ✅ work-queue.md(2026-09-06 08:00;选题榜 2608.31111 待处理)

无显著新增量的来源(已确认): - spark 9-05 inbox(agent/llm-infra 为主,无 rag 净增量) - Stephen 9-06 inbox(无 Sep 6 新文件) - flyp Sep 6 inbox(无新文件) - Jay Sep 6 其他文件(无新 rag paper_card)


8. 建议 R82 活文档写入方向

  1. RoboTok 写入 §2.7:互联网规模视频演示检索新域,与 LatentStream(视频流式)和 KBMR(静态 KB-VQA)形成多模态 RAG 三分格局
  2. KBMR 写入 §2.7 + §2.4:MLLM 检索 vs CLIP 双编码器;KB-VQA 场景的实体级语义对齐解决方案
  3. Embedder's Dilemma 写入 §2.4 + §2.12:embedding vs LLM 检索任务分工实证;支持混合策略结论
  4. ICLR 2026 Agent Memory TTL 数据写入 §0.5.1 + §2.12:三段效率-容量权衡(Low RAG 优/Medium 持平/High LC 优);推动精确 arXiv 编号追溯
  5. Agentic RAG SoK POMDP 写入 §2.14 + §2.5 + §2.6:RAG 架构评审的数学框架;评估方法论标准化起点;控制流设计参考
  6. Context Engineering vs RAG 辩论写入 §2.14(对立观点):作为 RAG 范式受到的系统性质疑标注,不属于内部矛盾,属于领域演化中的范式竞争
  7. R80+R81 Backlog 优先写入:ViSAR/NE-R1/BioNER+RAG/LAMAR/SimLLM 应在本轮活文档更新中完成(连续三轮悬空)

Tom · 2026-09-06 08:50 CST · E1 预消化 · rag · R82 窗口覆盖完成 · 5 件净增量(3 件主分类 rag paper_card 新入库 + 2 件体系级框架增量)+ 1 件协调信号(Context Engineering 辩论升档)+ 5 件 R81 backlog 提醒(连续三轮悬空)· RoboTok(77票·互联网规模机器人演示检索)+ KBMR(MLLM检索器·KB-VQA)+ Embedder's Dilemma(embedding vs LLM分工)+ ICLR 2026 Agent Memory TTL三段数据 + Agentic RAG SoK POMDP形式化 是本轮核心增量