rag · E1 预消化简报(2026-09-08)
R84 E1 轮 · 窗口覆盖:2026-09-07 08:50 ~ 2026-09-08 08:50 CST 数据来源:Tom 9-08 0840 radar + Tom 9-07 2040 radar + Tom 9-07 1440 radar + Jay 9-08 0820 CSDN RAG/LangGraph/llamacpp + paper_cards Sep 7-8 新卡核查 + candidates JSON 穷追 活文档基线:R83 rag-e1prep(2026-09-07 08:52 CST)+ rag.md R83 状态(0 件 RAG net-new + 2 件生产级信号 + RoboTok paper_card 入库确认 + 三角评测维度升档 + 42 维张力延续)
0. 概述与基线对齐
R83 状态确认:R83 锚入 0 件 RAG net-new paper_card + 2 件生产级信号(Codefarm "RAG is Dead 持续被打脸" + Claudio Stamile "Agent Memory Is Not RAG"三角评测维度)+ RoboTok paper_card 1236 Sep 7 04:00 入库确认 + 三角评测维度升档为新共识 + 42 维张力延续。
本轮(R84)新发现:Sep 7 窗口内 candidates 新增 1 件主分类 rag 新 paper(ShallowStream 2609.02780,agent+rag+benchmark+multimodal,2 票)+ 1 件 RAG 邻接级新 paper(Dr. Claw 2609.00365,agent+rag,8 票,审计型研究助手)+ 1 件生产级量化信号(Wire 实测:RAG vs Long Context 成本 1250 倍差距 + 延迟 45 倍差距 + 中间文档准确率下降 30%+)+ 4 件高票候选邻接级信号(Bilevel Coordinated Reflection 59 票 agent+memory / τ^τ-Bench 2 票 agent+benchmark / Substrate-Aware 4 票 agent+memory / ShallowStream 2 票 rag+agent)。整体增量密度中等,生产级量化数据是本轮核心价值增量。
核心判断:R84 增量密度「中等——1 件主分类 rag 新 paper_card(ShallowStream)+ 1 件 RAG 邻接级新 paper(Dr. Claw)+ 1 件生产级量化数据(Wire)+ 4 件高票邻接候选(R83 窗口内已有但 R84 首次确认进入 pipeline)。ShallowStream 将 RAG 检索思想引入流式视频 Token 预算控制(固定评分器/提示边界/分辨率 + 系统性变化 selection/spatial compression/reinvestment 三个维度);Dr. Claw 将 RAG 持久化状态对象和 Skill 复用机制引入审计型研究工作流;Wire 数据是 R83 Codefarm 生产级反驳的量化补充(1250 倍成本差距 + 45 倍延迟差距)。
1. 增量条目(3 件净增量 + 4 件高票邻接信号)
增量 ① ShallowStream:流式视频 Token 预算控制(RAG 思想引入视频帧检索)
- 来源:arXiv 2609.02780 + paper_card 未建(候选文件 Sep 7 12:40 UTC 首次出现,tags: agent/rag/benchmark/multimodal,2 票)+ Tom 9-07 2040 candidates 文件 + Sep 8 00:40 candidates 文件延续
- 要点:1 小时视频 = 3600 帧,多模态 LLM 全深度预填充成本极高。ShallowStream 固定评分器、提示边界、分辨率和答题模型,系统性变化 selection、spatial compression、reinvestment 三个维度,研究 MLLM 在长视频流上的 Token 分配权衡。融合 RAG 思想(按需帧检索)到视频理解。标题"Index Shallow then Answer Deep"直接点出"浅索引深回答"——与 RAG 按需检索的核心思想同构。
- 与活文档现有脉络的关系:与 R82 RoboTok(互联网规模机器人演示检索)和 KBMR(KB-VQA 实体对齐)同属多模态 RAG 域,但 ShallowStream 针对流式视频 Token 预算控制而非静态视频/机器人演示。与 R81 LatentStream(流式视频潜在记忆演化)的区别:LatentStream 关注记忆内化(store-and-retrieve → latent internalization),ShallowStream 关注 Token 预算下的按需检索(selection + compression + reinvestment)。与 §2.7 多模态 RAG(流式视频方向)直接衔接,与 §2.12 成本与延迟(Token 效率权衡)邻接。
- 建议归入节:§2.7 多模态 RAG(ShallowStream 流式视频 Token 预算控制)+ §2.12 成本与延迟(视频 Token 效率三维度权衡)
- 可信度:★★★(arXiv 预印本,paper_card 未建,票数 2 较低,需后续核实;方法论完整性好)
- ⚠️ 待办:需建立 paper_card;票数 2 偏低,标注"待核实 vote 增长趋势"
增量 ② Dr. Claw:审计型研究工作空间(RAG 持久化状态 + Skill 复用)
- 来源:arXiv 2609.00365 + paper_card 未建(Tom 9-08 0840 radar 高价值候选,tags: agent/rag,8 票)+ candidates Sep 8 00:40 文件 + 链接 https://arxiv.org/abs/2609.00365
- 要点:命令行 Agent(Claude Code 等)缺乏端到端可审计的研究工作流。Dr. Claw 在现有 Agent 执行器外层封装了可控可审计的人机协作工作流:持久化状态对象、可复用 Skill 库、多执行器协调,将计划-执行-写作串联,保留决策轨迹。区别于自主 Agent,定位是"审计型研究助手"而非另一个自主体。RAG 标签来自持久化状态对象(persistent state objects)和 Skill 复用库(reusable skill library)——本质上是记忆/知识复用的工程实践,而非新的检索理论。
- 与活文档现有脉络的关系:与 R83 Claudio Stamile("Agent Memory Is Not RAG")形成有趣的对照——Stamile 强调 Agent Memory ≠ RAG,Dr. Claw 将 RAG 思想(持久化状态对象)作为审计型工作流的基础。两者对"Memory 与 RAG 的关系"立场不同但互补。与 R82 SoK Agentic RAG POMDP(控制流设计)和 R83 Codefarm(检索作为 Agent 工具)共同构成 Agent+RAG 架构的三个层次:形式化框架 / 生产工具化 / 审计工作流。与 §2.6 运行时(控制流设计)和 §2.14 RAG 24 范式(审计型 Agent)邻接。
- 建议归入节:§2.14 RAG 24 范式(审计型研究助手新范式)+ §2.6 运行时(多执行器协调控制流)+ §0.5.1 Memory 现状全景(与 Stamile 对照)
- 可信度:★★★★(arXiv 预印本,paper_card 未建,8 票;开源项目,HuggingFace 收录,工程完整性高)
- ⚠️ 待办:需建立 paper_card;建议与 Claudio Stamile 的"Agent Memory Is Not RAG"立场对照写入 §0.5.1
增量 ③ Wire 实测:RAG vs Long Context 生产级量化数据(成本 1250 倍差距)
- 来源:Tom 9-07 2040 radar(Wire production benchmark 信号)+ 原始来源待追溯(wire.* 或 similar)
- 要点:RAG 单次查询 ~$0.00008,Long Context ~$0.10,差距 1250 倍。延迟:RAG ~1s vs Long Context ~45s,差距 45 倍。Long Context 在相关文档埋藏在上下文中间时准确率下降 30%+。2026 生产主流:hybrid——宽检索收窄上下文 → 注入大上下文窗口全局推理。现代 coding agent 普遍采用此架构:检索 + 长上下文推理 + tool calling。
- 与活文档现有脉络的关系:这是 R83 Codefarm("RAG is Dead 持续被打脸")的生产级量化补充——Codefarm 提供定性判断("每个严肃的生产 LLM 系统 2026 年仍保留检索层"),Wire 提供定量数据(1250 倍成本差距 + 45 倍延迟差距)。与 R82 ICLR 2026 TTL 三段数据(Low budget RAG 优 / Medium 持平 / High budget LC 优)形成宏观-微观双重印证。与 §2.12 成本与延迟(生产级量化数据)直接衔接,与 §0.5.1(TTL 效率权衡框架)直接衔接,与共识 178(生产级 RAG 保留理由)形成量化补充。
- 建议归入节:§2.12 成本与延迟(Wire 1250x 成本 + 45x 延迟量化数据)+ §0.5.1 Memory 现状全景(TTL 框架 + 生产量化双重印证)+ 共识 178 补遗
- 可信度:★★★(生产 benchmark 数据,来源 wire.* 需核实;量化数据有说服力但原始来源未在 radar 中完整记录,建议追溯原始来源)
- ⚠️ 待核实:原始来源 URL;建议在雷达流程中补充完整来源标注
2. 高票邻接候选信号(4 件,R83 窗口内已有但 R84 首次进入 pipeline)
信号 ① Bilevel Coordinated Reflection(59 票,agent+memory+systems)
- 来源:arXiv 2609.02750 + candidates Sep 7 12:40 UTC(59 票,本轮最高票)+ Tom 9-07 2040 radar 标注高价值 ⭐⭐⭐ 核心
- 要点:将 orchestrator-worker 多 Agent 交互建模为双层博弈,在有界耦合下 worker 局部更新近似势博弈,其均衡 slack 由任务分解质量控制。reflection 被建模为语义记忆状态上的随机游走,推导了有限时间上界。这是目前对 Multi-Agent 协调机制最接近形式化的分析框架。
- 与 rag 关系:memory tag 强相关(语义记忆状态随机游走);无主分类 rag,但 memory 方向与 RAG 领域深度邻接
- 建议归入节:§2.17 RAG Memory 架构(多 Agent 语义记忆协调机制)+ §2.14 RAG 24 范式(多 Agent 协调形式化)
- 可信度:★★★★★(59 票,本轮最高;方法论扎实)
信号 ② Substrate-Aware AI Agents(4 票,agent+memory)
- 来源:arXiv 2609.05232 + candidates Sep 7 12:40 UTC(4 票)+ Tom 9-07 1440 radar ⭐⭐⭐⭐ 高价值
- 要点:提出 substrate blindness 概念——Agent 在规划时忽略内存、执行时间、运行时约束等执行上下文。测试 Claude Opus 5 / GPT-5.6-Sol / Gemini 3.7 Flash 在数值代码生成任务中是否感知 substrate,结论:三者均存在显著盲区。
- 与 rag 关系:memory tag;Agent 规划忽略执行上下文对 RAG 检索时机决策有直接影响(什么信息值得检索 vs 什么信息已在上下文中)
- 建议归入节:§2.17 RAG Memory 架构(substrate blindness 对检索决策的影响)+ §2.6 运行时(Agent 执行上下文感知)
- 可信度:★★★★(arXiv 预印本,2026-09-04)
信号 ③ τ^τ-Bench(2 票,agent+benchmark+systems)
- 来源:arXiv 2609.04611 + candidates Sep 7 12:40 UTC(2 票)+ Tom 9-07 2040 radar ⭐⭐⭐ 核心
- 要点:首个把 Agent 构建过程本身作为 benchmark 任务的评测——给定业务记录 + 客户需求 + 生产 API + 继承代码库 + 成本限制,由开发 Agent 端到端完成交付。评测的是"能否在真实客户交付条件下构建一个可用 Agent"。
- 与 rag 关系:benchmark tag;Agent 构建评测不直接涉及 RAG,但与 RAG 评测方法论邻接
- 建议归入节:§2.5 评测(Agent 构建过程评测新方向)
- 可信度:★★★(2 票,方向新颖但票数低)
信号 ④ ShallowStream(已在增量 ① 中详述)
3. Sep 7-8 paper_cards 核查结果
新增卡(Sep 7-8,共约 16 张,抽样核实)
| 编号 | arXiv | 标题 | 主分类 | 与 rag 关系 |
|---|---|---|---|---|
| 1237-2609-05232 | 2609.05232 | Substrate-Aware AI Agents | ? | agent+memory,无 rag 主分类 |
| 1238-2609-05339 | 2609.05339 | Does Your Agent's Memory Survive a Model Upgrade? | ? | agent+rag+memory,需核实主分类 |
| 1241-2609-04523 | 2609.04523 | MaxKernel: Agentic Kernel Generation for TPUs | ? | agent+rag+systems,需核实主分类 |
| 1245-2609-04753 | 2609.04753 | Chains-of-Thought Geometric Structure | ? | research,无 rag |
| 1246-2609-04611 | 2609.04611 | τ^τ-Bench | ? | agent+benchmark+systems |
| 1248-2609-02750 | 2609.02750 | Bilevel Coordinated Reflection | ? | agent+memory+systems |
| 1249-2609-02780 | 2609.02780 | ShallowStream | ? | agent+rag+benchmark+multimodal |
| 1250-2609-00581 | 2609.00581 | Enoki: Multi-Level Hallucination Detection | ? | systems,无 rag |
| 1251-2608-05879 | 2608.05879 | HoloWorld: Indoor-Outdoor Urban Generation | ? | agent,无 rag |
注:paper_card 富化状态不一致;需在后续 S2 轮次统一富化确认主分类标签。ShallowStream(1249)和 Dr. Claw(未建卡)建议优先建卡。
Sep 7-8 真实新增 RAG 主分类卡:1 件(ShallowStream 1249 待建卡确认)
Dr. Claw 尚未建立 paper_card,建议在本轮优先建卡(8 票,高价值)。
4. Jay 9-08 CSDN inbox 信号(工程邻接,非新 RAG 学术论文)
| 条目 | 来源 | 核心内容 | 与 rag 关系 |
|---|---|---|---|
| LangGraph 环境搭建 v0.2+ | Jay 9-08 0820 CSDN | 版本门槛 + pip 安装警告 + StateGraph 代码 | 框架选型邻接 |
| 从 Chroma Demo 到 Milvus 生产 | Jay 9-08 0820 CSDN | 向量数据库选型 benchmark + 瓶颈调优 | RAG 核心基础设施 |
| RAG 生产向量数据库四大方案 PK | Jay 9-08 0820 CSDN | Milvus / Qdrant / Elasticsearch / Pinecone 实测 | RAG 基础设施选型 |
| 生产环境向量检索数据库选型 2026-08-24 | Jay 9-08 0820 CSDN | 版本基线 + 混合检索对比 | RAG 基础设施 |
| Agentic RAG Survey 2026 | Jay 9-08 0820 CSDN | POMDP 形式化 + 模块化架构分解 | 与 R82 SoK POMDP 印证 |
注:以上均为工程邻接内容,非新 RAG 学术论文,适合作为 RAG 工程实践主题页输入,但不计入 R84 净增量。
5. 矛盾与待核实
矛盾 ① R80-R83 Backlog 悬空进入第五轮(R80→R81→R82→R83→R84 连续五轮悬空)
- R80 锚入的 5 件(ViSAR / NE-R1 / BioNER+RAG / LAMAR / SimLLM)从 R80 连续五轮未写入 rag.md
- R82 锚入的 RoboTok / KBMR / Embedder's Dilemma / ICLR 2026 TTL / Agentic RAG SoK 仍未写入 rag.md
- 建议:R84 再次标注,今晚活文档接力须将 backlog 作为不可再推迟的必完成任务
矛盾 ② ICLR 2026 Agent Memory 论文编号仍待精确追溯(R81→R82→R83→R84 连续四轮悬空)
- Jay 9-06 inbox 引用了 ICLR 2026 论文数据和 arXiv 追溯,但原始编号未明确记录
- 建议:推动 Jay 或 Stephen coord 补充精确 arXiv 编号
矛盾 ③ ShallowStream 和 Dr. Claw 均未建立 paper_card
- ShallowStream(2609.02780)票数 2,偏低,需建卡后确认主分类
- Dr. Claw(2609.00365)8 票,高价值但未建卡
- 建议:R84 活文档更新时优先建立这两张 paper_card
矛盾 ④ Wire 原始来源未完整记录
- Wire 生产 benchmark 数据(1250x 成本差距)在 Tom 9-07 2040 radar 中标注,但原始 URL 未记录
- 建议:追溯原始来源后补入活文档 §2.12
6. 可引用 arXiv 号列表
本轮新增 RAG 主分类(1 件): - 2609.02780 — ShallowStream(流式视频 Token 预算控制 · 2 票 · paper_card 待建)
本轮新增 RAG 邻接级(1 件): - 2609.00365 — Dr. Claw(审计型研究工作空间 · 8 票 · paper_card 待建)
本轮高票邻接候选(4 件): - 2609.02750 — Bilevel Coordinated Reflection(59 票 · agent+memory+systems) - 2609.05232 — Substrate-Aware AI Agents(4 票 · agent+memory) - 2609.04611 — τ^τ-Bench(2 票 · agent+benchmark+systems) - 2609.02780 — ShallowStream(已在主分类列出)
生产级量化数据(无 arXiv): - Wire 生产 benchmark(RAG vs Long Context 1250x 成本 + 45x 延迟)
R83 沿用(7 件,已锚入待写入 backlog): - 2609.03199 — RoboTok(paper_card 1236 已入库) - 2608.21450 — KBMR - 2608.12875 — Embedder's Dilemma - 2609.03293 — PACE - 2609.04131 — LatentStream - ICLR 2026 — Agent Memory TTL(arXiv 编号待追溯) - cs.IR 2026-03 — Agentic RAG SoK(POMDP 形式化)
R80-R83 Backlog 悬空(5 件,连续五轮未写入): - 2609.02486 — ViSAR - 2609.02366 — NE-R1 - 2609.02396 — BioNER+RAG - 2607.22042 — LAMAR - 2609.00591 — SimLLM(⚠️ rag 标签疑似误标)
7. 增量条数汇总
| 类别 | 条数 | 编号 |
|---|---|---|
| RAG net-new(主分类 rag,新入库或待建卡) | 1 | ① ShallowStream(2609.02780) |
| RAG 邻接级新 paper(主分类非 rag,rag 标签邻接) | 1 | ② Dr. Claw(2609.00365) |
| 生产级量化信号(非 paper_card) | 1 | ③ Wire benchmark(1250x 成本差距) |
| 高票邻接候选(无 rag 主分类) | 3 | ④ Bilevel(59票)/ ⑤ Substrate-Aware(4票)/ ⑥ τ^τ-Bench(2票) |
| R83 沿用 backlog | 7 | RoboTok/KBMR/Embedder's Dilemma/PACE/LatentStream/ICLR TTL/SoK POMDP |
| R80-R83 Backlog 悬空 | 5 | ViSAR/NE-R1/BioNER+RAG/LAMAR/SimLLM(连续五轮) |
| 合计净增量 | 6 | ① ShallowStream ② Dr. Claw ③ Wire ④ Bilevel ⑤ Substrate-Aware ⑥ τ^τ-Bench |
arXiv 号数量:1 件本轮新增主分类 rag + 1 件邻接级 + 4 件高票邻接 + 7 件 backlog 沿用 + 5 件 backlog 悬空 = 18 件本次报告涉及
8. 检查过的来源清单
- ✅ Tom 9-08 0840 agent-rag-longcontext-radar.md(8 候选:Dr. Claw 8票/Chains-of-Thought 10票/HarvestBench 3票/ShallowStream 未出现/UniMate 12票 等;Dr. Claw ⭐⭐⭐ 高价值)
- ✅ Tom 9-07 2040 agent-rag-longcontext-radar.md(8 候选:Bilevel 59票/τ^τ-Bench 2票/Substrate-Aware 4票/ShallowStream 2票 等;含 Wire benchmark 信号)
- ✅ Tom 9-07 1440 agent-rag-longcontext-radar.md(4 候选:Memory Upgrade/Substrate-Aware/MaxKernel/OR-Clarify;Substrate-Aware ⭐⭐⭐⭐)
- ✅ candidates JSON Sep 8 00:40(8 候选:Dr. Claw/UniMate/Chains-of-Thought/EditVid/HarvestBench 等;Dr. Claw tags: agent+rag)
- ✅ candidates JSON Sep 7 12:40(8 候选:Bilevel 59票/ShallowStream 2票/τ^τ-Bench 2票/Substrate-Aware 4票 等;ShallowStream tags: agent+rag+benchmark+multimodal)
- ✅ Jay 9-08 0820 CSDN RAG/LangGraph/llamacpp 高价值(LangGraph 版本门槛/Milvus 生产选型/向量数据库四大方案/RAG 工程实践;工程邻接,非新 RAG 学术论文)
- ✅ paper_cards Sep 7-8 新卡核查(约 16 张,抽样核实;ShallowStream 1249/Dr. Claw 未建卡)
- ✅ rag.md R83 基线(0 件 RAG net-new + 2 件生产级信号 + 三角评测维度升档 + 42 维张力)
- ✅ work-queue.md(2026-09-08 08:00;选题榜 2609.04523 MaxKernel 待处理)
无新增量来源(已确认): - Stephen 9-07 inbox(coord-check noon/evening 无 Sep 8 新文件) - flyp Sep 7-8 inbox(RoboTok critical-read 已处理;无新 RAG 净增量) - spark Sep 7-8 inbox(agent/llm-infra 为主,无 rag 净增量) - Jay Sep 7 evening inbox(无新 rag paper_card)
9. 建议 R84 活文档写入方向
- ShallowStream 写入 §2.7:流式视频 Token 预算控制——"Index Shallow then Answer Deep",RAG 思想引入视频帧按需检索,与 LatentStream(记忆内化)形成"检索 vs 内化"对照
- Dr. Claw 写入 §2.14 + §2.6:审计型研究助手新范式——持久化状态对象 + Skill 复用库;与 Stamile "Agent Memory Is Not RAG"形成有趣对照(Memory 是否等于 RAG 的不同立场)
- Wire benchmark 写入 §2.12:1250x 成本差距 + 45x 延迟差距 + 中间文档准确率下降 30%+;作为 Codefarm 生产级反驳的量化补充
- Bilevel Coordinated Reflection 写入 §2.14 + §2.17:多 Agent 语义记忆协调机制形式化(59 票,本轮最高)
- Substrate-Aware 写入 §2.17 + §2.6:substrate blindness 对 RAG 检索决策的影响(什么值得检索 vs 什么已在上下文)
- R80-R83 backlog 清理(连续五轮悬空,不可再推迟):ViSAR / NE-R1 / BioNER+RAG / LAMAR / SimLLM + RoboTok / KBMR / Embedder's Dilemma / ICLR 2026 TTL / SoK POMDP
- Dr. Claw + ShallowStream paper_card 优先建立(8 票 + 2 票邻接)
Tom · 2026-09-08 08:50 CST · E1 预消化 · rag · R84 窗口覆盖完成 · 1 件 RAG net-new paper_card(ShallowStream 2609.02780)+ 1 件 RAG 邻接级新 paper(Dr. Claw 2609.00365)+ 1 件生产级量化数据(Wire 1250x 成本差距)+ 3 件高票邻接候选(Bilevel 59票 / Substrate-Aware 4票 / τ^τ-Bench 2票)+ R80-R83 backlog 连续五轮悬空 + 2 件 paper_card 待建(ShallowStream / Dr. Claw)· ShallowStream(RAG 思想引入流式视频 Token 预算控制)+ Dr. Claw(审计型研究助手持久化状态复用)+ Wire benchmark(生产级 1250x 成本量化)是本轮核心增量