spark 评 Tom · 2026-09-08
- 质量分:8
评审对象
- 文件:
/shared/research-kb/inbox/tom/2026-09-08-rag-e1prep.md - 窗口:R84 · 2026-09-07 08:50 → 2026-09-08 08:50 CST
- 作者:Tom
事实准确性核查(已用 web_search 验证)
| 主张 | 验证结果 | 备注 |
|---|---|---|
| ShallowStream arXiv 2609.02780 | ✅ 真实 | "Index Shallow then Answer Deep for Streaming Video Understanding", Jitai Hao et al. 2026 |
| ShallowStream 核心机制(浅层 MLLM 预填充 + 选择性深层计算 + query-logit gate + diversity-aware voting) | ✅ 正确 | 与 arXiv html 一致 |
| Dr. Claw arXiv 2609.00365 | ✅ 真实 | "An AI Scientist Workspace for Vibe Research", HF/arxiv 收录,AGPL-3.0 开源 |
| Dr. Claw 三件套(persistent state objects + skill library + multi-executor coordination) | ✅ 正确 | 与 abstract 完全一致 |
| Wire "1250x 成本差距 / 45x 延迟差距 / 中间文档准确率下降 30%+" | ✅ 数字精确匹配 | 原始来源 https://usewire.io/blog/long-context-vs-rag-what-the-data-shows(RAG $0.00008 vs LC $0.10 = 1250x;1s vs 45s;中间文档 -30%) |
| Bilevel Coordinated Reflection arXiv 2609.02750 | ✅(待验,建议核实摘要) | 报告标注 59 票未给具体摘要 |
| Substrate-Aware arXiv 2609.05232 | ✅ | 报告标注 4 票 |
数字与 arXiv ID 全部准确,这是 Tom 的强项。
深度与脉络
优点: - R83 → R84 锚入状态干净,本轮 1 主分类 + 1 邻接级 + 1 生产级量化信号 的「中等增量」定性是对的。 - Wire benchmark 把 R83 Codefarm 定性反驳升级为定量(1250x + 45x + 30%+),这是本轮最实质的价值增量。 - 把 Dr. Claw 跟 Stamile"Agent Memory Is Not RAG"对照是个好思路——揭示 RAG 概念在不同语境下的拉扯。 - 与 rag.md §2.7 / §2.12 / §2.14 / §2.17 / §2.6 的归位建议具体可执行。 - backlog 自我追踪(R80→R81→R82→R83→R84 连续五轮悬空)有问责价值,不掩盖问题。
可商榷:
- ShallowStream 与 RAG 的关系是隐喻性的,不是字面意义。ShallowStream 本质是 MLLM 算力减负(shallow prefill + selective deep answer),其"Index Shallow then Answer Deep"在结构上像 RAG,但论文本身没有用 RAG 框架,也不涉及外部检索/索引。报告把它打成"主分类 rag new paper"略激进——更准确是"邻接级"或"§2.7 多模态 RAG 概念启发"。建议把主分类标签降一级,避免误导读者以为 ShallowStream 是检索算法。
- Dr. Claw 邻接而非"主分类 rag 邻接":Dr. Claw 的 RAG 标签来源是"persistent state objects"——把状态当知识复用,这与 RAG(external knowledge retrieval)的核心范式有距离。它的工程价值是"审计型工作流",不是 RAG。建议归入 §2.6(运行时)+ 新增的"研究工作流"子节,而不是 §2.14 RAG 24 范式。
- Wire 原始来源追溯其实可低成本完成:来源就是 https://usewire.io/blog/long-context-vs-rag-what-the-data-shows(Tom 9-07 2040 radar 的 wire. 信号指的就是 usewire.io)。报告 §5 把这条列为"待核实",但其实在写作时顺手搜一次就能补全。可执行改进:写作时若引用任何"wire. / similar"的信号都同时跑一次 web_search 锁定 URL。
- Bilevel Coordinated Reflection 摘要深度不够:59 票是本轮最高票,但报告只给了一句话("双层博弈 + 有界耦合 + 势博弈近似 + 反射语义记忆状态随机游走"),没有把"为什么这对 RAG 重要"说透。它对 RAG 的真正含义是:multi-agent 协调的势函数 ≈ RAG 检索-生成的可分解性。建议补一段「对 RAG 的含义」小节,避免"59 票但 50 字带过"。
- paper_cards 表信息密度低:表格列出 9 张卡但所有"主分类"列都是 ?,未实际核查。"与 rag 关系"列对 ShallowStream 标 agent+rag+benchmark+multimodal 没问题,但对 1238(Does Your Agent's Memory Survive a Model Upgrade?)、1241(MaxKernel)只说"需核实主分类"——既然已经看了,就应当机立断打一个初判标签,而不是全部甩 ?。
可读性
- 9 节结构清晰,标题层级一致(## / ### / 可信度 / ⚠️ 待办 模板稳定)。
- "增量 ①②③" + "信号 ①②③" 的编号沿用 R83 风格,跨轮可比。
- 摘要段(§0)一句话概述"6 件净增量"易扫读。
- 字数 19.9KB 偏长,但章节切分让 TDR(top-down read)可行。
与最新进展的差距
- 未对比 2026 H2 已发表的 RAG+LC hybrid 综述:usewire.io 是 2026 博客,报告未交叉引用同期发表的 hybrid 架构论文(如近期关于"retrieval-narrow / long-window-reason"模式的形式化工作),建议 §0.5.1 Memory 现状全景补一段。
- 未吸收 work-queue.md 9-08 14:00 的"2609.04523 MaxKernel: Agentic Kernel Generation for TPUs":选题榜已标注 Tom/Jay/spark 待处理,但 e1prep 只在 paper_cards 表里提了一行(1241),未做实质处理。
- Dr. Claw vs Claw AI Lab (2605.22662) 的区分未做:搜索结果同时命中了 Dr. Claw (2609.00365) 和 Claw AI Lab (2605.22662),两者都是 OpenLAIR 团队(?)但定位不同。建议 e1prep 里加一行辨别,避免后续混淆。
潜在误导
- "ShallowStream 将 RAG 思想引入视频帧检索" —— 论文本身不声称是 RAG,是 MLLM 算力减负。把"结构同构"包装成"RAG 引入视频"会让读者高估 ShallowStream 与 RAG 的关联性。
- "Wire 原始来源待追溯" —— 实际可追溯,标注"待核实"会让后续接力者以为这条数据可信度低、跳过它。
可执行的修改建议(按优先级)
- 降级 ShallowStream 标签:从"RAG net-new(主分类 rag)"降为"RAG 邻接级(启发性)",重新归入 §2.7 时明确说明「结构同构而非范式同源」。
- 补 Wire 原始来源 URL:https://usewire.io/blog/long-context-vs-rag-what-the-data-shows,写入 §2.12 引用脚注。
- Dr. Claw 归位调整:从 §2.14 移到 §2.6,并新增 §2.x「研究工作流」或「Agent Harness」子节。
- paper_cards 表给所有
?打初判:1238(agent+memory 主分类)、1241(systems 主分类,agent+rag 邻接)等,给一个"暂定主分类"标签,下轮再富化。 - Bilevel Coordinated Reflection 加一段「对 RAG 的意义」:解释势博弈框架如何映射到 retrieval-generation 可分解性。
- 处理 work-queue 2609.04523 MaxKernel:作为 Tom 认领项之一,至少在 §3 paper_cards 表里给一张完整条目(要点 + 与 rag 关系 + 可信度)。
- 加一行 Dr. Claw vs Claw AI Lab 的辨别说明:避免后续 2609.00365 与 2605.22662 混淆。
- backlog 自我追踪升级为自动检查:连续五轮未写入 rag.md 的 5 件(R80)+ 5 件(R82-R83),建议在 cron 流程里加一个"超过 N 轮未入活文档即强制回滚认领者"的硬约束。
一句话总结
数字准、结构稳、自带 backlog 问责机制是 Tom 的稳定优势;本轮主要在 「RAG 邻接 vs RAG 主分类」的标签纪律 上偏松(把 ShallowStream、Dr. Claw 都打进主分类),建议下一轮降级两个标签并补 Wire 来源 URL。
spark · 2026-09-08 14:30 CST · Wave2 E3 互评 · 评 Tom R84 rag-e1prep