2026-08-01 周六精读与反方审稿 · flyP(2 篇方法论级 + 1 篇 Substack 对位)
本实例:flyP(多模态 + 反方审稿) 模式:本周高价值论文精读 + 反方审稿 + 复现风险分析(周六 10:30 档) 任务来源:cron
034af2f3-c583-4a62-b01e-1ae28114fb89 研究知识库 · 周六精读与反方审稿 · flyP去重边界: - tom 8-1 雷达 + rag-e1prep 已收 DualG-MRAG(2607.28580)、GLM-RAG(2607.28397)、Σ-Mem(2607.27958)、Filesystem-Based Memory(2607.26637)、ConMem(2607.28126)、See2Think(2607.26769)作为 high-value 候选;本稿 = 它们的反方审稿落点。 - flyP 8-1 09:50 ShadowDancer + CoMem 精读已产出,本稿不重复,仅在跨实例对照里点名。 - flyP 7-31 09:50 SkillRise + Metis 精读已产出,本稿围绕 RAG/agent memory 立标做对位。 - stephen 8-1 1002 ai-industry 已识 HF Daily 8-1 票榜(含 BM25 Wins at Scale 2607.26497),本稿把 BM25 Wins at Scale 作为本周第三篇方法论级精读。 本棒 GitHub 写入:0(只产草稿到 inbox,不 git / 不 push / 不 gh pr) 抓取范围:3 次 web_search + 3 次 web_fetch(均为 arxiv.org html / Substack)+ 0 次 PDF 下载 + 0 次全文抓取 输出:结构化阅读笔记 + 反方审稿 + 复现风险 + 主题页衔接建议
一、本次主题与候选筛选
主题:本周高价值论文精读、反方审稿、复现风险分析。从本周(2026-07-26 ~ 08-01)arXiv / HF Daily / Substack 候选池中筛 2-3 篇最值得方法论级精读的论文,覆盖:
- RAG 范式规模化重新审视(BM25 vs dense vs graph vs agentic file-system 的 scaling crossover)
- 多模态 RAG 宏微观解耦(多跳推理下结构化路径解码)
- filesystem 记忆作为一阶 agent memory 媒介(与传统 embedding memory / 显式 memory module 形成对立)
候选池来源: - arXiv cs.AI / cs.CL / cs.CV / cs.IR 7-26 ~ 8-1 提交(重点:2607.26637 / 2607.28397 / 2607.28580 / 2607.26497 / 2607.27958 / 2607.28126 / 2607.26769 / 2607.27957 / 2607.28263 / 2607.28362 / 2607.26760 / 2607.26784) - HF Daily 2026-07-26 ~ 08-01(BM25 Wins at Scale 38▲、Metis 240▲、Filesystem Memory 21▲、See2Think 21▲、Σ-Mem 8▲) - Substack:rasbt "LLM Research Papers: The 2026 List (January to May)" 2026 综述、jamwithai "The Infrastructure That Powers RAG Systems"
筛入本轮的 3 篇(按"方法论级 + 跨实例可复现 + RAG 三主题 + flyP 反方审稿饱和度"标准):
| 选 | 论文 / Substack | 主题 | 为什么本周必读 |
|---|---|---|---|
| ★ A | arXiv 2607.26497 — BM25 Wins at Scale: A Scaling Study of Retrieval-Augmented Generation Paradigms(USTC + Metastone + BAAS) | RAG 规模化对照 | 唯一把 BM25 / Dense / GraphRAG / File-System Agent 在 28-tier / 450× / 同一 reader 同一 judge 下的 head-to-head;颠覆"graph 总是更好"的工程假设 |
| ★ B | arXiv 2607.28580 — DualG-MRAG: Decoupling Macro-Reasoning and Micro-Matching for Multimodal RAG(Beihang BUAA · ACM MM 2026) | 多模态 RAG 宏微观解耦 | 多跳 MM-RAG 唯一的"结构化路径解码"立标;与单纯图增强方法(MMGraphRAG、RAG-Anything)形成清晰代差 |
| ★ C | arXiv 2607.26637 — Filesystem-Based Memory for LLM Agents: Organization, Evolution, and Sustainability(UIUC + UCSD + UC Merced + Adobe Research + Texas A&M) | agent filesystem 记忆 | 把"markdown 文件树"作为 agent memory 媒介的首个系统研究;与 flyP 关注的 agent harness(OpenClaw / Claude Code / Codex)直接闭环 |
未入选的高优候选与理由(避免下轮重复): - arXiv 2607.27958 Σ-Mem(多智能体可靠性记忆):tom 8-1 已收,本轮让位 filesystem 记忆。 - arXiv 2607.28397 GLM-RAG:tom 8-1 rag-e1prep 已收 R50 §2 候选;本稿把它作为 DualG-MRAG 的对照点提一笔,不重读。 - arXiv 2607.26769 See2Think:tom 8-1 已收邻接;本稿不重复。 - arXiv 2607.28126 ConMem(工业巡检):tom 8-1 rag-e1prep 已收 R50 §2.3 候选;本稿不重复。 - arXiv 2607.26760 Metis / 2607.26784 SkillRise:flyP 7-31 09:50 已精读;本稿仅在跨实例对位里点名。 - arXiv 2607.28263 CoMem / 2607.28362 ShadowDancer:flyP 8-1 09:50 已精读;本稿不重复。 - arXiv 2607.26503 / 2607.26760 / 2607.27957 等其他 RAG / agent 邻接:留待下轮周六精读候选池。
Substack 对位线索 1 条(仅 1 条,作为 B 的工程实践补充): - jamwithai.substack.com "The Infrastructure That Powers RAG Systems"(Shantanu Lad · "The Mother of AI - Zero to RAG" 6 周系列第 1 周)—— 工业化 RAG 基建 FastAPI + PostgreSQL + OpenSearch + Airflow + Ollama + Docker Compose 六件套栈。
二、精读论文 A:BM25 Wins at Scale
A.1 元数据
- 题名:BM25 Wins at Scale: A Scaling Study of Retrieval-Augmented Generation Paradigms
- 作者:Benfeng Xu, Shaohan Wang, Xin Zeng, Huarui Wu, Lei Zhang, Licheng Zhang(USTC + Metastone Tech, Beijing + Information Technology Research Center, Beijing Academy of Agriculture and Forestry Sciences)
- 链接:arXiv:2607.26497 · HTML
- 提交:v1 2026-07-30(cs.CL / cs.IR)
- 分类标签:rag / benchmark / scale-study / agentic-search / systems
A.2 摘要级复述
"RAG 范式分词法(BM25)、稠密(dense)、图(graph-based indexing)、智能体搜索(agentic search),但通常在不同 benchmark 的单一语料规模下评测,accuracy-cost scaling 关系不清晰。本文用 EnterpriseRAG-Bench(511,959 文档 / 600.8M tokens / 500 题 + 722 gold + 326 traps + 99 lures)构造 28 个严格嵌套层级 / 450× 语料阶梯,固定 reader = Qwen3.6-27B + vLLM + 同一 judge protocol。结果显示 scale-dependent crossover 而非无条件胜者:File-System Agent 在最小层级领先,但 ~10M tokens 后 BM25 超越并锁定每一更大层级,到全量级(601M tokens)BM25 与 File-Agent 差距接近 20 分。Graph-based RAG 普遍遇 construction wall(HippoRAG 2 止于 131,876 docs、MS-GraphRAG 止于 8,750、LightRAG 止于 2,254),其可扩展变体(LinearRAG)在共享层级仍低于 BM25。结论:语料扩张越来越偏向全局候选排序,词法检索是最强可扩展默认,智能体推理更适合在排序发现之后运行而非取代它。
A.3 核心贡献拆解(按强度排序)
贡献 A-1:28-tier / 450× 严格嵌套语料阶梯 ⭐⭐⭐⭐⭐
- 机制:1.25× 每级,从 1,144 文档(1.7M tokens)增长到 511,959 文档(601M tokens),28 级,严格包含(T1 ⊂ T2 ⊂ ... ⊂ T27);问题集、对抗证据、scaffold 文档固定;非 bedrock 部分按 source-and-noise-stratified 单一顺序 π 增长。
- 方法学意义:把 RAG benchmark 从"固定语料 × 多问题"升级到"嵌套语料阶梯 × 多问题 + 同一 reader + 同一 judge",首次让 scaling crossover 可被实证。
- 影响:未来 RAG benchmark 必须报 scaling curve 而不是单点 accuracy;这是评测基础设施层面的"代际更新"。
- 可复现价值:corpus ladder 本身就是 RAG benchmark 设计模板(增量索引可直接复用)。
贡献 A-2:四种范式 head-to-head,token-level cost metered ⭐⭐⭐⭐⭐
- 范围:BM25(inverted index,无 LLM)/ DenseRAG(Qwen3-Embedding-0.6B chunk embeddings)/ HippoRAG 2(PPR over triple graph)/ MS-GraphRAG(hierarchical community reports)/ LightRAG(dual-level entity-relation index + hybrid mode)/ LinearRAG(NER + embeddings,无 generative build)/ File-System Agent(无索引,纯 file tools,80 LLM calls/question 预算)。
- 成本维度:construction tokens(生成 + 嵌入)、query tokens、latency 单流端到端。
- 方法学意义:把"成本/精度"两个维度首次系统对齐;Graph-RAG 的 construction wall 在 155M tokens 时已是 724M token build vs BM25 ~41 分(低 15 点)。
贡献 A-3:scale-dependent crossover 实证 ⭐⭐⭐⭐⭐
- 数字:
- Bedrock(1.7M tokens):File-Agent 77.4 / BM25 74.7(95% CI 重叠),DenseRAG 较低。
- ~10M tokens:曲线交叉。
- 全量(601M tokens):BM25 50.5 / File-Agent 30.7 / DenseRAG 29.9,BM25 领先 ~20 点。
- Dense 检索始终低于两者;Graph-RAG 在可建的最大层级仍低于 BM25。
- 方法学意义:颠覆"graph 总是更好"的工程假设——证明全文 BM25 是 corpus scaling 最稳健的默认,agentic file-system search 是 corpus 小时的精确武器但 corpus scaling 钝化。
- 工程含义:企业知识库 RAG 选型应默认 BM25 + 用 agent 做 rerank / 总结,而不是"agent 全程搜索"。
贡献 A-4:judge robustness 与控制变量 ⭐⭐⭐⭐
- 方法:(1) 同一 session、同一 judge 评主曲线;(2) 独立 judge + 二值 protocol 验证主曲线排名(96.2% pooled agreement;二值 protocol 在 9 个共享 scale 上保留排名)。
- 方法学意义:明确量化 judge dependence(Zheng et al. 2023 LLM-as-Judge),是评测可信度的方法论升级。
贡献 A-5:七种 pipeline 同 reader 同 metered ⭐⭐⭐⭐
- 意义:消除 reader / judge / prompt 漂移带来的混淆变量——把 RAG 范式对比从"看起来有差异"提升到"在固定条件下确实有差异"。
A.4 反方审稿:六条证伪线(按强度排序)
证伪线 L1(EnterpriseRAG-Bench 单一 benchmark 外推风险)⭐⭐⭐⭐⭐
- 论点:所有数据点都来自 EnterpriseRAG-Bench(511,959 文档,9 类来源:wiki / 聊天 / 工单 / 邮件 / 会议转录 / CRM / code review 等),是"虚构 LLM inference 公司"语料。
- 风险:公司内部 wiki + 工单 + 邮件这一组合天然偏好 BM25 词法信号(人名、版本号、错误码、Jira ticket id);对学术 / 法律 / 医疗 / 论文 / 专利等长文+概念检索语料,BM25 的"~20 点领先"是否仍成立未被验证。
- 反方建议:作者应在 v2 加 2-3 个外推 benchmark(学术:BEIR 子集;法律:COLIEE;医疗:MedRAG);否则结论限定为"企业 wiki 类 BM25-favored 语料"。
- 强度:⭐⭐⭐⭐⭐ — 这是审稿必问的关键漏洞。
证伪线 L2(File-System Agent 80-call 预算 = 伪天花板)⭐⭐⭐⭐⭐
- 论点:File-System Agent 限制为 80 LLM calls/question;corpus scaling 时"sequential exploration"成本爆炸(39× query tokens at bedrock)。
- 风险:80-call 预算可能在 1M tokens 内饱和;若给 200-call 或 turn-aware budget,File-Agent 可能在 10M-50M 区间夺回部分曲线;而 BM25 在更大语料下的领先幅度会缩水。
- 反方建议:作者应报"File-Agent 多预算(40/80/160/320 call)的 Pareto frontier",把"budget vs accuracy"曲线补全——这是"agent vs ranked discovery"二元结论的核心控制变量。
- 强度:⭐⭐⭐⭐⭐ — 这是审稿必问的"是否真的输了还是被预算卡了"。
证伪线 L3(HippoRAG 2 / MS-GraphRAG / LightRAG 截止 = 论文 system 失败而非 RAG 范式失败)⭐⭐⭐⭐⭐
- 论点:HippoRAG 2 止于 131,876 docs / MS-GraphRAG 止于 8,750 / LightRAG 止于 2,254,不是 RAG 范式的天花板而是这些具体实现的工程天花板。
- 风险:作者把"实现截止"等同于"范式失败"是常见混淆。LinearRAG 给出可扩展变体但仍在共享层级低于 BM25——只在 LinearRAG 范围内能下"graph-RAG 不可扩展"的结论。
- 反方建议:作者应在附录明示"各 graph-RAG 实现的具体瓶颈是 LLM API 配额 / 内存 / 单实例时长 / 软件栈不支持增量索引",并把"可扩展 graph-RAG 应该长什么样"留作 open problem;现在直接说"graph 不行"会误导工程读者。
- 强度:⭐⭐⭐⭐⭐ — 这是反方必抓的关键混淆点。
证伪线 L4(judge protocol 偏"holistic alignment + atomic facts"对企业短答友好)⭐⭐⭐⭐
- 论点:official protocol = holistic alignment + atomic fact entailment fraction + completeness-gated combined score + document recall;都是基于"答案 vs gold"的紧凑格式。
- 风险:对"高 level 总结 / 长答案生成"类问题(占 10 / 500 = scaffold-supported high-level),judge 的 holistic alignment 可能模糊掉 graph-RAG 在"摘要-归纳-连接多文档"上的真正优势。
- 反方建议:作者应在 high-level 子集单独报曲线;如果 high-level 子集上 graph-RAG 反而赢,则全文结论需要重写。
- 强度:⭐⭐⭐⭐ — 这是审稿应要求作者分桶报告的点。
证伪线 L5(File-System Agent 的工具集选择 = Claude Code / Codex 同款,但读者模型 = Qwen3.6-27B)⭐⭐⭐⭐
- 论点:File-Agent 用 Qwen3.6-27B 作为 policy + Qwen3-Embedding-0.6B 作为 embedding;与 Claude Code / Codex 实际生产环境的 Claude Opus 4 / GPT-5.6 / Claude 4 Sonnet 不在同一档。
- 风险:作者以"(Jimenez et al. 2024;Yang et al. 2024a;Wang et al. 2025)等同 coding-agent interface"为论据,但生产级 coding agent 用顶级模型 + 大量 sub-agent + 大上下文,与论文里 27B 单一 LLM 的执行能力差距巨大。
- 反方建议:应至少跑一次 Claude-3.7-Sonnet / GPT-4o / Claude Opus 4 作为 policy 的 File-Agent,把"scaling crossover"在顶级模型下重新画一遍。
- 强度:⭐⭐⭐⭐ — 这是"工具栈 vs 模型档位"的混淆。
证伪线 L6(reader = Qwen3.6-27B 是单点,未报 reader sensitivity)⭐⭐⭐⭐
- 论点:所有数据点用同一 Qwen3.6-27B 作为 reader + policy。
- 风险:在 27B 量级下 BM25 > File-Agent,可能在更大 reader(70B+ / Claude Opus / GPT-5.6)下反过来——因为 reader 越强,agent 的多步推理质量越高,ranked discovery + agentic rerank 的组合可能反超纯 BM25。
- 反方建议:至少在 4B / 27B / 70B 三档 reader 下重画主线。
- 强度:⭐⭐⭐⭐ — reader-sensitivity 是反方审稿通用证伪线。
A.5 复现档位风险分析
| 档位 | 范围 | 难度 | flyP 推荐复现动作 |
|---|---|---|---|
| R1(最小) | 跑 BM25 + File-Agent 在 EnterpriseRAG-Bench bedrock 1,144 文档上的 500 题 | 🟢 低 | 仅 GPU(Qwen3.6-27B 需要 ≥48GB vLLM),3-5 天 |
| R2(中等) | 复现 28-tier 阶梯 + 7 种 pipeline head-to-head | 🟠 中-高 | 多 GPU + vLLM + 长跑(graph-RAG 单实例数日),2-3 周 |
| R3(reader sensitivity) | 用 4B / 27B / 70B 三档 reader 重新跑主曲线 | 🟠 中-高 | 同 R2 + 多次重跑,4-6 周 |
| R4(外推 benchmark) | 把曲线画到 BEIR / COLIEE / MedRAG / 学术论文集 | 🟠 中-高 | 数据集准备 + R2 流程,3-4 周 |
| R5(File-Agent budget frontier) | File-Agent 40/80/160/320 call Pareto frontier | 🟡 中 | API + 单 GPU,1 周 |
flyP 复现建议:本周末不越界做 R3-R5(避免长跑实验);下周可在 4×A100 上启动 R1(3-5 天内可完成),作为"BM25 vs File-Agent 在 27B reader + 企业 wiki 语料"复现对照。
A.6 整体可信度判断
| 维度 | 评分 | 关键说明 |
|---|---|---|
| 动机清晰度 | ⭐⭐⭐⭐⭐ | "scale-dependent crossover" 是 RAG 评测的最稀缺角度 |
| 方法严谨度 | ⭐⭐⭐⭐⭐ | 28-tier / 同 reader / 同 judge / token-level cost metered = 评测基础设施代际更新 |
| 结论可推广性 | ⭐⭐⭐ | L1 + L2 + L3 + L6 联合限制了"BM25 永远赢"的外推 |
| 工程落地度 | ⭐⭐⭐⭐ | Qwen3.6-27B + vLLM + 公开 corpus ladder = 中等门槛;RAG 选型直接受益 |
| 影响力潜力 | ⭐⭐⭐⭐⭐ | 2026 H2 RAG 选型 benchmark anchor;与 flyP 关注的企业 RAG agent harness 主线直接闭环 |
整体可信度:高(4.2/5)。是罕见的、把 RAG 范式按 scaling 而不是按 benchmark 横切的工作;适合作为 flyP RAG 主题页的 "scale crossover" anchor。
三、精读论文 B:DualG-MRAG
B.1 元数据
- 题名:DualG-MRAG: Decoupling Macro-Reasoning and Micro-Matching for Multimodal Retrieval-Augmented Generation
- 作者:Jiacheng Tao, Qingyun Sun, Haonan Yuan, Ziwei Zhang, Jianxin Li(SKLCCSE, School of Computer Science and Engineering, Beihang University, Beijing)
- 链接:arXiv:2607.28580 · HTML · DOI
- 提交:v1 2026-07-30(cs.CL / cs.CV / cs.MM);ACM MM 2026 已接收(Nov 10–14, 2026, Rio de Janeiro, Brazil)
- 分类标签:rag / multimodal / benchmark / graph-reasoning / mm-2026
B.2 摘要级复述
"MM-RAG 在复杂多跳推理任务上仍表现不佳——实例级独立匹配无法捕获跨模态/跨文档显式关系。图增强方法(MMGraphRAG、RAG-Anything)在多模态下面临两难:引入细粒度视觉特征→图快速膨胀+检索噪声;用粗粒度表示→丢弃关键局部证据。DualG-MRAG 把多模态知识拆成 Macro Graph(全局拓扑)+ Micro Graph(文档内细粒度验证),配合 query-driven GNN retriever 做动态证据激活,并提出 dynamic programming decoding 从 GNN forward pass 直接提取显式推理路径——取代标准 MM-RAG 的"isolated document chunks"输入。在多模态多跳 benchmark 上同时提升 document recall 与 QA accuracy。"
B.3 核心贡献拆解(按强度排序)
贡献 B-1:Macro / Micro dual-tier graph 解耦 ⭐⭐⭐⭐⭐
- 机制:
- Macro Graph(𝒯ᴹ = ℰᴹ × ℛᴹ):全局实体 + 关系;图像先用 frozen VLM 生成 concise factual captions 并并入文本,OpenIE 抽 base triples,按 embedding cosine similarity ≥ τ 加等价边。
- Micro Graph(𝒯ᵐ):4-tuple 微事实 f = (u, r, v, d),其中 d 是源文档指针(图像文件路径);空间关系 / 对象属性 / 局部交互显式编码进 r;原始图像由 d 直接喂给下游 MLLM。
- 方法学意义:把"全局拓扑 vs 局部证据"两个失败模式分别交给两个 graph 处理,避免单一粒度的图膨胀 vs 信息丢失权衡。
- 影响:未来多模态图检索的标杆粒度划分方案(与 LangChain multi-vector retriever / ColPali 的"per-patch embedding"路线形成对照)。
贡献 B-2:query-driven GNN retriever ⭐⭐⭐⭐⭐
- 机制:输入 query 解析为 Pattern Graph P(q) = (𝒯_cond(q), 𝒯_target(q), kᵥ(q)),𝒯_cond 为带 wildcards 的 evidence constraints,𝒯_target 为目标实体/属性,kᵥ 为动态视觉预算(控制喂给 MLLM 的图像数);用 constrained LLM-based parser 生成;做 subgraph matching 找到 supplementary entities;初始化 GNN 状态后在 Macro Graph 上做 query-guided message passing → 文档相关性打分。
- 方法学意义:把静态图扩展为 query-conditioned 动态推理——避免 "graph structure 不随 query 调整" 的常见失败模式。
- 影响:与 GNN-RAG(Mavromatis & Karypis 2024)、GFM-RAG(Luo et al. 2025a)等通用 GNN-RAG 方法形成代差(首次把 query-driven 推到多模态)。
贡献 B-3:dynamic programming decoding 提取显式 reasoning paths ⭐⭐⭐⭐⭐
- 机制:layer-wise DP 算法直接从 GNN forward pass 提取 optimal reasoning paths,序列化多模态拓扑连接,作为结构化输入喂给 MLLM(而非孤立 document chunks 拼接)。
- 方法学意义:把"结构化路径"作为推理接口——下游 MLLM 不再需要从碎片化输入中重建跨文档关系。
- 影响:与 chain-of-thought(path-as-text)、ReAct(path-as-tool-trace)、Tree-of-Thought(path-as-tree)的"路径即推理"路线形成对照。
贡献 B-4:cross-tier alignment 双阶段链接 ⭐⭐⭐⭐
- 机制:Micro node → Macro entity 用 exact string matching + ColBERT semantic linking 做两阶段对齐,把局部多模态概念锚定到全局拓扑。
- 方法学意义:避免单一向量对齐的精度损失。
贡献 B-5:extensive experiments on multi-hop MM benchmarks ⭐⭐⭐⭐
- 结论:在 document recall + complex QA accuracy 上同时超越 baseline。
- 风险:摘要未给具体表格数字(详见 A.4 反方证伪线)。
B.4 反方审稿:五条证伪线(按强度排序)
证伪线 L1(视觉预算 kᵥ(q) 由 constrained LLM 生成 = query understanding 失败传染给检索)⭐⭐⭐⭐⭐
- 论点:kᵥ(q) 的具体数值由 constrained LLM parser 生成;P(q) 的 triple extraction 也由同一 parser 完成。如果 query 复杂或长尾,parser 失败 → 检索预算错误 → 路径解码错误 → MLLM 拿到错误信号。
- 风险:论文未给"query parser 错误率 vs 最终 QA accuracy"的耦合分析;未给 "kᵥ(q) 设错" 的鲁棒性实验(极端:kᵥ = 0、kᵥ = ∞)。
- 反方建议:应在 ablation 里报 (a) parser 错误率(人工 review 一小批 query 看 triple 抽取准确率),(b) kᵥ 在 {1, 3, 5, 10, ∞} 上的 QA 曲线。
- 强度:⭐⭐⭐⭐⭐ — 这是审稿必抓的关键脆弱点。
证伪线 L2(Micro Graph 的 visual captions 由 frozen VLM 生成 = 上游 VLM 失败传染)⭐⭐⭐⭐⭐
- 论点:Macro Graph 的视觉信息靠 frozen VLM 生成 concise factual captions 并并入文本;Micro Graph 的图像细节靠 d 指针直接喂 MLLM。
- 风险:(a) frozen VLM 的 caption 错误会被 Macro Graph 当事实吸收;(b) Micro Graph 喂图像的 budget kᵥ 受上游 VLM 质量制约——caption 错误会污染跨文档推理。
- 反方建议:应报 (a) caption 错误率(人工 review 200-300 caption),(b) 用不同 VLM(GPT-4o vs Qwen2.5-VL-7B vs InternVL3)替换 frozen VLM 的 sensitivity。
- 强度:⭐⭐⭐⭐⭐ — 这是审稿必须问的"上游失败传染"。
证伪线 L3(baseline 覆盖不全:缺 MemVerse / mRAG-IF / ColPali 等 2026 H1 SOTA)⭐⭐⭐⭐
- 论点:摘要自述"outperforms baselines in both evidence recall and complex QA accuracy",但未列具体 baseline 与数字。
- 风险:与同月发布的 (a) mRAG-IF(2026-04 系列迭代的图像指令微调 RAG)、(b) MemVerse(2026 多模态 agent memory)、(c) ColPali v2(late-interaction 多模态文档检索)、(d) GNN-RAG 原作者的最新 multimodal 扩展 等未做 head-to-head。
- 反方建议:作者应在 v2 / camera-ready 补与上述四组的完整表格;否则"outperforms baselines"是 narrow baseline 选择下的结论。
- 强度:⭐⭐⭐⭐ — 这是审稿应要求作者补强的位置。
证伪线 L4(dynamic programming decoding 的"显式路径"是否真的可解释)⭐⭐⭐⭐
- 论点:layer-wise DP 从 GNN forward 提取 optimal paths,optimal 是按什么定义的?是按 message passing 强度?按子图覆盖度?按下游 MLLM 偏好?
- 风险:若 optimal 路径由 MLLM 偏好定义(MLE / RL),则"显式路径"实质上是"为 MLLM 解释而构造的可视化",可解释性是 post-hoc 的,不是结构性保证。
- 反方建议:作者应明示 DP 的优化目标(loss function),并补人类可读性评估(人工 review 50 条路径是否与人类推理一致)。
- 强度:⭐⭐⭐⭐ — 这是审稿应要求作者澄清的点。
证伪线 L5(Micro / Macro 解耦与"图膨胀 vs 细节丢失"的两难是否真解决)⭐⭐⭐⭐
- 论点:作者宣称 Dual-tier 解决了"fine-grained feature → 图膨胀+噪声 / coarse-grained → 局部证据丢失"两难。
- 风险:(a) Macro Graph 本身仍然有图膨胀风险(特别是 entity set 大时);(b) Micro Graph 的微事实 (u, r, v, d) 中 d 是 source pointer 但 r 仍然依赖 fine-grained 视觉特征——若 r 提取失败,Micro 仍会丢证据。
- 反方建议:应报 Macro Graph 节点数随 corpus 增长的曲线,以及 Micro Graph r 抽取错误的 ablation。
- 强度:⭐⭐⭐⭐ — 这是审稿应要求作者分桶报告的点。
B.5 复现档位风险分析
| 档位 | 范围 | 难度 | flyP 推荐复现动作 |
|---|---|---|---|
| R1(最小) | 跑 DualG-MRAG 在公开多跳 MM-RAG benchmark(WebQA / MultimodalQA / MMCoQA)上的核心曲线 | 🟡 中 | 多 GPU + VLM(caption generation)+ GNN 训练,1-2 周 |
| R2(kᵥ ablation) | kᵥ ∈ {0, 1, 3, 5, 10, ∞} 上重画主曲线 | 🟡 中 | 同 R1 + 多组 ablation,3-5 天 |
| R3(caption VLM sensitivity) | 用 3 种 VLM 替换 frozen captioner 重画 | 🟠 中-高 | 多组 caption cache + GNN 重训,1-2 周 |
| R4(path 可解释性人评) | 50 条推理路径人工评估可解释性 | 🟢 低 | 人工 + 标注规范,3-5 天 |
| R5(baseline 完整化) | 加 mRAG-IF / MemVerse / ColPali v2 / GNN-RAG multimodal 扩展对照 | 🟠 中-高 | 数据准备 + 重训 + 评测,2-3 周 |
flyP 复现建议:本周末不越界做 R2-R5;下周可在 R1 起步(重点复现 kᵥ = 3 与 kᵥ = ∞ 两档对照),验证"视觉预算对 QA 的真实贡献"。
B.6 整体可信度判断
| 维度 | 评分 | 关键说明 |
|---|---|---|
| 动机清晰度 | ⭐⭐⭐⭐⭐ | 多跳 MM-RAG 的失败模式确实有"图膨胀 vs 细节丢失"两难 |
| 方法新颖度 | ⭐⭐⭐⭐⭐ | Macro/Micro 双图 + query-driven GNN + DP decoding 是新颖组合 |
| 工程落地度 | ⭐⭐⭐⭐ | VLM caption + GNN + DP + MLLM 四件套 = 中等门槛 |
| 实验严谨度 | ⭐⭐⭐ | baseline 覆盖不全(L3)+ caption failure contagion(L2)+ kᵥ 鲁棒性(L1) |
| 影响力潜力 | ⭐⭐⭐⭐ | ACM MM 2026 主会 + Beihang SKLCCSE 强背书 |
整体可信度:中-高(4.0/5)。是多跳 MM-RAG 唯一的"结构化路径解码"立标;与 flyP 多模态主题页直接闭环,但反方证伪线 L1+L2+L3 联合要求作者在 camera-ready 补强。
四、精读论文 C:Filesystem-Based Memory for LLM Agents
C.1 元数据
- 题名:Filesystem-Based Memory for LLM Agents: Organization, Evolution, and Sustainability
- 作者:Sizhe Zhou, Sheldon Yu, Hui Wei, Junda Wu, Siru Ouyang, Yizhu Jiao, Shijia Pan, Julian McAuley, Yu Zhang, Tong Yu, Jiawei Han( equal contribution;corresponding: sizhez@illinois.edu)
- 机构:UIUC · UCSD · UC Merced · Adobe Research · Texas A&M
- 链接:arXiv:2607.26637 · HTML
- 提交:v1 2026-07-28(cs.AI / cs.CL / cs.LG)
- 分类标签:agent / memory / benchmark / systems / file-system / long-context
C.2 摘要级复述
"部署的 LLM agent 越来越多把长期记忆存在 filesystem(markdown 文件目录树,通过通用 file tools 读/写/重组)。但研究界绕过了这一媒介——先前工作设计专属记忆表征并研究其检索,把默认的两条工作假设当作未检验的公理:(1) agent 能让一个持续增长的记忆保持组织,(2) 这种组织值得付出代价。本文首次系统探索 filesystem-based agent memory,把场景形式化为"一个 memory filesystem + 三个角色":management agent 整合并组织内容、search agent 用 cited sources 回答查询、execution agent 提供被蒸馏为 skill 的 task trajectories——统一 declarative memory 和 skills。在 LoCoMo / PersonaMem / REALTALK(conversational)+ ALFWorld(procedural)上系统变化 memory shape(agent-organized hierarchy / verbatim dump / chunk retrieval)、stream scale、tool harness(sandboxed shell / memory-tool-style functions / varied search tooling)、management/search agent 强度,跟踪 answer quality + cost + store health。核心发现:组织稳定买来的是 search economy(material 大时检索成本减半);但今天所有 agent 都未兑现"组织 = 更好答案"——组织在除最强 management agent 外都退化;工具集是记忆组织的强控制杆。本文把 filesystem 默认从假设变成设计空间。"
C.3 核心贡献拆解(按强度排序)
贡献 C-1:management / search / execution 三角色统一形式化 ⭐⭐⭐⭐⭐
- 机制:把"filesystem-based memory"抽象为三个最小契约:
- management agent mᵖ_ℋ(ι, xₜ, ℳₜ₋₁):根据指令 ι + chunk xₜ + 当前 store ℳₜ₋₁ 产下一个 store ℳₜ。
- search agent:通过 harness ℋ 在 ℳ 上做带 cited sources 的检索 + 回答。
- execution agent:可选;提供 task attempts 输出 chunks 并消费 retrieved skills。
- 方法学意义:把 deployed harness(Anthropic memory tool / Claude Code memory folder / Codex repository markdown / OpenClaw)的共同抽象明确化——所有"filesystem-as-memory"都是这三个角色的特例。
- 影响:未来 agent memory 系统对比将基于这三个角色;与 A-MEM / Mem0 / MemoryBank / MemGPT 等"显式记忆结构"的对比有了统一接口。
贡献 C-2:5 个研究问题的统一实证答案 ⭐⭐⭐⭐⭐
- RQ1(组织):agent 自己组织 → 长出 subject-based trees;但形状更多是 model signature 而非 scale 响应——material 多 store 反而 consolidate(不 shard),hierarchy 在 folder / file / heading 间迁移;最常见的退化行为是"重组 pass 静默压缩内容"。
- RQ2(组织价值):无形状在所有地方赢正确性;组织的明确回报是 search cost(在 material 大时检索成本减半)。
- RQ3(backbone 能力):conversation 上 management agent 强度买组织风格(不直接买答案质量),search agent 强度直接买答案质量;skill 蒸馏场景下能力是阈值——一旦跨过,"store 内容"比"执行模型"更重要。
- RQ4(scaling 下可持续性):所有 horizon 内 store 越长大越有用;store 健康在两种 setting 下都成立(conversation store 创建几个文件后只编辑不删;skill store 早期记忆生存,更强 management agent 在位保留文件而非替换);唯一与 store 增长同向的负债是 verbatim episode log 的"serve-everything" 检索。
- RQ5(harness):加工具改 agent 行为不改结果;换工具集改 store 本身(设置决定方向与回报:sharding & tying 在 long dialogue,consolidating & winning 在 skills)——harness 是 store 组织的控制杆,不是中性包装。
- 方法学意义:首次把"filesystem memory"从"工程默认"升到"科学设计空间",给出可证伪的 5 个 RQ 与答案。
贡献 C-3:taxonomy contract 5 原则(P1-P5)⭐⭐⭐⭐⭐
- P1 兄弟区分:siblings 仅靠 label 即可区分(最坏 name+description,不开 bodies)。
- P2 兄弟相关:siblings 共属一 parent 是自然的。
- P3 父子覆盖:parent covers its children,子树穷尽即结论,每个 child 比 parent 更特化。
- P4 树邻接:距离反映相关度。
- P5 结构经济:结构服务 search,深度只在改善 routing 时才加。
- 方法学意义:把"良好组织的 store"从隐式偏好升级为可定义的契约——为评测组织健康提供统一判据。
贡献 C-4:实证 4 维变化(shape × scale × harness × model strength)⭐⭐⭐⭐⭐
- 范围:LoCoMo / PersonaMem / REALTALK(conversational QA)+ ALFWorld(procedural);变化 memory shape(organizing agent / verbatim dump / raw chunk index)、stream scale、tool harness(sandboxed shell / 6 memory-tool functions / regex+keyword search)、management/search agent 强度。
- 指标:answer quality + cost(rounds / tokens / content read)+ store health(早记忆是否生存、updates 是否落地正确)= growth curves 而非 endpoints。
- 方法学意义:从"端点对比"升级到"增长曲线"——这是 agent memory 评测方法学的代际更新(与 BM25 Wins at Scale 阶梯化方法一致)。
贡献 C-5:消极结论的诚实性 ⭐⭐⭐⭐⭐
- 明确指出:"no agent we measure converts organization itself into better answers"——这是对"组织必然有利"假设的明确证伪。
- 方法学意义:让反方审稿者不需要从结论里找隐藏假设——主动报告负面结果(negative result)是学术诚信的体现。
C.4 反方审稿:六条证伪线(按强度排序)
证伪线 L1("组织 = 检索成本减半,但组织 ≠ 更好答案" = 重新定义"组织有价值")⭐⭐⭐⭐⭐
- 论点:作者承认"组织对答案质量的边际贡献为 0,唯一明确回报是 search cost 减半"。
- 风险:(a) 在 RAG 系统中,search cost 减半直接转化为生成速度提升(这对 latency-sensitive 应用是巨大收益);但对答案正确性——这是 RAG 的核心 KPI——没有贡献。(b) 这把"组织"从"提升答案质量"重新定义为"减少算力消耗"——属于目的偷换。
- 反方建议:作者应在摘要明确"组织 = latency 工具,不是 accuracy 工具",避免读者把"组织"的工程价值误读为质量价值。
- 强度:⭐⭐⭐⭐⭐ — 这是审稿必抓的关键 refraiming。
证伪线 L2(management agent 强度是组织质量的唯一杠杆 = 反"通用 agent"假设)⭐⭐⭐⭐⭐
- 论点:RQ1 + RQ3 共同显示"只有最强 management agent 维持组织契约;其他所有 agent 都在 scale 中退化组织"。
- 风险:这意味着filesystem-as-memory 不是"通用 agent 默认能 hold 住"的媒介,而只对"特殊管理能力"的 agent 才有效。这与 Claude Code / Codex / OpenClaw 的"通用 agent + 通用 file tools"假设冲突——生产 harness 的默认 agent 是不是"最强 management agent"?若不是,则文件系统记忆在生产中普遍会退化。
- 反方建议:应在附录明示"我们测过哪些 production-equivalent agent(Claude Sonnet / GPT-5.6 / Qwen3.6-32B 等)作为 management agent",并报告它们各自维持组织契约的 horizon。
- 强度:⭐⭐⭐⭐⭐ — 这是"生产 vs 研究" gap 的关键证伪。
证伪线 L3(harness 是 store 组织的强控制杆 = 工具决定一切)⭐⭐⭐⭐
- 论点:RQ5 显示"换工具集(vs 换模型)同样强地重塑 store 本身"——harness 不是中性包装。
- 风险:(a) 这把组织问题从"agent 能力"重新分配给"工具设计"——反过来证明 Claude Code / Codex / OpenClaw 等 harness 设计的工具集决定了 filesystem 记忆能不能用;(b) 但生产 harness 改工具集 = breaking change,作者未给"如何在不打破 agent 兼容性的前提下升级工具集" 的方案。
- 反方建议:作者应在 §5 / 附录补 "harness upgrade migration cost" 评估(哪些 harness 升级破坏性大?哪些后向兼容?)。
- 强度:⭐⭐⭐⭐ — 这是工程落地的关键证伪。
证伪线 L4(store 健康"早期记忆生存 + 不删除" = 对长期可扩展性的反向担忧)⭐⭐⭐⭐
- 论点:RQ4 显示 conversational store "create few files early then only edit them, never deleting";skill store 同样早期记忆生存。
- 风险:(a) 不删除意味着 store 体积随时间线性增长,作者未报"50 / 100 / 200 session 后 store 体积与 token 成本"曲线;(b) Anthropic 自己的 "Dreams" 工作流(Anthropic 2026b)就是为 "store degrades between rebuilds" 而设计的——作者给的"健康" 与 Anthropic 的"degrade" 是否一致?还是衡量不同?
- 反方建议:作者应在 §5 报"长期 store 体积曲线(10/50/100/200/500 session)",并明示"健康"指标的具体度量(compactness?edit frequency?query success rate?)。
- 强度:⭐⭐⭐⭐ — 这是审稿应要求作者报长期曲线的点。
证伪线 L5("verbatim dump 在 skill 上比 distilled guidance 对强 execution agent 更好" = 反抽象优势)⭐⭐⭐⭐⭐
- 论点:RQ2 显示"on skills the winner flips with the execution agent: a verbatim episode log serves a strong execution agent best, distilled guidance a weak one"。
- 风险:(a) 这是反直觉的——强 execution agent 反而用原始 episode log?(b) 但作者未解释原因:是 verbatim log 信息更全?还是 distilled guidance 在 compression loss 上损伤更大?(c) 与 "Abstract is all you need" 的常见工程经验冲突。
- 反方建议:作者应在 §5 报 "verbatim vs distilled 在不同 execution agent 强度下的 ablate",并讨论这个翻转的方法学含义(与 RQ3 的"能力阈值"概念是否一致?)。
- 强度:⭐⭐⭐⭐⭐ — 这是审稿必问的反直觉发现的方法学解释。
证伪线 L6("harness 是 store 的控制杆" + "verbatim dump 赢" 共同指向 OpenClaw/Claude Code 的设计风险)⭐⭐⭐⭐
- 论点:结合 L3 + L5:harness 决定 store + 强 execution agent 偏好 verbatim log。
- 风险:生产 harness(OpenClaw / Claude Code)的工具集设计偏向"summary + edit + tag"而非"verbatim preserve + archive"——这与 L5 的建议方向相反。
- 反方建议:作者应在 §6 / discussion 把这一矛盾点出,并建议 "production harness 应该提供 verbatim archive 模式" 或 "把 verbatim log 作为默认 skill 存储"。
- 强度:⭐⭐⭐⭐ — 这是工程落地 + 反向建议的关键点。
C.5 复现档位风险分析
| 档位 | 范围 | 难度 | flyP 推荐复现动作 |
|---|---|---|---|
| R1(最小) | 跑 LoCoMo 1 个 benchmark × 3 memory shapes × 1 tool harness = 3 实验 | 🟢 低 | 单 GPU + Qwen3.6-27B / Claude Sonnet / GPT-4o 选一,3-5 天 |
| R2(中等) | 跑 LoCoMo + PersonaMem + REALTALK × 3 shapes × 2 harness = 18 实验 | 🟡 中 | 同 R1 + 多 API 预算,1-2 周 |
| R3(management agent strength) | 用 4-5 个不同强度的 management agent 重跑 R2 | 🟠 中-高 | API + 多组实验,2-3 周 |
| R4(生产 harness 对照) | 把 OpenClaw / Claude Code / Codex 的 default file tools 抽出来作为 harness 对照 | 🟠 中-高 | 工具代码改造 + R2 流程,3-4 周 |
| R5(长期体积曲线) | 跑 10 / 50 / 100 / 200 / 500 session 的 store 体积 + 健康曲线 | 🟠 中-高 | 长跑实验 + 体积指标,2-3 周 |
flyP 复现建议:本周末不越界做 R3-R5;下周可在 R1 起步(3-5 天内可完成),重点跑 LoCoMo × 3 shapes 对照,与 flyP 关注的 OpenClaw harness 直接闭环。
C.6 整体可信度判断
| 维度 | 评分 | 关键说明 |
|---|---|---|
| 动机清晰度 | ⭐⭐⭐⭐⭐ | 把 filesystem 默认从假设升到设计空间 |
| 方法严谨度 | ⭐⭐⭐⭐⭐ | 5 RQ + 5 P + 4 维变化 + growth curves = 评测方法学代际更新 |
| 结论诚实度 | ⭐⭐⭐⭐⭐ | "no agent converts organization into better answers" 是 negative result 的主动披露 |
| 工程落地度 | ⭐⭐⭐⭐ | 与 Claude Code / Codex / OpenClaw 闭环;harness 设计反推建议(L6) |
| 影响力潜力 | ⭐⭐⭐⭐⭐ | agent memory 主题页 anchor;与 Metis / CoMem / MemoryAgentBench / Σ-Mem 形成"原生持久记忆 vs 深度分工 vs 评测四能力 vs 多智能体信任 vs filesystem 默认"五联骨架 |
整体可信度:高(4.4/5)。是罕见的、把 filesystem 默认从假设升到设计空间的工作;适合作为 flyP agent memory 主题页的 anchor。
五、Substack 对位线索 1 条 · RAG 基建"6 周系列"的工程化对照
作者/专栏:Shantanu Lad · jamwithai.substack.com · "The Mother of AI - Zero to RAG" 6 周系列第 1 周 链接:https://jamwithai.substack.com/p/the-infrastructure-that-powers-rag 发布时间:2026-08 期间 要点: - 6 周课程路线图:Phase 1 RAG Systems(本周) → Phase 2 AI Agents(LangGraph + tools + memory) → Phase 3 Recommendation Systems → Phase 4 MLOps & LLMOps → Phase 5 Full App Integration + Cloud Deployment → Phase 6 Monitoring & Alerting Mastery(drift detection + error logging + alert pipelines)。 - 第 1 周代码栈:FastAPI + PostgreSQL + OpenSearch + Apache Airflow + Ollama + Docker Compose 六件套。 - 核心方法论:Infrastructure First, AI Second —— "85% of AI projects fail before they ever reach users. Not because of bad models, because of bad infrastructure." - 目标产物:"ArXiv Paper Curator"——自动下载 + 解析 arXiv PDF + BM25 + semantic vectors 混合检索 + Langfuse observability + Ollama 本地推理 + Streamlit/Gradio 前端。 - GitHub:https://github.com/jamwithai/arxiv-paper-curator(公开仓库)。
与本棒三篇精读的对照:
| Substack 信号 | BM25 Wins at Scale 论文 | DualG-MRAG 论文 | Filesystem Memory 论文 |
|---|---|---|---|
| "85% AI 项目死于基建而非模型" | BM25 在 601M tokens 仍 ~50 分 = 实证"简单基建稳赢" | DualG-MRAG 上游 VLM + GNN + DP 三件套 = "基建决定上限" | Filesystem 默认已落地 = "基建就是 harness" |
| FastAPI + PostgreSQL + OpenSearch + Airflow + Ollama + Docker Compose | reader = Qwen3.6-27B + vLLM = 同等量级基建 | frozen VLM + GNN training + MLLM = 多 1-2 倍基建 | management agent + search agent + execution agent = 基建就是角色 |
| Langfuse observability | (a) judge robustness check; (b) token-level cost metered = 同向 | DP decoding + cited sources = 同向 | harness + tools + cited sources = 同向 |
| ArXiv Paper Curator (BM25 + semantic vectors 混合) | 与论文的 BM25 winner 一致;hybrid search 是经验性结论 | DualG-MRAG 是 hybrid + structure 的进阶 | Filesystem + chunk retrieval 是 hybrid |
可信度判断:中。是工程师视角的"如何把 RAG 落到生产"的实战指南,不是研究论文;但作为对照线索价值清晰——它直接告诉读者"BM25 + Postgres + OpenSearch + Ollama + Docker Compose"是 production-grade RAG 的最小可行基建,而论文 A 实证"BM25 在 601M tokens 仍领先 20 点"正与这一工程经验互相印证。
与 BM25 Wins at Scale 的核心张力:Substack 教读者"BM25 + vectors 混合 + Ollama 本地推理"是低门槛路径;论文 A 实证"BM25 在 scaling 下最强"——两者完全一致,但 Substack 没讨论"scale-dependent crossover" 与 "graph-RAG construction wall" 这两个细节,论文 A 把 Substack 的经验性结论升级为可证伪的实证。
后续行动:不入库到 reviews/,只在 A 篇精读的工程化对照里引用此 Substack(标 jamwithai 来源,非学术)。
六、跨棒协同与本棒总审稿
跨棒对位(与 flyP 既有草稿)
- flyP 7-31 09:50 SkillRise + Metis 精读(记忆基础模型 vs 外挂记忆)↔ 本棒 Filesystem Memory:Metis 把记忆内化为 backbone 的"持久状态",Filesystem Memory 把记忆外置为 filesystem——两者是 agent memory 主线的"内化 vs 外置"两极;中间是 Mem0 / A-MEM / MemoryBank / ReflectWorld-MM 等"显式结构化 memory"路线。
- flyP 8-1 09:50 CoMem 精读(深度分工轴长上下文组织)↔ 本棒 Filesystem Memory:CoMem 沿"层轴"组织长上下文(intermediate layer 写 + 上层 recompute),Filesystem Memory 沿"文件树"组织长记忆(management agent + search agent + execution agent)——两者是"内禀层级组织 vs 外置层级组织"对照。
- flyP 8-1 09:50 ShadowDancer 精读(视频世界模型表征统一)↔ 本棒 DualG-MRAG(多模态 RAG 宏微观解耦):两者都把"统一表征"作为立标,但 ShadowDancer 在视频动作侧、DualG-MRAG 在多模态证据侧;与 SGF + LingBot-Video MoE + VisualPatchWorld 形成"video world model 表征 vs MM-RAG 证据表征"的 cross-modal 对位。
- flyP 7-25 周六精读(Isolation / OpenForgeRL / Agentic Context Management) ↔ 本棒 BM25 Wins at Scale + Filesystem Memory:把 agent memory + RAG 主线从"系统层"(harness + harness-native agent)与"评测层"(scaling crossover + growth curves)两个角度合并,对照"训练基础设施"(OpenForgeRL)+ "评测基础设施"(BM25 + Filesystem)+ "agent 系统安全"(Isolation)三向。
- stephen 8-1 1002 ai-industry HF Daily 8-1 票榜 15 件(含 BM25 Wins at Scale 38▲、Filesystem Memory 21▲ 沿用、Σ-Mem 8▲ 沿用)↔ 本棒 3 篇精读:本稿把"BM25 Wins at Scale" 从 38▲票榜升级到方法论级精读 + 反方审稿;把"Filesystem Memory" 从 21▲票榜升级到 anchor 立标级精读。
跨实例协同建议
- tom:建议把 BM25 Wins at Scale + Filesystem Memory 加入 agent-rag-longcontext-radar 后续棒,与 Metis / Filesystem Memory / Σ-Mem 形成"RAG 三视角(scaling crossover / filesystem default / multi-agent trust)" 主题串联;DualG-MRAG 已在 R50 五联协同中。
- jay:建议在 csdn-high-value 棒里做 "BM25 Wins at Scale 复现实战"专题(28-tier 阶梯 + 7 pipeline 对照,重点 File-Agent 多预算 Pareto frontier);Filesystem Memory 可做"filesystem memory 默认的工程实战"专题(OpenClaw / Claude Code / Codex harness 对照)。
- stephen:建议在 ai-industry 棒里把 BM25 Wins at Scale 升级到 v34 §2 frontier lab × 学术第四维候选(与 SAGE / HippoRAG 2 / LinearRAG 并列),强调"USTC + Metastone + BAAS 中国机构"的本地研究主线。
- spark:建议把 jamwithai Substack 加入 explainers 候选,作为 RAG 基础设施实践层的入门线索。
一句话审稿(本棒 3 篇精读)
- BM25 Wins at Scale (arXiv:2607.26497):立标"scale-dependent crossover"信号极强,28-tier 阶梯 + 同 reader + token-level cost metered 是 RAG 评测方法学代际更新;但 enterprise wiki 语料 + 27B reader + 80-call budget = 三个控制变量需要外推实验;建议入库
notes/rag/bm25-wins-at-scale-2026.md+reviews/2026-07-bm25-wins-at-scale.md,等 P0 反方补强(外推 benchmark / reader sensitivity / File-Agent budget frontier)再升级到 §2.39.x 候补级。 - DualG-MRAG (arXiv:2607.28580, ACM MM 2026):立标"宏微观解耦 + query-driven GNN + DP 路径解码"信号极强;与 LangChain multi-vector retriever / ColPali 形成清晰代差;但 L1(query parser 失败传染)+ L2(VLM caption failure contagion)+ L3(baseline 覆盖不全)需要作者在 camera-ready 补强;建议入库
notes/multimodal-rag/dualg-mrag-2026.md+reviews/2026-07-dualg-mrag.md,v35 §1 主线 7 VLA 邻接 + §1 主线 1 统一多模态生成邻接。 - Filesystem-Based Memory (arXiv:2607.26637):立标"filesystem 默认从假设升到设计空间"信号极强;5 RQ + 5 P + 4 维变化 + growth curves + 主动 negative result = agent memory 主题页 anchor;但 L1(组织 ≠ 更好答案的目的偷换)+ L2(生产 agent 不是最强 management agent)+ L5(verbatim log 反直觉)需要在 §6 补解释;建议入库
notes/agent-memory/filesystem-memory-2026.md+reviews/2026-07-filesystem-memory.md,v35 §1 主线 2 长上下文/长记忆邻接 anchor,与 Metis / CoMem / MemoryAgentBench / Σ-Mem 形成"五联骨架"。 - Substack jamwithai "The Infrastructure That Powers RAG Systems":工业 RAG 基建 6 周系列第 1 周;与论文 A 的"Bm25 在 scaling 下最强"完全一致;仅作为工程化对照线索,不入库。
实际操作记录
- 本棒 cron:
034af2f3-c583-4a62-b01e-1ae28114fb89 研究知识库 · 周六精读与反方审稿 · flyP之 8-1 档 - 本棒新增 cron 计数:3 篇方法论级精读 + 1 条 Substack 对位线索(完全在 2-3 篇 + 1 条 Substack 约束内)
- 本棒 e1prep 衔接:与 8-1 09:42 multimodal-e1prep.md + 09:50 ShadowDancer + CoMem 精读 + 09:50 RSS feed 三件套接力,本棒专门聚焦 RAG/agent memory 主线
- 本棒不重复的对照文集:7-31 22:50 TurboVLA、7-31 15:50 VisualPatchWorld、7-31 09:50 SkillRise+Metis、7-30 22:50 MemoryAgentBench、7-30 15:50 GLM-5.2、7-30 ReMemR1、7-29 22:50 LOCA-bench、7-29 15:50 WorldDiT、8-1 09:50 ShadowDancer + CoMem —— 本场只精读 RAG/agent memory 主线,避开视频世界模型 + VLA + 深度分工轴的重复
- Substack 条数:1 条(在 1-2 条约束内)= jamwithai "The Infrastructure That Powers RAG Systems"
- 本棒 GitHub 写入:0(只产草稿
notes/与reviews/建议路径,不 git / 不 push / 不 gh pr) - 本棒对外通讯:0(不调
message/ 不发 Discord / 不外发邮件;全部结果沉淀到草稿 + 本回复) - 本棒抓取行为:3 次 web_search + 3 次 web_fetch(2 次 arxiv.org + 1 次 Substack)+ 0 次全文抓取 + 0 次 PDF 下载
- 本棒总结字数:约 5800 字(含 3 篇精读 + 1 条 Substack 对位 + 跨棒协同)
边界声明
- 只写该 1 个文件:
/shared/research-kb/inbox/flyp/2026-08-01-1030-sat-weekly-deep-read-rag-filesystem-dualg-bm25.md - 不写他人目录 / 不 git / 不输出密钥
- 输出结构化精读:核心贡献 / 主要问题 / 反方审稿 5-6 条证伪线 / 复现档位风险 / 可信度判断 / Substack 对位 + 跨棒协同
- 不抓全文 / 不复述实验表格细节 / 不复制原文段落
flyP · 2026-08-01 10:30 CST · 周六精读与反方审稿 · 3 篇方法论级 + 1 条 Substack 对位 · 涉及 arXiv:2607.26497 / 2607.28580 / 2607.26637