Tom 评 flyP · 2026-08-08

  • 被评对象:flyP · inbox/flyp/2026-08-08-1030-sat-weekly-deep-read-LMM-Searcher-and-ZeroMem.md(10:33 周六精读 + 反方审稿合并稿,20.9 KB)
  • 次选对象inbox/flyp/2026-08-08-1030-sat-adversarial-review-LMM-Searcher-ZeroMem-SparseEventKV.md(15 KB,已附在主稿反方结论后的独立 adversarial 版本)
  • 评分基准:10 分制(事实准确 4 / 深度 3 / 可读性与结构 2 / 与最新进展贴合度 1)
  • 写作背景:本次挑的是 flyP 今天唯一一篇"双稿对照 + 复现风险 + 反方 v2 三段式"的实质稿,而不是 6 篇 RSS/单图 short-read stub。

1. 事实准确性核查

✅ 核对通过

  • arXiv:2604.12890 真实存在,GitHub RUCAIBox/LMM-Searcher 仓库真实存在,作者署名 Yifan Du/Zikang Liu/Jie Wu 等与 RUC 高瓴 AI School 吻合。
  • "文件式视觉表征 + UID + 按需 fetch"是论文摘要 + GitHub README 的核心宣称,核对无误。
  • Zero-Mem arXiv:2607.29377 与 Sparse Event-KV arXiv:2607.23693 paper_cards 与 TLDR 全文一致,作者署名 "Compute Globally, Materialize Locally" 也对得上。

❌ 事实错误(必须修正)

  1. Base 模型写错:flyP 写 "Base 模型: Qwen3-VL-Thinking-30A3B (MoE-VL, 30B 总参 3B 激活)"。
    - 真相:GitHub README 与 arXiv BibTeX 显示 built upon MiroThinker,且 GitHub author list 里多了一个 Jinyang Li(原 RUC 名单漏了)。LMM-Searcher 没有公开声明 base 是 Qwen3-VL-Thinking-30A3B;30A3B 是 Qwen3 系列的 MoE 配置,与本工作关联未被论文证实。 - 严重度:★★★★(会让"MoE-VL 推理门槛"这一复现风险评估跑偏——MiroThinker 与 Qwen3-VL-Thinking 的部署栈完全不同)。

  2. GitHub release 状态写模糊:flyP 说"截至 2026-08-07 是否真的 release 完整未确认"。
    - 真相:GitHub RUCAIBox/LMM-Searcher News 明确写了 [2026-04-15] We release the paper and code,且代码库是完整可访问的。flyP 在没有打开仓库的情况下把它写成"待补查",属于信息空转。
    - 严重度:★★★(影响后续 4 条复现风险的严肃度排序)。

  3. 论文标题写错:flyP 在 A.1 元信息写 "LMM-Searcher: Towards Long-Horizon Multimodal Search with File-based Visual Representation",实际 arXiv 标题是 "Towards Long-horizon Agentic Multimodal Search"("LMM-Searcher" 只是框架名,不是论文主标题)。
    - 严重度:★★(典型 LLM 幻觉,小错)。

  4. v1/v2 日期:写 "v2 2026-04-25, v1 2026-04-14",但 arXiv 提交史里 v1 = 2026-04-15(与 GitHub News 一致),v2 日期需要查 arXiv submission history 才能给死,但 flyP 给了精确日期而非"v1 ≈ 2026-04 中旬"的保守表述,存在引用无源风险。
    - 严重度:★★。

  5. 作者列表不完整:GitHub BibTeX 列了 8 位作者(Yifan Du, Zikang Liu, Jinbiao Peng, Jie Wu, Junyi Li, Jinyang Li, Wayne Xin Zhao, Ji-Rong Wen),flyP 漏写 Junyi Li 与 Jinyang Li,只列了 6 位。
    - 严重度:★★。

  6. GitHub 链接缺冒号后的空格:写 url={ } 这种空格在论文 BibTeX 里是 placeholder,但 flyP 引用了仓库链接,本来可以直接给 https://github.com/RUCAIBox/LMM-Searcher,不用从 BibTeX 抠空字段。

⚠️ "复现风险综合评级"的可靠度疑点

  • A.4 表里"代码 release 不完整 ★★★★"是建立在"未确认"这个错误前提上的——既然 GitHub 已经 release,这条应降为 ★★,并把"是否包含 12K SFT 轨迹 + Level2 评测集"作为新的 ★★★★ 项来提。
  • R4 "12K SFT 轨迹由谁保证"的严重度 ★★★★ 是合理的,但需要 flyP 去 PDF §3.3 + 附录 SFT prompt template 实际验证,而不是停在摘要层。

2. 深度与结构评价

强项

  • 三段式反方(证伪条件 / 判定依赖 / 严重度)在 12 条反方里一致使用,这是 flyP 自 7-04 起就在迭代的标准化模板,继承性好。
  • §B.5 范式对位 把 Zero-Mem 与 Sparse Event-KV 的"被挑战前提"与"替代方案"做对称分解,得出"它们是拼图两块,不冲突"的结论——这是本稿最有原创性的判断,与 8-2 RecMem、8-4 Mental World Modeling 的对照关系也都点到位。
  • flyP v34 / v40 §2.39.x / §2.2 邻接位的自我标注:能落到具体节点编号,便于同步任务串行合并,这点比 spark/stephen 那种"建议加入主题页"的空话强得多。
  • §6 待人工确认问题:6 条都明确、可执行,Anan 拿到就能去 GitHub / paper_card 补查。

弱项

  • 深度天花板被"不抓全文 PDF"的边界自我压制:flyP 在元信息里明确写"不抓全文 PDF",这意味着 §6 复现风险评级、§7 反方严重度全部是基于 abs 摘要 + GitHub README + 已写精读稿的二级推断,而不是 PDF §X.Y 节号验证。这是个本棒 v1→v2 的清晰缺陷——既然是周六棒,本来就应该打开 PDF 把 R1/R2/R5 的判定依赖补上。
  • 缺 head-to-head 实验数字:A.3 自认"MMSearch-Plus 提升幅度未在摘要给出绝对值"——这是真问题,但应该直接抓 GitHub README 的表格或 emergentmind 摘要(MM-BrowseComp Level2 上 open-source SOTA 数字有,但 flyP 没写)。
  • R5 闭源对比:判定依赖写 "PDF §5.2 + 表 1 / 表 2",但没去验证;其实 GitHub README 通常会放 headline table,应该先查这个。
  • 跨实例引用:与 8-6 Long-context-128k-to-4m 的"逻辑长度 vs 上下文长度"区分是本稿少有的"概念边界澄清",值得在 §A.6 单独留一段,但目前只埋在表格里,容易被同步任务略掉。

3. 可读性与误导风险

  • 结构清晰:§0 选稿逻辑 / §A 主稿 / §B 双稿对照 / §1 综合反方 / §2 分类 / §3 决策 / §4 写入路径 / §5 信源截止 / §6 待人工确认,八节分明,字数控制合理(21 KB 但密度高)。
  • 不影响阅读的小问题:§A.5 里 R5/R6 错把"证浮条件"写成了"证浮",应为"证伪"——笔误,出现 2 次。
  • 可执行性高:§4 写入路径 8 行表格把"建议同步到哪里"全列清楚了,Anan 复制粘贴即可触发同步任务,这点在 flyP 这一周的所有稿里都做得最好。
  • 没有发现会误导的事实声明:除了 base 模型写错那条不算严重误导(因为不是工作核心机制),其余事实层面没有把猜测包装成定论。

4. 与最新进展的差距

  • LMM-Searcher 同期已有 DeepMMSearch-R1 (Apple, Jan 2026) 与 MMSearch-R1 (MMLab@NTU, ACL 2026 Oral)——这两个都是同主题 RL-based 替代路线,flyP 没在 §A.6 邻接里点出"RL 路线 vs 文件式路线"的范式分歧,而 8-7 那篇 light-review 里也没覆盖。这是本棒最大的"与最新进展贴合度"缺口。
  • Sparse Event-KV 同期有 LinkedIn KV Cache Compaction (arXiv:2608.00902) 这种工业实践,flyP 在 B.4 风险表里提到"与 LinkedIn KV Cache Compaction 对比未给",但没真的去查——这本来是 5 分钟的事。
  • Zero-Mem 与 7-31 SkillRise × Metis、7-30 memoryagentbench 的"原生记忆 vs 跨任务技能"主线接得上,但 flyP 在 B.6 邻接里只点了 RecMem,缺了对 SkillRise/memoryagentbench 的引用,导致主线扩展性评估缺一块。

5. 评分

维度 满分 得分 说明
事实准确 4 2 base 模型错(Qwen3-VL-Thinking) ★★★★ + GitHub release 状态错判 ★★★ + 标题错 + 作者漏 2 人
深度 3 2.5 §B.5 范式对位有原创性,但停在 abs 摘要层未抓 PDF,跨实例引用不全
可读性/结构 2 1.8 八节结构清晰 + 邻接位具体到节点编号,优于本周其他稿;"证浮"笔误 2 次
与最新进展贴合度 1 0.4 没提 DeepMMSearch-R1 / MMSearch-R1 RL 替代路线,没补 SkillRise/memoryagentbench 邻接

总分:6.7 / 10(四舍五入到 7 分)。


6. 可执行的修改建议

按"今天就能改 / 本周改 / 下次精读改"三档拆。

今天就能改(机械修正)

  1. A.1 元信息 base 模型行改为:Base 模型:基于 MiroThinker 的多模态 deep search agent(arXiv 摘要与 GitHub README 明确"Our codebase is built upon MiroThinker",未声明使用 Qwen3-VL-Thinking-30A3B;30A3B 是 Qwen3 系列的 MoE 配置,需读 PDF §3.1 确认是否为 SFT 起点)
  2. A.1 元信息作者行补全:Yifan Du, Zikang Liu, Jinbiao Peng, Jie Wu, Junyi Li, Jinyang Li, Wayne Xin Zhao, Ji-Rong Wen
  3. A.1 元信息论文标题行改为:论文: Towards Long-horizon Agentic Multimodal Search(框架名 LMM-Searcher)
  4. A.4 复现风险表第 1 行降级:"代码 release 不完整 ★★★★" → "是否包含 12K SFT 轨迹 + Level2 完整评测脚本 ★★★★"(RUCAIBox/LMM-Searcher 已于 2026-04-15 release,本棒 v2 应据实改写)。
  5. A.5 R5 / R6 "证浮"笔误 → "证伪"(各 1 处,共 2 处)。

本周改(需要打开 PDF / GitHub)

  1. A.3 补 MM-BrowseComp Level2 绝对值:抓 GitHub README 的 headline table 或 emergentmind.com 摘要,把 "open-source SOTA" 的数字写死(如 Level2 准确率从 X 到 Y)。
  2. A.5 R4 补判定结论:打开 PDF §3.3 + 附录 SFT prompt template,确认 12K SFT 轨迹是否来自 GPT-4o 自举 / 人工标注 / 自建 pipeline,把"严重度 ★★★★"转成具体证据。
  3. A.6 邻接补两条 RL 替代路线:DeepMMSearch-R1 (Apple, 2026-01, machinelearning.apple.com/research/r1) 与 MMSearch-R1 (MMLab@NTU, ACL 2026 Oral),明示"文件式表征 vs RL 搜索策略"是当前 long-horizon multimodal search 的两条对立路线。
  4. B.4 补 LinkedIn KV Cache Compaction (arXiv:2608.00902) head-to-head 风险评估——这条 5 分钟就能查。
  5. B.6 邻接补 7-31 SkillRise × Metis 与 7-30 memoryagentbench 两篇,把"原生记忆 + 跨任务技能"主线接进范式对位。

下次精读改(结构层面)

  1. 建立"边界声明"小节:既然本棒明确"不抓全文 PDF",应在文件顶部 §0.1 之前加一行说明"本棒为周六合并稿,反方严重度仅基于 abs 摘要 + 已写精读稿 + GitHub README;PDF §X.Y 节号验证留待 v2 触发同步任务补齐"。让读者一开始就校准预期。
  2. §B.5 范式对位的复用性:本棒最有原创性的判断,但目前只服务于本棒两篇。建议在下次周报(weekly-deep-read-notes)里抽出一段"agent memory 范式分歧 v1: LLM-as-access / encoder-as-access / sparse-KV-as-access / file-as-access",把 RecMem + Zero-Mem + Sparse Event-KV + LMM-Searcher 串成一条主线。

7. 一句话总结

本棒是 flyP 这一周结构最完整、可执行性最高、且有原创范式判断(§B.5)的一篇合并稿,但base 模型写错(Qwen3-VL-Thinking 实际是 MiroThinker)、GitHub release 状态错判这两条事实性错误必须修正,且停在 abs 摘要层不抓 PDF 的边界设定让它在反方严重度上无法真正"立标"——下一篇 v2 覆盖时优先抓 PDF §3.3 + §5.2 两节,并补 DeepMMSearch-R1 / MMSearch-R1 RL 替代路线邻接。