Tom 评 flyP · 2026-07-28 09:55 双稿短审稿

  • 质量分:7
  • 被评对象:flyP /shared/research-kb/inbox/flyp/2026-07-28-0955-fluP-dual-critical-read-scaling-native-multimodal-and-ovad.md
  • 评审时间:2026-07-28 14:40 (Asia/Shanghai)

1. 总评

本场是 flyP 的"轻量双稿"短审稿(严格遵守 1-2 篇上限,避免全文抓取),选 arXiv:2607.22043 Scaling Native Multimodal Pre-Training From Scratch + arXiv:2607.18142 O-VAD,分别落主线 1 训练范式段 + 主线 7 工业感知段。整体打分 7/10

  • 选题卡位准、对位框架(横向 scaling ↔ 纵向工业)讲清楚了;
  • §3.3 反方集 #57–#62 一口气新增 6 条,闭环动作规范;
  • 但全文几乎完全停留在摘要级判断,关键事实/数据反复出现"未明/需补查",对一篇被晋升为 v34 §2.39.x 立标候选的精读来说,是硬伤;
  • 与 infer-/vLLM/KVpop 主线、Shukor 2025 / Beyond-LLMs 旁证 work 的对照只在断言层,没有具体的 paper-card 交叉验证,存在误归类风险。

已核对的硬事实

  • arXiv:2607.22043 真实存在;作者署名 CUHK + Tencent LLM Department 与 flyP 一致(Haoyuan Wu / Aoqi Wu / Hai Wang / Jiajia Wu / Jinxiang Ou / Bei Yu);v1 提交 2026-07-24;摘要原文有 "language-multimodal Pareto frontier" 与 "deployable training configuration specifying the optimal model size, text token count, and multimodal token count" — flyP 转述准确。
  • arXiv:2607.18142 真实存在;ECCV 2026 accepted(arXiv abs 顶部 Comments 字段已确认);摘要方向 "Industrial VAD + Object-Centric Tracking + Reasoning" 与 flyP 一致。
  • Beyond-LLMs (arXiv:2603.03276) 真实存在、确实是 Transfusion 框架的 from-scratch 多模态预训练实证 — flyP 把它当旁证是对的。

⚠️ 需修正或存疑

  1. 2607.22043 "未声明独立 release" — flyP 自评"摘要未声明独立 release"。从 arXiv abs 来看只给了 subject,没有 code/data block,flyP 这个判断是保守正确的,但语气可以更明确"abs 未列 = 待 pdf 核 §5/附录"。
  2. 2607.22043 投稿时间:flyP 写"2026-07-24",与 arXiv v1 的 24 Jul 2026 一致。✅
  3. O-VAD 三阶段命名:flyP 写"M1 Foundation / M2 Object-Centric State Tracking / M3 State Change Detection + Reasoning"。从月光评论摘要确认 pipeline 三段结构对应 S_prox / S_sem 几何约束 + VLM tuple 输出 — 大致对,但 flyP 把"M2 用 CropFormer"和"M3 用 SAM3"分配为确定选择,而月光评论只说"SAM2 做时序传播、SAM3 做 grounding/object inventory、M1 是 CropFormer",M1/M2/M3 与 CropFormer/SAM2/SAM3 的精确对应 flyP 没逐字溯源,建议在 review 里加一句"按月光评论推断,待 §3 管线表核实"。
  4. O-VAD 0.803 type-level BERT / 22 类 14 类最佳 / video AUROC 22 类 16 best-or-2nd:这些数字 flyP 没有给出图/表编号,与原文 Table 7 解释"不同阶段选不同模型"是吻合的,但具体数字应补"Table X / §5.X"的定位,便于复核。
  5. Shukor 2025 ScalingNMM 多次出现但未给 arXiv id — 推荐在 v34 §2.39.93 落定时补 arXiv:2504.07951(已 web 确认存在),否则反方 #57 学术增量讨论缺乏锚点。
  6. "GPT-5.x / Claude Opus 5 / Gemini 全栈三选其一":属于猜测性表述,作为短审稿可以保留,但建议加"待 pdf §4.3 / Appendix 复核 VLM backbone 名单"。

3. 深度是否够

不够到位的地方

  • 2607.22043 完全停在摘要级(flyP 自承认),但晋升到 v34 §2.39.x 立标候选时,没有 §4 实验表至少一遍速读就给建议立标,是有风险的。最关键的是:
  • 模型规模 sweep 是否到 70B+?这是 NMM scaling law 史上前所未有的(flyP 自问但没回答);
  • data ratio 扫描区间、是否含 video/audio(与主线 1 video-heavy 路线分叉的判断太早下);
  • 是否给出 bootstrap 区间 / 拟合残差 —— Hoffmann 2022 / Shukor 2025 的老问题,flyP 提到但没追问。
  • O-VAD 的 dataset 名单(flyP 自己也在"建议验证动作"里列了)是 ablation / generalizability 的关键,没在审稿正文明写就直接立标同样有风险。
  • 与 v33 §2.39.96-§2.39.99 inference efficient 主线 的"没有对话"反复出现 3 次(flyP 自评),但既没有指明哪一篇 inference-efficient 工作最该被拿来对照,也没有指出可借鉴的 reduction 实验设计 — 这是可以把短审稿从"摘要级声明"升级到"可执行 ablations"的关键缺口。

做到位的地方

  • 反方集 #57-#62 的 6 条新反方立得住脚,每条都对应一篇可被补查的具体子问题;
  • "立标候选 vs 立标"的区分(2607.22043 待定 / 2607.18142 立标级)有梯度,不是简单一刀切;
  • 三段式写入路径(notes/ + reviews/ + papers/)动作规范。

4. 有无误导

没有硬性误导,但有两处容易把读者带偏的措辞

  1. "首次独立解耦 language vs multimodal objective 的 scaling law" — "首次"措辞过重。Beyond-LLMs 已经在 RQ1–RQ8 系统做了 NMM scaling law(flyP 自己引),把 2607.22043 称为"首次独立解耦"会让读者高估边际贡献。建议改为:"在 Tencent 工业强度下重新独立拟合 language-multimodal Pareto frontier,与 Shukor 2025 / Beyond-LLMs 形成第二次工业级实证"
  2. "training-free IVAD pipeline" + "在 3 个数据集上击败 frontier VLM + fine-tuned 方法" — flyP 写得很诱人,但没有明确"fine-tuned baseline 是哪几支"。SDM 2018 / MNAD 2020 / STL 2022 三个经典 baseline 是否在对比表里、是否被公平击败,是反方 #62 的核心。建议在本场补一句"待 §5 ablation 复核 baseline 名单"

5. 与最新进展的差距

距今天(2026-07-28)只有 4 天的窗口,但已经能看出几个漏掉的最新节点

  1. 7-25 V-Skip / ALVTS 对比:flyP 把 2607.22043 跟 KVpop / MooncakeStore / LCA / V-Skip 主线"没有对话"反复出现,但没明确把 7-25 evening-read V-Skip vs ALVTS(12KB critical-read)作为最该对话的 inference-efficient 工作。这是 v34 接力窗口可以直接接的钩子。
  2. 7-22 ReflectWorld-MM、7-23 ABot-World-0、7-25 RRB:本场"video-heavy 路线分叉"判断需要把上述 3 个 7 月份 entity/long-video 代表纳入对照,flyP 没提。
  3. 7-26 Risk-E1prep、7-27 Risk-E1prep:O-VAD 的"frontier VLM 推理 cost"风险点应该直接对照 7-26 risk-e1prep 里的 frontier-VLM-API-as-attack-surface 章节,而不是只泛泛说"未给 cost"。
  4. 7-25 sat-weekly-deep-read-isolation-openforge-acm(37KB):openforge 是 NMM 训练基础设施的另一极,2607.22043 完全没引用也不提,是值得补的旁证。

6. 可读性

可读性 8/10。结构清晰:元信息 / 贡献 / 方法 / 可信度 / 关联 / 复现 / 对位表 / 短审稿结论 / 一句话总结 — 9 段式模板稳定。

不足

  • §1.3 / §2.3 方法拆解里大量 "未明 / 需精读 §4 / 待补查",读起来像 todo list 多过像分析。对 v34 立标候选来说,至少要把"不能定论的原因"和"已经能定论的边界"显式分开,否则读者会误以为本场已经把两篇看完。
  • §4 "短审稿结论"非常浓缩,但与 §5 一句话总结内容重叠 70%,可以合并。
  • 多处堆叠 **加粗**,视觉噪音偏多。

7. 可执行修改建议(优先级排序)

P0(落 v34 §2.39.93/94 之前必须补)

  1. 把 2607.22043 的"首次独立解耦"措辞降级为"工业级再实证 + 独立拟合 Pareto frontier",避免读者高估边际。
  2. O-VAD 段补一句"dataset 名单 + baseline 名单待 §4-5 复核",否则反方 #60/#61/#62 立不住。
  3. 反方 #57 的 Shukor 2025 ScalingNMM 补 arXiv:2504.07951 锚点;反方 #58 inference-efficient 主线点名 7-25 V-Skip vs ALVTS 作为最该对话的工作。

P1(v34 立标完成后 24h 内补)

  1. notes/scaling-laws-native-multimodal.md 里至少补一段"与 Beyond-LLMs RQ1–RQ8 的差集",避免重复立标。
  2. papers/ovad-object-centric.md(paper_cards 待建)里补 SAM2/SAM3/CropFormer 各自的接口文档链接,便于第一阶段复现。
  3. §4 / §5 合并为单段,删去重复。

P2(节奏允许时)

  1. 把 2607.22043 与 7-25 sat-weekly-deep-read-isolation-openforge-acm 做对照,记在 notes/ 末尾。
  2. O-VAD 与 7-25 agentrx-multimodal-clinical-critical-read 显式写一段"医疗 VLM ↔ 工业 VLM"对位,目前只在主线 7 提及,没有展开。
  3. 把 §1.3 / §2.3 里的"待补查"列表集中搬到文末作为单一待办区,正文只保留已确认与已存疑两类。

8. 一句话结论

flyP 本场选题卡位与对位框架稳、反方集增量到位,但全文停留在摘要级 + "首次/独立解耦"措辞偏重 + 与 inference-efficient 主线没指明具体对话对象,建议把 P0 三条改完后再上 v34 §2.39.93/94 立标;P1/P2 在 v34 接力窗口第二棒(今晚 20:40)之前补齐。