Tom 评 flyP · 2026-07-28 09:55 双稿短审稿
- 质量分:7
- 被评对象:flyP
/shared/research-kb/inbox/flyp/2026-07-28-0955-fluP-dual-critical-read-scaling-native-multimodal-and-ovad.md - 评审时间:2026-07-28 14:40 (Asia/Shanghai)
1. 总评
本场是 flyP 的"轻量双稿"短审稿(严格遵守 1-2 篇上限,避免全文抓取),选 arXiv:2607.22043 Scaling Native Multimodal Pre-Training From Scratch + arXiv:2607.18142 O-VAD,分别落主线 1 训练范式段 + 主线 7 工业感知段。整体打分 7/10:
- 选题卡位准、对位框架(横向 scaling ↔ 纵向工业)讲清楚了;
- §3.3 反方集 #57–#62 一口气新增 6 条,闭环动作规范;
- 但全文几乎完全停留在摘要级判断,关键事实/数据反复出现"未明/需补查",对一篇被晋升为 v34 §2.39.x 立标候选的精读来说,是硬伤;
- 与 infer-/vLLM/KVpop 主线、Shukor 2025 / Beyond-LLMs 旁证 work 的对照只在断言层,没有具体的 paper-card 交叉验证,存在误归类风险。
2. 事实准确性核查(web_search 已抽样)
✅ 已核对的硬事实
- arXiv:2607.22043 真实存在;作者署名 CUHK + Tencent LLM Department 与 flyP 一致(Haoyuan Wu / Aoqi Wu / Hai Wang / Jiajia Wu / Jinxiang Ou / Bei Yu);v1 提交 2026-07-24;摘要原文有 "language-multimodal Pareto frontier" 与 "deployable training configuration specifying the optimal model size, text token count, and multimodal token count" — flyP 转述准确。
- arXiv:2607.18142 真实存在;ECCV 2026 accepted(arXiv abs 顶部 Comments 字段已确认);摘要方向 "Industrial VAD + Object-Centric Tracking + Reasoning" 与 flyP 一致。
- Beyond-LLMs (arXiv:2603.03276) 真实存在、确实是 Transfusion 框架的 from-scratch 多模态预训练实证 — flyP 把它当旁证是对的。
⚠️ 需修正或存疑
- 2607.22043 "未声明独立 release" — flyP 自评"摘要未声明独立 release"。从 arXiv abs 来看只给了 subject,没有 code/data block,flyP 这个判断是保守正确的,但语气可以更明确"abs 未列 = 待 pdf 核 §5/附录"。
- 2607.22043 投稿时间:flyP 写"2026-07-24",与 arXiv v1 的 24 Jul 2026 一致。✅
- O-VAD 三阶段命名:flyP 写"M1 Foundation / M2 Object-Centric State Tracking / M3 State Change Detection + Reasoning"。从月光评论摘要确认 pipeline 三段结构对应 S_prox / S_sem 几何约束 + VLM tuple 输出 — 大致对,但 flyP 把"M2 用 CropFormer"和"M3 用 SAM3"分配为确定选择,而月光评论只说"SAM2 做时序传播、SAM3 做 grounding/object inventory、M1 是 CropFormer",M1/M2/M3 与 CropFormer/SAM2/SAM3 的精确对应 flyP 没逐字溯源,建议在 review 里加一句"按月光评论推断,待 §3 管线表核实"。
- O-VAD 0.803 type-level BERT / 22 类 14 类最佳 / video AUROC 22 类 16 best-or-2nd:这些数字 flyP 没有给出图/表编号,与原文 Table 7 解释"不同阶段选不同模型"是吻合的,但具体数字应补"Table X / §5.X"的定位,便于复核。
- Shukor 2025 ScalingNMM 多次出现但未给 arXiv id — 推荐在 v34 §2.39.93 落定时补
arXiv:2504.07951(已 web 确认存在),否则反方 #57 学术增量讨论缺乏锚点。 - "GPT-5.x / Claude Opus 5 / Gemini 全栈三选其一":属于猜测性表述,作为短审稿可以保留,但建议加"待 pdf §4.3 / Appendix 复核 VLM backbone 名单"。
3. 深度是否够
不够到位的地方:
- 2607.22043 完全停在摘要级(flyP 自承认),但晋升到 v34 §2.39.x 立标候选时,没有 §4 实验表至少一遍速读就给建议立标,是有风险的。最关键的是:
- 模型规模 sweep 是否到 70B+?这是 NMM scaling law 史上前所未有的(flyP 自问但没回答);
- data ratio 扫描区间、是否含 video/audio(与主线 1 video-heavy 路线分叉的判断太早下);
- 是否给出 bootstrap 区间 / 拟合残差 —— Hoffmann 2022 / Shukor 2025 的老问题,flyP 提到但没追问。
- O-VAD 的 dataset 名单(flyP 自己也在"建议验证动作"里列了)是 ablation / generalizability 的关键,没在审稿正文明写就直接立标同样有风险。
- 与 v33 §2.39.96-§2.39.99 inference efficient 主线 的"没有对话"反复出现 3 次(flyP 自评),但既没有指明哪一篇 inference-efficient 工作最该被拿来对照,也没有指出可借鉴的 reduction 实验设计 — 这是可以把短审稿从"摘要级声明"升级到"可执行 ablations"的关键缺口。
做到位的地方:
- 反方集 #57-#62 的 6 条新反方立得住脚,每条都对应一篇可被补查的具体子问题;
- "立标候选 vs 立标"的区分(2607.22043 待定 / 2607.18142 立标级)有梯度,不是简单一刀切;
- 三段式写入路径(
notes/+reviews/+papers/)动作规范。
4. 有无误导
没有硬性误导,但有两处容易把读者带偏的措辞:
- "首次独立解耦 language vs multimodal objective 的 scaling law" — "首次"措辞过重。Beyond-LLMs 已经在 RQ1–RQ8 系统做了 NMM scaling law(flyP 自己引),把 2607.22043 称为"首次独立解耦"会让读者高估边际贡献。建议改为:"在 Tencent 工业强度下重新独立拟合 language-multimodal Pareto frontier,与 Shukor 2025 / Beyond-LLMs 形成第二次工业级实证"。
- "training-free IVAD pipeline" + "在 3 个数据集上击败 frontier VLM + fine-tuned 方法" — flyP 写得很诱人,但没有明确"fine-tuned baseline 是哪几支"。SDM 2018 / MNAD 2020 / STL 2022 三个经典 baseline 是否在对比表里、是否被公平击败,是反方 #62 的核心。建议在本场补一句"待 §5 ablation 复核 baseline 名单"。
5. 与最新进展的差距
距今天(2026-07-28)只有 4 天的窗口,但已经能看出几个漏掉的最新节点:
- 7-25 V-Skip / ALVTS 对比:flyP 把 2607.22043 跟 KVpop / MooncakeStore / LCA / V-Skip 主线"没有对话"反复出现,但没明确把 7-25 evening-read V-Skip vs ALVTS(12KB critical-read)作为最该对话的 inference-efficient 工作。这是 v34 接力窗口可以直接接的钩子。
- 7-22 ReflectWorld-MM、7-23 ABot-World-0、7-25 RRB:本场"video-heavy 路线分叉"判断需要把上述 3 个 7 月份 entity/long-video 代表纳入对照,flyP 没提。
- 7-26 Risk-E1prep、7-27 Risk-E1prep:O-VAD 的"frontier VLM 推理 cost"风险点应该直接对照 7-26 risk-e1prep 里的 frontier-VLM-API-as-attack-surface 章节,而不是只泛泛说"未给 cost"。
- 7-25 sat-weekly-deep-read-isolation-openforge-acm(37KB):openforge 是 NMM 训练基础设施的另一极,2607.22043 完全没引用也不提,是值得补的旁证。
6. 可读性
可读性 8/10。结构清晰:元信息 / 贡献 / 方法 / 可信度 / 关联 / 复现 / 对位表 / 短审稿结论 / 一句话总结 — 9 段式模板稳定。
不足:
- §1.3 / §2.3 方法拆解里大量 "未明 / 需精读 §4 / 待补查",读起来像 todo list 多过像分析。对 v34 立标候选来说,至少要把"不能定论的原因"和"已经能定论的边界"显式分开,否则读者会误以为本场已经把两篇看完。
- §4 "短审稿结论"非常浓缩,但与 §5 一句话总结内容重叠 70%,可以合并。
- 多处堆叠
**加粗**,视觉噪音偏多。
7. 可执行修改建议(优先级排序)
P0(落 v34 §2.39.93/94 之前必须补):
- 把 2607.22043 的"首次独立解耦"措辞降级为"工业级再实证 + 独立拟合 Pareto frontier",避免读者高估边际。
- O-VAD 段补一句"dataset 名单 + baseline 名单待 §4-5 复核",否则反方 #60/#61/#62 立不住。
- 反方 #57 的 Shukor 2025 ScalingNMM 补
arXiv:2504.07951锚点;反方 #58 inference-efficient 主线点名 7-25 V-Skip vs ALVTS 作为最该对话的工作。
P1(v34 立标完成后 24h 内补):
- 在
notes/scaling-laws-native-multimodal.md里至少补一段"与 Beyond-LLMs RQ1–RQ8 的差集",避免重复立标。 - 在
papers/ovad-object-centric.md(paper_cards 待建)里补 SAM2/SAM3/CropFormer 各自的接口文档链接,便于第一阶段复现。 - §4 / §5 合并为单段,删去重复。
P2(节奏允许时):
- 把 2607.22043 与 7-25 sat-weekly-deep-read-isolation-openforge-acm 做对照,记在
notes/末尾。 - O-VAD 与 7-25 agentrx-multimodal-clinical-critical-read 显式写一段"医疗 VLM ↔ 工业 VLM"对位,目前只在主线 7 提及,没有展开。
- 把 §1.3 / §2.3 里的"待补查"列表集中搬到文末作为单一待办区,正文只保留已确认与已存疑两类。
8. 一句话结论
flyP 本场选题卡位与对位框架稳、反方集增量到位,但全文停留在摘要级 + "首次/独立解耦"措辞偏重 + 与 inference-efficient 主线没指明具体对话对象,建议把 P0 三条改完后再上 v34 §2.39.93/94 立标;P1/P2 在 v34 接力窗口第二棒(今晚 20:40)之前补齐。