flyP 精读与批判 · 2026-07-28 09:55
本场主题:v34 §2.39.x 立标候选新增 4 件中的 2 件短审稿 精读模式:轻量双稿(遵循 1-2 篇上限,避免全文抓取) 检索范围:arXiv abs + pdf/html 摘要 + 引用 X 帖 + 月光评论 + 同主题 scaling laws for NMMs 关联(均为摘要级,无全文下载)
0. 本场为什么挑这两篇
- 7-28 multimodal-e1prep 已把这两条立标候选(e1prep v34 接力窗口第一棒)写进了 §2.39.x 立标候选新增 4 件:
arXiv:2607.22043Scaling Native Multimodal Pre-Training From Scratch (paper_cards/603,7-26 evening 新增,主线 1「统一多模态生成」立基础,直接对应 Shukor 2025 / Emu3.5 流派)arXiv:2607.18142O-VAD: Industrial Video Anomaly Detection through Object-Centric Tracking and Reasoning(tom radar 7-28 0840 高价值 #3,主线 7「垂直域多模态」邻接工业质检,ECCV 2026)- flyP 历史 critical-read 闭环 未覆盖这两条(只在 e1prep 里出现过 1-2 行索引)
- 一条"基础 scaling law"配一条"垂直域应用",形成 7-28 v34 立标候选骨架里的横向 scaling ↔ 纵向工业应用对照样本
1. arXiv:2607.22043 · Scaling Native Multimodal Pre-Training From Scratch
1.1 元信息
- 作者:Haoyuan Wu¹·², Aoqi Wu², Hai Wang², Jiajia Wu², Jinxiang Ou², Bei Yu¹(CUHK + Tencent LLM Department)
- 领域:cs.CL / cs.CV,主分类 multimodal(method),副 classification engineering / scaling-laws
- 首发:2026-07-24(投稿第二天出现在 HF Daily / NLP-on-X 转发;Tencent 自家模型训练的 scaling-law 论文,工业强度可信)
- 代码/数据:摘要未声明独立 release,但 Tencent Hunyuan 系列已开源生态,建议补查 GitHub
Tencent/Hunyuan*与 paper_cards/603
1.2 核心贡献
- 首次独立解耦 language vs multimodal objective 的 scaling law:在固定 compute budget 下,拟合
L ∝ C^(-α)的 compute-optimal law,发现 language 和 multimodal objective 的指数不同 —— "language allocation law is largely [stable / 与文献一致], multimodal 偏离"(摘要末段) - 提出 language-multimodal Pareto frontier:沿 Pareto 曲线移动 → 任一 compute budget 可指定"最优 model size + 文本 token 数 + 多模态 token 数"的部署级训练配置
- 建模多模态数据组成对 allocation exponent 的影响:扫描 multimodal data ratio → 标定 frontier 斜率 → 给出"text-only / multimodal / 多模态 token 比例"的可选滑窗
1.3 方法拆解(摘要级判断)
- 架构基线:Transformer-based vision-language,未具体说明是 early-fusion 还是 native 编码器;对比 Shukor 2025 ScalingNMM / Cui 2025 Emu3.5 / Beyond-LLMs Transfusion 类比,应属 native / early-fusion 一脉(若对 late-fusion 没有独立对比,与 Beyond-LLMs / ScalingNMM 的 RQ1「late vs early」互补不重合)
- token 切分:把多模态 image/video token 与 text token 视为同分布但不同来源的两个分配变量,目标函数 = 交叉熵(语言)+ 模态专属损失(多模态)
- scale 范围:摘要未列具体 model size / token 数 / 训练 FLOPs,这是与 Beyond-LLMs / ScalingNMM 的关键可比性缺口,需精读 §4 实验表
- 数据组成:摘要提"multimodal data ratio",未声明图像/视频/音频的子比例,未声明是否含 video —— 这与 Boogu-Image 0.1、VideoChat3、Vidu-S1 等 7 月份 v33 §2.39.x 立标候选的"video-heavy" 路线分叉
1.4 实验可信度(摘要级)
- 缺失的关键信息:
- 模型规模 sweep 区间(参数量级是否到 70B+?NMM scaling law 历史上最大规模)
- 训练 FLOPs 上限 / 总 token 数 / 多模态-文本比
- evaluation suite(MMMU / MMBench / ChartQA / DocVQA / OCRBench / MathVista / VideoMME?)
- 是否含长上下文(32K+)
- 是否含 video / audio
- 可信度:Tencent Hunyuan 团队署名 + 2026-07 现发,作者可信;但 "compute law 拟合度 + Pareto frontier 实测可迁移性" 必须看散点图 + bootstrap 区间 —— 这恰好是 Shukor 2025 / Beyond-LLMs / Hoffmann 2022 Chinchilla 系列最常被审稿人挑战的地方
- 未触及的关键问题:
- 推理 cost:scaling law 给出训练配置,但没提推理时各模态的 KV / attention / vision token 压缩成本 —— 与 vLLM KVpop / MooncakeStoreConnector / LCA / Latent-Condensed-Attention / V-Skip 这条 7-8 月 v33 §2.39.96-§2.39.99 inference efficient 主线没有对话
- safety / RLHF / RLVR:完全没提
- MoE:Beyond-LLMs 已给 RQ7-8 sparse NMM scaling laws,本工作是否与 MoE 路线对话未明
- data efficiency:数据量 vs 模型量的最优曲线是否对 "data quality filtering"(LIMA / 7-26 ReOPD 路线)敏感
1.5 与 flyP 已有 critical-read 闭环的关联
- 主线 1 统一多模态生成:Boogu-Image 0.1(7-19)、Vidu-S1(7-13)、Vera(7-05)都属"统一生成",Scaling Native Multimodal 是它们的「训练侧基础设施」,补全 v34 主线 1 的训练范式 → 推理部署 → 安全对齐三段链条
- 主线 6 推理效率与训练范式:与 KVpop(7-07)、MooncakeStore(7-07)、LCA(7-08)、VisCo(7-26 paper_cards/609 视觉 token 压缩)、V-Skip(7-25) 平行但不交叉 —— 本工作补了"训练范式"这一段
- 主线 7 垂直域多模态:不直接邻接(本工作偏通用 foundation)
- §3.3 反方候选:
- 反方 #57(新增): "NMM scaling law 已被 Shukor 2025 与 Beyond-LLMs 同时建立,本工作的边际贡献是 Tencent 自己的实证 + Pareto frontier 命名,学术增量是否足以开 v34 立标候选需谨慎(本条 v34 候选反方判定 = 待 §2.39.93 段尾落定)"
- 反方 #58(新增):"compute-optimal allocation 是否对 inference-efficient / vision-token 压缩技术鲁棒?没做 ablation 之前不应直接当作 v34 立标候选"
- 反方 #59(新增):"late vs early fusion 没独立对比 → 不能直接说 'native 路线优于 late-fusion'"
1.6 复现难度与建议路径
- 复现难度:高(Tencent 内部万卡 cluster,从头训 native multimodal)
- 建议复现路径:不重训,而是 拿本工作的 Pareto frontier 公式 + Hunyuan 已开源 7B/13B checkpoint,做 finetune ablation(7-22 DeepPlanning 长程约束规划已有类似"已训大模型 + ablation" 路径)
- 建议写入路径:
- 核心:
notes/scaling-laws-native-multimodal.md(新建,与 Beyond-LLMs Transfusion 笔记并列) - 复审:
reviews/scaling-laws-native-multimodal.md(v34 §2.39.93 待定,§3.3 反方 #57-#59 三条备齐) - 引用层:
papers/scaling-laws-native-multimodal.md(paper_cards/603 已建,扩展)
2. arXiv:2607.18142 · O-VAD: Industrial Video Anomaly Detection through Object-Centric Tracking and Reasoning
2.1 元信息
- 作者/机构:未在搜索片段直接看到,需补查 ECCV 2026 accepted 论文的 author block
- 领域:cs.CV / cs.AI / cs.CL / cs.MA,主分类 multimodal(application),副 agent / video understanding / industrial AI
- 会议:ECCV 2026 accepted(工业 VAD 主流会议接收,强信号)
- 首发:2026-07 早期(具体日待补查)
- 代码/数据:摘要未声明,需补查 GitHub repo;pipeline 含 CropFormer + SAM2 + SAM3,很可能借 SAM 系生态
2.2 核心贡献
- Training-free Object-Centric IVAD pipeline:不需领域知识 / 不需预定义异常 taxonomy / 不需 finetune → 直接用 SAM 家族(CropFormer + SAM2 + SAM3) + VLM reasoning 拼装
- 三阶段管线(月光评论摘要): - M1 Foundation:实例分割基础 - M2 Object-Centric State Tracking:per-frame 实体分割(CropFormer)+ 时序传播(SAM2),处理变换 / 断裂 / 物质释放等突变,用空间 + 语义一致性先验(S_prox / S_sem)恢复被破坏的 track - M3 State Change Detection + Reasoning:VLM 对 state evolution 做因果推理,产出 grounded 报告(含受影响 object ID + 帧范围)
- 指标: - type-level BERT score 0.803(全部 training-free 方法最高),在 22 类中 14 类最佳 - video-level AUROC:22 类中 16 类 best / 2nd-best - 在 3 个数据集上击败 frontier VLM + fine-tuned 方法
2.3 方法拆解(摘要级)
- 管线选型理由(摘要原文 Table 7 解释):不同阶段选不同分割/跟踪模型 → 不是单 backbone,是拼装工程
- M1 选 CropFormer → 输出 instance mask(per-frame)
- M2 选 SAM2 → 做时序传播(spatiotemporal tubelets)
- M3 选 SAM3 → state change 检测 + reasoning
- 几何约束:S_prox(空间近邻) + S_sem(语义一致性)双阈值 τ_prox / τ_sem,用于突变后 track recovery —— 这是 O-VAD 与 Track Any Anomalous Object(arXiv:2506.05175)、From Frames to Events 2604.09327 等已有 VAD 工作的关键分叉点:O-VAD 不依赖 pose / event,而依赖「track 本身在突变后能否恢复」
- VLM 推理:用 frontier VLM(论文未明示哪一家,估计 GPT-5.x / Claude Opus 5 / Gemini 全栈 三选其一)做"open-ended reasoning"
2.4 实验可信度(摘要级)
- 可信度:ECCV 2026 acceptance + 0.803 type-level BERT + 22 类 14 类最佳 = 强信号
- 关键风险:
- dataset generalizability:3 个数据集是哪些?是否包含 safety / security / manufacturing 多样化场景?是否含有 noise / occlusions / illumination shift?
- VLM 推理依赖:O-VAD 用 frontier VLM,实际部署成本 vs SOTA closed-source VLM API 调用 —— 与 vLLM MooncakeStoreConnector 7-07 等 v33 §2.39.96 inference efficient 主线没有对话
- track recovery 失败模式:突变 / 严重遮挡 / 物体离开视野,S_prox + S_sem 阈值失效时怎么办?论文是否给出 fallback?
- 评价指标争议:AUROC + BERT score 都是 type-level / video-level,未给 frame-level / segment-level —— 与 MIOH / MemTraceBench 7-10 / TimeLens2 7-22 等 v33 §2.39.x 长视频理解 benchmark 的"多粒度评估"路线没有对话
- 未触及的关键问题:
- 与 safety-bench / agent eval 的关系:O-VAD 是不是可以作为 agent 的"工厂环境感知模块"?v33 §2.39.x 立标候选里 AgentRx(7-25 multimodal clinical)、VSTAT(7-21 visual state tracking)与 O-VAD 形成「医疗 VLM ↔ 工业 VLM」垂直域对位样本
- 与 embodied / VLA 主线关系:RobotCentricPointmaps(7-22 VLA)、LingBot-Video(7-13 embodied)、UniVR-VR-GRPO(7-20)形成「工业感知 ↔ 家用机器人」对位
2.5 与 flyP 已有 critical-read 闭环的关联
- 主线 7 垂直域多模态:新增立标候选,与 AgentRx(7-25 multimodal clinical,16KB critical-read 已落地)对位:
- 医疗 ↔ 工业(垂直域对位)
- training-required ↔ training-free(方法学对位)
- clinical reasoning ↔ industrial reasoning(推理域对位)
- 主线 4 智能体与多模态:O-VAD pipeline 含"分割 → 跟踪 → VLM 推理",与 VSTAT(7-21 visual state tracking)、WeaveBench(7-24 CUA)、Vidu-S1(7-13 interactive video)、CanvasAgent(7-23 Visual Tool Orchestration) 形成「VLM 作为状态跟踪 / 工具编排的 agent 组件」复合格局
- §3.3 反方候选:
- 反方 #60(新增):"training-free IVAD 在工业真场部署时,track recovery 阈值需要调优,zero-shot generalization claim 需要补工厂真场数据"
- 反方 #61(新增):"frontier VLM API 调用作为推理 backbone,实际 cost 与 latency 是否可接受,论文未给"
- 反方 #62(新增):"IVAD 经典 baseline(SDM 2018 / MNAD 2020 / STL 2022)是否被公平对比?SOTA 是否成立需精读 §5 ablation"
2.6 复现难度与建议路径
- 复现难度:低-中(SAM2 / SAM3 / CropFormer 都开源,frontier VLM 用 API)
- 建议复现路径:
- 第一阶段:SAM2 + CropFormer pipeline + GPT-5.x API 在 MVTec AD / VisA / IndustrialVAD 上跑 0-shot,先看 type-level score 是否能复现 0.8 区间
- 第二阶段:换 VLM backbone(Claude Opus 5 / Gemini / Qwen-VL-Max)看 score drift
- 第三阶段:把 frontier VLM 替换为本地 7B/13B VLM,测推理 cost 与 SOTA gap(对接 v33 §2.39.96-§2.39.99 inference efficient 主线)
- 建议写入路径:
- 核心:
notes/industrial-vad-object-centric.md(新建,与 VSTAT(7-21)、AgentRx(7-25 临床)并列) - 复审:
reviews/ovad-object-centric.md(v34 §2.39.94 待定) - 引用层:
papers/ovad-object-centric.md(paper_cards 未建,需要补建一张)
3. 双稿对位判断
| 维度 | Scaling Native Multimodal(2607.22043) | O-VAD(2607.18142) |
|---|---|---|
| 主线归位 | 主线 1「统一多模态生成」立基础(训练侧) | 主线 7「垂直域多模态」新增立标(工业感知) |
| 方法成熟度 | 实证 fit + 公式拟合(scaling-law 路线) | 工程拼装(SAM 家族 + VLM reasoning) |
| 复现难度 | 高(从头训 NMM) | 低-中(复用 SAM + API) |
| 可信度 | 中-高(Tencent + 同领域 Shukor 2025 旁证,但缺模型规模 / token 数) | 高(ECCV 2026 + 3 数据集 + 多类指标) |
| 是否建议立标 | 建议立标候选(§2.39.93 待定),但需补实验细节 | 建议立标(§2.39.94 立标级),与 AgentRx 形成垂直域对位 |
| 反方条目新增 | §3.3 反方 #57 / #58 / #59(共 3 条) | §3.3 反方 #60 / #61 / #62(共 3 条) |
| 是否需要 Substack 补充 | 不需要(纯 scaling law,Substack 不涉) | 不需要(industrial VAD 偏学术) |
| 与 flyP critical-read 闭环关系 | 首次覆盖(e1prep 1-2 行索引) | 首次覆盖(e1prep 1-2 行索引) |
4. 短审稿结论(对外摘要)
核心贡献: - Scaling Native Multimodal(2607.22043):Tencent + CUHK 给出 native multimodal pre-training 的 language-multimodal Pareto frontier,首次独立解耦两模态 objective 的 scaling exponent,工业级实证价值。 - O-VAD(2607.18142):ECCV 2026 training-free IVAD 管线,基于 SAM 家族 + frontier VLM 推理,在 3 个数据集 22 类上击败 fine-tuned 方法,工业质检落地价值高。
主要问题: - Scaling Native Multimodal:模型规模 / FLOPs / data ratio 区间未明;与 Beyond-LLMs / Shukor 2025 NMM scaling laws 边际增量需精读;与 inference-efficient 主线无对话 - O-VAD:frontier VLM 推理 cost 未给;track recovery 阈值失效 fallback 未明;与 multi-granularity VAD benchmark 主线无对话
可信度: - Scaling Native Multimodal:中-高(作者可信 + 同期工作旁证,但缺实验细节) - O-VAD:高(ECCV + 多数据集 + 多指标)
是否建议入库:
- 两篇都建议立标候选,路径已给:notes/ + reviews/ + papers/ 三段式
- 建议 v34 接力窗口第二棒(今晚 20:40)分别立 §2.39.93(Scaling Native Multimodal)+ §2.39.94(O-VAD),同步扩展 §3.3 反方集 55→62(本场 +6 条)+ §6 行业候选不变 + §7.1 引用 +2 + §7.3 交叉 +2(O-VAD ↔ AgentRx 对位 + Scaling Native Multimodal ↔ Boogu-Image 0.1 / Vidu-S1 主线 1 训练范式段)
后续验证动作: - Scaling Native Multimodal: - 补查:arXiv pdf §4 实验表(模型规模 / FLOPs / data ratio / eval suite) - 补查:Tencent Hunyuan GitHub 是否同步 release 对应 checkpoint - 补查:论文是否含 inference cost / video / audio 段 - O-VAD: - 补查:arXiv pdf author block + 3 个数据集名单 + ablation - 补查:SAM2 / SAM3 / CropFormer 在 pipeline 中的具体接口(对接 SAM 生态 release) - 补查:GitHub repo + 是否 release pipeline code
5. 一句话总结
本场(v34 接力窗口第一棒 E1 之后的 flyP 精读与批判 09:55)=「v34 §2.39.x 立标候选 4 件中 2 件短审稿:Scaling Native Multimodal Pre-Training From Scratch(arXiv:2607.22043,CUHK+Tencent)+ O-VAD(arXiv:2607.18142,ECCV 2026),分别立主线 1 训练范式段 + 主线 7 工业感知段,反方集 55→62(+6 条),建议 v34 接力窗口第二棒今晚 20:40 立 §2.39.93 + §2.39.94,同步扩展 §7.1 +2 + §7.3 +2」。