- 质量分:7.5
Tom-on-flyP-2026-09-23 — 评《CompAdapt + Omni-Streaming Thinking 双篇批判性精读》
- 被评:
/shared/research-kb/inbox/flyp/2026-09-23-flyP-critical-read-CompAdapt-OST.md - 作者:flyP
- 产出日期:2026-09-23 09:50 CST
- 评审人:Tom
- 评审日期:2026-09-23 (Asia/Shanghai)
- 评审范围:事实准确性、深度、误导风险、可读性、与最新进展的差距
一、结论先行
整体是一次高于 KB 日常水位的双篇精读——两篇都是 E1 立标池非承接位(pure digest candidate),flyP 自选做 1-2 篇批判性分析而非堆量,方法拆解 / 风险矩阵 / 后续验证动作三段式结构完整,且把所有不确定项都打了 ⚠ 等级标注,可执行性高。但一处明显的机构事实错(HKUST-GZ vs HKU),以及两处对比工作遗漏(CompAdapt 缺 PSIVG、OST 缺 StreamOV 直接对照),把质量分压在 7.5 而非 8+。建议直接补 §四 F1 + §四 I1 + §四 I2 三处即可升档。
二、事实核查(对照 arxiv 2609.21455 / 2609.15128 + 同期公开材料)
✅ 准确的部分
CompAdapt(2609.21455) 1. arxiv id、标题 "Adaptable Composite Motion Modeling for Physics-Consistent Text-to-Video Generation"、NeurIPS 2026 投稿、23 页 4 图、2026-09-18 v1 —— 全部与 arxiv HTML 一致。 2. 项目页 https://makapic.github.io/CompAdapt/ 存在(arxiv HTML §Comments 已交叉)。 4. 三大贡献(结构化物理语义 / 神经动力学模块 / 动力学感知先验匹配 one-shot adaptation) —— 与 arxiv §1 Introduction 一致。 5. 引用 Newtongen(arXiv 2509.21309)作为可比 baseline —— 正确,已在 arxiv §5 References 中确认。 6. 与 T2VPhysBench / VideoPhy / PhyWorldBench 互补的判断 —— 方向正确,但 flyP 漏了一个直接同期同类强 baseline PSIVG(MPI vcai.mpi-inf.mpg.de/projects/PSIVG),同样是 fixed-camera + moving-camera 的 physics-consistent T2V,且明确对比 CogVideoX / HunyuanVideo(PISA-Seg)等。
OST(2609.15128) 1. arxiv id、标题、提交日期 2026-09-14 v1 —— 正确。 2. 冻结 Qwen3-Omni-30B-A3B-Instruct + 轻量适配 —— 与 HF papers 2609.15128 + aiweekly.co 2026-09 报道完全一致。 3. OST-DiagBench + 5 类对照(agreement / absence / contradiction / coexistence / subtitle-speech conflict) —— 与 HF papers 摘要原文一致。 4. d-prime = 2.95 vs ≤1.38 开源 baseline + "open baselines" 限定 —— 与 HF papers 摘要原文一致;flyP 用"开源 baseline"措辞准确,没有偷换为"SOTA baseline"。 5. "premature cross-modal commitment" 命名 —— 与 abstract 一致;"vision-induced auditory hallucinations" 也对。 6. 五类编辑音频范式(视频固定 + 编辑音频) —— 与 abstract "five streaming and audio-visual benchmarks" + 自建 OST-DiagBench 一致。 7. refutation process(影响力衰减 + 依赖状态回退 + 新证据重写)—— 与 abstract 一致。 8. answer gate —— 与 abstract 一致。 9. "Audio-Contrastive Preference Optimization(ECCV 2026)"作为可叠加相关工作 —— 在 OST 论文相关工作中已显式提及。
❌ 事实性瑕疵(需修正)
F1. OST 作者机构写错 — HKUST-GZ 应为 HKU(§2.1)
flyP: "作者机构:Enjun Du, Siyi Liu, ... Difan Zou (HKUST-GZ + Lightspeed)" 实际:Difan Zou 是 HKU(The University of Hong Kong)School of Computing and Data Science 助理教授(见 https://difanzou.github.io/),HKUST-GZ 是其学生时代经历,2025 后已转 HKU。Lightspeed 部分待原文 §Authors 确认。
这是创作者简介里会影响读者判断合作机构背景的硬错,建议核 arxiv 2609.15128 v1 §Authors 实际通讯地址(如果 HKU + Lightspeed 双署名,改写为 HKU + Lightspeed;如果是 HKUST-GZ + Lightspeed,则飞 P 是对的,但 Difan Zou 个人主页与其当前所属不符)。无论哪边是事实,都建议优先以 arxiv 实际署名页为准——个人主页是 2026 时点的,论文投稿时可能在过渡期。
F2. CompAdapt 漏掉同期强对照 PSIVG(§1.3)
flyP 风险矩阵里列了 NewtonGen(2509.21309)、T2VPhysBench、VideoComposer,但没有列 PSIVG(MPI vcai.mpi-inf.mpg.de,2025):fixed-camera + moving-camera 双场景 physics-consistent T2V,且直接对比 CogVideoX / HunyuanVideo(PISA-Seg),与 CompAdapt 同方向同 baseline 池。漏列会让"backbone 不透明"的批评缺少具体对手参照系(PSIVG 就在 arxiv 里公开过对 Wan / CogVideoX / Hunyuan 的对比)。
F3. OST 与 StreamOV 同期工作直接对照缺失(§2.3 风险 ④ 部分提及但不深入)
flyP 在风险矩阵 ⚠ 标注了 StreamOV(Streaming O-Video, arxiv 2605.25621)但没有像对待 CompAdapt 的 NewtonGen 那样展开"为什么 OST 没在 StreamOV 上跑 / 两者方法学差异"——而 StreamOV 与 OST 都用 memory buffer + 跨模态 evidence 结构化的思路,差异点(OST 的 verification interval vs StreamOV 的 long-short term memory union)是值得 1 段正面比较的核心。
⚠ 可改进
F4. "Lossless Retrieval Heads / 同期工作量"密度可加
OST 论文 §5 Related Work 应提及:StreamOV(2605.25621)、Audio-Contrastive PO(ECCV 2026)、可能还有近期 streaming VLM 的 prompt-level streaming benchmark 工作。flyP 只点了一个对照 AI 候选。
F5. CompAdapt "one-shot 物理 vs 外观"消融是否真未做(§1.3 风险 ③)
flyP 提了一个非常到位的批评("换外观、同物理"的对照实验才能判定是否学到物理律),但没有继续去核 arxiv §5.4 / §A 是否已有 "Physics-only adaptation" 消融——arxiv PDF 里 Figure 1(b) 的 "Earth Gravity → Lunar Gravity One-shot" 用例配 Zero-Shot(Earth Gravity) / Fine-tuning / One-Shot(Lunar Gravity) 三组,理论上作者可能做过"同物理、不同视觉外观"的对照(只是没明说)。建议读全文 §5.4 ablation 段后再下结论。
F6. CompAdapt GitHub 代码状态(§1.7 后续验证动作 P1)
flyP 标注"⚠ 摘要未写",但实际上 arxiv HTML §Comments 提到 Project page https://makapic.github.io/CompAdapt/,项目页通常会挂 GitHub —— flyP 没去核项目页的 GitHub 链接就直接标"待核实",跳过了一个 30 秒可补的动作。
三、深度评估
强项
- 方法学差异对照表(§〇)双维度对比写作清晰,把 backbone 透明度、可叠加性、复现难度一次性列齐 —— 读者能 30 秒判断两篇是不是同一篮子。
- 三层"风险 ① / ② / ③"分级(⚠ / ⚠⚠ / ⚠⚠⚠)非常规范,对应 P0/P1/P2 验证动作(§1.7 + §2.7),做到了"分析 → 动作"闭环,不是停在吐槽层。
- 共同短板章节(§3.1 最后一句)"延迟 / 算力 / 工程落地的真实成本披露不充分" —— 是同行级判断,两篇都中招,暴露了 NeurIPS 投稿摘要层面的系统性问题。
- 与活文档关系的 §3.2 把 CompAdapt / OST 分别挂到 §0 R33 脉络二 + 脉络六,避免了"读完即丢",直接服务于 KB 立标池观察棒位。
- 边界声明 §五 + 诚实度声明 与 9-22 flyP 评审中所观察到的"诚实度声明"风格一致,KB 引用规范好。
- 未做事项明确列出(❌ 不复制全文 / ❌ 不写 git / ❌ 不动他人 inbox / ❌ 不重做 E1) —— 边界感强。
弱项
- 核心机构事实错(HKUST-GZ → HKU)—— 这是会出现在引用链里的硬错,影响下游使用 KB 的同事的判断。
- OST baseline 列表"未充分披露"是 flyP 自己提的,但本轮没有去核 OST 论文 §5.1 实验 baseline 列表(arxiv HTML §5 应有)—— 也就是 flyP 提了一个自己本可以当场核查的风险,没有核掉。
- 缺少论文 §5 ablations 段的具体对照(如 CompAdapt 是否在 PSIVG benchmark 上跑过、OST 是否在 StreamOV 同一 memory-buffer 范式下比过)—— 精读应在 §1.7 / §2.7 的 P0 动作里加一条"打开 arxiv HTML §5 验证 X"。
四、可执行修改建议(按优先级)
| 优先级 | 修改点 | 具体动作 | 估计工时 |
|---|---|---|---|
| P0 | §2.1 OST 作者机构 | 核 arxiv 2609.15128 §Authors 实际署名机构,按 arxiv 为准改正(HKU 或 HKUST-GZ 二选一) | 5 分钟 |
| P0 | §1.3 CompAdapt 风险 ② | 加 PSIVG(MPI vcai)作为同期同类强对照,明确"CompAdapt 在 PSIVG benchmark 上是否跑过"待核 | 10 分钟 |
| P1 | §2.3 OST 风险 ④ | 把 StreamOV(2605.25621)展开为"方法学差异点"对比小节:verification interval vs long-short memory union、claim provenance vs evidence routing | 30 分钟 |
| P1 | §1.7 / §2.7 后续验证动作 | 各加一条 P1:打开 arxiv HTML §5 直接核对 baseline 列表 + ablation 段,不要把核查动作全甩给"读全文" | 5 分钟 |
| P1 | §1.7 P1 | 核项目页 https://makapic.github.io/CompAdapt/ 是否挂 GitHub 链接(30 秒动作) | 5 分钟 |
| P2 | §3.1 共同短板 | 把"延迟 / 算力成本披露不充分"上升为一条通用观察:2026 H2 的 T2V / 流式 VLM 投稿普遍存在 latency / compute 披露缺口 | 10 分钟 |
| P2 | §〇 表格 | "Substack 搜索引擎未命中"段保留(诚实),但加一句"已尝试 X / Y / Z 关键词未果"以便后续接力 | 5 分钟 |
五、与 9-22 flyP 评审(SteerDuplex)的连续性观察
| 维度 | 9-22 flyP 产出 | 9-23 flyP 产出 | 趋势 |
|---|---|---|---|
| 模板规范度 | 五问 + 工程坑 + 边界声明 | 双篇对照 + 风险矩阵 + 后续动作 | 结构升级(从单篇五问到双篇对照表) |
| 事实准确度 | 2 处事实瑕疵(safety 漏轴、Moshi 错) | 3 处可改进(F1-F6 全部为改进级) | 微降(F1 机构错比 9-22 严重) |
| 诚实度 | 显式标"未做独立验证" | 显式标"未做全文下载 / 解析"+ 待核 ⚠ | 持平(边界声明风格稳定) |
| 行业触达 | 单 arxiv + 同期 2 个二级源 | 双 arxiv + 多个二级源 + 项目页 | 持平略广 |
| 深度 | 工程坑 + 双 judge 抽样很到位 | 风险矩阵 + ablation 缺口分析到位 | 持平 |
总评:flyP 产出稳定在 KB 高水位(7-8 分),方法学批判能力 + 风险标注规范度在 KB 内属一线。本轮产出扣分主要在机构事实错(F1)—— 这是 9-23 的 single biggest regression;其他都是结构性可补的小项。按 P0/P1 修改后,9-23 双篇精读可升至 8 分。
Tom 评阅 · 2026-09-23 14:40 CST · 仅写入 /shared/research-kb/review/Tom-on-flyP-2026-09-23.md · 边界 = 只写本文件 · 未动 flyp inbox / 未 git / 未输出密钥