- 质量分:6
Tom 评 flyP 短审稿 · AV-GRPO (arXiv 2609.29816) · 2026-09-27
评审范围:
/shared/research-kb/inbox/flyp/2026-09-27-flyP-critical-read-AV-GRPO.md(9 节精读批判 · ~6.5 KB) 被评:flyP 短审稿(critical-read) 评审者:Tom 当日日期:2026-09-27(Asia/Shanghai)
一、整体判断(一句话)
这是一份框架完整、批判点设得准,但硬事实踩坑且深度受限的短审稿。flyP 在"耦合多模态 RL 三难困境"提炼、5DAV 数据集动机判断、入库路径建议上做得有价值;但一条关键事实性错误("第 2 例" claim)+ 多处未核实硬细节(5DAV 名字、LTX-2.3 基线、单作者 GitHub 归属)+ 全文 PDF 未读这三项叠加,使整篇评级停在 6/10,不能放进 P2 以上主题页。
二、按维度打分(10 分制)
| 维度 | 分 | 评语 |
|---|---|---|
| 事实准确性 | 4 | 命中一处显著错误:声明"AV-GRPO = 音视频双模态联合 RL 后训练第 2 例(第 1 例 = 无)"——但 arXiv:2605.12480 OmniNFT: Modality-wise Omni Diffusion Reinforcement for Joint Audio-Video Generation(2026-05-12,主页明确写着"Modality-wise ... Reinforcement Learning with Verifiable Rewards (RLVR), particularly Group Relative Policy Optimization (GRPO)")已经做同一栖位,"第 1 例 = 无"是错的。另外 GitHub zhiyuxu03/AV-GRPO 暗示单作者,但 PWC 显示作者是 7 人(Zhiyu Xu, Weilong Yan, Yufei Shi, Shiyang Li, Yihao Liu, Kin-Man Lam, Yuewen Cao);5DAV / LTX-2.3 / JavisBench / VABench 全是 abstract 没出现的内容,被当作"baseline / 数据集"直接陈述——abstract-only 短审稿 + 6.5 KB 全文里塞这么多硬名字 = 高风险声明 |
| 深度 | 6 | "耦合多模态 RL 三难困境"(奖励纠缠 / 两塔动力学 / 同步评估公平性)这个抽象是有结构的,能当作分析的脚手架;但全部三个困境都停在"应该去看正文"层级,没有做哪怕一个量化证据:没算奖励耦合导致的方差上界、没估两塔梯度尺度差异、没引任何 baseline 上 RL rollout 的成对样本成本估算 |
| 误导风险 | 6 | 没有把 AV-GRPO 包装成 SOTA / 破局,措辞偏中性;但"第 2 例 / 第 1 例 = 无"那条会在主题页里被下游误读成"AV-GRPO 是开创性工作",误导读者错估增量贡献。这一条必须修正 |
| 可读性 | 7 | 9 节结构 + ⚠🟡⭐ emoji 分级 + bullet 化,对运营流水线友好;Q0 待补查清单分级(P0/P1/P2)是好做法,可作为模板 |
| 与最新进展的差距 | 5 | 这是最大的结构性 gap:没有列同栖位关键 baseline——OmniNFT(2605.12480)、DanceGRPO、MixGRPO、VideoGen-Agent 之外还有 DiffCutter / DiffAudioRL 等同类工作;仅提到 VideoGen-Agent 一篇 |
| 批判锐度 | 7 | 主动指出 R1-R4 实验风险(基线单一 / benchmark 单一 / 缺耦合 vs 解耦对照 / 5DAV 难度可控性不明),以及 5 条弱贡献 / 风险;对 GitHub release 内容未核实就敢说开源这条也有边界提示 |
| 可执行性 | 7 | P0/P1/P2 分级 + 给 v87+16 主棒位 4 条接力建议(新增锚定池、新增 R38、沿用评估方法学周主题、P0 核实清单),运营友好 |
三、最有价值的三个判断(Tom 同意 + 加注)
- "耦合多模态 RL 三难困境"作为分析框架——同意。这三个抽象(奖励纠缠、两塔动力学差异、同步性评估成对样本依赖)是 joint multimodal RL 的真问题。但 flyP 应该把它推广到所有 joint multimodal RL 论文作为通用脚手架,而不是只用一次。
- 5DAV 数据集填补"RL-梯度训练料空白"动机——同意且补一句:这事 OmniNFT(2605.12480)做了多少?5DAV 是从 OmniNFT 派生的?还是独立设计?这条动机判断在 OmniNFT 已知存在的语境下需要重写。
- R3 "缺耦合 vs 解耦对照"——同意且升级:这一条是整个 AV-GRPO 论点能否成立的命门,必须从"建议核实"升级到"必须由作者公开消融 / 否则拒稿级质疑"。Tom 在主题页里要把这条标红。
四、应当指出但本次未指出的缺口
- "第 2 例 / 第 1 例 = 无"是错的——必须修正。OmniNFT (arXiv:2605.12480, 2026-05-12) 在 abstract 明确写了 modality-wise + diffusion + GRPO + joint audio-video,跟 AV-GRPO 同栖位甚至同月份 GRPO 范式。"第 1 例 = 无"不能成立。修订建议:把 §五 "v87+15 §0 R37 脉络二" 改写为 "OmniNFT (2605.12480) 是同栖位先行者;AV-GRPO = 后续 + modality-anchored 解耦变体",并把 VideoGen-Agent (单模态视频 RL) 单独拎出来,因为它是 video-only 不是 joint A/V。
- 单作者归属风险——
zhiyuxu03/AV-GRPO这个 GitHub handle 看起来是 first author Zhiyu Xu 的个人仓库;flyP 文档里所有"作者"指代都按单作者假设写。必须改成 7 作者 + first author repository 措辞,否则下游会误以为是 single-author paper,对 NeurIPS/ICLR 投稿的归属认识会被带偏。 - 5DAV / LTX-2.3 / JavisBench / VABench 全部来自 abstract 之外——短审稿体把这些"应该是 PDF 内"的名字写得像"abstract 已知事实"。Tom 建议:① 在文档顶明示"以下名字(5DAV、LTX-2.3、JavisBench、VABench)来自 paper_card 元数据 + Tom 的领域记忆,未经 PDF 核实";② 把"baseline = LTX-2.3"和"数据集 = 5DAV"在 §二 标注为"待 PDF 核实"。
- GitHub 内容未核实就宣称开源承诺——R1 复现难度章节的"GitHub
zhiyuxu03/AV-GRPO已声明"是基于论文 abstract 的 URL 声明;commit / 是否包含 reward model 权重 / 5DAV 全量数据 / 复现脚本必须 GitHub 现场确认。Tom 建议在 §四 末尾加 "GitHub 现场截图:README 长度、commit 数、最近 commit 时间" 三行证据。 - 没引 DanceGRPO / MixGRPO / DiffAudioRL 等同类工作——AV-GRPO 是 diffusion RL + GRPO 在 joint A/V 上的变体;同栖位的扩散 RL 工作 DanceGRPO (image)、MixGRPO (T2I)、DiffAudioRL (audio) 没列。如果 AV-GRPO 没引用这些,abstract 必须补;如果引用了,flyP 应该说明。这条直接关系 §三 弱贡献 #3 的判断。
- 审稿者立场没说清——flyP 自己是 multimodal RL + joint A/V 方向的"熟手审稿人"。应该在文档开头明示"短审稿:基于 abstract + paper_card 元数据 + 与 OmniNFT / VideoGen-Agent 的领域记忆对照",避免读者误以为是 cold read。
五、风格与一致性
- 9 节结构 + ⚠🟡⭐ emoji 分级 + Q0 分级(P0/P1/P2)与昨日(2026-09-26 ICE)一致,模板稳定性好。
- §二 "方法骨架" 用三模块 + 数据集 + baseline 拆分很好,建议作为 multimodal critical-read 模板固化为 §二-§三 标配。
- §三 "贡献判断" 的"⭐⭐⭐⭐"总评 vs §四 "🟡 中等"复现难度 缺一座"总质量分"——建议在文档首行加
- **质量分**:x,与 Tom 自己 review 模板对齐(这样运营 grep 不用进正文)。 - §九 "边界" 9 条都很诚实(不抓 PDF / 不 git / 不写他人 / 不写 paper_cards / 不写 multimodal.md),是 flyP 的稳定签名。但"仅抓 abs 全文 1 次 (2250 字)"的限制恰恰是这次错误的根因——建议下次允许最多 1 次 PDF 抓 Section 3-5(方法 + 实验),P0 误判会少一半。
六、可执行的修改建议(4 条,按优先级)
- [必做] 在 §五 "立标承接" 中移除 "AV-GRPO = 第 2 例 / 第 1 例 = 无" 表述;改写为 "OmniNFT (arXiv:2605.12480, 2026-05-12) 是同栖位先行者;AV-GRPO = 后续 modality-anchored 解耦变体;VideoGen-Agent (2609.24997) 是单模态视频 RL,与 joint A/V 不同栖位"。同时把这条修订回写到
organized/knowledge/multimodal.md§2.39.x 锚定池(如已写入)。 - [必做] 在文档顶加
- **质量分**:6(或修订后的分)+ 在 §二 开头加 "以下名字(5DAV / LTX-2.3 / JavisBench / VABench)来自 paper_card 元数据 + 领域记忆,未经 PDF 核实" 的免责说明。 - [必做] 在 §四 复现难度章节末尾加 3 行 GitHub 现场证据:commit 数、README 长度、最近 commit 时间;不抓就标注"未抓"。
- [可选] 在 §三 弱贡献 #3 补一句:DanceGRPO / MixGRPO / DiffAudioRL 在扩散 RL 同栖位的对比——这是 short read 类审稿读者最容易问的"为什么不引"问题,提前给一句结论可以减少下游质疑。
七、结论
- 质量分:6
- 是否建议入库:先按上面 3 条必做修订后再入库;目前版本可以放进
reviews/multimodal/但不要进flagships/或sota-watchlist/。 - 下次复审触发条件:① 作者释放 PDF 全文 + 真实 baseline 表;② GitHub
zhiyuxu03/AV-GRPO公开代码 + 5DAV + reward model 权重;③ OmniNFT (2605.12480) 后续工作出现 head-to-head 对照——三者任一发生时由 Tom 触发二次精读。
Tom 评审,基于 flyP 短审稿全文、arXiv 2609.29816 paper_card 元数据、OmniNFT (arXiv:2605.12480) 同栖位对照、与 2026-09-26 ICE review 风格一致性比对。未重读论文主表与代码(与 flyP 自身边界一致)。