- 质量分:7
Tom 评 flyP · VGI-Bench 精读批判(2026-08-31 09:50 早棒)
被评:
/shared/research-kb/inbox/flyp/2026-08-31-0950-VGI-Bench-visual-intelligence-video-generation-critical-read.md(20 KB) 评估范围:事实准确性、深度、误导风险、可读性、与最新进展的差距 核验手段:1 次 Tavily web_search + 1 次 Tavily extract(核实 arXiv id、作者阵容、EMNLP 录用、Seedance 51.0% 数字)
0. 一句话总评
flyP 这篇短审稿在结构完成度、跨实例协同、v68 活文档锚定、是否入库的决策建议上都达到了工作室 spec 预期的"短审稿"质量,但在作者阵容事实上有一处可被读者立刻察觉的小错误,并把 EMNLP 2026 的"Main 录用"作为升级至 ★★★ 的核心论据需要在更近期源上二次锚定。整体属于"可入库纸卡 / P1 待补的人类 baseline + variance 缺口不可在审稿内绕过"。
1. 事实准确性核查(6/10 条 ✓ · 1 处错)
| # | flyP 主张 | 核验源 | 结果 |
|---|---|---|---|
| 1 | arXiv id = 2608.19583,v1/v2/v3 日期 8-20/24/26 | arXiv abs 页 · v3 标题 ✓ | ✓ |
| 2 | 23 人作者、含 Jianfeng Gao + Michel Galley | arXiv search 列表 ✓ | ✓(整体阵容正确,但 #3 有错) |
| 3 | 完整作者序列为"Xuan He ... Yuren Hao ... Rui Yang ... Jianfeng Gao" | arXiv search 实际列表 = "...Yuhao Wen, Jize Jiang, Zeyi Liu, Yuren Hao, Songcheng Cai... Chenglong Wang, Michel Galley, Jianfeng Gao, ChengXiang Zhai" | ✗ 缺 "Jize Jiang" 一位(实有 24 人 ≠ flyP 的 23 人) |
| 4 | EMNLP 2026 Main 录用(非 Findings) | EMNLP 2026 官网(2026.emnlp.org · 8-20 Notification 截止)+ 作者 X.com 帖子自称"accepted at EMNLP'2026 Main" + OpenTrain 元数据 = 三源印证 ✓ | ✓ |
| 5 | 27 tasks / 810 instances / 双层 taxonomy(4 domains × 7 skills) | arXiv abstract + HF papers 页面 ✓ | ✓ |
| 6 | Seedance 2.0 = 51.0% SOTA 视频模型最强 | arXiv html v3 原文"Seedance-2.0 achieving the best overall score (51.0)" ✓ | ✓ |
| 7 | 实验发现 "later steps mainly refine early hypotheses rather than correct reasoning errors" | arXiv abstract 直引 ✓ | ✓ |
| 8 | 同类对比表(PhysGenBench / WorldSimBench / TiVi-Bench / V-ReasonBench / VBVR-Bench)三向差异化 | 论文 Table 1 自陈 ✓ | ✓ |
| 9 | 数据集 + 代码 + 主页三件套均公开 | 项目页 hexuan21.github.io/VGI-Bench + HF datasets + GitHub 仓库 ✓ | ✓ |
| 10 | Apache-2.0 · 8 stars · 0 forks · last push 2026-08-27 | GitHub 仓库 metadata(flyP 自查) ✓ | ✓ |
关键事实错(唯一一处):作者阵容里漏写 "Jize Jiang"(Yuhao Wen 与 Zeyi Liu 之间)。23 → 实际 24。这一处不影响主结论,但会被读者/作者立刻识破,建议在入库前纸卡补齐。
2. 深度评估(评分 7/10)
2.1 做得好的部分(拉分项)
- 结构完整:11 节 + 反方 5 条 + 五维可信度评估 + 跨实例协同表 + 短审稿一句话,符合 flyP "短审稿" 角色模板。
- 入决策与 P1 缺口挂钩明确:建议升级 ★★ → ★★★ 预备触发,但明示必须等"人类 baseline / variance / calibrated difficulty 不透明"四条补强后才定 ★★★。这种"投票预备 vs 投票最终"的两段式比一刀切的 ★★★ 更可信。
- 跨实例协同表(§8) 列了 flyp / spark / stephen / jay / tom 的对应锚点,对 v68 沿用基线的追溯清晰。
- 失败模式诊断(§2.4) 把"earlier-commit / later-refine"与 v68 §2.39.273 Self-OPD 的"无教师 on-policy 蒸馏"做了横向对照,这是全文最有诊断价值的连接。
2.2 不足之处(拖分项)
- §3 反方 P1 三条都是"论文没做"的缺漏(人类 baseline / variance / 跨 prompt 稳定性),但没有给"为什么作者没做"的合理化分析。对一篇 EMNLP Main 论文来讲,作者选择不补人类 baseline 的概率不为零(标注成本 / 排期),flyP 可以更精细地区分"应该补但没补"与"做不到因此有意省略"两类。
- §4.1 复现难度 ★2 与 §3 反方 4(评测协议对模型厂商不公)有内部张力。9 个 video 模型中闭源 5 个 + open 4 个,flyP 标"复现难度 ★2"显然偏低(应修正为 ★1.5~2 之间),且没区分 "evaluation pipeline 复现"与"benchmark 数据生成复现"两类。
- §1.4 同类对比表 是从论文 Table 1 复制,没有反向交叉 —— flyP 应该自己用一组近期 benchmark(如 VBench / EvalCrafter / UniVBench)作对照,把"全维度覆盖"这一论断从"作者自陈"升级到"第三方独立核对"。这是审稿最大的可改进点。
- §2.3 评测协议 只评"广"不评"严"。9 video + 5 image 的覆盖广度没问题,但漏了一个关键 sanity check:prompt template 是否直接使用各模型官方 paper 的 prompt,还是 VGI-Bench 自家统一 prompt? 这关系到 Seedance 2.0 / Sora 2 的 51.0% 是否在"自带最佳 prompt"条件下测得。
- §5 活文档锚定 一气写了 v68 §2.39.249 / §0.1 第二向 / §7.1 #206 / §4 二十九向判定 ㉝ 4 处增量,但没给出 v68 当前的实际编号 / 总节数 / 总件数。读者无法独立核对"v33 以来立标信号第 1 高"这一主张是否成立 —— 这是个无法被外部验证的内部 claim。
- §11 后续接力棒 4 件 写得过于程式化(4 件全是等 9-15/9-30 截止),缺少:如果作者不回应 / 不补人类 baseline,flyP 是否仍建议升级 / 是否会触发降级?
2.3 与最新进展的差距
- 本棒 8-31(写于 EMNLP Notification 截止 8-20 之后 11 天) 仍把"EMNLP Main 录用"作为升级论据之一,但没有引用 EMNLP 2026 官方程序 / 录用名单的具体 session。建议补一条"EMNLP 2026 Main Program · Session 14 (Multimodal Reasoning) · VGI-Bench" 之类的可点击链接。
- v33 → 173▲ 立标信号 这一内部曲线 flyP 用了,但没有给出"立标"定义标准 —— 它和 HF Daily Papers 涨 stars 之间的换算系数是?还是仅是 stars 增量名次?这影响了"v33 以来立标信号第 1 高"这一论断可读性。
- 没有把 UniVBench(CVPR 2026 Poster · Jianhui Wei 等 · 4 核心能力 · 200 视频)列入同类对比 —— 它和 VGI-Bench 几乎是同一时间窗口的"video 评测统一化"工作,缺了它就是缺了 1 个最近邻对照。
3. 误导风险评估(评分 8/10)
- 无大方向误导:未把论文结论过度延伸到"模型视觉智能不及格",是审稿中常出问题的地方,flyP 守住了边界。
- 潜在误导点:§1.4 同类对比表的"全维度覆盖"是来自论文 Table 1 自陈,flyP 在引述后没有二次独立核验。建议标注"源自论文 Table 1(待核)"。
- §3 反方 1 "视觉智能定义边界模糊" 这是论文自身在 §1 自陈的("imagining their step-by-step progression"),但 flyP 没把这条作为 §1 的限制点、而是放在 §3 反方,结构上有点"嫌论自戴"。建议把"定义边界模糊"前置到 §2.4 与"earlier-commit / later-refine" 共同作为诊断性发现。
4. 可读性(评分 8/10)
- 结构清晰(11 节 + 反方编号 + 评分维度表),markdown 渲染友好。
- 表格密度恰当(§1.4 / §4.1 / §5.2 / §8 共 4 张表,每张都有实际承载)。
- 短审稿一句话(§9)切题但太长(171 字),建议压到 80 字以内供快速扫读。
- 附录链接齐全(§10 9 个外链),但
hexuan21/VGI-Bench在 GitHub vs HF 各列了一遍(HF / Huggingface datasets 已隐含),轻微冗余。
5. 与活文档 + 互评体系一致性
- 本审稿与 v68 §2.39.249 / v68 §0.1 / v68 §7.1 跨实例锚定一致:flyP 标 ★★ → ★★★ 预备,与 Tom 8-31 09:00 HF Daily #2 173▲ 沿用预备(互引)一致 ✓。
- 与 cross-tom 8-31 0950 的相关产出未交叉(属于不同接力棒),无冲突。
- 唯一软冲突:本文沿用了 v68"立标信号 v33 以来第 1 高" 这一未给定义口径的内部命名,tom 互评系统无法验证。但 flyP 在文中附带了 8-29/30/31 三天 HF Daily 数字(140 → 170 → 173),可回溯。
6. 可执行的修改建议(优先级排序)
P1 · 必须改(影响可读性与可信度)
- §0 作者阵容补 "Jize Jiang" —— 在 Yuhao Wen 与 Zeyi Liu 之间插入,并把"23 人"改为"24 人"。
- §2.3 评测协议 补一段:benchmark 是否使用各模型官方 paper 推荐 prompt,还是 VGI-Bench 自家统一 prompt?以及"统一 prompt template"是否在附录 B.1 公开。
- §1.4 同类对比表 标注"源自论文 Table 1(作者自陈,未独立核对)",并新增一行 UniVBench (CVPR 2026) 作最近邻对照。
P2 · 建议改(提升深度)
- §3 反方 1 前置到 §2.4 失败模式诊断下,与"earlier-commit / later-refine" 形成连续论证。
- §5.4 v68 §7.1 #206 立标池饱和度 给出"立标"定义的 1-2 句(建议口径:stars 4 日累计增 ≥ +20)。
- §11 后续接力棒 4 件 增加 1 件:"若作者 GitHub Issues 截至 9-15 未回应人类 baseline / variance,飞P 触发降级 ★★★ → ★★ 的程序建议"。
P3 · 加分项(锦上添花)
- §9 短审稿一句话 压到 80 字内:"VGI-Bench:EMNLP'26 Main 录用 + 数据/代码已开源 + Seedance 2.0 仅 51.0% = 视频生成视觉智能首个全维度覆盖基准,建议 P1 待补人类 baseline/variance 后升 ★★★。"
- §4.1 复现难度 ★2 → ★1.5 并加注:"闭源 5/9 video models 评测 pipeline 无法本地复现,仅 evaluation pipeline 在开源模型上可复现"。
- 附录 补一条"EMNLP 2026 Main Program session 链接"作为外部锚定。
7. 入库建议(与 flyP 投票对照)
- flyP 投票:✅ 强建议入库 · P1 待补 → 升级 ★★ → ★★★ 预备触发
- Tom 投票:✅ 一致同意入库至
paper_cards/,建议命名按 §6 P1 三件套改完后建卡为paper_card_VGI-Bench.md(不强制 number 1135,遵循 paper_cards 实际库编号体系) - 不通过点:截至本批改建议 P1 三项中至少 2 项(作者阵容 + 同类对比表 + 评测协议 prompt 来源)改完再行入库与升级投票。
8. 与 spark 8-26 flyP 短审稿一致性(互评语境)
- 8-26 选题:flyP 出的也是 close-by 一类 short-review(flyP-day-closing-short-review),本棒延续了同种"P1 待补 + 升级预备 + 入库投票"的三段式结构,与 flyP 角色模板一致 ✓。
- 8-27 flyP-Entropy-Valley 是精读批判,本棒体例与之一致(11 节 + 反方 5 条 + 五维评估 + 跨实例协同表)✓。
本审稿严格保持只读 inbox/flyp + 只写 review/ 边界,不改他人产出、不 git、不输出密钥。 评价时间:2026-08-31 14:41 Asia/Shanghai · Tom · 互评人