FIRM-Video: Check Before You Score for Reliable Text-to-Video Reward Modeling
- 关联论文:2608.21839
- 作者:Tom
- 更新:2026-08-27
一句话结论
FIRM-Video 通过"先核查后评分"原则,将 T2V 奖励模型从不可靠的整体评分,变为可验证的维度级清单核查,在精度与效率之间找到了更稳固的平衡点。
解决什么真问题
Text-to-Video(T2V)模型的评估长期依赖两种极端路线:一是基于固定评分规则的整体裁判(如 VBench),二是端到端开放推理(如 LLM-as-Judge)。前者检查维度单一、归因纠缠;后者虽然灵活但推理成本高,且存在"评分正确但理由不忠实"的问题——模型给高分但说不出为什么,导致下游 RLAIF 训练信号含噪、Alignment 效果不稳定。
FIRM-Video 指出根本问题在于:训练监督信号本身不可靠。如果奖励模型不能诚实地说清楚"哪个像素/哪个动作不对",用它来指导模型 Alignment 就等于用错误的罗盘航行。
核心方法
FIRM-Video 的设计哲学是"Check Before Score"——先验证每一个维度,再汇总。
三个核查维度:
-
Instruction Following(指令遵循):将 prompt 分解为带权重的原子需求(atomic requirements),逐条核查视觉证据是否满足每个原子项,而非直接给整体分。
-
World Coherence(世界一致性):针对每个视频中的可见实体和动作,构建 prompt-calibrated、target-specific 的检查清单。这些检查基于视觉证据而非语言先验。
-
Perceptual Quality(感知质量):应用通用的视觉缺陷分类法(taxonomy),系统性地核查伪影、闪烁、模糊等缺陷。
关键机制:
Prompt → Checklist Decomposition → Dimension-specific Verification → Verified Score + Analysis
Verified criteria + scores 进一步转换为自然语言分析(natural-language analyses),用于端到端 reward modeling 的训练信号。
数据集: - FIRM-Video-90K:88,044 个维度级实例,来自 29,348 个视频 - FIRM-Video-Bench:750 个点级人工标注,覆盖 250 个视频
模型:基于 Qwen3-VL 构建 FIRM-Video-8B
关键实验与数据
在 FIRM-Video-Bench 上的主要结果:
- MAE(Mean Absolute Error):FIRM-Video-8B 达到最佳整体 MAE(原文未给出具体数值)
- VBench 采样(Best-of-8):在三个视频生成器上,FIRM-Video-8B 一致性地取得最高 VBench Total、Quality 和 Semantic Scores
⚠️ 存疑:原文 abstract 未给出 MAE 数值,亦未列出 Baseline 具体对比数字,依赖 abstract 口径无法核验精确性能数据。
实验覆盖三个视频生成器(具体名称原文 abstract 未列出)。
亮点与局限
亮点: - Check-before-score 原则从机制上解决了"评分不忠实"问题——先验证再评分,而非先评分再事后解释 - 维度级分解使 Reward Model 本身可解释:归因从整体变成原子级 - 覆盖三大维度(Instruction Following / World Coherence / Perceptual Quality),覆盖面较全面 - 数据集规模可观(90K 实例,250 视频人工标注)
局限: - 依赖 Qwen3-VL 作为基础模型,对其他 LLM/VLM 的迁移性未充分验证 - FIRM-Video-90K 是合成数据集,核查清单本身的质量取决于 LLM 的分解能力,存在错误传播风险 - 原文 abstract 未提及代码/权重是否开源 - World Coherence 核查依赖"可见实体和动作",对第一人称/遮挡严重场景可能失效
对工程落地的启发
-
RLAIF 训练数据构建:做 RLHF/RLAIF 时,FIRM-Video 的核查-评分两阶段思路可直接移植:先用规则/小模型做维度核查,再用核查信号训练奖励模型,比直接让 LLM 打分更可靠。
-
视频生成质量评估:对视频生成 pipeline,可在推理时嵌入 FIRM-Video 的维度核查表,作为 Best-of-N 采样的评分器,提升选中高质量视频的概率。
-
细粒度 Alignment:如果目标是让模型遵循特定指令(比如"人物转头看窗外"),可以在 FIRM-Video 的原子需求分解框架上构建定制化核查清单。
-
⚠️ 注意事项:部署前需验证 FIRM-Video-8B 在目标视频分布上的 MAE 是否与 FIRM-Video-Bench 报告一致;跨域泛化性能未充分验证。
与同方向工作的关系
| 工作 | 方法 | 优势 | 局限 |
|---|---|---|---|
| FIRM-Video(本篇) | Checklist-driven, check-before-score | 可验证、归因清晰 | 依赖 LLM 分解质量 |
| VBench | 固定评分规则整体裁判 | 效率高 | 维度单一、归因纠缠 |
| LLM-as-Judge | 端到端开放推理 | 灵活性高 | 推理成本高、理由不忠实 |
| VideoReward | 端到端奖励模型 | 效率高 | 不可解释 |
FIRM-Video 处于 VBench(规则驱动)和 LLM-as-Judge(端到端)之间——保留维度可解释性,同时用 LLM 做核查生成。
适合谁读
- 视频生成团队:需要构建可靠评估体系的研究者和工程师
- RLAIF/RLHF 研究者:关注训练信号质量的改进方向
- 多模态评估研究者:FIRM-Video 的 Checklist 分解框架有跨模态迁移潜力
- VLM 应用开发者:需要细粒度视频质量归因工具的实践者
⚠️ 自检栏:机制 N 段(√ 核查-评分两阶段 + 三个维度分解)/ 工程 M 段(√ 数据集构建方法 + Qwen3-VL-8B 实验)/ ⚠️ 数字核验(⚠️ abstract 未给出 MAE 数值 / VBench 分数未核实)/ 私域五维 SUM ≤ 3(✓ 0)/ CJK 字数 ≤ 4000(待实测)