论文
FIRM-Video:在评分之前检查可靠的文本到视频奖励模型
FIRM-Video: Check Before You Score for Reliable Text-to-Video Reward Modeling
摘要
可靠的奖励模型对于文本到视频的评估和对齐至关重要。然而,评估准确性和推理效率之间的权衡对训练监督的质量提出了很高的要求。现有的方法往往依赖于具有固定规则或开放式推理的整体判断,导致检查不完整、论证不忠实和归因纠缠。我们引入了 FIRM-Video,这是一个基于先检查后评分原则的统一检查表驱动的数据构建框架:构建特定于维度的检查表,根据时间视觉证据验证每个标准,并仅聚合经过验证的决策。对于指令遵循,FIRM-Video 将提示分解为加权原子要求;对于世界一致性,它构建了基于可见实体和行动的及时校准、针对特定目标的检查;对于感知质量,它应用了视觉缺陷的通用分类法。验证的标准和分数进一步转化为自然语言分析,以进行端到端奖励建模。随后,我们构建了 FIRM-Video-90K,其中包含 29,348 个视频中的 88,044 个特定维度实例,并引入了 FIRM-Video-Bench,其中包含 250 个视频中的 750 个逐点人类注释。基于 Qwen3-VL 的 FIRM-Video-8B 在 FIRM-Video-Bench 上实现了最佳的总体 MAE,同时在三个视频生成器的 Best-of-8 采样中始终提供最高的 VBench 总分、质量和语义分数。