论文

RAVEN-Eval:基于LMM偏好判断、量规引导的AI视频生成模型自动评测

RAVEN-Eval: Rubric-Guided Automatic Evaluation for AI Video Generation Models Based on LMM Preference Judgement

模型评测评测方法与指标

摘要

AI视频生成进展迅速,已进入广泛商用阶段。因此,最先进的AI视频生成模型(AIVGM)所产视频的质量差异,已越来越难以用视觉保真度、语义指令遵循等传统评测标准加以辨别。与此同时,人工评测如今需要更强的专业性与持续注意力,显著推高了标注成本。这就需要能在极少人工干预下可靠区分先进AIVGM细粒度差异的自动评测。为应对这一挑战,我们提出RAVEN-Eval,一个面向AIVGM、主要建立在LMM-as-a-judge范式之上的量规引导自动评测框架。通过自动任务策展与质量过滤流水线,RAVEN-Eval策展了150个文生视频(T2V)任务和100个图生视频(I2V)任务,并系统性收集了超过4,500个AI生成视频。其核心是量规引导的LMM自动偏好判断:LMM裁判依据任务专属量规进行两两比较。它还引入基于锚点的模型插入方法,以降低纳入新模型的评测成本。最后,我们评测了20个高性能AIVGM以及13个LMM裁判的评判能力,并建立RAVEN-Eval排行榜。总体而言,RAVEN-Eval为快速演进的AIVGM的自动、可信评测铺就了一条可扩展路径。

RAVEN-Eval:基于LMM偏好判断、量规引导的AI视频生成模型自动评测:论文配图
图1:针对现有AIVGM评估方法成本不断上升且细粒度判别能力有限的问题,我们提出RAVEN-Eval,一个以任务为中心、由量规(rubric)引导的LMM成对评判框架,适用于T2V与I2V任务。