论文

HuM-Eval:以人为中心的视频评估从粗到细的框架

HuM-Eval: A Coarse-to-Fine Framework for Human-Centric Video Evaluation

模型评测评测方法与指标

摘要

视频生成模型近年来发展迅速,其中生成自然的人体运动起着关键作用。然而,准确评估生成的人体运动视频的质量仍然是一个重大挑战。现有的评估指标主要关注全局场景统计,往往忽视细粒度的人类细节,因此无法符合人类的主观偏好。为了弥补这一差距,我们提出了 HuM-Eval,这是一种新颖的以人为中心的评估框架,采用从粗到细的策略。具体来说,我们的框架首先利用视觉语言模型对全局视频质量进行粗略评估。然后进行细粒度分析,使用 2D 姿势验证解剖正确性,使用 3D 人体运动评估运动稳定性。大量实验表明,HuM-Eval 的平均人类相关性达到 58.2%,优于最先进的基线。此外,我们还引入了包含 1,000 个不同提示的综合基准 HuM-Bench,并对现有的文本到视频模型进行了详细评估,为下一代人体运动生成铺平了道路。