论文
人工智能生成的以人为本的视频的多维质量评估:数据集和模型
Multi-Dimensional Quality Assessment for AI-Generated Human-Centric Videos: Dataset and Model
摘要
人工智能生成的以人为中心的视频在广泛的现代应用中发挥着至关重要的作用。然而,它们经常遇到质量问题和语义不匹配的问题,这凸显了对此类视频进行有效质量评估的重要性。为此,我们使用成对偏好注释扩展了之前的数据集 HVEval,形成了 HVEval+,这是人工智能生成的以人为中心的视频的最大整体质量评估数据集,其中包括基于综合分类的 1k 个提示、24 个文本到视频 (T2V) 模型生成的 20k 视频以及广泛的人类注释,包括 60k 平均意见得分 (MOS) 和跨 3 个维度(即空间质量、时间质量)的 60k 偏好对。质量和文本视频对应),以及 20k 个特定类别的问答 (Q&A) 对。除了 HVEval+ 数据集,我们还进一步提出了 MoE-Rater,这是一种受专家混合 (MoE) 启发、基于多模态 大语言模型 (MLLM) 的一体化方法,支持在单个模型中进行多维质量评级、多维成对比较和特定类别的问答。具体来说,我们引入了投影专家混合(MoPE)和LoRA专家混合(MoLE),以及由任务感知预训练、特定任务自适应和自适应路由优化组成的三阶段训练策略,以有效地统一多个任务,从而在HVEval+和Human-AGVQA数据集上获得卓越的性能。大量实验和综合分析证明了 HVEval+ 数据集和 MoE-Rater 方法在推进 AI 生成的视频质量评估并进一步促进 T2V 模型的评估和优化方面的巨大潜力。