论文

Artifact-Bench:评估 MLLM 检测和评估 AI 生成视频的伪影

Artifact-Bench: Evaluating MLLMs on Detecting and Assessing the Artifacts of AI-Generated Videos

模型评测基准与评测资源

摘要

最近的视频生成模型极大地提高了人工智能生成视频的真实感,但其输出仍然表现出时间不一致、结构扭曲和语义不连贯等伪影。虽然多模态 大语言模型 (MLLM) 显示出强大的视觉理解能力,但它们感知和推理此类伪影的能力仍不清楚。现有的基准通常缺乏对伪影感知感知和细粒度诊断推理的系统评估,尤其是在真实感内容之外的各种人工智能生成的视频领域。为了解决这一差距,我们引入了 Artifact-Bench,这是一个用于评估 MLLM 在 AI 生成的视频伪影检测和分析方面的综合基准。我们首先建立了现实主义文物的三级分层分类法,涵盖真实感、动画和 CG 风格的视频。基于这种分类法,Artifact-Bench 定义了三个互补的任务:真实视频与人工智能生成的视频分类、成对真实性比较和细粒度伪影识别。对 19 个领先 MLLM 进行的实验揭示了伪影感知和推理的巨大局限性,许多模型在具有挑战性的环境中接近随机甚至低于随机的性能。我们进一步观察到 MLLM 判断与人类感知偏好之间存在显着偏差,凸显了它们作为人工智能生成视频真实感的一般评估者的可靠性有限。