论文

VEFX-Bench:通用视频编辑和视觉效果的整体基准

VEFX-Bench: A Holistic Benchmark for Generic Video Editing and Visual Effects

模型评测基准与评测资源

摘要

随着人工智能辅助视频创作变得越来越实用,指令引导的视频编辑对于完善生成或捕获的镜头以满足专业要求至关重要。然而,该领域仍然缺乏具有完整编辑示例的大规模人工注释数据集和用于比较编辑系统的标准化评估器。现有资源受到小规模、缺少编辑输出或缺乏人工质量标签的限制,而当前的评估通常依赖于昂贵的手动检查或不专门用于编辑质量的通用视觉语言模型判断。我们引入了 VEFX-Dataset,这是一个人工注释的数据集,包含 9 个主要编辑类别和 32 个子类别的 5,049 个视频编辑示例,每个示例都沿着三个解耦的维度进行标记:指令跟踪、渲染质量和编辑独占性。在 VEFX-Dataset 的基础上,我们提出了 VEFX-Reward,这是一种专门为视频编辑质量评估而设计的奖励模型。 VEFX-Reward 联合处理源视频、编辑指令和编辑后的视频,并通过序数回归预测每个维度的质量分数。我们进一步发布了 VEFX-Bench,这是一个包含 300 个精选视频提示对的基准测试,用于对编辑系统进行标准化比较。实验表明,在标准 IQA/VQA 指标和分组偏好评估方面,VEFX-Reward 比通用 VLM 判断和先前奖励模型更符合人类判断。我们使用 VEFX-Reward 作为评估器,对代表性商业和开源视频编辑系统进行基准测试,揭示了当前模型中视觉合理性、指令遵循和编辑局部性之间持续存在的差距。我们的项目页面是https://yangbogaobarry.github.io/VEFX-Bench/。