论文

OmniEdit-Bench:基于指令的视频编辑的综合基准

OmniEdit-Bench: A Comprehensive Benchmark for Instruction-based Video Editing

模型评测基准与评测资源

摘要

基于指令的视频编辑(IVE)是一个具有广泛应用的新兴领域,但评估编辑模型仍然具有挑战性。现有的基准受到两个主要限制:从图像编辑继承的任务覆盖范围有限,忽略了视频特定的维度;以及指标不足,无法衡量指令保真度,导致由于原始视频的强烈视觉先验而导致不正确的编辑获得高分。为了解决这些问题,我们为 IVE 引入了全面且结构化的基准。我们的基准测试将编辑任务分解为多个视频特定维度,包括空间、时间、音频和基于参考的编辑,超越了传统的帧级评估。它还区分显式和隐式指令,并结合基于推理的场景,以更好地反映现实世界的需求。此外,我们提出了一个评估框架,使用人类判断和最先进的视觉语言模型,从四个互补维度评估编辑质量:准确性、保存性、真实性和一致性。为了强调指令保真度,我们引入了一种准确性感知惩罚机制,该机制以准确性为条件限制其他分数,防止视觉上合理但不正确的编辑收到夸大的评估。对代表性开源和商业模型的大量实验表明,当前的 IVE 模型还远远不能令人满意。 OmniEdit-Bench 提供了一个全面且可靠的测试平台,用于评估基于指令的视频编辑,并提供对未来研究方向的见解。项目页面为https://omniedit-bench.github.io/。