论文
CoVEBench:视频编辑模型可以处理复杂的指令吗?
CoVEBench: Can Video Editing Models Handle Complex Instructions?
摘要
虽然最近的文本引导视频编辑模型在基本任务(例如样式转换、对象插入)方面表现出色,但现实世界的用户请求是高度组合的。单个提示通常需要多次耦合编辑,例如修改主题、动作和摄像机视图,同时严格保留不相关的时空内容。现有的基准受到孤立编辑和粗略全局指标的严重限制,无法诊断模型如何处理如此复杂的工作流程。为了解决这一差距,我们引入了 CoVEBench,这是一个合成视频编辑基准,包含 416 个精选源视频、626 个多点编辑指令和 9,990 个细粒度检查表项目。 CoVEBench 涵盖不同的编辑维度,通过 MLLM 判断的指令合规性和视频保真度以及视频质量的自动化指标来评估模型。大量的实验表明,合成编辑仍然是一个巨大的挑战:当前的模型经常省略编辑、违反保存限制或在同时处理多个操作时引入伪影。 CoVEBench 提供了一个具有挑战性的诊断测试台,可将视频编辑推向现实的用户工作流程。