论文

VEBench:针对真实世界视频编辑的大型多模态模型进行基准测试

VEBench:Benchmarking Large Multimodal Models for Real-World Video Editing

模型评测基准与评测资源

摘要

现实世界的视频编辑不仅需要电影技术的专业知识,还需要多模式推理来选择、对齐和组合素材以形成连贯的叙述。虽然最近的大型多模态模型(LMM)在一般视频理解方面取得了显着进展,但它们在多视频推理和操作编辑工作流程方面的能力在很大程度上仍未得到探索。我们推出 VEBENCH,这是第一个综合基准测试,旨在评估现实视频编辑场景中的编辑知识理解和操作推理。 VEBENCH 包含 3,900 个高质量编辑视频(超过 257 小时)和 3,080 个经过人工验证的 QA 对,通过三轮人工-AI 协作注释管道构建,确保精确的时间标记和语义一致性。它具有两个互补的 QA 任务:1)视频编辑技术识别,评估模型使用多模态线索识别 7 种编辑技术的能力; 2) 视频编辑操作模拟,通过要求从多个候选者中选择相关剪辑并进行时间本地化来模拟真实世界的编辑工作流程。专有(例如 Gemini-2.5-Pro)和开源 LMM 的广泛实验揭示了当前模型性能与人类水平的编辑认知之间存在巨大差距。这些结果凸显了将视频理解与创造性操作推理联系起来的迫切需要。我们设想 VEBENCH 成为推进智能视频编辑系统和推动未来复杂推理研究的基础。