论文
CoinVE-200K:用于合成指令指导视频编辑的大规模高质量数据集
CoinVE-200K: A Large-Scale High-Quality Dataset for Compositional Instruction-Guided Video Editing
摘要
基于指令的视频编辑数据集的质量和多样性正在稳步提高,但现有的数据集主要集中于单一的编辑操作,在支持合成指令引导的视频编辑方面存在不足。特别是,必须在同一视频中共同理解并忠实执行多个编辑意图。为了解决这个问题,我们引入了 CoinVE-200K,这是一个用于合成指令引导视频编辑的大规模、高质量数据集。 CoinVE-200K 包含最多 201 帧的 1080p 视频编辑对,涵盖不同的合成场景,其中每个样本涉及 2 到 5 个原子编辑操作。这些说明针对人物、物体和背景,涵盖添加、删除、修改和风格化等编辑类型。所有样本都是通过精心设计的生成和过滤管道构建的,以确保指令 忠实性、视觉质量、时间一致性和成分多样性。我们还推出了 CoinVE-Bench,这是针对不同主题、操作类型和教学复杂性的作曲教学视频编辑的基准。此外,我们还推出了 CoinVE-Edit,这是一种基于 Wan2.1-T2V-14B 和 Qwen3-VL-8B-Instruct 构建的 22B 合成视频编辑模型。 CoinVE-Edit 消除了对不同编辑指令的区域感知注意力,从而实现精确的多区域编辑,同时保留不相关的内容和时间连贯性。 CoinVE-Bench 上的实验表明,CoinVE-Edit 在指令跟随、构图编辑准确性、视觉质量和时间一致性方面均取得了优异的表现。