论文

RefVideo-6M:用于教学视频编辑的可靠的基于参考的数据集

RefVideo-6M: A Reliable Reference-Based Dataset for Instructional Video Editing

模型训练合成数据

摘要

视频编辑的最新进展很大程度上是由大规模基于指令的数据集推动的。然而,现有数据集仍然面临两个关键限制。首先,目标视频通常是通过自动编辑模型生成的,这可能会引入可见的伪影和不可靠的监督信号。其次,大多数公共数据集主要依赖于文本指令,而缺乏对于精确、身份保护和可控编辑至关重要的视觉参考。为了解决这些限制,我们引入了RefVideo-6M,这是一个大规模参考引导编辑数据集,包含 500 万个视频编辑样本和 100 万个图像编辑样本。为了确保可靠的监督,我们的数据集使用了一个构建管道,将无伪影的真实视频视为编辑目标,并与多个编辑专家一起生成经过质量过滤的输入条件。此外,它还提供约 600 万个视觉参考,涵盖不同的参考类型和编辑场景,从而使模型能够学习除纯文本指令之外的细粒度视觉对应。基于 RefVideo-6M,我们进一步训练参考引导视频编辑模型 Ref-MoT,以评估所提出的数据集的有效性和可扩展性。大量实验表明,RefVideo-6M 提供比现有数据集更可靠的监督,并能够训练强大的编辑模型,提高视觉质量、可控性和参考一致性。开源数据集可在 https://huggingface.co/datasets/RefVideo6M/RefVideo6M 上获取。