论文

移动字母表:文本到视频生成训练数据的受控研究

Moving Alphabet: A Controlled Study of Training Data for Text-to-Video Generation

模型训练合成数据

摘要

通过扩展模型大小、数据和计算,文本到视频的生成在过去五年中取得了显着进步。与模型架构不同,训练数据通常未被充分探索。现实世界的数据管理是复杂且重要的,涉及从原始视频和视频描述中选择剪辑以创建视频文本对以学习文本到视频的映射。我们研究数据分布和视频描述质量如何影响文本到视频模型。为了实现受控实验,我们引入了移动字母表,这是一个程序测试台,可以渲染具有不同字体、颜色、大小和位置的字母,并在黑色背景下以不同的方向和速度移动。该设计可以通过破坏 真值 元数据来精确控制数据分布和视频描述质量。我们的实验得出了三个发现:a)视频内容和持续时间的多样化和平衡分布对于泛化至关重要; b)视频描述质量显着影响模型性能和训练效率,这表明文本到视频模型受到视频理解能力的限制; c) 无分类器指导和高质量数据上的 微调 可以从受损坏视频描述训练的模型中进行部分恢复,但不能完全补偿较差的 预训练 数据。我们相信这些见解可以为大规模文本到视频模型的开发提供信息,并且我们主张更多地关注 预训练 数据的科学性。