论文

MONET:海量、开放、非冗余且丰富的文本到图像数据集

MONET: A Massive, Open, Non-redundant and Enriched Text-to-image dataset

模型训练合成数据

摘要

训练大型文本到图像模型需要具有多样化内容和详细说明的高质量、精选数据集。然而,大规模收集、过滤、重复数据删除和重新描述此类语料库的成本和复杂性阻碍了该领域的开放和可重复研究。我们介绍 MONET,一个开放的 Apache 2.0 数据集,大小约为。通过安全过滤、基于域的过滤、精确和近乎重复的删除以及使用涵盖短到长形式描述的多个视觉语言模型重新字幕的连续阶段,从跨异构开源的 2.9B 个原始对中收集了 104.9M 图像-文本对,并通过综合生成的样本进一步增强。每个图像都附带预先计算的嵌入和注释,以加速下游使用。为了验证 MONET 的有效性,我们专门在其上训练了 4B 参数潜在扩散模型,并达到了有竞争力的 GenEval 和 DPG 分数,证明我们的数据集降低了大规模、可重复的文本到图像研究的障碍。