论文

LACON:从未经整理的数据训练文本到图像模型

LACON: Training Text-to-Image Model from Uncurated Data

模型训练合成数据

摘要

现代文本到图像生成的成功很大程度上归功于海量、高质量的数据集。目前,这些数据集是通过过滤器优先范式进行管理的,该范式基于对模型性能有害的假设而积极丢弃低质量原始数据。被丢弃的坏数据真的没有用处,还是蕴藏着未开发的潜力?在这项工作中,我们批判性地重新审视这个问题。我们提出了 LACON(标签和调节),这是一种利用底层未经整理的数据分布的新型训练框架。 LACON 没有进行过滤,而是将质量信号(例如美观评分和水印概率)重新调整为明确的定量条件标签。然后训练生成模型以了解从坏到好的全部数据质量。通过学习高质量和低质量内容之间的明确界限,与使用相同计算预算仅对过滤数据进行训练的基线相比,LACON 实现了卓越的生成质量,证明了未经整理的数据的重要价值。