论文

Abra:缩放扩散图像训练

Abra: Scaling Diffusion Image Training

模型评测模型行为与机制分析

摘要

计算最优缩放法则指导前沿语言模型的训练,但在视觉生成方面仍然很大程度上尚未探索。我们使用 Abra 提出了文本到图像扩散模型的系统缩放定律研究,Abra 是一个受控的流匹配 Transformer 系列,经过三个数量级的计算(10^{19}$ 到 $10^{22}$ FLOP)训练,达到了比以前的工作大得多的计算预算。我们证明扩散模型的扩展与语言模型一样可预测,但需要更多的数据来进行最佳训练:计算最优性发生在每个参数大约 200 美元的图像标记上,是 LLM 的 Chinchilla 计算最优处方的十倍。我们表明,与语言模型不同,扩散模型对于过度训练具有鲁棒性,并且实践者应该错误地选择更多的数据而不是更大的模型。最后,我们证明这种可预测性超越了训练损失,扩展到生成质量指标、最佳 CFG 设置、表示质量,甚至训练曲线的形状,这些都折叠成通用形式。