论文
探索性建模:解锁第三个预训练轴和端到端生成
Explorative Modeling: Unlocking a Third Pretraining Axis and End-to-End Generation
摘要
AlexNet 引发的深度学习革命告诉我们,端到端训练胜过将问题分解为手工设计的阶段。然而,生成模型仍然是例外——尽管生成模型非常强大,但它们仍然没有经过端到端的训练。这是因为,生成式建模的核心是处理具有多种模式的分布,而现有的可扩展方法以相同的方式处理此问题,通过分解生成过程,这会阻止端到端生成。在这项工作中,我们引入了探索性建模,这是一种新的范式,它会考虑训练循环,探索模型生成和数据之间的 K 个候选匹配,并进行最佳训练,因此预测会致力于模式而不是模糊它们。我们发现探索模型 (XM) 在两种情况下很有用。首先,增加探索在现有生成模型的参数和数据之外添加了第三个预训练轴,其中扩展探索单调地提高了连续和离散领域(图像、视频和语言)的性能。值得注意的是,探索带来的收益随着规模的扩大而增加,随着数据规模的扩大,收益从 7% 上升到 36%,随着模型的增长,收益从 13% 上升到 23%,计算量增加 3 倍时,效率提升一倍多。具体来说,探索将 FLOP 效率提高了 4.1 倍,样本效率提高了 6.2 倍,参数效率提高了 47%,在没有指导的情况下将最强的图像生成方法提升到 ImageNet 上接近最先进的 1.43 FID,实现了端到端现有模型的扩展,并解锁了扩展泛化。其次,XM 支持端到端重建生成建模,以减少 16-256 倍的推理步骤来匹配控制任务的扩散。总之,这些结果将 XM 确立为现有生成模型的新预训练轴和独立的端到端生成建模范例。