论文

从原子到熵:凸体系中扩散训练的最佳噪声分配

From Atoms to Entropy: Optimal Noise Allocation for Diffusion Training in the Convex Regime

模型训练预训练

摘要

扩散模型应如何决定训练的噪声级别以及多少?尽管这种选择很重要,但当前的噪声时间表主要基于启发法或经验调整。在这里,我们开发了一个通用统计框架,用于研究扩散训练中的渐近最优噪声水平分配。我们的第一个主要结果涉及完全耦合的机制,其中信息可以在不同的时间点之间传播。在凸性或 Polyak-Lojasiewicz 型假设下,我们表明优化的训练计划允许原子最小化器,集中于有限多个噪声级别。我们的第二个主要结果将该框架专门用于理想化的独立学习者制度,旨在模拟神经网络中的时间专业化。在附加的特征噪声解耦条件下,随机矩阵分析得出信息论代理:解耦采样密度与生成熵率(条件熵沿前向过程增长的速率)的平方根成正比。我们在受控设置中测试这些预测,其中耦合目标可以直接优化,包括狄拉克混合、低维流形和 MNIST。在这些设置中,优化的调度始终是有限支持的,而平滑熵代理紧密跟踪神经网络模型中的原子最优,并且主要在完全耦合的参数情况下崩溃,正如理论所表明的那样。然后,我们在更大规模的实验中评估熵调度,其中完整的调度优化目前是棘手的。结果表明,平方根熵调度可以显着提高离散域上的训练效率,并且与连续图像上的标准 EDM 式启发式算法保持竞争力。