论文
对缩小图像的训练什么时候会产生相同的梯度?
When does training on downscaled images yield the same gradients?
摘要
Diffusion Transformer 可生成强大的图像,但其训练成本随着分辨率的增加而超线性增长。最近的工作证明了在频谱前提下以降低的分辨率进行训练或采样的合理性:在高噪声下,缩小的潜在信号几乎保留了完整的幸存信号。然而,缩小的步骤是否也保留原始训练梯度信号仍然悬而未决。我们将信号在降尺度下的变化减少为两项:一个由降尺度比率控制的噪声相关项,它在高噪声下衰减,如频谱前提预测的那样;以及一个与 σ 无关的下限,由目标网格的绝对标记计数控制,由计算图本身携带,并由无噪声水平去除。测量的(路线,σ)图证实了这一说法,并揭示了光谱图片无法表达的结构:在 1024->768 路线上,一个窗口(0.65 < σ < 0.95),在任何容差下都没有光谱标准预测,其中缩小的梯度保持在原始梯度的一小部分范围内。使用仅限于地图验证的路线和噪声窗口的缩小步长来训练 LoRA 适配器,可以在固定步长预算下减少 14.6% 的训练时间,同时在权重空间中保持接近原生的状态。代码可在 https://github.com/sorryhyun/anima_lora 获取。