论文

等效流,不平等学习:Transformer 中的干净潜在预测

Equivalent Flows, Unequal Learning: Clean-Latent Prediction in Transformers

模型训练预训练

摘要

流量采样器消耗速度,但神经网络可以预测干净端点并通过固定仿射读数将其转换为速度。我们使用 JLT(冻结变分自动编码器(VAE)表示中的潜在 Transformer)来研究这种选择。对于平方误差,最佳清洁和速度预测器在代数上是等价的;有限的 Transformer 在两个接口下为其学习的输出分配不同的计算。局部高斯分析识别由读数提供的已知残差响应和由速度预测添加的各向同性目标方差。测量的 FLUX.2 通道频谱支持这种几何区别:90% 的目标方差占据 128 个干净方向中的 83 个,而 109 个速度方向则占据其中。在匹配的速度目标下,干净预测将 ImageNet FID-50K 在 Base 尺度上从 6.56 提高到 2.70,在 Large 尺度上从 2.12 提高到 1.47,在每个测量的 Large 检查点处具有较低的 FID。将干净预测扩展到 951M 参数达到 FID-50K 1.19 和 IS 271.96。此外,基础尺度的客观消融表明,直接干净回归达到 FID-50K 2.38,无需依赖时间的误差加权。这些结果表明,将已知计算移至网络之外如何改变代数等效流接口下的学习。代码:https://github.com/akatsuki-neo/JLT/blob/main/README.md