论文

恐龙强迫流模型:不要对您可以预测的内容进行降噪

Dino Forcing Flow Models: Do not denoise what you can predict

摘要

诸如 DINO 之类的共同去噪预训练表示可以显着提高流匹配模型的训练速度和质量,但它引入了第二个去噪轨迹,并且需要精心设计的时间表。我们提出了一个更简单的替代方案:直接预测预训练的表示,然后根据模型自己的预测来调节模型。这消除了对第二个 ODE 和任何特定于表示的去噪计划的需要,同时保留了表示指导的优点。我们的方法收敛速度明显更快,并且根据 FID 分数衡量,实现了更好的发电质量。在 ImageNet 上,它在潜在空间中的表现优于现有技术,且迭代次数比之前的方法少 2 倍;在像素空间中,与现有的同类方法相比,它使 FID 提高了 20% 以上。这些结果支持一个简单的原则:不要对可以预测的内容进行降噪。我们的代码可在https://github.com/arijit-hub/dino_forcing. 公开获取