论文

用于视觉生成的摊余矩匹配

Amortized Moment Matching for Visual Generation

模型训练预训练

摘要

我们提出摊销矩匹配,利用神经网络来学习数据矩作为分布训练信号。通过多项式投影投射扩散降噪器,我们建立了矩摊销的通用框架,揭示了$n$次投影明确识别高达$n+1$阶的数据矩。从易处理的仿射情况导出,我们实例化了摊销弗雷切距离 (AMFD) 损失。与依赖于显式边际矩计算的 FD-loss 不同,AMFD 能够通过交替的、无矩阵的优化管道动态学习条件矩,从而轻松扩展到高维数据。当操作全局表征特征时,AMFD 作为一个强大的 后训练 目标;从经验上看,它的神经公式比精确的统计匹配产生了更稳健的训练动态,大大超过了 FDr$^6$ 指标上的 FD 基线,并在 ImageNet 上实现了卓越的一步生成。此外,它解锁了本地生成空间内的直接探索,这表明前两个时刻只能在具有强语义的空间中识别目标分布。最后,当扩展到文本到图像生成时,AMFD 的条件感知特性在指令跟踪能力方面取得了巨大的进步,使我们的单步模型能够在 GenEval 基准测试中超越其多步 FLUX.2 [klein] 4B 教师,同时在 PickScore 上实现同等性能。代码和检查点可在 https://github.com/poppuppy/amfd 获取。