论文
定点掩蔽生成建模
Fixed-Point Masked Generative Modeling
摘要
掩码生成模型 (MGM) 可实现并行解码并在多种模式中实现强大的性能,但每一步都需要全序列双向 Transformer,这使得训练成本高昂,并且在低采样预算下降低了质量。现有的工作通过更好的采样器或更便宜的固定深度降噪器来提高效率,但它们仍然为每个细化步骤分配固定量的降噪器计算。我们引入了定点掩蔽生成模型(FP-MGM),它用共享注意力层上的定点求解器替换了部分降噪器,从而以更少的参数实现自适应深度。为了使其对于屏蔽生成更有效,我们首先引入跨步骤一致性损失,它在相邻去噪步骤处对齐隐藏表示,其次引入三态重用(3SR),它通过分别处理不同的未更改、仍然屏蔽和新显示的标记,使用先前的解决方案来热启动求解器。这些组件共同定义了我们用于定点掩码生成的完整训练到推理框架,\emph{CoFRe}。我们还表明,预训练的 MGM 可以转换为具有短 微调 的 FP-MGM,从而避免完全重新训练。在各种模式中,CoFRe 改善了质量和成本权衡。在 OpenWebText 上,与 MDLM 相比,CoFRe 将参数减少了 38.8%,训练时间减少了 11.5%,VRAM 减少了 16.9%,同时将生成困惑度从 830.8 提高到 101.8,预算为 96$ Transformer 块前向传播。在 ImageNette 中,CoFRe 将训练时间减少了 48.6%,将 VRAM 减少了 50.7%,同时改进了所有测试样本预算中的 FID。总体而言,CoFRe 为更便宜的训练和更强大的低预算掩蔽生成提供了一个实用的框架。