论文
驯服扩散中的异常标记 Transformer
Taming Outlier Tokens in Diffusion Transformers
摘要
我们研究 Diffusion Transformer (DiTs) 中的异常标记以生成图像。先前的工作表明,Vision Transformer (ViTs) 可以产生少量高范数词元,这些词元在携带有限的本地信息的同时吸引了过多的注意力,但它们在生成模型中的作用仍未得到充分探索。我们证明这种现象出现在现代表示自动编码器(RAE)-DiT 管道的编码器和降噪器中:预训练的 ViT 编码器可以产生离群表示,而 DiT 本身可以开发内部离群标记,尤其是在中间层。此外,简单地屏蔽高范数标记并不能提高性能,这表明问题不仅是由少数极值引起的,而且与损坏的本地补丁语义更密切相关。为了解决这个问题,我们引入了双级寄存器(DSR),这是一种针对两个组件的基于寄存器的干预:可用时训练寄存器,否则递归测试时间寄存器,以及用于降噪器的扩散寄存器。在 ImageNet 和大规模文本到图像生成中,这些干预措施不断减少异常伪影并提高生成质量。我们的结果强调了异常值词元控制是构建更强大 DiT 的重要组成部分。