论文
学习阅读扩散变压器中的上下文token
Learning to Read the Contextual Tokens in Diffusion Transformers
摘要
多模态扩散变压器(MM-DiT)在整个生成过程中联合处理视觉和文本表示。这些模型通过多模态注意力不断更新文本token,形成动态上下文token,其功能尚不清楚。在这项工作中,我们引入了一个通过自然语言询问来阅读这个上下文空间的框架。我们训练一个轻量级瓶颈网络,将中间上下文token映射到冻结大语言模型 (LLM) 的输入空间,允许LLM直接从这些隐藏表示中回答有关新兴图像的问题。我们的读者揭示了上下文token编码了新兴场景的丰富的全局表示:特定于生成的语义,包括提示未指定的属性,在去噪过程中可以在早期令人惊讶地访问,而随着时间的推移,越来越细粒度的细节变得可读。值得注意的是,即使 MM-DiT 收到空提示,该信息仍然是可解码的,这表明上下文token从不断发展的视觉表示本身中积累了大量的图像特定信息。我们进一步发现,具有更易读的上下文表征的几代人往往会获得更高的人类偏好分数。基于这些观察,我们引入了上下文对齐,这是一种训练技术,它明确强化了上下文token中编码的视觉语义信息,从而提高了生成质量和分布覆盖范围。总之,我们的结果将上下文token确立为 MM-DiT 内部动态的可解释视图和改进生成模型的有效目标。