论文

VoT:统一多模态表示对齐的思想愿景

VoT: Vision-of-Thought for Unified Multimodal Representation Alignment

模型架构混合架构

摘要

当前的文本到图像系统通常采用“文本编码器加扩散解码器”范例,其中文本语义直接调制连续的潜在噪声。尽管取得了成功,但这些方法缺乏明确的、可解释的中间表示,无法有效地连接高级语言语义和低级视觉信号。在本文中,我们提出了视觉思维(VoT),这是一个在视觉语言模型(VLM)和扩散 Transformer(DiT)之间引入离散视觉思维层的框架。我们不仅仅将 VLM 视为文本编码器,而是将它们用作多模式规划器,在渲染像素之前生成代表高级视觉规划(例如对象和布局)的离散 VoT 标记。我们在 VLM 语义空间中训练一个专门的 VoT 标记器,其闭环目标结合了 VLM 对齐、特征重建和矢量量化损失。这些目标使得词元在语义上可以被 VLM 读取,同时保留生成所需的视觉信息。实验结果表明,VoT 改善了语义对齐,并为可解释和可控的生成提供了结构化接口。