论文
通过理解监督来指导统一多模态模型中的视觉生成
Steering Visual Generation in Unified Multimodal Models with Understanding Supervision
摘要
统一的多模式模型有望弥合理解和生成之间的差距。然而,为了实现有竞争力的性能,最先进的模型在很大程度上采用了解耦的理解和生成组件。这种设计虽然对个别任务有效,但削弱了相互增强所需的联系,从而使潜在的协同作用在经验上不确定。我们建议通过引入面向理解的 后训练 (UNO) 来明确恢复这种协同作用,这是一个轻量级框架,它不仅将理解视为一项独特的任务,而且将其视为引导生成表示的直接监督信号。通过整合编码语义抽象(字幕)和结构细节(视觉回归)的目标,我们实现了从理解到生成的有效梯度流。关于图像生成和编辑的大量实验表明,理解可以成为生成的有效催化剂。