论文

流动中的梦想:自进化统一多模态模型的生成基础反馈

Dreaming in Flow: Generative Grounding Feedback for Self-Evolving Unified Multimodal Models

模型训练预训练

摘要

统一的多模式模型将视觉理解和生成集成在单个网络中,但这两种功能通常作为单独的任务进行优化。我们引入了生成证据对齐反馈(GGF),这是一个自我进化的 后训练 框架,仅使用文本提示和模型自己的视觉体验。给定提示,模型首先生成一个视觉“梦想”。流级反馈在相同的噪声潜在状态下比较文本、图像和修复条件的预测,将基于图像的生成方向转移到提示条件。梦境重播基础通过字幕和重新想象来重播这个梦,训练声明级证据以在重播中保持一致,同时分离不相关的视觉体验。这两个方向共同优化,让生成为理解提供视觉基础,并在没有配对图像-文本监督的情况下完善后续生成。具有不同理解的统一模型的实验——生成集成设计显示了文本到图像生成的持续改进以及视觉理解方面的适度进步。