论文

OmniGen-AR:自回归任意图像生成

OmniGen-AR: AutoRegressive Any-to-Image Generation

应用与实践内容创作

摘要

自回归 (AR) 模型在视觉生成方面展现出强大的潜力,通过简单的架构和优化目标提供卓越的性能。然而,现有方法通常仅限于单一模态条件(例如文本),限制了它们在需要通过不同控制进行图像合成的现实场景中的适用性。在这项工作中,我们提出了 OmniGen-AR,这是一个用于 Any-to-Image 生成的统一自回归框架。通过共享视觉标记器和文本标记器的文本提示来离散化各种视觉条件,OmniGen-AR 支持单个模型内的广泛条件输入,包括文本(文本到图像生成)、空间信号(分割到图像和深度到图像)和视觉上下文(图像编辑、帧预测和文本到视频生成)。为了减轻从条件标记到内容标记的信息泄漏风险,我们引入了解缠结因果注意(DCA),它将全序列因果掩模分为条件因果注意和内容因果注意。它充当训练时间正则化器,不会影响推理过程中的标准下一个标记预测。通过这种设计,OmniGen-AR 在一系列基准测试中实现了最先进的或至少具有竞争力的结果,例如 GenEval 上的 0.63 和 VBench 上的 80.02,展示了其在灵活和高保真视觉生成方面的有效性。