论文

通过再生进行细化:扩大修改空间可促进统一多模态模型中的图像细化

Refinement via Regeneration: Enlarging Modification Space Boosts Image Refinement in Unified Multimodal Models

应用与实践内容创作

摘要

统一多模态模型 (UMM) 将视觉理解和生成集成在单个框架内。对于文本到图像 (T2I) 任务,这种统一功能允许 UMM 在初始生成后细化输出,从而有可能扩展性能上限。当前基于 UMM 的细化方法主要遵循通过编辑进行细化 (RvE) 范例,其中 UMM 生成编辑指令来修改未对齐的区域,同时保留对齐的内容。然而,编辑指令通常仅粗略地描述提示图像未对准,导致细化不完整。此外,像素级保存虽然对于编辑是必要的,但却不必要地限制了细化的有效修改空间。为了解决这些限制,我们提出了通过再生进行细化(RvR),这是一种新颖的框架,它将细化重新表述为条件图像再生而不是编辑。 RvR 不依赖编辑指令并强制执行严格的内容保留,而是根据目标提示和初始图像的语义标记重新生成图像,从而实现更完整的语义对齐和更大的修改空间。大量实验证明了 RvR 的有效性,将 Geneval 从 0.78 提高到 0.91,将 DPGBench 从 84.02 提高到 87.21,将 UniGenBench++ 从 61.53 提高到 77.41。