论文
FiRe:用于增强图像生成的细粒度多模态推理
FiRe: Fine-grained Multimodal Reasoning for Enhanced Image Generation
摘要
随着多模态 大语言模型 (MLLM) 的快速进展,联合执行图像理解和生成的统一 MLLM 取得了显着进展。然而,尽管统一 MLLM 具有自我反思和自我完善的固有推理能力,但它们在文本到图像生成中的使用在很大程度上仍未得到充分探索。同时,现有的基于多模态推理的图像生成方法大多依赖提示增强或整体图文对齐判断,没有对详细提示属性进行细粒度的反映和细化,导致细粒度控制有限。为了解决这个限制,我们提出了 FiRe,一种细粒度多模态推理方法,用于通过 MLLM 增强图像生成。具体来说,FiRe会进行细粒度的多步推理,首先将提示分解为关键的视觉需求,然后在生成的图像中自我判断其满意度,然后根据自我生成的精确反馈进行局部细化。此外,为了进一步增强MLLM的多模态推理能力,我们引入了FiRe-GRPO,一种针对FiRe量身定制的强化学习方法。由于标准组相对策略优化 (GRPO) 在多步骤推理中受到稀疏、基于结果的奖励的影响,因此我们将推理过程制定为步骤级决策问题,设计特定于步骤的奖励,并计算 GRPO 内细粒度贡献分配的步骤级优势。大量实验表明,FiRe 始终优于竞争性文本到图像基准,包括现有的基于推理的方法,尤其是在组合文本到图像基准方面取得了显着的进步。