论文

大语言模型 是视觉生成的通用推理机

Large Language Models are Universal Reasoners for Visual Generation

应用与实践内容创作

摘要

文本到图像的生成随着扩散模型的发展而迅速发展,从 CLIP 和 T5 调节发展到统一系统,其中单个 LLM 主干网处理视觉理解和生成。尽管架构统一,这些系统在合成过程中经常无法忠实地对齐复杂的提示,尽管它们在验证图像是否满足这些相同的提示方面仍然高度准确。我们将其形式化为 \emph{理解代沟} 并提出 UniReasoner,一个利用 LLM 作为通用推理器将其理解强度转化为直接生成指导的框架。根据提示,LLM 首先生成由离散视觉标记组成的粗略视觉草稿。然后,它通过评估草稿的及时一致性来进行自我批评,产生有根据的文本评估,指出需要纠正的内容。最后,扩散模型共同以提示、视觉草稿和评估为条件,确保生成受到明确的纠正信号的指导。每个信号都解决了另一个信号的局限性:草案提供了一个具体的场景级锚点,可以减少纯文本调节中的规范不足,而评估则将验证转变为扎根的、可操作的约束,以纠正遗漏、幻觉和关系错误。实验表明,UniReasoner 在保持图像质量的同时,在相同的扩散主干下改进了组合对齐和语义 忠实性,展示了一种利用 LLM 推理来缩小理解代沟的实用方法。