论文

PRISM:通过基于图像的自我奖励机制快速细化文本到图像的生成

PRISM: Prompt Refinement via Image-grounded Self-rewarding Mechanism for Text-to-Image Generation

上下文与知识上下文工程

摘要

文本到图像生成模型可以从自然语言描述合成高质量图像,但其性能对提示表述仍然高度敏感。现有的提示优化方法主要依赖于文本端重写、提示扩展或外部奖励信号,提供有限的基于图像的诊断,并且对学习可重用的优化策略的支持较弱。在本文中,我们提出了 PRISM,一种通过基于图像的自我奖励机制进行快速细化的框架。 PRISM 通过使用结构化视觉诊断解释生成的图像并根据语义一致性、美学质量和人类偏好一致性对其进行评分,从而闭合提示图像反馈循环。它首先通过多任务监督的 微调 初始化统一的 VLM,然后通过混合理想点和切比雪夫奖励的自我奖励优化来改进提示策略。大量实验表明,PRISM 提高了整体图像质量和细粒度语义对齐,同时提供可解释的反馈以进行有针对性的快速细化。该代码可从 https://anonymous.4open.science/r/PRISM-FF81 获取。