论文

具有可解释的潜在奖励的自我校正图像生成

Self-Corrected Image Generation with Explainable Latent Rewards

应用与实践内容创作

摘要

尽管在文本到图像生成方面取得了重大进展,但将输出与复杂的提示对齐仍然具有挑战性,特别是对于细粒度的语义和空间关系。这一困难源于生成的前馈性质,这需要在不完全理解输出的情况下预测对齐。相比之下,评估生成的图像更容易处理。受这种不对称性的推动,我们提出了 xLARD,这是一种自我校正框架,它使用多模态 大语言模型 通过可解释的 LAtent RewarD 来指导生成。 xLARD 引入了一个轻量级校正器,可以根据模型生成的参考的结构化反馈来细化潜在表示。一个关键组成部分是从潜在编辑到可解释奖励信号的可微映射,从而能够从不可微分的图像级评估中提供连续的潜在级指导。这种机制允许模型在生成过程中理解、评估和纠正自身。跨不同生成和编辑任务的实验表明,xLARD 在保持生成先验的同时提高了语义对齐和视觉保真度。代码可在 https://yinyiluo.github.io/xLARD/ 获取。