论文

眼见为实:将提示重写与视觉锚点对齐以生成文本到图像

Seeing is Believing: Aligning Prompt Rewriting with Visual Anchors for Text-to-Image Generation

上下文与知识上下文工程

摘要

尽管文本到图像 (T2I) 模型的功能令人印象深刻,但由于用户提示的简洁和模糊性,意图生成差距常常持续存在。现有的方法主要是提高提示的流畅性和可读性。然而,增强过程仍然缺乏视觉基础。因此,重写者可能会过度推断缺失的细节,从而导致意图生成差距。为了解决这个限制,我们提出了 FaithRewriter,一种用于 T2I 生成的新颖的提示增强框架。具体来说,FaithRewriter 首先利用多模态 MLLM 从原始提示生成图像作为中间视觉提示。然后,将此提示与提示结合起来,并输入到大型 LLM 中,以生成基于视觉的增强效果,更好地反映预期内容在图像中的显示方式。最后,这些增强被提炼成小规模的 LLM 以进行高效部署,增强其生成有效 T2I 提示的能力。实验表明,FaithRewriter 生成的提示比强基线更忠实于用户意图,并且在视觉上更合理,有助于缩小意图生成差距。