论文

绘图前先想象:图像生成的视觉提示工程

Imagine Before You Draw: Visual Prompt Engineering for Image Generation

模型推理推理策略与问题分解

摘要

将视觉语义表示作为图像生成之前的中间步骤可以降低文本和图像之间的建模难度,从而提高生成质量。 X-Omni 和 BLIP3o-Next 等最近的作品已经探索了这个方向,但它们通常使用两级外部管道:一个单独的自回归模型首先生成语义标记,然后将其作为条件馈送到独立的扩散解码器。由于解码器无法联合访问原始输入和语义计划,因此这种设计引入了信息瓶颈,限制了编辑等下游任务中的细节保留。 Transfusion、BAGEL 和 Show-o2 等内部架构通过在单个模型内实现跨模式交互来避免这一瓶颈,但它们仍然面临着没有中间语义指导的困难的文本到像素建模差距。我们提出了视觉提示工程(VPE),它可以无缝集成到此类内部框架中。具体来说,该模型首先自回归生成视觉语义标记(例如,SigLIP 2)作为捕获语义布局的“视觉提示”,然后生成以此计划为条件的完整图像标记。我们跨类条件生成、文本到图像生成和图像编辑验证 VPE,涵盖各种词元类型和模型架构。结果表明,VPE 可以加速收敛,提高质量上限,并通过内部集成,实现比相同参数范围的外部替代方案更好的编辑保存(PSNR:26.76 比 19.92),同时保持有竞争力的编辑响应能力。