论文

EPIC:用于组合文本到图像生成的高效谓词引导推理时间控制

EPIC: Efficient Predicate-Guided Inference-Time Control for Compositional Text-to-Image Generation

模型推理推理验证与自校正

摘要

最近的文本到图像 (T2I) 生成器可以合成逼真的图像,但仍然难以处理涉及多个对象、计数、属性和关系的合成提示。我们引入了 EPIC(高效谓词引导推理时间控制),这是一种用于组合 T2I 生成的 无需训练 推理时间细化框架。 EPIC 将细化转化为谓词引导搜索:它将原始提示一次解析为对象变量和类型化谓词的固定可视化程序,涵盖可检查的条件,例如对象存在、计数、属性和关系。每个生成或编辑的图像都使用从该图像中提取的视觉证据针对该程序进行验证。只有当所有谓词都满足时,才判断图像满足提示;否则,失败的谓词决定下一步,将局部失败路由到目标编辑,将全局失败路由到重采样,同时固定的视觉程序保持不变。在 GenEval2 上,EPIC 将基本生成器单遍生成的提示级准确度从 34.16% 提高到 71.46%。在相同的生成器/编辑器设置和最大图像模型执行预算下,EPIC 的性能比最强的先前细化基线高出 19.23 个点,同时将图像模型执行的实现成本降低了 31%,将 MLLM 调用降低了 72%,将每个提示的 MLLM 词元降低了 81%。