论文
UFO:多模态图像生成中全条件对齐的评估链
UFO: Chain-of-Evaluation for Omni-Condition Alignment in Multi-Modal Image Generation
摘要
多模式图像生成,特别是主题驱动的定制,近年来引起了越来越多的关注。尽管生成模型取得了快速进步,但它们的评估仍然很大程度上滞后。现有的方法,无论是基于嵌入的还是基于多模态大语言模型(MLLM)的方法,都是孤立地评估每个模态条件的对齐情况,这与多模态图像生成的同时条件对齐目标相矛盾,导致与人类判断的一致性较差。为了应对这一挑战,我们提出了 UFO,这是第一个用于全条件对准同时评估的统一框架。具体来说,UFO 引入了一种新颖的原子化评估链范式,即它首先将全条件对齐分解为细粒度、解开的原子评估单元 (AEU) 的顺序链,将它们分类为不同的模态相关类别,然后采用通用或专用功能调用来准确验证不同的 AEU 类型。实验结果表明,UFO 与人类评价偏好的相关性最高,平均提高了 15.25%。此外,我们还推出了 UFO-Bench,这是一个专用基准测试,旨在全面评估现有定制模型在文本和视觉条件的多种相互交互下的性能。