论文

MIBE:个性化图像生成的多主体交互基准和评估器

MIBE: Multi-subject Interaction Benchmark and Evaluator for Personalized Image Generation

模型评测基准与评测资源

摘要

多主体个性化图像生成需要根据引导提示精确渲染所有请求的参考身份及其指定的交互。然而,最先进的模型仍然在这个过程中遇到困难,经常忽略主题,未能保留参考外观,或错误地归因交互。此外,主要为单一主题保真度设计的现有指标无法可靠地捕获这些错误,排名可分离性严重下降,并且随着主题数量的增加而无法与人类偏好保持一致。为了解决这一差距,我们引入了多主体交互基准和评估器(MIBE),这是一个由多主体交互基准(MIB)和多主体交互评估器(MIE)组成的统一框架。 MIB通过解耦的数据机制系统地涵盖了不同的关系类型和场景复杂性。这包括用于可扩展度量训练的 60K 对 VLM 标记银组和 4K 对双盲人类评估金组,涵盖各种最先进的生成器,银组达到 95.1% 的跨 VLM 偏好一致性。为了展示该基准的实用性,我们推出了 MIE,这是一种轻量级、参考条件评估器,专门在 Silver Set 上进行了训练,具有双头排名和诊断目标。 MIE 在 Gold Set 上表现出强大的跨生成器泛化能力,相对于人类偏好实现了 0.922 的总体成对精度,其中在见过的生成器上达到 0.982,在未见的生成器上达到 0.884。通过超越包括 CLIP 和 DINO 变体在内的广泛基线指标,MIE 证明诊断监督可以在传统评估者崩溃的情况下保持排名可分离性和人类一致性。