论文

当身份崩溃时:多主体个性化的压力测试基准

When Identities Collapse: A Stress-Test Benchmark for Multi-Subject Personalization

模型评测基准与评测资源

摘要

主题驱动的文本到图像的扩散模型在保留单一身份方面取得了显着的成功,但它们组成多个交互主题的能力在很大程度上仍未被探索且极具挑战性。现有的评估协议通常依赖于全局 CLIP 指标,该指标对本地身份崩溃不敏感,并且无法捕获多主体纠缠的严重性。在本文中,我们发现了当前模型中普遍存在的“可扩展性错觉”:虽然它们擅长以简单布局合成 2-4 个主题,但当扩展到 6-10 个主题或承担复杂的物理交互任务时,它们会遭受灾难性的身份崩溃。为了系统地揭示这种失败模式,我们构建了严格的压力测试基准,其中包括分布在不同主题数量和交互难度(中性、遮挡、交互)中的 75 个提示。此外,我们证明基于标准 CLIP 的指标对于这项任务来说存在根本缺陷,因为它们经常为语义正确但身份崩溃的图像分配高分(例如,生成通用克隆)。为了解决这个问题,我们引入了主题崩溃率(SCR),这是一种基于 DINOv2 结构先验的新颖评估指标,它严格惩罚局部注意力泄漏和同质化。我们对最先进模型(MOSAIC、XVerse、PSR)的广泛评估表明,随着场景复杂性的增加,身份保真度急剧下降,10 个受试者的 SCR 接近 100%。我们将这种崩溃追溯到全局注意力路由中固有的语义捷径,强调了未来生成架构中明确的物理解缠的迫切需要。