论文
视觉相似性的多种感觉:文本提示的图像感知度量
The Many Senses of Visual Similarity: A Text-Prompted Image Perceptual Metric
摘要
人类视觉相似性判断是依赖于上下文的。例如,两个图像可能形状相似但颜色不同。然而,现有的感知相似性度量将这些细微差别压缩为单个标量值,没有提供针对特定方面的条件的机制。为了弥补这一差距,我们引入了人类对图像三元组相似性判断的大规模数据集,其中每个三元组都在相似性的多个自由形式语义方面进行了注释。对广泛的前沿视觉语言模型(VLM)进行基准测试表明,与人类注释者的共识相比,存在相当大的性能差距。利用我们的数据,我们微调 VLM 以生成文本提示图像感知相似度 (TPIPS) 指标,根据指定的文本提示捕获视觉相似度的多种感觉。我们证明 TPIPS 更符合人类的感知,并且能够可靠地推广到训练分布之外。最后,我们展示了 TPIPS 在文本引导检索、组合搜索和生成模型的细粒度评估方面解锁了新功能。我们的代码、数据和训练模型位于 https://peterwang512.github.io/TPIPS