论文
VLM4Cluster:视觉语言预训练时代深度聚类的基准测试
VLM4Cluster: Benchmarking Deep Clustering In the Era of Vision-Language Pre-training
摘要
视觉语言预训练重塑了图像聚类,催生了语言辅助图像聚类(LaIC),它利用文本语义来补充视觉表示。尽管 LaIC 方法迅速普及,但目前尚不清楚 LaIC 实际上对图像聚类有多大促进,因为现有研究普遍存在重大局限性,包括实验设置不一致、数据集选择不充分和评估维度有限。为了解决这一差距,我们引入了 VLM4Cluster,这是预训练视觉语言模型 (VLM) 时代图像聚类的综合基准。 VLM4Cluster 实现了涵盖经典、深度和语言辅助图像聚类的 17 种代表性方法,并在涵盖经典、挑战性、细粒度、大规模和分布外设置的 20 个数据集上对它们进行评估。除了有效性之外,VLM4Cluster 还沿着三个互补维度系统地研究图像聚类:对对抗性扰动的鲁棒性、分布变化下的泛化以及计算效率。我们的研究表明,LaIC 在许多语义要求较高的基准上大幅提升了聚类性能前沿,通常在分布变化下表现出更强的泛化能力,并实现了更有利的有效性-效率权衡。然而,它的收益在大规模和细粒度数据集上变得不太一致,而语言辅助并没有系统地降低对对抗性扰动的敏感性。 VLM4Cluster在https://github.com/YuanweiHuu/VLM4Cluster.发布