论文
学习带有文本信息的图像聚类的深度模态共享自我表达
Learning Deep Modality-Shared Self-Expressiveness for Image Clustering with Textual Information
摘要
利用文本信息进行图像聚类已成为一个有前途的方向,这很大程度上归功于视觉语言模型(VLM)学习到的强大表示。现有方法通常检索每个图像的文本对应项,然后通过直接执行跨模态一致性来细化多模态表示,例如,最大化从预训练的 VLM 继承的图像文本相似性。然而,这种策略跨模态对齐异构表示,而没有明确建模每种模态内的内在结构,因此可能会产生不可靠的对齐或扭曲对于聚类至关重要的模态特定结构。在本文中,我们提出了一种简单但有原则的方法,称为深度模态共享自我表达模型(DeepMORSE),它通过模态共享自我表达模型发现跨模态结构,并同时学习符合模态特定子空间联合的结构化表示。此外,我们从理论上证明,模态共享的自表达系数可以抑制类间噪声,从而实现子空间保留的解决方案,并表明小批量优化过程在自表达模型上引入了隐式正则化。我们在六个广泛使用的图像聚类基准上评估 DeepMORSE,并观察到 UCF-101、DTD-47 和 ImageNet-Dogs 数据集上的性能提升超过 3%。此外,我们通过在图像检索和零样本分类等下游任务上实现最先进的性能,展示了所学习的表示的强大可迁移性,而不需要任何特定于任务的损失或后处理。代码位于:https://github.com/mengxianghan123/DeepMORSE。