论文
用于语义图像检索的自监督视觉表示的几何分析
Geometric Analysis of Self-Supervised Vision Representations for Semantic Image Retrieval
摘要
基于内容的图像检索(CBIR)系统使用户能够根据视觉内容而不是依赖元数据来搜索图像。文本领域受益于使用 BERT 等无监督方法创建的表示的向量搜索。然而,现代视觉自监督学习方法在 CBIR 相关文献中大多没有报道,而是依赖于对齐文本和视觉的监督模型或多模态方法。我们评估了现代视觉自我监督学习方法所学到的表征在利用向量数据库和最近邻搜索的典型检索堆栈下的表现。我们的评估表明,潜在空间几何影响近似于最近邻(ANN)索引。具体来说,几种现代 SSL 方法产生的具有高偏度的高度各向异性表示会降低基于分区和基于散列的搜索的性能,即使它们自己的线性探测或 K-NN 精度不受影响。相反,具有较高各向同性和局部纯度的表示更好地满足 ANN 索引基于距离的假设,从而提高语义检索性能。