论文
CLIP 潜在空间的超球面几何:语义混合模型
The Hyperspherical Geometry of CLIP Latent Space: A Semantic Mixture Model
摘要
对比语言图像预训练(CLIP)表示形成由余弦相似度控制的语义嵌入空间,反映了内在的超球面几何。然而,现有的概率解释通常依赖于高斯假设,无法捕捉这种方向性和多模态结构。我们提出了基于单位超球面上定义的 von Mises-Fisher (MovMF) 分布混合的 CLIP 潜在空间的原则密度模型。使用期望最大化(EM)算法,我们有效地学习了一个概率模型,其中每个混合分量对应于一个连贯的语义概念。该公式产生与超球面几何形状自然对齐的闭合形式似然,从而实现准确且可解释的密度估计。根据经验,我们的模型显着改进了长尾和分布外检测,并提供自然的语义分解,将每个嵌入表示为可解释概念的稀疏概率组合。这些结果表明,CLIP 潜在空间更忠实地表征为超球面语义混合,而不是各向同性高斯,为建模和理解多模态表示建立了一个简单且几何一致的概率框架。项目页面位于https://xiaoyuzhizi.github.io/movmf-clip/。