论文
KODA:视觉语言基础模型的对比表示比较和对齐
KODA: Contrastive Representation Comparison and Alignment for Vision-Language Foundation Models
摘要
CLIP 和 SigLIP 等视觉语言基础模型为多模态学习系统提供了广泛使用的表示。虽然这些模型通常通过下游性能进行比较,但此类评估通常无法解释它们的表示在结构上有何不同。在这项工作中,我们通过对比嵌入聚类的任务来研究这个问题:识别在一种表示下弱聚类但在另一种表示下强聚类的样本子集。我们提出\emph{差异分析的内核优化(KODA)},这是一种基于内核的对比表示比较和对齐框架。 KODA 通过模态核组合构建统一的多模态核,并将差异发现表述为约束优化问题,在一种表示中搜索相干结构,同时抑制参考表示中的相干性。这产生了与特定样本子集和模态交互相关的可解释的差异方向。为了将 KODA 扩展到大型视觉语言数据集,我们使用随机投影开发联合内核的随机低维近似,包括用于平移不变内核的随机傅里叶特征。根据经验,KODA 可以识别跨视觉语言表示的一致且可解释的差异结构,并提供用于表示对齐的样本子集。代码可在 https://github.com/yokiwuuu/KODA 获取。