论文
多模态对比学习的表达能力:双塔与多模态架构差异
Expressivity In Multimodal Contrastive Learning
摘要
对比学习已成为现代表征学习的基石,为 CLIP 式模型提供支持,这些模型支持文本到图像生成、视觉语言模型以及快速增长的各种模式的检索。尽管取得了实证上的成功,但这些架构的表达能力仍然知之甚少。为了获得洞察力,我们通过采用人口水平、密度估计的观点来研究表达性:每个架构都包含一组参数化的密度,可以选择其参数来近似模态的联合分布。这就孤立了一个纯粹表征能力的问题:给定的参数化对比族可以近似于任意精度的联合分布?我们表明表现力很大程度上依赖于架构。对于两种模态,简单的两塔 CLIP 架构是一个通用逼近器。当存在三种或更多模态时,CLIP 的自然概括在实践中广泛使用,它基于通过对所有成对相似性求和而发现的损失。这可以证明不能表示任意联合分布,尽管我们证明它仍然具有足够的表达能力来匹配所有成对条件。受这一差距的启发,我们提出了 Hadamard-CLIP,它在现有编码器之上添加了单个学习权重向量,并恢复任意数量模态的联合近似,同时保留 CLIP 的快速、可预计算嵌入检索。