论文
TEVI:通过稀疏自动编码器对视觉表示进行文本条件编辑,以改进视觉语言对齐
TEVI: Text-Conditioned Editing of Visual Representations via Sparse Autoencoders for Improved Vision-Language Alignment
摘要
CLIP 等视觉语言模型由于共享图像文本嵌入空间,对于各种任务非常有用。尽管如此,图像和文本嵌入通常对齐不佳,影响下游性能。最近的研究假设这可能归因于信息不平衡:图像包含的信息比其图像描述描述的信息更多。在这项工作中,我们提出了 TEVI,这是一个使用图像描述作为从图像嵌入中保留哪些内容的信号的框架。具体来说,我们使用稀疏自动编码器来解开图像嵌入,并训练掩蔽模块以根据给定的图像描述有选择地重建嵌入。在使用合成字幕的受控设置中,我们表明 TEVI 可以有效地保留字幕描述的属性,同时丢弃其他属性。我们发现这扩展到了在自然图像上训练的 CLIP 模型,其中 TEVI 学会了有意义的掩蔽并允许基于条件的检索。最后,我们使用 TEVI 来提高粗粒度和细粒度基准的检索性能。代码可在 https://github.com/neuroexplicit-saar/TEVI 获取。