论文
FLiP:理解和解释多模态多语言句子嵌入
FLiP: Towards understanding and interpreting multimodal multilingual sentence embeddings
摘要
本文提出了用于理解预训练句子嵌入空间的分解线性投影(FLiP)模型。我们训练 FLiP 模型来从多种高资源和中资源语言的多语言 (LaBSE)、多模态 (SONAR) 和基于 API (Gemini) 的句子嵌入空间中恢复词汇内容。我们证明 FLiP 可以从嵌入中回忆起超过 75% 的词汇内容,显着优于现有的非因式分解基线。以此作为诊断工具,我们发现了所选句子编码器的模态和语言偏差,并为从业者提供了有关编码器的内在见解,而无需依赖传统的下游评估任务。我们的实现是公开的 https://github.com/BUTSpeechFIT/FLiP。