论文
jina-embeddings-v5-omni:冻结编码器、保留文本嵌入几何的多模态模型
jina-embeddings-v5-omni: Geometry-preserving Embeddings via Locked Aligned Towers
摘要
在这项工作中,我们介绍了 GELATO(通过锁定对齐塔进行几何保留嵌入),这是一种多模态嵌入模型的新颖方法。我们建立在 VLM 风格的架构之上,其中非文本编码器适合为语言模型生成输入,而语言模型又为所有类型的输入生成嵌入。我们展示结果:jina-embeddings-v5-omni 套件,这是一对将文本、图像、音频和视频输入编码到单个语义嵌入空间中的模型。 GELATO 通过添加图像和音频编码器扩展了两个 Jina Embeddings v5 文本模型,以支持其他模式。主干文本嵌入模型和添加的非文本模态编码器仍然冻结。我们只训练连接组件,占联合模型总权重的0.35%。因此,训练比全参数再训练要有效得多。此外,语言模型实际上保持不变,为文本输入生成与 Jina Embeddings v5 文本模型完全相同的嵌入。我们的评估表明,GELATO 产生的结果可与最先进的技术相媲美,其性能与更大的多模态嵌入模型几乎相同。