论文
Fusion Embedding:文本、图像、视频和音频的统一嵌入空间
Fusion Embedding: A Unified Embedding Space for Text, Image, Video, and Audio
摘要
涵盖文本、图像、视频和音频的单个嵌入空间让一个索引可以服务用户可以提出的每个查询。基于视觉语言骨干的嵌入模型现在引领文本/图像/视频检索基准,但完全缺乏音频,而音频文本检索则由不服务于其他模态的专业系统主导。我们提出了 Fusion Embedding 系列,它将音频添加到参数永远不会更新的冻结视觉语言嵌入基础中:第 1 代 (fusion-embedding-1) 仅训练冻结音频塔和冻结基础之间的 16.4M 参数连接器,第 2 代 (fusion-embedding-2) 添加了模态门控深度适配器(44.2M 参数),其分支永远不会在文本、图像或视频输入上执行:它们的输出是逐位的已发布基地的数据,在每次训练运行后进行验证。由于基础已经绑定了文本、图像和视频,因此仅将音频与文本对齐就可以实现音频图像检索,并且零配对视听训练数据。除了配方之外,我们还用受控的负面结果映射其设计空间(用 LLM 重写训练描述,替换排行榜更强的音频塔,并加宽连接器以减少检索)以及训练协议结果,我们希望将其转移到任何冻结的解码器-LM 嵌入主干。两代产品都在单个 GPU 上进行数小时的训练。权重、代码和评估工具都是公开发布的。