论文
OmniRetriever:通过 Fusion-as-Teacher 进行任意音频-视频-文本检索 蒸馏
OmniRetriever: Any-to-Any Audio-Video-Text Retrieval via Fusion-as-Teacher Distillation
摘要
统一的多模态嵌入空间已成为跨模态检索和多模态 RAG 的标准接口,最近的音频-视频-文本 (AVT) 编码器将此设置扩展到三种模态。只要所有三种模态都可用,此类编码器就可以生成联合 (T、V、A) 嵌入,但标准成对 InfoNCE 目标在训练期间不会使用该信号。我们通过 fusion-as-teacher 蒸馏 缩小了这一差距,它将融合嵌入的停止梯度副本视为单模态嵌入的教师信号,并与直接监督融合嵌入的 Tuple-InfoNCE 项配对。我们将此目标实例化为 OmniRetriever-7B。在六个零样本检索基准测试中,OmniRetriever-7B 在 Clotho 和 SoundDescs 上超越了闭源 Gemini Embedding 2 13.3-18.0 R@1,并在 MSR-VTT 和 MSVD 上达到了开放视频文本编码器的当代零样本专业水平。为了对联合表示进行压力测试,我们进一步发布了 OmniRetriever-Bench,这是一个 12 方向 AVT 检索基准,总计 3782 个三元组; OmniRetriever-7B 的 AVG-all 达到 34.84,比 Gemini Embedding 2 提高了 1.72,比之前最好的开源 AVT 方法提高了 8.03。