论文

Omni-Embed-Audio:利用多模式 LLM 进行稳健的音频文本检索

Omni-Embed-Audio: Leveraging Multimodal LLMs for Robust Audio-Text Retrieval

摘要

基于对比语言音频预训练(CLAP)的音频文本检索系统在传统基准测试中取得了强劲的性能;然而,这些基准依赖于与现实世界的搜索行为有很大不同的描述式查询,限制了它们对实际检索鲁棒性的评估。我们推出 Omni-Embed-Audio (OEA),这是一种面向检索的编码器,利用多模态 LLM 和原生音频理解。为了系统地评估描述式查询之外的鲁棒性,我们引入了用户意图查询(UIQ)——反映自然搜索行为的五种表述:问题、命令、关键字标签、释义和基于排除的否定查询。对于否定查询,我们开发了一个硬否定挖掘管道,并提出了判别指标(HNSR、TFR)来评估模型抑制声学上相似干扰因素的能力。在 AudioCaps、Clotho 和 MECAT 上进行的实验表明,OEA 实现了与最先进的 M2D-CLAP 相当的文本到音频检索性能,同时在两个关键领域表现出明显的优势:(1) 占主导地位的文本到文本检索(相对改进 +22%),以及 (2) 显着优越的硬负辨别(+4.3%p HNSR@10,+34.7% 相对 TFR@10),揭示了LLM 主干提供对复杂查询的卓越语义理解。