论文
ALM2Vec:面向通用音频检索的指令感知嵌入
ALM2Vec: Learning Audio Embeddings for Universal Audio Retrieval with Large Audio-Language Models
摘要
语言音频检索的最新进展很大程度上是由对比双编码器架构驱动的,该架构在共享嵌入空间中对齐音频和文本。虽然有效,但现有的检索嵌入主要针对音频描述匹配进行了优化,限制了它们支持不同检索目标和可控检索行为的能力。我们提出了 ALM2Vec,这是一种源自预训练大型音频语言模型 (LALM) 的通用音频嵌入框架。通过迁移通过大规模多模态训练获得的音频理解、指令遵循和推理能力,ALM2Vec 学习一个统一的嵌入空间,用于跨音频域和任务类型的检索。除了传统的文本音频检索之外,ALM2Vec 将自然语言指令合并到嵌入过程中,从而支持针对音频问答和方面条件检索等场景的指令感知检索。实验结果表明,ALM2Vec 在标准音频和语音检索基准上实现了具有竞争力的性能,同时展现出有前景的组合和可控检索能力,突显了其作为跨领域、任务和用户意图检索的统一音频嵌入模型的潜力。