论文
文本提示的 CLAP:通过对比学习学习文本条件的音频表示
Text-Prompted CLAP: Learning Text-Conditioned Audio Representations via Contrastive Learning
摘要
对比语言音频预训练 (CLAP) 在共享嵌入空间中对齐文本和音频,但独立编码每种模态限制了其在复杂的音频理解和检索任务中建模跨模态语义的能力。为了解决这个限制,本文提出了文本提示 CLAP (TP-CLAP),这是 CLAP 的参数有效扩展,引入了基于交叉注意力的融合模块,将文本提示合并到音频特征中。 TP-CLAP 使用音频多项选择问答 (AMCQA) 框架进行训练,通过对比学习将文本条件音频表示与正确答案选择的文本嵌入对齐。实验表明,尽管 TP-CLAP 尺寸紧凑,但它在音频问答方面可与几个大得多的音频 LLM 相媲美或超过。在 微调 用于以属性为中心的音频到音频检索之后,文本条件音频表示在音乐检索基准上始终优于无条件音频表示。此外,TP-CLAP 在传统音频文本检索和零样本分类方面改进了基本 CLAP 模型。