论文

通过分阶段调制进行声学提示,以实现音频语言模型中的小样本学习

Acoustic Prompting via Stage-wise Modulation for Few-Shot Learning in Audio Language Models

模型训练参数高效训练

摘要

音频语言模型 (ALM) 通过将音频波形与文本对齐,在零样本音频分类方面取得了显着的成功。最近提高下游性能的努力主要集中在学习最佳文本提示上。然而,以前的方法侧重于文本编码器,而没有开发音频编码器内可学习提示的潜力。在本文中,我们提出了一种新颖的框架,它将可训练的提示引入音频编码器以捕获特定于任务的声学特征。我们证明,将音频端提示学习与现有的文本端方法相结合可以增强小样本适应。通过 11 个数据集的广泛实验表明,将我们的方法作为即插即用模块与现有文本提示调整集成通常会带来性能改进。这些发现表明,显式调节音频表示空间可以有效补充纯文本提示方法。该代码可在 https://github.com/hyebin-c/aspl 获取。