论文

ZEBRA:零样本熵正则化即时学习,用于音频语言模型中从基础到小说的泛化

ZEBRA: Zero-Shot Entropy-Regularized Prompt Learning for Base-to-Novel Generalization in Audio-Language Models

模型训练参数高效训练

摘要

音频语言模型 (ALM) 通过将音频与文本类描述对齐来实现强大的零样本性能。尽管即时学习通过少样本监督适应提高了基类的准确性,但我们观察到一个关键的权衡:它经常会降低新类别的性能,有时会低于零样本准确性。这暴露了 ALM 快速学习中基础到新颖的泛化差距。为了解决这个问题,我们提出了 \textbf{ZEBRA} (用于从基础到小说泛化的零样本熵正则化提示学习),这是一种即插即用的框架,它将零样本 logits 与提示学习 logits 融合在一起,并采用自熵正则化来减少对基类的过度拟合。跨多个音频分类数据集的实验表明,ZEBRA 持续提高新颖类性能,同时保持强大的基础准确性,与标准即时学习相比,显着缩小了基础与新颖的差距。该代码位于:https://github.com/asif-hanif/zebra。