论文
AnchorPrompt:用于稳健音频语言模型的自提软提示
AnchorPrompt: Self-Distilled Soft Prompts for Robust Audio-Language Models
摘要
大型音频语言模型 (LALM) 对输入扰动敏感,例如噪声、波形损坏和对抗性注入。我们提出了 AnchorPrompt,这是一种有效的适应方法,可以保持模型冻结并学习插入到解码器输入、音频和问题嵌入之间的单个提示向量块。我们通过对不同音频和文本扰动的自蒸馏来训练这些向量。为了提高答案一致性并减轻幻觉,我们使用模型对干净录音的预测作为可回答输入的目标,并在音频缺乏足够证据来回答时分配拒绝目标。此外,AnchorPrompt 在推理时与扰动无关,不需要事先检测扰动,并且能够零样本传输到看不见的失真。我们通过三个基准评估了三个 LALM,并表明 AnchorPrompt 在大多数测试条件下提高了答案的一致性。九个模型基准对中的六对的干净准确度有所提高,对其余最多 1.2% 的影响最小。至关重要的是,AnchorPrompt 减少了严重音频损坏下的幻觉,同时减少了对干净音频的错误拒绝。最后,这些一致性增益会转化为看不见的扰动,例如选择排列和混响。