论文
对比音频解码的自适应扰动选择
Adaptive Perturbation Selection for Contrastive Audio Decoding
摘要
大型音频语言模型(LALM)经常通过用语言先验推翻声学证据来产生幻觉。虽然对比解码 (CD) 提供了 无需训练 缓解,但现有方法依赖于掩蔽或噪声等钝扰,从而导致结构化音频转换尚未探索。我们通过评估不同的目标音频扰动库并自适应地为每个任务和示例选择最佳负分支来探索这个设计空间。首先,我们通过证明简单的二元是/否约束减少了模型错误地确认不存在的音频特征的倾向,从而改进了早期的提示工程。其次,跨时间、频谱、频率和幅度域评估我们的库表明,最佳变换高度依赖于任务;例如,反转音频阵列会破坏时间连贯性,从而将时间顺序任务的准确率从 74.7% 提高到 81.4%。最后,我们在模型隐藏状态上训练了一个轻量级扰动选择器,以动态路由负分支,从而在存在任务上额外获得 +4.3% 的增益。