论文
TAD:具有置信引导门控的词元自适应对比解码,用于减轻大型音频语言模型中的幻觉
TAD: Token-Adaptive Contrastive Decoding with Confidence-Guided Gating for Hallucination Mitigation in Large Audio-Language Models
摘要
大型音频语言模型(LALM)可以产生幻觉音频对象,对不存在的声音事件回答“是”,从而破坏音频问答的可靠性。我们提出了词元自适应解码(TAD),这是一种用于减轻幻觉的 无需训练 策略,通过将真实音频下的 logits 与匹配的无声参考进行对比来做出最初的是/否决定。 TAD 引入了词元自适应、置信引导门,该门在第一个解码步骤中至关重要,并且对肯定词元进行类别条件,使用音频静默余量来避免证据薄弱或已经足够时的过度校正。 AudioCaps-Hallucination 的实验表明,相对于音频感知解码 (AAD)(具有固定对比强度的对比基线),TAD 在流行、对抗和随机分割中将 Qwen2 的 F1 提高了 0.059 到 0.117,将 Gemma 提高了 0.025 到 0.064,而在 Clotho-AQA 上,TAD 将 F1 从 0.810 提高到 0.816 Qwen2 上的结果与 Gemma 上的 AAD 相当。