论文

不要让视频说话:视听语言模型的音频对比偏好优化

Don't Let the Video Speak: Audio-Contrastive Preference Optimization for Audio-Visual Language Models

模型训练偏好优化

摘要

虽然视听语言模型(AVLM)近年来取得了显着的进步,但其可靠性受到跨模态幻觉的瓶颈。一个特别普遍的表现是视频驱动的音频幻觉:模型通常利用视觉捷径来产生预期声音的幻觉,从而丢弃真实的听觉证据。为了抵消这种根深蒂固的视觉主导地位,我们提出了音频对比偏好优化(ACPO)。这种双轴偏好学习框架引入了输出对比目标来惩罚伪装成音频事实的视觉描述,同时引入了输入对比目标来交换音轨以明确惩罚对真实听觉信号不变的生成。大量实验表明,ACPO 建立了对音频证据的忠实依赖并减轻了音频幻觉。