论文
通过多模态直接偏好优化减少 LLM 音频理解幻觉
Hallucination Reduction for LLM-Based Audio Understanding via Multimodal Direct Preference Optimization
摘要
当同时呈现音频和文本输入时,大型音频语言模型 (LALM) 容易产生幻觉并过度依赖文本先验。为了减轻这些幻觉,我们建议利用多模态直接偏好优化(mDPO)目标,该目标通过对比完整和失真的音频对应项,迫使模型将其生成基于声学输入。我们通过应用各种声学扰动将这种偏好学习框架扩展到音频领域。通过跨 DCASE 2025 Challenge 和 AH Existence 数据集评估 Qwen2-Audio 骨干模型,我们证明将 mDPO 扩展到 LALM 可以显着增强复杂 DCASE 数据集中的时间推理,并提高 AH 基准中基本存在 验证 的性能。我们将时间反转、频率掩蔽和随机噪声确定为最有效的扰动。最终,我们的方法在 DCASE 2025 数据集上实现了 14.0% 的绝对准确度提升,在 AH Existence 上实现了 27.4% 的绝对准确度提升。
