论文

通过多模态直接偏好优化减少 LLM 音频理解幻觉

Hallucination Reduction for LLM-Based Audio Understanding via Multimodal Direct Preference Optimization

模型训练偏好优化

摘要

当同时呈现音频和文本输入时,大型音频语言模型 (LALM) 容易产生幻觉并过度依赖文本先验。为了减轻这些幻觉,我们建议利用多模态直接偏好优化(mDPO)目标,该目标通过对比完整和失真的音频对应项,迫使模型将其生成基于声学输入。我们通过应用各种声学扰动将这种偏好学习框架扩展到音频领域。通过跨 DCASE 2025 Challenge 和 AH Existence 数据集评估 Qwen2-Audio 骨干模型,我们证明将 mDPO 扩展到 LALM 可以显着增强复杂 DCASE 数据集中的时间推理,并提高 AH 基准中基本存在 验证 的性能。我们将时间反转、频率掩蔽和随机噪声确定为最有效的扰动。最终,我们的方法在 DCASE 2025 数据集上实现了 14.0% 的绝对准确度提升,在 AH Existence 上实现了 27.4% 的绝对准确度提升。

通过多模态直接偏好优化减少 LLM 音频理解幻觉的原论文方法或结果图
图 1:减少幻听的 mDPO 框架概述。