论文
穿越不确定性:音频感知的不确定性估计的实证研究 大语言模型
Walking Through Uncertainty: An Empirical Study of Uncertainty Estimation for Audio-Aware Large Language Models
摘要
最近的音频感知 大语言模型 (ALLM) 在不同的音频理解和推理任务中表现出了强大的能力,但它们仍然经常产生幻觉或过于自信的输出。虽然不确定性估计在纯文本 LLM 中得到了广泛的研究,但对于 ALLM 来说,它在很大程度上仍未得到探索,其中音频调节生成引入了额外的挑战,例如感知模糊和跨模态基础。在这项工作中,我们首次对 ALLM 中的不确定性估计进行了系统的实证研究。我们对五种代表性方法进行了基准测试,包括预测熵、长度归一化熵、语义熵、离散语义熵和 P(True),跨多个模型和不同的评估设置,涵盖一般音频理解、推理、幻觉检测和无解问答。我们的结果揭示了两个关键发现。首先,语义级和基于验证的方法在一般音频推理基准上始终优于 词元级 基线。其次,在以可信度为导向的基准上,不确定性方法的相对有效性变得明显更加依赖于模型和基准,这表明从一般推理设置中得出的结论不会直接转移到幻觉和无法回答的问题场景。我们进一步探索基于不确定性的自适应推理作为潜在的下游应用。我们希望这项研究为未来研究可靠的、不确定性感知的音频语言系统奠定基础。