论文
AOR-Bench:大型音频语言模型是否过度拒绝伪有害查询?
AOR-Bench: Do Large Audio Language Models Over-Refuse Pseudo-Harmful Queries?
摘要
大型音频语言模型 (LALM) 在各种音频任务中都表现出了强大的性能。随着它们越来越多地部署在现实世界的应用中,确保其安全性变得更加重要。尽管拒绝机制通过阻止 LALM 响应有害请求来充当关键的保护措施,但它们也可能导致过度拒绝,即模型错误地拒绝良性查询。这个问题在音频领域尤其具有挑战性,因为单独看来有害的语音在与周围的声学环境(例如背景声音)一起解释时可能会变得良性。为了研究这个问题,我们引入了 AOR-Bench(音频过度拒绝基准),这是第一个专为 LALM 设计的过度拒绝基准。 AOR-Bench 包含 6 个场景类别的 3,000 个伪有害音频样本。通过评估来自 6 个主要模型家族的 12 个代表性 LALM,我们发现过度拒绝现象很普遍(图 1),并揭示了其安全判断中的几个重要模式。作为缓解这一问题的初步努力,我们进一步探索了两种轻量级策略(例如思想链和激活引导)来减少过度拒绝。