论文

大型音频语言模型可以忽略多语言干扰吗?他们的选择性听觉注意能力的评估

Can Large Audio Language Models Ignore Multilingual Distractors? An Evaluation of Their Selective Auditory Attention Capabilities

模型评测基准与评测资源

摘要

多语言干扰下强大的选择性听觉注意对于可靠的 LALM 部署至关重要。我们介绍 MUSI,这是一种受鸡尾酒会启发的基于源的口语理解和推理的受控诊断评估。每个项目将英语目标对话与英语、西班牙语、韩语或中文的合理干扰项配对,并在受控 SNR 下评估 (1) 单流、(2) 基于分离和 (3) 端到端鸡尾酒会设置下的模型。在四个开放权重和两个闭源 LALM 中,我们发现模型相关的语言条件变异和不利 SNR 下的脆弱性增加。错误主要是由干扰源引起的混淆,而分离可以减少声学重叠,但往往无法解决源归属问题。这些发现强调选择性听觉注意是可靠部署 LALM 的主要能力。