论文

当功能无法组合时:诊断大型音频语言模型中的组合性差距

When Capabilities Fail to Compose: Diagnosing the Compositionality Gap in Large Audio-Language Models

模型评测模型能力评测

摘要

大型音频语言模型(LALM)在单个音频任务上表现强劲,但这些功能是否可以可靠地组合仍有待探索。我们对 LALM 中的能力构成进行了受控诊断研究,要求模型集成音频属性识别、提示条件片段选择以及下游 ASR 或问题解答。我们构建具有不同声学线索的两个话语输入,以评估环境声音、性别和情感线索的构图,并将 ASR、数学 QA 和事实 QA 作为下游任务。在四个开源 LALM 中,40 个模型-任务-提示设置中的 39 个设置中的组合 QA 准确率平均下降了 26.7 个百分点。 ASR 表现出类似的一致退化,40 个设置中的 39 个设置中,WER 平均增加了 28.5 个百分点,而退化程度因模型、提示类型和提示显着性而异。我们通过输出格式、位置偏好和思想链 (CoT) 分析进一步探讨这些失败。我们的研究揭示了拥有个人音频能力和可靠地创作它们之间存在系统性差距。