论文

AudioICL-Bench:大型音频语言模型上下文学习的基准

AudioICL-Bench: A Benchmark for Large Audio Language Model In-Context Learning

模型评测基准与评测资源

摘要

上下文学习 (ICL) 有望适应音频的 无需训练,其中标记每个新条件的成本很高。然而,现有的音频 ICL 研究主要测量任务识别,其中演示仅提示预先训练的功能,而不是任务学习,其中真正新的输入标签映射必须仅从演示中推断出来。我们引入了 AudioICL-Bench,这是一种诊断基准,其每集规则都会重新采样,因此无法从先验知识中恢复出正确答案。它的九项任务沿着两个轴组织,将必须从演示中学习的内容与必须在信号中感知的内容分开,从而使失败能够归因于任一来源。在五种大型音频语言模型中,当感知很容易时,最强大的模型很容易将任意声音绑定到新标签,但在时间测量和组合多个诱导规则上崩溃,揭示了两个主要的能力边界:时间感知和多规则组合。