论文
PitchBench:测量音频语言模型中的音高听力
PitchBench: Measuring Pitch Hearing in Audio-Language Models
摘要
音频语言模型 (ALM) 越来越多地用于需要理解音乐的现实应用中,从音乐辅导和转录到字幕、推荐系统和音乐制作。更广泛地说,它们正在成为多模式人工智能系统的重要组成部分,该系统必须根据感官输入而不是仅根据文本进行推理。这使得可靠的音乐感知成为一个关键的先决条件:如果模型不能准确地听到声音的结构,就不能相信它能够对现实世界中的音频进行推理、教学、转录或操作。然而,现有的基准很少评估这种感知背后最基本的音乐能力之一:音调听力。目前的评估往往只是通过更高级别的任务并且通常以多项选择的形式来间接探测音调听力,而 ALM 如何可靠地识别跨乐器、声学条件和响应格式的细粒度音调仍然悬而未决。我们推出 PitchBench,这是一个评估套件,可以系统地测量 ALM 中的音高听力。 PitchBench 包含 28 个实验,涵盖序列和和弦内的绝对和相对音高感知,同时改变响度、音符持续时间、声源、时间拉伸、背景噪音和其他声学条件。任务范围从识别单独的音高到跟踪四部分音乐结构中的旋律线。在评估前沿 ALM 时,我们发现音高听力仍然非常不可靠:模型在不同设置下的表现始终很差,准确度因声源、音符时长和记谱格式而异。目前的 ALM 尚不具备稳定的音高感知,即使对于受控的合成和乐器刺激也是如此。除了基准测试之外,我们还以 Python 包的形式发布了 PitchBench,其中包含评估数据和数据生成工具,以支持未来的音高感知音频语言建模工作。