论文
VocalCoachBench:根据歌唱专家反馈对音频语言模型进行基准测试
VocalCoachBench: Benchmarking Audio-Language Models on Expert Feedback for Singing
摘要
最近的音频语言模型越来越多地在识别、描述和推理音频方面进行评估,但面向专家的应用程序需要不同的功能:生成反馈来识别问题并根据输入提出纠正措施。我们推出了 VocalCoachBench,这是一个根据专家声乐指导反馈评估音频语言模型的基准。 VocalCoachBench 包含由 18 名专业声乐训练师注释的 515 条录音,产生 1,056 份专家意见和 12,051 条原子教练声明。它包括用于受控比较的同一歌曲子集和用于跨不同歌曲和录音条件进行分段反馈的多样化歌曲子集。为了适应专家反馈的开放性,VocalCoachBench 将确定性结构化目标与基于声明的自由诊断评估和纠正指导分开。人工注释分析表明,专家共识随标签粒度的变化而变化很大,从而激发了分层结构化指标和基于声明的开放式反馈评估。对 12 个最新音频语言模型的实验揭示了一致的差距:虽然模型可以比较性能并识别自由形式反馈中的广泛问题领域,但 Top-3 细粒度问题标签识别仍然低于标签先验基线,并且严格的诊断一致性保持在 7% 以下。据我们所知,VocalCoachBench 提供了第一个公共测试平台,用于评估基于音频的歌唱专家反馈,将音频语言评估从描述转向分析反馈。