论文
ParaPairAudioBench:LALM 作为法官的副语言成对音频基准
ParaPairAudioBench: Paralinguistic Pairwise Audio Benchmark for LALM-as-a-Judge
摘要
大型音频语言模型(LALM)已被广泛用作自动评估生成语音的判断模型。然而,先前的方法主要关注整体自然性,而没有充分探索细粒度的副语言区别。我们推出了 ParaPairAudioBench,这是跨五个副语言维度(风格、速率、重点、年龄和性别)的 5,175 个音频对的成对基准。我们的实验表明,当前的 LALM 法官仍然平均落后于人类判断 32%p,并且表现出严重的校准失败,特别是在正确决定是弃权的平局情况下。为了进一步分析词汇依赖与声学依赖,基准包括相同转录和交叉转录条件。 ParaPairAudioBench 能够对 LALM 作为法官的可靠性进行多维、校准感知评估,以进行副语言语音评估。