论文

审计大型音频语言模型中的协议级快捷方式判断语音评估

Auditing Protocol-Level Shortcuts in Large Audio Language Model Judges for Speech Evaluation

模型评测评测方法与指标

摘要

大型音频语言模型(LALM)越来越多地用作语音评估的自动判断器。然而,与人类评分的高度一致性并不能保证他们的判断是基于音频的。法官可以依靠评估协议本身提供的专业标签或参考数据,走捷径代替听音频。在本文中,我们审核了 LALM 判断中三种常见部署协议的协议级“快捷方式”:特征蓝图判断(其中音频被声学特征的结构化文本描述所取代)、参考条件判断和成对 A/B 比较。在六个法官和四个属性中,我们发现几个 LALM 依赖于协议级快捷方式。例如,在特征蓝图评审中,不正确的专家标签将五名评审的情绪准确度降低至0.10或更低,而在串联A/B比较中,Qwen3-Omni-Thinking经常选择相同的位置,而不管顺序交换如何。这些结果表明,除非模型和评估协议被联合评估,否则聚合协议可能会夸大 LALM 判断的有效性,并且每个模型-协议对都应该使用匹配的快捷探针进行评估。