论文

响亮、更长、更生动:语音大语言模型评审中的声学捷径和未明确的基本原理

Louder, Longer, Livelier: Acoustic Shortcuts and Underspecified Rationales in Speech LLM Judges

模型评测评测方法与指标

摘要

大语言模型作为评审广泛用于评估文本,但将这种范式扩展到语音需要模型来解释声学和语言证据。这引入了特定于模态的风险:语音评审可能会将感知上显着的提示视为质量的证据,即使该提示与目标标准无关或比人类听众给予的权重更大。我们将这种行为称为声学捷径。为了研究它,我们使用对强度、内容丰富度和情感表达的受控操作来审核六位语音大语言模型评审。我们评估逐点评分和成对比较,使用人类偏好校准来解释结果。评委们始终如一地奖励响亮的音频,比人类听众更喜欢内容丰富的语音,并将情感传递映射到质量偏好中。这些影响在成对比较中最为明显,而逐点分数常常掩盖它们。更令人担忧的是,随附的理由很少识别出改变判断的声学提示,而是反复依赖有限的词汇,使它们在声学上不明确。总之,这些发现表明,可靠的语音评审必须抵制声学捷径,并将其理由建立在其决策背后的声学证据之上。为了支持再现性和未来的审计,我们还发布了 SpeechJudgeAudit,这是本研究中使用的受控刺激和评估工具。