论文

音频语言模型是否使用副语言证据?响应评估的反事实审计

Do Audio Language Models Use Paralinguistic Evidence? Counterfactual Audits for Response Evaluation

模型评测评测方法与指标

摘要

音频语言模型(ALM)越来越多地用作语音到语音系统的判断,但接收音频的判断实际上可能不会使用副语言证据。我们引入反事实审计来进行副语言响应评估。每个审核项目都固定笔录,同时改变情感、韵律或情感转变的时间,迫使有效的法官跟踪音频线索,而不是词汇内容或反应风格。我们使用本地单上下文判断协议和对比可恢复性控制来评估 ALM 法官,然后进一步将每个项目分解为其组成感知和响应映射技能。这会产生有用的诊断状态,识别判断失败的不同来源。在 Gemini、GPT 和开放音频模型中,我们发现对比成功常常夸大了本机判断的可靠性,并且相似的总体精度可以隐藏不同的故障模式。这些结果表明,不应仅通过准确性来评估 ALM 法官,而需要在部署之前进行彻底的行为审核。