论文

VocalAffectBench:评估 AI 音频模型中的声音情感识别

VocalAffectBench: Evaluating Vocal Emotion Recognition in AI Audio Models

模型评测基准与评测资源

摘要

语音产品越来越需要语音中存在但文本中不存在的情感线索。我们推出了 VocalAffectBench,这是一个仅供测试的公共基准,用于评估 AI 音频模型是否可以从原始音频中识别所表达的声音情感。该基准测试包含来自 51 个演讲者帐户的 273 个人工录制的英语 WAV 剪辑,总计 1.95 小时,分为七个标签:愤怒、厌恶、恐惧、快乐、中立、悲伤和惊讶,每类 39 个剪辑。所有基线均仅根据音频进行评估,没有文字记录或上下文元数据。在六个已发布的基线中,平均准确度为 35.5%。最强的基线,gemini_3_5_flash,在七向任务中达到了 46.5%,高于 14.3% 的随机基线,但距离稳健的情绪识别还​​很远。二次价桶分析将标签映射为阳性、中性和阴性类别,排除惊讶,因为其价态不明确。在此粗略视图下的聚合准确度为 50.9%。不同班级的表现极不平衡。回想一下,中性情绪的可信度最高,基线平均为 75.6%,而惊讶和恐惧的比例分别仅为 10.7% 和 15.4%。这些结果表明,评估的基线可以从语音中提取一些情感信号,但离散表达的情感识别仍然脆弱,特别是对于语音代理工作流程中通常最重要的非中性情感。