论文
HumDial-EIBench:人类记录的音频语言模型多轮情绪智力基准
HumDial-EIBench: A Human-Recorded Multi-Turn Emotional Intelligence Benchmark for Audio Language Models
摘要
评估音频语言模型 (ALM) 的情商 (EI) 至关重要。然而,现有的基准大多依赖于合成语音,仅限于单轮交互,并且严重依赖于开放式评分。本文提出了 HumDial-EIBench,一个评估 ALM EI 的综合基准。它使用 ICASSP 2026 HumDial 挑战赛中真实录制的人类对话,将情绪跟踪和因果推理重新表述为具有对抗性干扰因素的多项选择题,从而减轻认知任务的主观评分偏差。它保留了移情反应的生成,并引入了声学语义冲突任务来评估对矛盾的多模态信号的鲁棒性。对八个 ALM 的评估表明,大多数模型都难以应对多轮情感跟踪和隐式因果推理。此外,所有模型都表现出解耦的文本和声音同理心,以及在跨模式冲突期间严重的文本主导偏差。