论文

HEAR:真实的声音,真实的偏见:大规模人类记录的、人口多样化的音频语言模型基准

HEAR: Real Voices, Real Bias: A Large-Scale Human-Recorded, Demographically Diverse Benchmark for Audio Language Models

模型评测基准与评测资源

摘要

我们引入了 HEAR(真实说话者对音频-LLM 偏差的人工记录评估),这是一个大规模的、生态上有效的基准,包含来自 843 个不同人口的参与者的 87,000 个真实人类音频样本。 HEAR 通过多项选择题回答 (MCQA) 和开放式长格式任务实现综合评估。据我们所知,这是第一个完全基于真实人类语音的大规模语音基准测试。我们评估实时语音到语音和语音到文本架构的模型行为。我们的结果表明,语音条件偏差是模型特定的属性。此外,我们证明个性化指令不断加剧人口差异。我们的研究结果表明,语音偏差是一种可控的模型特征,为未来音频大语言模型开发中的偏差缓解和评估提供了基础框架。