论文

VIBE:通过真实世界语音对大型音频语言模型进行语音诱导的开放式偏差评估

VIBE: Voice-Induced open-ended Bias Evaluation for Large Audio-Language Models via Real-World Speech

模型评测鲁棒性、公平性与可信度评测

摘要

大型音频语言模型(LALM)越来越多地集成到日常应用中,但它们的生成偏差仍未得到充分探索。现有的语音公平性基准依赖于合成语音和多项选择题 (MCQ),两者都提供了碎片化的公平性观点。我们提出了 VIBE,这是一个使用人工录制的语音,通过开放式任务(例如个性化推荐)来评估生成偏差的框架。与 MCQ 不同,我们的方法允许刻板关联在没有预定义选项的情况下有机地体现,从而使其可以轻松扩展到新任务。评估 12 个最先进的 LALM 揭示了现实场景中的系统偏差。性别和口音线索都会引发统计上显着的分布变化,并且偏差的大小强烈依赖于任务。