论文
全模态语言模型中的人口统计和语言偏差评估
Demographic and Linguistic Bias Evaluation in Omnimodal Language Models
摘要
本文对在单一框架内处理文本、图像、音频和视频的全模态语言模型中的人口统计和语言偏差进行了全面评估。尽管这些模型正在被广泛部署,但它们在不同人口群体和模式中的表现尚未得到充分研究。针对人口统计属性估计、身份验证、活动识别、多语言语音转录和语言识别等任务评估了四种全模态模型。准确度差异是根据年龄、性别、肤色、语言和原籍国来衡量的。结果表明,图像和视频理解任务通常表现出更好的性能,并且人口差异更小。相比之下,音频理解任务表现出明显较低的性能和严重的偏差,包括不同年龄组、性别和语言之间的巨大准确度差异,以及频繁的预测崩溃到狭窄的类别。这些发现凸显了评估所有支持模式的公平性的重要性,因为全模式语言模型越来越多地在现实世界的应用中使用。