论文
多模式中的人口统计公平性 LLM:人脸验证中性别和种族偏见的基准
Demographic Fairness in Multimodal LLMs: A Benchmark of Gender and Ethnicity Bias in Face Verification
摘要
多模态 大语言模型 (MLLM) 最近被探索作为人脸验证系统,用于确定两个人脸图像是否属于同一个人。与专用人脸识别系统不同,MLLM 通过视觉提示并依赖一般视觉和推理能力来完成此任务。然而,这些模型的人口公平性在很大程度上仍未得到探索。在本文中,我们提出了一项基准研究,该研究评估了来自六个模型系列的九个开源 MLLM,参数范围从 2B 到 8B,涉及四个种族群体和两个性别群体的 IJB-C 和 RFW 人脸验证协议。我们在每个人口群体的多个操作点上使用等错误率和真实匹配率来衡量验证准确性,并使用四个基于 FMR 的公平性指标来量化人口差异。我们的结果表明,FaceLLM-8B(我们研究中唯一的面部专用模型)在两个基准测试中都远远优于通用 MLLM。我们观察到的偏差模式与传统人脸识别中常见的偏差模式不同,不同的群体受到的影响最大,具体取决于基准和模型。我们还注意到,最准确的模型不一定是最公平的,总体准确性较差的模型可能看起来很公平,因为它们在所有人口群体中产生一致的高错误率。