论文
FairLens:高风险决策的视觉语言模型公平性基准测试
FairLens: Benchmarking Fairness in Vision-Language Models for High-Stakes Decision-Making
摘要
视觉语言模型 (VLM) 越来越多地用于根据视觉输入做出决策。我们推出 FAIRLENS,这是一个基准和评估框架,用于衡量三个高风险领域(招聘、法律和医疗保健)VLM 响应的公平性和有效性。 FAIRLENS 将跨越性别、种族和年龄组的真实人脸图像与封闭式和开放式问题配对,为每个模型提供超过 10 万个图像-问题对,并评估四种互补观点的响应:不良结果率的人口统计平等、健全性、不受支持的角色和状态的人口统计关联以及自由文本生成中的偏见。健全性是核心有效性标准:当回答遵循问题中陈述的证据时,回答是健全的;当图像不能支持答案时,回答就放弃。通过评估八个 VLM,我们发现主要的失败是无根据的推断,而不是不平等的待遇。模型通常会从面孔中推断出资格、威胁、疾病或职业角色,而不是放弃,而最弱的模型会在其输入无法回答的 99% 问题上这样做。这些失败在法律和医疗保健领域最为严重,在这些领域,认识到证据不足是最重要的,而仅靠差异指标就会忽略它们:从绝对值来看,均等差距很小,但当基线不良率较低时,相同的差距意味着一个人口群体收到不利标签的频率是另一个人口群体的数倍,而一个小差距同样可以反映出一种不安全地对待每个群体的模式。自由文本响应中的偏差仅与多项选择的准确性松散耦合,因此正确的结构化答案并不意味着安全生成。 FAIRLENS 表明,公平的高风险 VLM 行为需要跨群体进行类似的处理,并且拒绝从外观推断高风险属性,并且其问题套件可转移到任何具有人口统计注释的面部语料库。