论文

FairFund-Bench:评估 LLM 资源分配中的分配偏差

FairFund-Bench: Evaluating Distributive Bias in LLM Resource Allocation

模型评测基准与评测资源

摘要

大语言模型 (LLM) 越来越多地参与稀缺资源的分配,引发了人们对基于种族和性别等特征的偏见分配的担忧。然而,最近的 LLM 审计产生了不一致的结果,发现了对妇女和少数族裔的正面和负面歧视的证据,即使对于相同的模型也是如此。我们证明这种分歧可能是由于审计格式的差异引起的,并引入了 FairFund-Bench,这是一个系统地改变以前审计设计的关键特征的基准:评估任务(评级、排名或分配)、比较背景(单一或多重刺激)以及审计是透明的还是隐蔽的。该基准包括 600 个英语财务援助请求,这些请求是根据人工编写的模板创建的(根据 130 万个真实的 GoFundMe 活动进行校准),涵盖三个领域、四个种族和两个性别类别,以及源自福利应得理论的五个需求因果框架。在 14 个模型中,审计格式改变了偏见的方向:模型在单独对索赔人进行评级时对少数群体有利,但在并排排名时对某些群体进行惩罚。尽管总体上偏差程度较小,但隐蔽审计中的偏差程度比透明审计中的偏差大几倍,在透明审计中,面对仅索赔人姓名不同的上诉,模型绝大多数会平均分配资金。相比之下,因果框架效应大约超过人口效应一个数量级,并且在模型和审计格式之间保持一致,表明当前的 LLM 能够稳健地再现人类应得性评估。该基准评分模型基于四个标准(人口统计偏差、应得性一致性、跨任务一致性和跨上下文一致性),是公开可用的,并且可以很容易地适应其他实质性领域。