论文

大语言模型中的归因偏差

Attribution Bias in Large Language Models

模型评测鲁棒性、公平性与可信度评测

摘要

随着大语言模型(LLM)越来越多地被用于支持搜索和信息检索,它们能否将内容准确归因于其原作者变得至关重要。在本工作中,我们提出AttriBench,首个在知名度与人口统计学特征上均保持平衡的引语归因基准数据集。通过显式平衡作者知名度与人口统计学特征,AttriBench使得对引语归因中人口统计学偏差的受控研究成为可能。利用该数据集,我们在不同提示设置下评估了11个广泛使用的LLM,发现即便是前沿模型,引语归因仍然是一项具有挑战性的任务。我们观察到不同种族、性别以及交叉群体之间的归因准确率存在巨大且系统性的差异。我们进一步提出并研究了“抑制”(suppression)这一独特的失效模式,即模型完全省略归因,即使模型能够获取作者信息。我们发现抑制现象普遍存在,且在人口统计学群体间分布不均,揭示了标准准确率指标无法捕捉的系统性偏差。我们的结果将引语归因定位为衡量LLM表征公平性的基准。

大语言模型中的归因偏差:论文配图
图 4:跨模型和提示的总体归因准确性(正确百分比)。请注意,即使在前沿模型上,性能也非常低。误差线显示 95% 的置信区间。