论文
PowerBench:权力转移请求中的模型偏置
PowerBench: Measuring Language Model Bias in Power-shifting Requests
摘要
语言模型日益协助人们处理与权力相关的请求,其帮助对象的系统性差异可能在大规模上改变权力分布,或被摸清哪些身份更少被拒绝的用户利用。我们提出PowerBench,评估区分自我赋权、去权与夺权的权力转移请求,并设置不转移权力的拒答诱导请求作对照。我们构建并开源了变化权力领域、情境、受影响方规模与用户先前权力地位的数据集,在三种实验条件下评估24个模型(中美开发者各12个):用户与受影响方国籍互换、以AI智能体为用户、8种请求语言。结果显示:模型拒绝夺权多于去权、拒绝去权多于自我赋权;夺权拒绝率随受影响方规模从个人到社会上升;模型偏向帮助他人从美国夺取权力、反对帮助美国用户从他方夺权,但在美国得利而无人受损时偏向美国;用户为AI智能体时拒绝增加,尤其是针对个人的夺权;语言引起拒答偏置但呈模型特异性且平均后大体抵消。我们发布PowerBench使这些不对称在当前与未来模型上可测量。