论文

大语言模型 中答案格式变化对性别偏见的影响

Effects of Answer Format Variation on Gender Bias in Large Language Models

模型评测鲁棒性、公平性与可信度评测

摘要

大语言模型 (LLM) 中的性别偏见或其他社会偏见经常通过问答或调查基准进行评估,其中 LLM 需要以预定义的答案格式给出响应。在调查科学中众所周知,答案格式对答案有很大的影响,就像LLM对提示措辞很敏感一样。然而,据我们所知,尚未研究答案格式的变化如何影响 LLM 中性别偏见的测量及其与人类反应分布的一致性。我们根据 BBQ 基准和 OpinionQA 调查数据评估了三个指令调整模型,涵盖封闭式、李克特量表和开放式格式,比较其他相同条件下的偏差测量和分布对齐。我们发现答案格式确实会极大地改变测量结果,包括顺序排名的逆转。出现这些差异是因为每种格式都会引发不同的响应行为,例如强制选择、基于比例的分布和自由文本生成中的拒绝。我们的研究结果强调了将答案格式视为 LLM 评估的实质性组成部分的重要性,并激励多格式设计以实现更稳健的模型评估。