论文

重定向,而不是删除:任务相关的刻板印象揭示了 LLM 对齐的局限性

Redirected, Not Removed: Task-Dependent Stereotyping Reveals the Limits of LLM Alignments

模型评测鲁棒性、公平性与可信度评测

摘要

语言模型的偏差有多大?答案取决于你如何提问。一个拒绝在不同种姓之间选择领导角色的模型,在填空任务中,会可靠地将高种姓与纯洁联系起来,将低种姓与缺乏卫生联系起来。单任务基准测试错过了这一点,因为它们仅捕获模型偏差概况的一部分。我们引入了涵盖 9 种偏见类型的分层分类法,包括种姓、语言和地理偏见等尚未充分研究的轴,通过涵盖显式决策到隐式关联的 7 项评估任务来实施。使用 \textasciitilde45K 提示审核 7 个商业和开放式 LLM,我们发现了三种系统模式。首先,偏差是与任务相关的:模型在显式探针上反驳刻板印象,但在隐式探针上重现它们,同一模型和身份组的任务类型之间的刻板印象得分差异高达 0.43。其次,安全一致性是不对称的:模型拒绝将负面特征分配给边缘化群体,而是自由地将正面特征与特权特征联系起来。第三,未经充分研究的偏差轴显示出所有模型中最强烈的刻板印象,这表明调整工作跟踪基准覆盖范围而不是损害严重程度。这些结果表明,单一基准审计系统性地错误描述了 LLM 偏见,并且当前的一致性做法掩盖了代表性损害,而不是减轻了损害。