论文

偏见与推理的机制:解读《LLM》中思想链提示对性别偏见的影响

Mechanics of Bias and Reasoning: Interpreting the Impact of Chain-of-Thought Prompting on Gender Bias in LLMs

模型评测模型行为与机制分析

摘要

尽管有大量文件表明 大语言模型 (LLM) 编码了性别偏见,但它越来越多地部署在社会敏感环境中。思想链(CoT)提示已被提议作为一种减轻偏见的方法。然而,现有的评估主要集中在 LLM 基准性能的变化上,对于明显的偏差减少是否反映了模型内部机制的有意义的变化提供了有限的洞察。在这项工作中,我们将基于基准的评估与机械可解释性技术和推理链失败分析相结合,研究 CoT 提示如何影响 LLM 中的性别偏见。我们的结果证实了跨基准的 LLM 输出中存在刻板偏差,这表明 CoT 提示并不能始终如一地减少偏差差距。机制分析表明,尽管 CoT 平衡了某些注意力头簇中的偏见行为,但性别偏见仍然嵌入在隐藏的表征中,表明只是表面上的缓解。对推理链的检查进一步表明,这些改进源于记忆和对数据集的熟悉,而不是对偏见的真正理解。