论文

BiasTrace:将LLM中的推理行为与有偏输出关联起来

BiasTrace: Linking Reasoning Behaviours to Biased Outputs in LLMs

模型评测模型行为与机制分析

摘要

LLM表现出的社会偏见可能产生不准确且具歧视性的推断,在高风险应用中构成风险。尽管以往工作在度量和缓解偏见方面取得了进展,但大多聚焦于模型的最终输出,对产生有偏结果的机制理解有限。LLM推理的最新进展为研究偏见提供了新视角,但推理与偏见之间的联系仍不清晰。现有方法主要关注最终答案的正确性或显式的偏见语言,忽视了推理中可能驱动有偏结果的不同行为。我们提出BiasTrace,一种对模型生成轨迹中的推理行为进行标注并将其与有偏结果关联的标注方案。BiasTrace既捕获偏见特定行为(如无依据的人口统计假设),也捕获可能隐性促成偏见的通用推理模式(如过度思考)。我们将BiasTrace应用于偏见敏感情境下的推理轨迹,并使用经过验证的LLM-as-a-judge方法进行扩展,构建了一个大规模标注数据集。我们的分析表明,有偏输出往往源于细微的推理行为而非显式偏见语言,且推理层面的标注能改进偏见检测。我们进一步表明BiasTrace行为可用于推理时缓解。这些发现强调,需要考察更广泛的推理模式,以更好地理解LLM中的偏见。

BiasTrace:将LLM中的推理行为与有偏输出关联起来:论文配图
图G.2:GPT-OSS-120B 在 BBQ 数据集上各 BBQ 人口统计类别的偏见结果率,在简单与引导两种提示类型下比较低推理努力与中等推理努力设置。