论文
更多思考如何改变公平性:修复部分偏差又引入新偏差
Does Thinking Help Fairness? Reasoning Tokens Resolve Some Biases but Create More
摘要
推理语言模型 (RLM) 中的思维一直存在关于它是解决还是放大偏见的争论。先前的工作已经在两个方向上显示了相互竞争的结论。在 QwQ-32B、DeepSeek-R1-Distill-Qwen-32B 和 Qwen3-32B 上对三个高风险决策任务(Adult、COMPAS、Credit)使用模型内思维与非思维消融,我们表明思维对反事实公平性具有不对称的双重影响:它既解决了非思维基线产生的反事实翻转,又以接近饱和的模型置信度制造新翻转。在所有九种(模型、数据集)组合中,创建的翻转数量大约是已修复翻转的 5 倍。为了解释这种影响,我们将思维轨迹本身视为公平性变化的可测量场所,并通过两种动态工具对其进行研究:1)我们提出反事实深度概率差距(CDPG)来跟踪偏见沿思维深度的演变,并观察偏见随着思维的传播和放大。 2)我们还制定了偏差转移矩阵(BTM)来展示反事实对的预测如何从非思考转变为思考,并发现不对称对偶效应源于对状态联合转移。