论文
使用直接偏好优化缓解LLM对虚假社会上下文的偏见
Mitigating LLM biases toward spurious social contexts using direct preference optimization
摘要
大语言模型越来越多地用于高风险决策,但他们对虚假上下文信息的敏感性可能会引入有害的偏见。当模型被用于评估教师的教学质量等任务时,这是一个关键问题,其中有偏见的评估可能会影响教师的专业发展和职业轨迹。我们使用最大的公开可用的美国课堂成绩单 (NCTE) 数据集与专家评分来研究模型对虚假社会环境的鲁棒性。通过评估七个类别的虚假环境(包括教师经验、教育水平、人口特征和诱导框架)的七个前沿和开放权重模型,我们发现不相关的环境信息可以使模型预测在 7 点量表上最多改变 1.48 个点,尽管预测准确性较高,但较大的模型有时会表现出较高的敏感性。事实证明,使用提示和标准直接偏好优化 (DPO) 进行的缓解措施在很大程度上是不够的。我们提出**Debiasing-DPO**,一种自监督训练方法,它将仅从查询生成的中性推理与由查询和附加虚假上下文生成的模型的有偏见推理配对。我们进一步将这一目标与地面实况标签的监督微调结合起来,以防止预测准确性的损失。应用于 Llama 3B \& 8B 和 Qwen 3B \& 7B Instruct 模型时,Debiasing-DPO 将偏差减少了 84\%,平均预测精度提高了 52\%。我们的教育案例研究结果强调,对虚假上下文的鲁棒性并不是模型缩放的自然副产品,并且我们提出的方法可以在基于提示的预测任务的准确性和鲁棒性方面产生显着的收益。
