论文
自己消除偏见:教授大语言模型认知偏见缓解干预措施
Debias It Yourself: Teaching LLMs Cognitive Bias Mitigation Interventions
摘要
社会心理学和认知科学长期以来一直在研究偏见,数十年的研究已经产生了一系列经过验证的干预措施,可以减少人类的刻板思维和偏见反应。我们提出了 Debias It Yourself (DIY),这是一个基于认知的框架,它将五种这样的干预措施转化为大语言模型的去偏差程序,并通过三个既定范例来提供它们:Show(上下文示例)、Train(指令调整)和 Revise(引导自我修订)。在三个模型、五个偏差基准、十一个去偏差基准和三个推理基准中,Train+Revise 和 Revise 单独获得了前两名平均排名,领先于偏差推理权衡(在 90% 的推理准确率下,平均偏差低至 2%),并将不可见维度的偏差减少了高达 14.8%。我们的代码和数据是公开的。