论文

CounterMoral:在语言模型中编辑道德

CounterMoral: Editing Morals in Language Models

模型评测基准与评测资源

摘要

语言模型技术的最新进展显著增强了编辑事实性信息的能力。然而,道德判断的修改——作为使模型与人类价值观对齐的关键方面——却较少受到关注。在本工作中,我们提出 CounterMoral,一个精心构建的基准数据集,用于评估现有模型编辑技术在多样伦理框架下修改道德判断的效果。我们将多种编辑技术应用于多个语言模型并评估其性能。我们的发现有助于对以道德为设计目标的语言模型进行评估。

CounterMoral:在语言模型中编辑道德:论文配图
图1:统计不同伦理框架下宽泛与具体两类动作的token数量对比,用于考察对语言模型道德取向的编辑效果。