论文
CounterMoral:在语言模型中编辑道德
CounterMoral: Editing Morals in Language Models
摘要
语言模型技术的最新进展显著增强了编辑事实性信息的能力。然而,道德判断的修改——作为使模型与人类价值观对齐的关键方面——却较少受到关注。在本工作中,我们提出 CounterMoral,一个精心构建的基准数据集,用于评估现有模型编辑技术在多样伦理框架下修改道德判断的效果。我们将多种编辑技术应用于多个语言模型并评估其性能。我们的发现有助于对以道德为设计目标的语言模型进行评估。
