论文
规则与现实之间:论大语言模型道德判断的语境敏感性
Between Rules and Reality: On the Context Sensitivity of LLM Moral Judgment
摘要
人类的道德决定在很大程度上取决于环境。然而,对大语言模型道德的研究主要是研究固定场景。我们通过引入情境道德选择来解决这一差距,这是一个道德困境的数据集,具有道德心理学中已知的系统情境变化,可以改变人类的判断:后果论、情感论和关系论。通过评估 22 个大语言模型,我们发现几乎所有模型都是上下文相关的,将判断转向违反规则的行为。与人类调查相比,我们发现模型和人类最容易被不同的上下文变化触发,并且在基本情况下与人类判断一致的模型不一定在上下文敏感性上一致。这就提出了控制上下文敏感性的问题,我们通过激活引导方法来解决这个问题,该方法可以可靠地增加或减少模型的上下文敏感性。
