论文

《大语言模型》中情绪会影响道德判断吗?

Do Emotions Influence Moral Judgment in Large Language Models?

模型评测模型行为与机制分析

摘要

大语言模型 已将情绪识别和道德推理作为不同的能力进行了广泛的研究,但情绪影响道德判断的程度仍有待探索。在这项工作中,我们开发了一种情感诱导管道,将情感注入道德情境中,并评估多个数据集和 LLM 中道德可接受性的变化。我们观察到一种方向性模式:积极情绪会增加道德可接受性,而消极情绪会降低道德可接受性,其影响足以在高达 20% 的案例中扭转二元道德判断,并且敏感性与模型能力成反比。我们的分析进一步表明,特定情绪有时可能会与其效价所预测的相反(例如,悔恨反而会增加可接受性)。一项补充人类注释研究表明,人类没有表现出这些系统性转变,表明当前 LLM 中存在对齐差距。