论文
设计使然的不连贯?论LLM的道德自我一致性
Incoherent by Design? On the Moral Self-Consistency of LLMs
摘要
LLM越来越多地被用于道德敏感的场景,但它们是否在不同情境下一贯地应用伦理原则尚不清楚。一个能陈述道德原则的模型,当同一场景被改写或重新框定时,仍可能违反该原则。这种不一致对任何输出被用于辅助道德决策的系统都是问题:如果生成式系统表现出内部不一致,AI介导系统的认知完整性就变得不确定。为研究这一问题,我们在受控提示框架内考察LLM道德推理的稳定性,覆盖三大哲学流派:义务论、功利主义和美德伦理。我们构建了道德等价的场景集,其中底层情境保持不变,而表述方式变化,以反映不同的伦理立场和风格扰动。然后我们评估多个模型的回复,包括GPT、Mistral和Llama。为评估一致性,我们把模型输出转换为结构化逻辑语句,并识别同一流派内生成的回复之间的矛盾。结果揭示了大量的不一致性,跨场景矛盾率最高达78%。这些发现指向生成式AI中更广泛的认知不稳定现象:模型无法可靠地与自身先前输出保持连贯。这种不稳定会带来真实后果:随着生成式系统影响人们形成信念、判断行为和吸收价值观,它们的不一致也会塑造人类的推理与决策。此外,如果系统无法一致地表达自己的规范承诺,价值对齐就成为移动靶而非明确目标。因此,我们主张证明内部不连贯是AI对齐的必要前提。