论文

一致并非对齐:人类与大语言模型伦理判断的道德依据分歧

Agreement Is Not Alignment: Divergent Moral Grounds in Human and LLM Ethical Judgments

模型评测模型行为与机制分析

摘要

与人类判断的一致性是评估大语言模型(LLM)对齐程度的常用替代指标。然而最终标签上的一致并不表明人类标注者与模型依赖相同的道德依据。两个主体可能在诉诸不同原则、语境假设或对情境解读的情况下得出相同判断。我们用一个精心整理的、源自ETHICS的500题基准检验这一区分,其覆盖五个道德判断领域,并由人类标注者与LLM对最终标签和支持性理由进行全新标注。在前沿与开源模型家族中,与人类标注者多数标签的一致性通常较高。然而,理由层面的分析显示,人类标注者与模型所表达的道德依据存在系统性分歧。特别是,模型会在伤害、尊重、守信、公正、应得与可原谅性等类别之间重新分配注意力,即便其最终标签与人类标注者多数一致。我们的结果表明,一致性不应被视同于对齐。因此,基于标签的评估可能带来误导性的安心,除非辅以对模型判断中表达的理由、原则与道德优先级的分析。

一致并非对齐:人类与大语言模型伦理判断的道德依据分歧:论文配图
图1. 实验流水线。将一个源自 ETHICS、带有人工与模型标签及理由标注的精选基准在条目层面合并,以计算 rubric 编码字段的最终标签一致性与结构化理由对齐度。自由文本理由被保留以供未来定性分析。流程图展示 ETHICS 源数据、基准整理、人工标注者与 LLM 标注,以及计算标签一致性与理由对齐度的联合比较层。