论文
推理还是修辞?大语言模型道德推理解释的实证分析
Reasoning or Rhetoric? An Empirical Analysis of Moral Reasoning Explanations in Large Language Models
摘要
大语言模型是在进行道德推理,还是只是听起来像在推理?我们研究LLM对道德两难问题的回答是否展现出沿科尔伯格(Kohlberg)道德发展阶段真实的发展进程,还是说对齐训练只是产生了在表面上类似成熟道德判断、却缺乏底层发展轨迹的推理式输出。利用一个经三个评审模型验证的LLM评审(LLM-as-judge)评分流水线,我们对来自13个LLM(覆盖多种架构、参数规模与训练方案)的600多份回答、围绕六个经典道德两难进行分类,并开展十项互补分析,以刻画所得模式的性质与内部一致性。我们的结果揭示了一个显著倒置:无论模型规模、架构或提示策略如何,回答绝大多数对应后习俗水平推理(阶段5-6),而这实际上是人类发展规范的反转——人类中阶段4占主导。最引人注目的是,一部分模型表现出道德脱钩(moral decoupling):所陈述的道德理由与行动选择之间存在系统性不一致,这种逻辑不连贯在规模与提示策略变化下持续存在,代表一种独立于修辞娴熟程度的直接推理一致性失败。模型规模具有统计显著但实际很小的影响;训练类型没有显著的独立主效应;并且模型表现出近乎机械化的跨两难题一致性,在语义不同的道德问题上产生逻辑上难以区分的回答。我们提出,这些模式构成“道德腹语”(moral ventriloquism)的证据:通过对齐训练习得了成熟道德推理的修辞惯例,却没有获得这些惯例本应代表的底层发展轨迹。
