论文

推理还是修辞?大语言模型道德推理解释的实证分析

Reasoning or Rhetoric? An Empirical Analysis of Moral Reasoning Explanations in Large Language Models

模型评测模型行为与机制分析

摘要

大语言模型是在进行道德推理,还是只是听起来像在推理?我们研究LLM对道德两难问题的回答是否展现出沿科尔伯格(Kohlberg)道德发展阶段真实的发展进程,还是说对齐训练只是产生了在表面上类似成熟道德判断、却缺乏底层发展轨迹的推理式输出。利用一个经三个评审模型验证的LLM评审(LLM-as-judge)评分流水线,我们对来自13个LLM(覆盖多种架构、参数规模与训练方案)的600多份回答、围绕六个经典道德两难进行分类,并开展十项互补分析,以刻画所得模式的性质与内部一致性。我们的结果揭示了一个显著倒置:无论模型规模、架构或提示策略如何,回答绝大多数对应后习俗水平推理(阶段5-6),而这实际上是人类发展规范的反转——人类中阶段4占主导。最引人注目的是,一部分模型表现出道德脱钩(moral decoupling):所陈述的道德理由与行动选择之间存在系统性不一致,这种逻辑不连贯在规模与提示策略变化下持续存在,代表一种独立于修辞娴熟程度的直接推理一致性失败。模型规模具有统计显著但实际很小的影响;训练类型没有显著的独立主效应;并且模型表现出近乎机械化的跨两难题一致性,在语义不同的道德问题上产生逻辑上难以区分的回答。我们提出,这些模式构成“道德腹语”(moral ventriloquism)的证据:通过对齐训练习得了成熟道德推理的修辞惯例,却没有获得这些惯例本应代表的底层发展轨迹。

推理还是修辞?大语言模型道德推理解释的实证分析:论文配图
图 22:后传统推理的出现与参数计数(分段回归)。根据对数参数计数绘制每个模型的平均道德推理阶段(95% CI)。分段回归在 ≈\approx32B 参数处识别变化点:变化点前的段(红色,斜率 =+0.383=+0.383)显示快速增长,而变化点后的段(绿色,斜率 =+0.267=+0.267)显示持续但减弱的增长。整体线性拟合(灰色虚线,r=0.36r=0.36)和橙色点划线标记第 5+ 阶段出现在 8B 一起表明,后传统框架在达到显着规模之前普遍出现。