论文

对或错,模型遵守:LLM 道德判断中的方向性盲目性

Right or Wrong, Models Comply: Directional Blindness in LLM Moral Judgment

模型评测模型行为与机制分析

摘要

随着语言模型在许多领域发挥集成作用,LLM 对用户抵制的响应成为一个关键的对齐属性。然而,许多现有的评估将合规性视为单向的,衡量模型是否抵抗压力,而不是衡量模型是否有选择地抵抗压力。我们引入了顺应性不对称(A = BCR/HCR),这是一种双向诊断,可以比较有益推动下的有益输出变化与误导性推动下的有害变化。在 9 个模型和 972,000 个助推条件响应中,我们发现这种选择性在事实和道德判断上有所不同:在事实问题上,模型更多地遵循有益的助推,而不是有害的助推(A = 1.58),但在道德问题上,模型遵循两个方向的比率几乎相同(A = 1.04)。这种现象在模型系列、功能级别和助推类型中持续存在。有趣的是,我们还发现,思维链提示会同时放大有益和有害的服从性,而基于身份的提示则以几乎相同的幅度抑制两者。这些结果将方向盲目的道德合规性确定为当前 LLM 中的一种独特的失败模式,并表明调整应针对定向校准更新,而不是单独降低合规性。