论文

大语言模型 的是-否偏差反映了答案顺序和措辞,而不是道德判断的转变

The yes-no bias of large language models reflects answer order and wording, not shifts in moral judgment

模型评测评测方法与指标

摘要

大语言模型 (LLM) 越来越多地发出被解读为二元判决的判断,越来越多的文献报道了这种判断在逻辑上不相关的措辞变化下发生了变化——其中包括对道德困境的放大的是与否偏见,而这在人类中是不存在的。单个框架无法说明这种转变是什么:在是/否问题中,“否”一词既是逻辑判断,又是词汇标记,也是最后打印的选项。我们引入了一个心理测量测试组,将这些分开:交叉对称化——每个逻辑上不相关的因素以平衡对的形式翻转——跨越问题形式的语料库。逻辑上等效形式的分级评级恢复了连贯的内部道德尺度:前沿模型的立场$θ$几乎是格式不变的($\pm 1$轴上的跨形式不连贯性0.12-0.21);小型开放权重模型会以特定于模型的方式失败。通过“是/否”强制做出结论会覆盖一个可分解的工件:对最后打印的选项的顺序偏差 - 与经典的人类首要地位相反 - 加上对单词“不”的词汇拉力;该工件仅在 Claude 模型中很重要(故事平均 -0.32 到 -0.86),GPT-5.5 和 Gemini 的 $\approx 0$,并且在扩展推理下缩小。言语和判决共享同一个标记;将单词替换为任意标签将它们分开,并且判决附加的逻辑偏差证明每个前沿模型的 $\approx 0$,而模型特定的标签和订单附件仍然存在:模型不会被拒绝 - 拉力遵循印刷表面,而不是它所承载的判决。最小模型 $P = σ((θ\pm m)/s)$ 通过框架敏感性 m 和道德决断力 s 总结任何此类伪影,与采样温度明显不同。该电池适用于任何困境集和二进制格式:测量模型值需要跨越问题的框架,而不是询问一次。