论文
思考模式如何改变LLM道德判断?五个前沿模型的受控即时vs思考比较
How Does Thinking Mode Change LLM Moral Judgments? A Controlled Instant-vs-Thinking Comparison Across Five Frontier Models
摘要
我们评估启用厂商提供的推理模式是否改变同一模型检查点内的道德判断。跨100个道德判断场景与五个前沿推理训练LLM(Claude Sonnet 4.6、GPT-5.5、Gemini 3 Flash、DeepSeek V3.1与Qwen3.5 397B),即时与思考模式间的总体二元裁决一致性保持高位且统计上不可区分(Krippendorff's alpha=0.78对0.79)。然而分歧集中在21个模型争议场景上——即时模式的一致性接近随机(alpha=0.08)。在这些场景上,推理方向性地收窄跨模型分歧,把平均成对一致性从5.4提高到6.7(满分10)。推理还降低五个模型中三个的人口统计-判断不一致,且未增加任何模型的不一致。跨全部五个模型家族,推理改变自标伦理框架的频率高于改变二元裁决的频率。
