语言模型如何处理道德指令?四种模型的深思熟虑、一致性和其他认可
How Do Language Models Process Ethical Instructions? Deliberation, Consistency, and Other-Recognition Across Four Models
摘要
对齐安全研究假设道德指令可以改善模型行为,但语言模型内部如何处理这些指令仍然未知。我们在四种模型(Llama 3.3 70B、GPT-4o mini、Qwen3-Next-80B-A3B、Sonnet 4.5)、四种道德指令格式(无、最低规范、推理规范、美德框架)和两种语言(日语、英语)中进行了 600 多次多智能体模拟。验证性分析完全复制了先前研究中的 Llama Japanese 解离模式(所有三个假设的 $\mathrm{BF}_{10} > 10$),但其他三个模型都没有重现该模式,将其确立为模型特定的。三个新指标——审议深度(DD)、跨困境的价值一致性(VCAD)和其他识别指数(ORI)——揭示了四种不同的道德处理类型:输出过滤器(GPT;安全输出,无处理)、防御性重复(Llama;通过公式化重复实现高度一致性)、批判性内化(Qwen;深度深思熟虑、不完全整合)和原则一致性(十四行诗;深思熟虑、一致性和其他识别同时发生)。核心发现是处理能力和指令格式之间的相互作用:在低 DD 模型中,指令格式对内部处理没有影响;在高 DD 模型中,合理的规范和美德框架会产生相反的效果。词汇对道德指令的遵守与细胞水平的任何处理指标都不相关($r = -0.161$ 到 $+0.256$,所有 $p > .22$;$N = 24$;权力有限),这表明安全、合规性和道德处理在很大程度上是分离的。这些处理类型显示出与临床罪犯治疗中观察到的模式的结构对应性,其中没有内部处理的正式合规性是公认的风险信号。