论文

大语言模型 是否编码机构经验?歧义下跨语言道德推理的证据

Do Large Language Models Encode Institutional Experience? Evidence from Cross-Linguistic Moral Reasoning Under Ambiguity

模型评测模型行为与机制分析

摘要

大语言模型 (LLM) 在不同语言的道德推理中表现出系统性差异,但这种差异的来源仍不清楚。我们测试了这样的假设:语言对所使用的制度环境的各个方面进行编码,从而允许 LLM 通过训练继承制度特定的道德先验。我们通过涵盖广泛的制度质量梯度的九种语言、六种前沿 LLM 和两项预先注册的研究,研究了其可接受性取决于制度运作的道德困境。在研究 1 中,明确的制度框架产生了一致无效的结果:跨语言道德分歧在制度偶然情景中没有增加,也没有跟踪语言社区之间的制度差异。在研究 2 中,我们引入了制度上模糊的情景,其中存在机构利益但没有明确说明。在这些条件下,跨语言道德分歧相对于制度上的惰性控制有所增加,并且除了一个理论上信息丰富的例外之外,它与语言社区之间现实世界的制度差异有关。明确的框架再次减弱了这些影响。这些发现表明,制度经验可能会在塑造 LLM 道德推理的语言中留下可察觉的痕迹,同时也表明明确的制度线索可以抑制这些差异的表达。