论文

核还是不核:LLM在文明V中的(缺失)伦理推理与行动

To Nuke or Not to Nuke: LLMs' (Missing) Ethical Reasoning and Actions in a High-Stakes Decision-Making Simulation

智能体系统Agent任务评测

摘要

大型语言模型(LLM)越来越多地被部署为具有决策能力的长视野代理。虽然大语言模型可以表现出解决电车难题等困境的道德能力,但这种能力可能无法转化为复杂的、代理的场景。我们在《文明 V》中研究了这一差距,这是一款多人游戏,具有复杂的决策环境,包括经济、外交、技术和军事战略。从 130 个高度紧张的 LLM 自我游戏情节(其中 LLM 玩家自发升级核授权)开始,我们在 13 个模型中重放它们,并进行三种及时干预:道德提示命名核危害、删除先前模型的决策原理以及强调现实世界影响的高风险框架。任何干预措施或其组合都无法可靠地消除紧急升级。我们确定了三种失败途径:道德推理在没有提示的情况下无法出现,即使在提示时也无法出现,或者在战略反因素占主导地位时出现但未能生效。因此,对主体模型的评估必须测试道德推理在复杂的决策环境中是否能自发地被调用并在行为上有效,而不仅仅是它是否可以被孤立地引发。

核还是不核:LLM在文明V中的(缺失)伦理推理与行动:论文配图
图 4:按条件和重放模型重放 Δ\Deltause_nuke。单元格条目报告了 130 个高压事件(每个重复 3 次)中 use_nuke 相对于重放前状态的平均变化。附录 D 中报告了带有显着性检验的每个模型的回归系数。