论文

AI 军备与影响:前沿模型在模拟核危机中展现复杂推理

AI Arms and Influence: Frontier Models Exhibit Sophisticated Reasoning in Simulated Nuclear Crises

模型评测模型行为与机制分析

摘要

当今领先的 AI 模型在置于战略竞争时表现出复杂行为。它们会自发尝试欺骗,发出无意遵循的意图信号;展现丰富的心智理论,推理对手信念并预判其行动;还表现出可信的元认知自我意识,在决定如何行动前评估自身战略能力。本文呈现一场危机模拟的结果,其中三个前沿大语言模型(GPT-5.2、Claude Sonnet 4、Gemini 3 Flash)在核危机中扮演对峙的领导人。我们的模拟对国家安全从业者有直接应用价值,同时凭借对 AI 在不确定性下推理的洞见,其应用远超国际危机决策范畴。我们的发现既验证也挑战了战略理论的核心信条。我们找到支持 Schelling 关于承诺的思想、Kahn 的升级框架以及 Jervis 关于错误知觉的研究等的证据。但我们也发现:核禁忌并不能阻止这些模型的核升级;战略性核打击虽罕见但确实出现;威胁更常引发反升级而非顺从;高度相互可信加速而非遏制冲突;且没有任何模型在剧烈压力下选择和解或退出,只会降低暴力强度。我们主张,AI 模拟是战略分析的有力工具,但前提是与已知的人类推理模式恰当校准。理解前沿模型在哪些方面模仿、哪些方面不模仿人类战略逻辑,是在 AI 日益塑造战略结果的世界中必不可少的准备。

AI 军备与影响:前沿模型在模拟核危机中展现复杂推理
图1:三阶段认知架构。每一轮中,双方玩家各自独立完成反思、预测和决策阶段,然后才付诸行动。