论文

当AI穿行于战争迷雾之中

When AI Navigates the Fog of War

模型评测模型能力评测

摘要

在战争轨迹成为历史上显而易见的事实之前,AI能对战争进行推理吗?分析这一能力很困难,因为回溯性地缘政治预测深受训练数据泄露的混淆。我们通过一个时间锚定的案例研究来应对这一挑战:研究对象是2026年中东冲突的早期阶段,该冲突在当前前沿模型的训练截止之后才展开。我们构建了11个关键时间节点、42个节点特定的可验证问题和5个一般性探索问题,要求模型仅依据各时点本可公开获得的信息进行推理。这一设计大幅缓解了训练数据泄露的顾虑,营造出适合研究模型如何在战争迷雾下分析正在展开危机的设定,并据我们所知提供了首个对LLM在持续地缘政治冲突中推理的时间锚定分析。我们的分析揭示三个主要发现。首先,当前最先进的大语言模型常展现出惊人程度的战略现实主义,能超越表面言辞、推理更深层的结构性动因。其次,这种能力在各领域并不均衡:模型在经济与后勤等结构化情境中比在政治模糊的多行为体环境中更可靠。最后,模型的叙述随时间演变,从早期对快速遏制的预期,转向对地区僵持与消耗性降级的更系统性解释。鉴于撰写时冲突仍在进行,本工作可作为地缘政治危机展开期间模型推理的存档快照,使未来研究得以摆脱回溯分析的后见之明偏差。

当AI穿行于战争迷雾之中:论文配图
图 1:2026 年中东冲突早期阶段的关键时间节点(上)以及选定节点的代表性模型分析(下)。模型在战争迷雾下展示了可识别的战略推理模式,并且它们的分析随着时间线上新信息的出现而不断发展。