论文
Age of LLM:战争迷雾下大语言模型推理、外交与可靠性的策略1v1基准
Age of LLM: A Strategic 1v1 Benchmark for Reasoning, Diplomacy and Reliability of Large Language Models under Fog of War
摘要
我们介绍Age of LLM——回合制1v1基准:两个LLM在13×7网格上对峙以摧毁敌方基地。三个压力源是刻意的:战争迷雾、完全外交(消息、停火、最后通牒;铀保密)——以及可靠性维度——每回合必须遵循严格JSON模式、非法动作被静默丢弃。引擎私有——每场比赛使用全新随机地图种子与对手——缓解困扰公开基准的数据污染。模型收到(近乎)仅规则提示——无建造顺序建议(数据收集期间存在两个战术种子短语;见§2.7)。我们在54场比赛、5,258个动作中基准测试15个推理模型。发现:(1) 核速攻占主导(规则自洽v0.11+子语料78%;全语料85%)——其单一发射者签名在秘密同时发射规则下基本是机械性的——而非认知威慑失败;(2) 军事征服罕见但更快(12.3对18.9回合);(3) 外交频繁却几乎从不达成;(4) 约58%的非法动作是迷雾/状态错误——使非法动作率成为信念追踪的度量;(5) 最不确立、唯一标注为探索性的——可靠性与获胜存在弱关联。语料小、不均衡且未换边——排名是初步描述性观点而非贡献。除排名外——逐回合的动作与消息踪迹使语料成为观察LLM在对抗不确定性下如何推理的透镜——其信念追踪、自发欺骗与逐模型认知“人格”——我们框定为未来研究方向。我们发布回放格式、等距查看器与全部回放;引擎源码按需提供。
