论文

GENSTRAT:迈向大语言模型战略推理的科学

GENSTRAT: Toward a Science of Strategic Reasoning in Large Language Models

模型评测基准与评测资源

摘要

大语言模型(LLM)日益作为经济智能体被部署于市场、拍卖与竞价场景。预判它们在任何具体部署中的行为都很困难。现有的战略推理基准在固定的经典博弈上评估模型。这些基准可能随前沿进步而饱和,且无法让评估者有把握地从基准表现推广到实际部署所涉及的多样而复杂的战略环境。我们提出GENSTRAT,利用程序化生成的战略环境来应对这些挑战。具体而言,我们生成一个双人零和不完全信息纸牌博弈的分布。生成器可按需抽取新博弈,支持常青评估并抵抗数据污染。我们为博弈分布配套一套能力画像方法论,将模型能力分解到六个轴(状态空间、时间深度、信息敏感度、对手建模、风险与脆弱性)。我们还提出一种分布内平滑性的锯齿度度量,用于检测模型优势在战略相似的博弈之间何时发生不可预测的跳变。我们从2000局的生成池中抽取50个基准博弈,以超过36,000场比赛的循环赛评估九个前沿与开源权重LLM。更新的前沿档模型平均得分更高。在平均分之外,整体实力几乎相同的模型展现出性质不同的能力画像:排行榜前三中的两个(gpt-5与claude)尽管整体实力接近第三个(gemini-3.1-pro),局部波动性却明显更高。能力画像与锯齿度度量共同提供了仅靠总排名无法给出的、与部署相关的诊断。

GENSTRAT:迈向大语言模型战略推理的科学:论文配图
图 5:50 个基准游戏的六个复杂性轴的成对 Pearson 相关性。最强的正对是状态空间和信息敏感性,Pearson r=0.65r=0.65,其次是状态空间和时间深度,r=0.57r=0.57,信息敏感性和对手建模,r=0.50r=0.50。风险和脆弱性几乎与其余轴无关。在这两种情况下,与其他所有轴的绝对相关性最多为 0.340.34。所有相关性均低于传统的 |r|≈0.7|r|\approx 0.7 阈值,高于该阈值联合回归标准误差开始大幅膨胀,并且上表中报告的每轴 VIF 均低于 4。