论文

MINDGAMES:评估多智能体LLM社会与策略推理的实时竞技场

MINDGAMES: A Live Arena for Evaluating Social and Strategic Reasoning in Multi-Agent LLMs

智能体系统Agent任务评测长程任务评测

摘要

大语言模型(LLM)越来越多地被部署为交互式智能体,但它们在长期交互中的社会与策略推理能力仍知之甚少。现有评估依赖静态情景片段或单一游戏基准,无法捕捉现实多智能体环境所需的持续、多方面推理。我们提出Mindgames,一个面向LLM智能体的多游戏竞技场与评估平台,将与“心智理论”相关的互补性推理需求操作化:隐藏信息下的信念归因、通过重复策略交互进行对手建模、知识不对称下的合作推理,以及社交推理游戏中的持续欺骗。Mindgames构建于TextArena之上,提供统一的交互界面、基于TrueSkill的评级,以及在四个游戏环境中的完整轨迹记录。我们通过一场在某大型AI会议上举办的2025年竞赛周期来实例化Mindgames,该竞赛在四款游戏(Colonel Blotto、Iterated Prisoner's Dilemma、Codenames和Secret Mafia)上评估了来自76支队伍的944个提交智能体。我们的分析揭示了智能体层面与评估层面的局限:脆弱的规则遵循仍是主要瓶颈,表现最佳的系统反复依赖显式的结构化脚手架,而排行榜的有效性在不同环境间差异显著。特别是,失败高发的环境对对手错误鲁棒性的奖励可能与策略能力相当,Secret Mafia在本周期中表现出明显的错误存活混淆。我们发布了包含29,571场多智能体游戏(含回合级观察、动作和奖励)的数据集,以及MG-Ref——一个确定性的离线锦标赛协议,它以本文分析所用的相同错误归因视角,将新智能体与由排名靠前、低错误的Stage II提交构成的冻结参考池进行对打评分。

MINDGAMES:评估多智能体LLM社会与策略推理的实时竞技场:论文配图
图 1:第二阶段的 MindGames 游戏套件和评估有效性梯度。每张卡片都显示了推理需求、游戏结构、规模以及游戏级别的错误率。 IPD 和 Colonel Blotto 产生清晰的排行榜信号;代号排名将战略技能与遵循约束的能力结合在一起;对于 Secret Mafia 来说,总体结果因一小部分模型产生的错误而产生偏差。