MINDGAMES:评估多智能体LLM社会与策略推理的实时竞技场
MINDGAMES: A Live Arena for Evaluating Social and Strategic Reasoning in Multi-Agent LLMs
摘要
大语言模型(LLM)越来越多地被部署为交互式智能体,但它们在长期交互中的社会与策略推理能力仍知之甚少。现有评估依赖静态情景片段或单一游戏基准,无法捕捉现实多智能体环境所需的持续、多方面推理。我们提出Mindgames,一个面向LLM智能体的多游戏竞技场与评估平台,将与“心智理论”相关的互补性推理需求操作化:隐藏信息下的信念归因、通过重复策略交互进行对手建模、知识不对称下的合作推理,以及社交推理游戏中的持续欺骗。Mindgames构建于TextArena之上,提供统一的交互界面、基于TrueSkill的评级,以及在四个游戏环境中的完整轨迹记录。我们通过一场在某大型AI会议上举办的2025年竞赛周期来实例化Mindgames,该竞赛在四款游戏(Colonel Blotto、Iterated Prisoner's Dilemma、Codenames和Secret Mafia)上评估了来自76支队伍的944个提交智能体。我们的分析揭示了智能体层面与评估层面的局限:脆弱的规则遵循仍是主要瓶颈,表现最佳的系统反复依赖显式的结构化脚手架,而排行榜的有效性在不同环境间差异显著。特别是,失败高发的环境对对手错误鲁棒性的奖励可能与策略能力相当,Secret Mafia在本周期中表现出明显的错误存活混淆。我们发布了包含29,571场多智能体游戏(含回合级观察、动作和奖励)的数据集,以及MG-Ref——一个确定性的离线锦标赛协议,它以本文分析所用的相同错误归因视角,将新智能体与由排名靠前、低错误的Stage II提交构成的冻结参考池进行对打评分。
