论文
TowerMind:面向LLM智能体的塔防游戏学习环境与基准
TowerMind: A Tower Defence Game Learning Environment and Benchmark for LLM as Agents
摘要
大语言模型(LLM)的最新突破使其成为智能体的一种有前景的范式,长期规划与决策制定正成为适应多样场景与任务的核心通用能力。即时战略(RTS)游戏是评估这两项能力的理想试验场,因为其固有玩法既需要宏观层面的战略规划,也需要微观层面的战术调整与动作执行。现有基于RTS游戏的环境要么计算需求相对较高,要么缺乏对文本观察的支持,这限制了RTS游戏在LLM评估中的使用。受此启发,我们提出TowerMind,一个以RTS游戏塔防(TD)子类为基础的新型环境。TowerMind保留了RTS游戏在评估LLM方面的关键优势,同时具有较低的计算需求和多模态观察空间,包括基于像素、文本和结构化游戏状态的表示。此外,TowerMind支持评估模型幻觉,并提供高度的可定制性。我们设计了五个基准关卡,在不同多模态输入设置下评估多个广泛使用的LLM。结果显示,在能力与幻觉两个维度上,LLM与人类专家之间存在明显差距。实验进一步揭示了LLM行为的关键局限,例如规划验证不足、决策缺乏多终态性(multifinality)以及动作使用低效。我们还评估了两种经典强化学习算法:Ape-X DQN和PPO。凭借轻量级的多模态设计,TowerMind补充了现有基于RTS游戏的环境格局,并为AI智能体领域引入了新基准。源代码已在GitHub上公开(https://github.com/tb6147877/TowerMind)。
