论文

TowerMind:面向LLM智能体的塔防游戏学习环境与基准

TowerMind: A Tower Defence Game Learning Environment and Benchmark for LLM as Agents

智能体系统Agent任务评测

摘要

大语言模型(LLM)的最新突破使其成为智能体的一种有前景的范式,长期规划与决策制定正成为适应多样场景与任务的核心通用能力。即时战略(RTS)游戏是评估这两项能力的理想试验场,因为其固有玩法既需要宏观层面的战略规划,也需要微观层面的战术调整与动作执行。现有基于RTS游戏的环境要么计算需求相对较高,要么缺乏对文本观察的支持,这限制了RTS游戏在LLM评估中的使用。受此启发,我们提出TowerMind,一个以RTS游戏塔防(TD)子类为基础的新型环境。TowerMind保留了RTS游戏在评估LLM方面的关键优势,同时具有较低的计算需求和多模态观察空间,包括基于像素、文本和结构化游戏状态的表示。此外,TowerMind支持评估模型幻觉,并提供高度的可定制性。我们设计了五个基准关卡,在不同多模态输入设置下评估多个广泛使用的LLM。结果显示,在能力与幻觉两个维度上,LLM与人类专家之间存在明显差距。实验进一步揭示了LLM行为的关键局限,例如规划验证不足、决策缺乏多终态性(multifinality)以及动作使用低效。我们还评估了两种经典强化学习算法:Ape-X DQN和PPO。凭借轻量级的多模态设计,TowerMind补充了现有基于RTS游戏的环境格局,并为AI智能体领域引入了新基准。源代码已在GitHub上公开(https://github.com/tb6147877/TowerMind)。

TowerMind:面向LLM智能体的塔防游戏学习环境与基准 配图
图 10:多层 CNN 模型的模型架构。128 x 128 × 3 的图像经由卷积层处理,最终通过全连接网络产生 1200 维的策略输出