论文
RTSGameBench:视觉语言模型战略推理的RTS基准
RTSGameBench: An RTS Benchmark for Strategic Reasoning by Vision-Language Models
摘要
现代视觉语言模型(VLM)常在战略推理上挣扎——即在竞争与合作设定下、不确定性中预判并影响其他智能体的行动。即时战略(RTS)游戏可成为诊断该局限的自然试验台——它们要求与盟友协调、适应对手战略——并在部分可观测下做长程规划。但既有RTS基准评估范围有限、缺乏系统能力诊断——且固定在预先设计的场景覆盖内。为解决这些局限——我们呈现RTSGameBench——建立在Beyond All Reason(要求比既有试验台更广战略多样性的大规模RTS游戏)上。所提基准经多样对战结构的多元游戏提供评估——经各针对单项战略能力的小游戏提供诊断评估——并经把自由格式查询转为新小游戏的自我演化生成框架提供可扩展覆盖——逐周期改进。此外——为使VLM在大型RTS游戏中运作——我们提供以带智能体记忆的FSM管理单位的RTSGameAgent。我们实证验证:多个SOTA VLM在对战要求更紧协调、多智能体协调及任务规模增大时表现不佳。
