论文

RTSGameBench:视觉语言模型战略推理的RTS基准

RTSGameBench: An RTS Benchmark for Strategic Reasoning by Vision-Language Models

智能体系统上下文与知识记忆Agent任务评测Agent记忆长程任务评测

摘要

现代视觉语言模型(VLM)常在战略推理上挣扎——即在竞争与合作设定下、不确定性中预判并影响其他智能体的行动。即时战略(RTS)游戏可成为诊断该局限的自然试验台——它们要求与盟友协调、适应对手战略——并在部分可观测下做长程规划。但既有RTS基准评估范围有限、缺乏系统能力诊断——且固定在预先设计的场景覆盖内。为解决这些局限——我们呈现RTSGameBench——建立在Beyond All Reason(要求比既有试验台更广战略多样性的大规模RTS游戏)上。所提基准经多样对战结构的多元游戏提供评估——经各针对单项战略能力的小游戏提供诊断评估——并经把自由格式查询转为新小游戏的自我演化生成框架提供可扩展覆盖——逐周期改进。此外——为使VLM在大型RTS游戏中运作——我们提供以带智能体记忆的FSM管理单位的RTSGameAgent。我们实证验证:多个SOTA VLM在对战要求更紧协调、多智能体协调及任务规模增大时表现不佳。

RTSGameBench:视觉语言模型战略推理的RTS基准:论文配图
图 1:RTSGameBench 概述。我们通过三个组成部分评估 VLM 的战略推理:(1)跨不同对局结构的完整游戏评估; (2) 针对个人战略能力的诊断小游戏; (3) 自我进化的游戏生成框架,通过多代理协作将自由格式查询转换为新的诊断游戏,从而实现按需扩展。