论文

BotzoneBench:通过分级AI锚点的可扩展LLM评估

BotzoneBench: Scalable LLM Evaluation via Graded AI Anchors

模型评测评测方法与指标

摘要

大语言模型(LLM)日益被部署在需要策略决策的交互环境中,但对这些能力的系统评估仍具挑战性。现有的LLM基准主要通过孤立任务评估静态推理,未能捕捉动态策略能力。近来的游戏化评估采用LLM对LLM的锦标赛,产生的相对排名依赖瞬息万变的模型池,带来二次方计算成本,且缺乏用于纵向追踪的稳定性能锚点。核心挑战在于建立一个可扩展的评估框架,以一致、可解释的标准而非易变的同侪模型来衡量LLM的策略推理。我们证明,将LLM评估锚定到固定层级的技能校准游戏人工智能(AI)上,可以实现具有跨时间稳定可解释性的线性时间绝对技能测量。基于Botzone平台成熟的竞赛基础设施,我们的BotzoneBench在八款多样的游戏中评估LLM,涵盖从确定性完美信息棋盘游戏到随机不完美信息卡牌游戏。通过对来自五个旗舰模型的177,047个状态-动作对的系统评估,我们揭示了显著的性能差异并识别出不同的策略行为,表现最佳的模型在多个领域达到与中高段位专用游戏AI相当的水平。这一锚定评估范式可推广到游戏之外的任何具有明确技能层级的领域,为评估交互式AI能力建立一个可扩展、可复用的框架。

BotzoneBench:通过分级AI锚点的可扩展LLM评估
图2:基于 llm 的机器人的提示模板。带下划线的文本是为每个状态动态生成的。系统提示提供静态的游戏规则和输出格式要求,而用户提示提供动态的逐轮信息:玩家身份、当前游戏状态、动作历史和合法动作。这一设计提供了所有必要的上下文,同时把策略推理完全留给 llm 。