论文

LUDOBENCH:通过基于Ludo局面的棋盘游戏场景评估LLM行为决策

LUDOBENCH: Evaluating LLM Behavioural Decision-Making Through Spot-Based Board Game Scenarios in Ludo

模型评测基准与评测资源

摘要

我们提出LudoBench,一个在Ludo(一种随机多人棋盘游戏,其骰子机制、棋子捕获、安全格导航与归家路径推进带来实质性的规划复杂性)中评估LLM战略推理的基准。LudoBench包含480个手工构建的局面场景,横跨12个行为上各异的决策类别,每个类别隔离出一种特定策略选择。我们还贡献了一个功能完备的4人Ludo模拟器,支持随机、启发式、博弈论与LLM智能体。博弈论智能体使用带深度限制前瞻的Expectiminimax搜索,在贪婪启发式之外提供一个有原则的策略上限。对横跨四个模型家族的六个模型进行评估,我们发现所有模型仅在40-46%的情形下与博弈论基线一致。模型分化为不同的行为原型:完成者会把棋子送到底但忽视发展,发展者则只顾发展却从未完成。每种原型都只掌握了博弈论策略的一半。在相同的棋盘状态下,模型在历史条件化的『记仇』框定下表现出可测量的行为变化,揭示提示敏感性是一个关键弱点。LudoBench为在不确定性下对LLM战略推理进行基准测试提供了一个轻量且可解释的框架。全部代码、局面数据集(480条)与模型输出见 https://anonymous.4open.science/r/LudoBench-5CBF/

LUDOBENCH:通过基于Ludo局面的棋盘游戏场景评估LLM行为决策:论文配图
图 1:带注释的 Ludo 棋盘。主赛道 (0-51)、彩色主路、安全广场和基地区域。玩家起始位置为 P0 = 0、P1 = 13、P2 = 26、P3 = 39。图 2:特工面对面胜率矩阵。超过 200 场比赛的胜率确认了基线技能阶梯:随机 << 启发式 << GT。 GT 与启发式搜索的 59% 验证了深度有限搜索的优势。