论文
LUDOBENCH:通过基于Ludo局面的棋盘游戏场景评估LLM行为决策
LUDOBENCH: Evaluating LLM Behavioural Decision-Making Through Spot-Based Board Game Scenarios in Ludo
摘要
我们提出LudoBench,一个在Ludo(一种随机多人棋盘游戏,其骰子机制、棋子捕获、安全格导航与归家路径推进带来实质性的规划复杂性)中评估LLM战略推理的基准。LudoBench包含480个手工构建的局面场景,横跨12个行为上各异的决策类别,每个类别隔离出一种特定策略选择。我们还贡献了一个功能完备的4人Ludo模拟器,支持随机、启发式、博弈论与LLM智能体。博弈论智能体使用带深度限制前瞻的Expectiminimax搜索,在贪婪启发式之外提供一个有原则的策略上限。对横跨四个模型家族的六个模型进行评估,我们发现所有模型仅在40-46%的情形下与博弈论基线一致。模型分化为不同的行为原型:完成者会把棋子送到底但忽视发展,发展者则只顾发展却从未完成。每种原型都只掌握了博弈论策略的一半。在相同的棋盘状态下,模型在历史条件化的『记仇』框定下表现出可测量的行为变化,揭示提示敏感性是一个关键弱点。LudoBench为在不确定性下对LLM战略推理进行基准测试提供了一个轻量且可解释的框架。全部代码、局面数据集(480条)与模型输出见 https://anonymous.4open.science/r/LudoBench-5CBF/
