论文

DungeonBench:龙与地下城战斗中的规则密集型战术推理基准

DungeonBench: A Benchmark for Rules-Rich Tactical Reasoning in Dungeons & Dragons Combat

智能体系统Agent任务评测

摘要

游戏和模拟器通过将决策转化为可测量的结果,为评估提供有价值的标准。然而,当前的评估工具在测试规则丰富的战术推理方面存在局限:在几何、时间、资源、目标和规则交互都重要时,选择决策的能力。我们介绍DungeonBench,这是一个为Dungeons & Dragons战斗中的战术推理而设计的基准,旨在覆盖2014年系统参考文档中大部分与战斗相关的内容,这些内容可以通过模拟器解决,同时保留简化战斗模拟器通常抽象掉的机制。在每个步骤中,DungeonBench展示完整的战术观察、待决决策和可索引的执行选项,涵盖移动、攻击、法术、反应、目标、准备和稀缺资源。任务是评估受行动经济、生物属性、战场几何、时间窗口和未来遭遇影响的合法选择的价值。DungeonBench有两条轨道:战斗回合,评估单个战斗中的局部战术表现;日,通过持续的生命点、法术槽、消耗品、准备和短暂休息时间,将战斗回合链接起来,迫使策略在即时战术优势和未来生存性之间进行权衡。相同的引擎生成的决策流支持启发式控制器、语言模型策略、学习的选项排名器和掩蔽行动的强化学习代理。我们在这共享的决策流上评估前沿语言模型策略。结果表明,完整的战术观察并未饱和基准:前沿策略在直接战斗中常获胜,但链接的战斗回合暴露了资源预算、休息时间和规则意识的战术纪律失败。

DungeonBench:龙与地下城战斗中的规则密集型战术推理基准:论文配图
图1:DungeonBench 概览。引擎将战术状态映射为合法、可执行的选项;不同策略在同一决策序列上作出选择,模拟器对遭遇战和单日结果评分。