论文
CivBench:基于对局进展的LLM文明V战略决策评估
CivBench: Progress-Based Evaluation for LLMs' Strategic Decision-Making in Civilization V
摘要
评估基于LLM的智能体的战略决策,需要具备生成性、竞争性和纵向性的环境,但鲜有基准能同时提供这三者,能提供足够丰富的评估信号以支持长程多智能体对局的就更少。我们提出CivBench,一个面向多人Civilization V中LLM战略家(即智能体配置)的基准。由于在跨越数百回合、多个对手的对局中,终局胜负作为信号过于稀疏,CivBench在回合级游戏状态上训练模型来估计整个对局过程中的胜利概率,并通过预测效度、结构效度与聚合效度加以验证。在7个LLM与多种CivBench智能体条件下的307场对局中,我们展示了CivBench作为未饱和基准估计战略能力的潜力,揭示了智能体配置带来的模型差异化效应,并勾勒出仅凭结果评估无法看到的独特战略画像。
