论文

MineCEraft:在Minecraft世界中评估语言模型作为建筑工程师的能力

MineCEraft: Evaluating Language Models as Construction Engineers in the World of Minecraft

智能体系统Agent任务评测

摘要

我们推出 MineCEraft(Minecraft 建筑工程基准,发音为mine-see-ee-raft),这是一个易于使用的开源基准,旨在系统地评估 Minecraft 中建筑任务的LLM的可靠性和局限性。 MineCEraft 基准测试由 723 个领域专家手工制作的自然语言指令组成,具有可编程验证的评估,涵盖 17 个不同的任务类别,为评估LLM执行实际建筑工程任务的能力提供了安全可控的实验环境。借助这一基准,我们对最先进的LLM进行了深入评估,并进行了详细的错误分析,揭示了将LLM应用于建筑工程任务的关键故障模式和实际挑战。

MineCEraft:在Minecraft世界中评估语言模型作为建筑工程师的能力:论文配图
图1:大语言模型代理商甚至无法可靠地执行简单的指令来建造一座拱形桥。我们将这项任务分解成有章可循的评价部分。这一基准揭示了妨碍在现实世界的建设情景中可靠地使用基于大语言模型的代理物的局限性。