论文

MirrorCraft:Minecraft隐藏规则变化下的配对评估

MirrorCraft: Paired Evaluation under Hidden Rule Changes in Minecraft

智能体系统Agent任务评测

摘要

随着大语言模型(LLMs)的繁荣,一个有趣的话题是:LLM-驱动的代理在Minecraft中如何工作?不幸的是,现有的基准测试都在固定的游戏中机制下进行。在这些设置下,高表现并不表明代理是否能够在熟悉配方、掉落和其他规则变化时继续进步。在这篇文章中,我们介绍了MirrorCraft,这是一种用于评估代理在Minecraft中隐藏规则变化的基准测试。每个Mirror世界都是其对应的Vanilla世界的副本,其中服务器端规则由对应的datapack修改。地形、 spawn、资源放置、目标、界面和行动预算在每个Vanilla-Mirror对内保持匹配。MirrorCraft包括五个控制的生物群落、六个规则套件、三个进展目标、两个模型家族和六个代理配置,共享Mineflayer界面。我们用确定性进展里程碑和成功率评估任务进度,使用Rule Intervention Effect(RIE)衡量匹配的Vanilla和Mirror世界之间的性能变化。实验表明,隐藏规则变化在不同套件中具有显著不同的效果。在没有规则描述的配置中,ReAct取得最高的Pooled Mirror分数。提供精确的规则只会小幅提高所有三个目标的平均进展和完成率。MirrorCraft扩展了Minecraft的评估范围,超越了固定的机制,并为研究代理如何使用当前世界的规则与熟悉规则不同提供了一个可控的环境。

MirrorCraft:Minecraft隐藏规则变化下的配对评估:论文配图
图1:Vanilla 世界与 Mirror 世界中的基准构建和配对评估概览。配对的 Mirror 世界从 Vanilla 存档复制,在匹配的控制条件下评估,并加载用于规则干预的一组数据包。