论文

Mine Odyssey:在真实地点的Minecraft重建中评测空间Agent

Mine Odyssey: Benchmarking Spatial Agentic Intelligence in the Wild

智能体系统Agent 环境交互Agent任务评测

摘要

基础模型的进步正在推动引入代理来帮助现实世界中的人们。这些智能体需要 agentic 空间智能:探索不熟悉的环境,通过交互更新空间理解,并根据反馈调整行动以维持实现一系列目标的进展。现有的基准仅涵盖有限范围的空间布局、规模和遍历要求。我们介绍 Mine Odyssey,这是一个使用 Minecraft 现实世界位置重建来评估 agentic 空间智能的基准。它包含 180 项任务,覆盖五大洲 20 个国家和地区的 30 个此类地点,其中包括 20 个室外环境和 10 个室内环境。这些设置跨越不同的空间尺度、布局、地形和连接模式,从曼哈顿中城和恩特鲁普乡村到圣卢西亚山和白金汉宫。我们选择有意义的路径点,例如地标、建筑物和房间,并手动验证它们的可达性。每个任务都提供自然语言指令,指定哪些任务 访问的路径点以及访问顺序。完成这些任务需要Agent找到无障碍路线和入口、打开门并使用楼梯和梯子在各个楼层之间移动,同时监控进度并从导航错误中恢复。在八个经过评估的最先进模型中,GPT-6 Astra 取得了 85.6% 的最高成功率。然而,第二好的模型 Claude Opus 5.5 完成了 73.9% 的任务,而评估最强的开放权重模型 DeepSeek-V4.1-Flash 达到了 23.9%,这凸显了当前模型的 agentic 空间智能还有很大的改进空间。对 Mine Odyssey 的全面分析和消融研究揭示了当前模型的局限性,并为推进 agentic 空间智能提供了见解。