论文
MineExplorer 评测开放世界中的隐式多跳探索
MineExplorer: Evaluating Open-World Exploration of MLLM Agents in Minecraft
摘要
多模态大语言模型在感知、推理及动作生成方面表现突出,但它们能否在动态开放世界中持续探索仍不明确。现有具身及游戏基准往往将交互压缩为短程任务,或将成功与游戏专用机制纠缠在一起。我们提出MineExplorer,在Minecraft中评估多模态Agent的开放世界探索能力。首先过滤掉高度依赖Minecraft专有知识的原子任务,使评测更能反映通用开放世界推理;随后以ReAct式能力描述组织基准,将原子任务组合为具有隐式依赖的多跳任务。为构建可靠实例,采用多Agent合成工作流,共同设计任务图、沙箱场景及基于规则的里程碑评估器。人工评价表明,该流程生成的实例明显比单Agent基线可靠。对先进多模态Agent的实验发现,开放世界探索仍有挑战:强模型能处理许多单跳任务,但当需要沿更长轨迹协调隐含前置条件时,性能明显下降。进一步分析发现,任务难度与Agent完成情况相关,更大模型或思考模式也不总能带来更好表现。代码与数据集见https://github.com/Jometeorie/MineExplorer。