论文

MineNPC-Task:面向记忆感知Minecraft Agent的任务套件

MineNPC-Task: Task Suite for Memory-Aware Minecraft Agents

智能体系统上下文与知识记忆Agent任务评测Agent记忆

摘要

我们提出了 \textsc{MineNPC-Task},这是一个用户编写的基准测试和评估工具,用于在开放世界 \emph{Minecraft} 中测试内存感知、混合主动的 LLM 代理。任务不是依赖于合成提示,而是通过与专家玩家的形成性和总结性合作来引出,标准化为具有明确先决条件和依赖结构的参数模板,并在禁止外行捷径的有限知识策略下与机器可检查的验证器配对。该工具捕获计划/行动/内存事件,包括计划预览、有针对性的澄清、内存读写、前提条件检查和修复尝试,并报告与尝试的子任务总数相关的结果,这些结果来自现实世界的证据。作为初始快照,我们使用 GPT-4o 实例化框架,并跨 \textbf{8} 经验丰富的玩家评估 \textbf{216} 子任务。我们观察到代码执行、库存/工具处理、引用和导航中反复出现的故障模式,以及混合主动澄清和轻量级内存支持的恢复。参与者对交互质量和界面可用性给予积极评价,同时强调跨任务需要更强的记忆持久性。我们发布了完整的任务套件、验证器、日志和工具,以支持对未来内存感知具体代理的透明、可重复的评估。

MineNPC-Task:面向记忆感知Minecraft Agent的任务套件 配图
图 1:(a) MineNPC-Task:每行展示一个自然的、由玩家撰写的 Minecraft 请求,将评估锚定于共同游戏(co-play)中建造、耕作与采矿的不同阶段。(b) 有界且可复现的评估:一个模型无关的测试框架,负责路由意图、通过单轮澄清进行规划、在受限知识策略下经由公开的 Mineflayer API 执行,并仅依据游戏内证据结合轻量记忆进行评判。(c) 该基准能够回答的问题:AI NPC 在真实玩家任务中会在哪里失败?GPT-4o 在这一受限设定下表现出哪些失败模式?哪些设计选择使评估公平?左:垂直堆叠的 Minecraft 场景,每个场景展示一个自然的玩家请求——盖房子、收小麦、挖煤炭。中:评估框架框图,包含意图、规划、执行与记忆模块。右:列出三个基准问题的标注框。