论文

Minecraft游戏中多模态LLM智能体的经验迁移

Experience Transfer for Multimodal LLM Agents in Minecraft Game

上下文与知识记忆Agent记忆

摘要

在复杂游戏环境中运行的多模态LLM智能体必须持续复用过往经验,以高效解决新任务。在这项工作中,我们提出Echo,一个面向迁移的记忆框架,使智能体能从既往交互中提炼可行动的知识,而非将记忆视为静态记录的被动仓库。为使迁移显式化,Echo将可复用知识分解为五个维度:结构、属性、过程、功能与交互。这一形式化使智能体能够识别不同任务间共享的重复模式,并推断哪些既往经验在新情境中仍然适用。在此形式化基础上,Echo利用上下文类比学习(ICAL)检索相关经验,并通过上下文示例将其适配到未见任务。在Minecraft中的实验表明,在从零学习设置下,Echo在物体解锁任务上实现了1.3倍至1.7倍的加速。此外,Echo表现出爆发式的链式解锁现象,在获得可迁移经验后的短时间内快速解锁多个相似物品。这些结果表明,经验迁移是提升多模态LLM智能体在复杂交互环境中效率与适应性的一个有前景方向。

Minecraft游戏中多模态LLM智能体的经验迁移:论文配图
图 2:不同代理的物品解锁进度比较。 x 轴表示迭代步骤,y 轴表示解锁的唯一项目的数量。我们的方法显示出明显更快的进展,在中期表现出“快速解锁”现象,其中相似的物品以爆炸性方式解锁。与之前的方法(MP5 [38]、Voyager [42]、JARVIS-1 [45] 和 MrSteve [36])相比,我们的方法实现了约 1.3×\times–1.7×\times 的同等里程碑速度。