论文

EmbodiedMemory-Bench:长期具体任务的具体记忆基准测试

EmbodiedMemory-Bench: Benchmarking Embodied Memory for Long-Horizon Embodied Tasks

智能体系统上下文与知识记忆Agent任务评测Agent记忆长程任务评测

摘要

长视野体现交互要求智能体在观察、行动和遇到变化时保留并不断更新有关环境的信息。然而,当前的智能体很难可靠地维持这种记忆。我们的分析将这种限制追溯到四个关键缺陷:细粒度视觉记忆薄弱、动态世界状态跟踪不可靠、无法记录交互结果揭示的世界状态以及对先前经验的概括有限。然而,现有的基准测试并没有直接评估长视野交互过程中的这些记忆能力。为了解决这一差距,我们引入了 EmbodiedMemory-Bench (EMem-Bench),它包含四个任务系列的 2,554 个交互片段。 EMem-Bench 要求智能体根据交互历史记录构建和更新内存,然后通过在环境中进行操作来使用它来完成后续任务。我们进一步提出了具身记忆器(EMem),这是一种外部记忆系统,它将具身经验组织成空间、事件和场景记忆。我们还训练 EMem-8B,这是一种管理和使用这些内存的 8B 策略。我们评估各种开源和专有的 MLLM 以及代表性的多模态存储系统。结果表明,当前模型在应对四个挑战方面仍然薄弱且不平衡。在匹配的主干网下,EMem 在评估的内存系统中实现了最佳的整体性能,并改进了开源和专有模型,而 EMem-8B 则进一步改进了其主干网。项目页面:此 https URL