论文

面向长期用户交互的具身多模态大语言模型智能体个性化

Personalizing Embodied Multimodal Large Language Model Agents over Long-term User Interactions

上下文与知识记忆Agent记忆

摘要

基于多模态大语言模型(MLLM)的具身智能体在解决物理环境中的复杂任务方面展现出强大潜力。然而,个性化辅助所要求的不仅是遵循通用指令或识别物体类别。在真实场景中,目标对象往往只通过先前交互隐式指定,要求智能体利用随时间积累的个性化上下文。在这项工作中,我们提出POLAR,一个面向长期用户交互的个性化具身智能体的多模态记忆增强框架。POLAR将先前交互组织成多模态知识图谱,其中捕捉个性化上下文与视觉概念的语义记忆,以及智能体轨迹等具身体验的情景记忆。为执行具身任务,POLAR检索相关记忆来解释当前请求并引导任务执行。我们在多个MLLM骨干和多样评估场景下评估POLAR,以研究记忆在长期个性化中的作用。结果表明,所提出的记忆机制通过更有效地利用先前交互积累的信息,持续提升性能。当智能体需要跨多次交互推理、执行多跳推理或跟踪用户特定上下文随时间的更新时,收益尤其显著。

面向长期用户交互的具身多模态大语言模型智能体个性化:论文配图
图 1:长期用户交互的个性化。在日常生活中,用户经常通过先前交互中积累的个人上下文来引用对象,而不是明确的目标引用。当存在多个相似对象时,传统的具体代理可能无法确定用户想要哪个特定实例,因为它们专注于查找类别“鞋子”而不是“哪只”鞋子。这激发了个性化实例基础,其中具体代理使用长期交互历史来解决用户意图。