论文
面向长期用户交互的具身多模态大语言模型智能体个性化
Personalizing Embodied Multimodal Large Language Model Agents over Long-term User Interactions
摘要
基于多模态大语言模型(MLLM)的具身智能体在解决物理环境中的复杂任务方面展现出强大潜力。然而,个性化辅助所要求的不仅是遵循通用指令或识别物体类别。在真实场景中,目标对象往往只通过先前交互隐式指定,要求智能体利用随时间积累的个性化上下文。在这项工作中,我们提出POLAR,一个面向长期用户交互的个性化具身智能体的多模态记忆增强框架。POLAR将先前交互组织成多模态知识图谱,其中捕捉个性化上下文与视觉概念的语义记忆,以及智能体轨迹等具身体验的情景记忆。为执行具身任务,POLAR检索相关记忆来解释当前请求并引导任务执行。我们在多个MLLM骨干和多样评估场景下评估POLAR,以研究记忆在长期个性化中的作用。结果表明,所提出的记忆机制通过更有效地利用先前交互积累的信息,持续提升性能。当智能体需要跨多次交互推理、执行多跳推理或跟踪用户特定上下文随时间的更新时,收益尤其显著。
