论文
PersonaVLM:长期个性化多式联运 LLM
PersonaVLM: Long-Term Personalized Multimodal LLMs
摘要
多式联运 大语言模型 (MLLM) 是数百万人的日常助手。然而,他们产生符合个人偏好的反应的能力仍然有限。先前的方法只能通过输入增强或输出对齐实现静态、单轮个性化,因此无法捕获用户随时间变化的偏好和个性(见图 1)。在本文中,我们介绍了 PersonaVLM,这是一种专为长期个性化而设计的创新个性化多模式代理框架。它通过集成三个关键功能,将通用 MLLM 转变为个性化助手: (a) 记忆:它主动从交互中提取和总结按时间顺序排列的多模态记忆,将它们整合到个性化数据库中。 (b)推理:通过从数据库中检索和整合相关记忆来进行多轮推理。 (c) 响应一致性:它推断用户在长期交互过程中不断变化的个性,以确保输出与其独特特征保持一致。为了进行评估,我们建立了 Persona-MME,这是一个包含 2,000 多个精心策划的交互案例的综合基准,旨在评估七个关键方面和 14 个细粒度任务的长期 MLLM 个性化。大量实验验证了我们方法的有效性,在 128k 上下文下将基线提高了 22.4% (Persona-MME) 和 9.8% (PERSONAMEM),同时比 GPT-4o 分别提高了 5.2% 和 2.0%。项目页面:https://PersonaVLM.github.io。