论文
通过强化多模态参考游戏个性化 MLLM
Personalizing MLLMs via Reinforced Multimodal Reference Game
摘要
个性化多模态 大语言模型 (MLLM) 旨在从视觉数据中识别用户的独特概念并提供个性化响应。尽管先前的工作已经显示了概念描述和推理对于此任务的好处,但 MLLM 描述通常包含状态和上下文等信息,这些信息无助于甚至可能阻碍在其他视觉上相似的项目中唯一识别目标概念。相反,对个人概念的有效描述应该是准确的、有区别的,并且没有分散注意力的细节。为了实现这样的描述,我们引入了强化参考游戏(RRG),这是一种学习框架,通过新颖的强化多模态参考游戏来促进区分性描述。 MLLM 在对比游戏环境中扮演着说话者和听者的角色,其目标是有效地传达有关目标概念的辨别信息。我们的方法针对硬肯定(同一概念的不同观点)和硬否定(视觉上相似但不同的概念)制定了可验证的对比奖励。根据经验,RRG 在三个个性化基准上跨多个任务实现了最先进的水平。 RRG 泛化到看不见的领域,并且优于基于概念描述和个性化特定 RL 框架的现有方法。我们将在项目页面发布代码和模型。