论文
通过上下文提示调整个性化您的大型视觉语言模型
Personalize Your Large Vision-language Models With In-context Prompt Tuning
摘要
大型视觉语言模型(LVLM)已经表现出强大的通用多模态能力,并且越来越多地部署在下游系统中。这一趋势推动了人们对 LVLM 个性化的兴趣日益增长,LVLM 个性化旨在使模型能够快速有效地学习分布外多模式概念,以满足用户的特定需求。然而,许多现有方法依赖于推理时间训练,这降低了效率。他们还很难在复杂的多图像、多概念设置中保持准确性。这些限制限制了基于 LVLM 的系统的更广泛部署。因此,本文提出上下文提示调整(ICPT)。具体来说,ICPT 采用能够在复杂场景中运行的轻量级投影模块,从多个参考图像中提取细粒度的视觉语义,将这些特征与身份标签映射一起无缝转换为连续提示。为了最大限度地提高计算效率,该模块根据每个概念的内在视觉复杂性自适应地确定提示长度。至关重要的是,为了克服现实应用中普遍存在的环境偏差和跨概念干扰,我们引入了两种新颖的几何正则化。这些约束通过将关键身份与瞬态环境状态解耦并分离概念以避免语义混淆来完善提示表示。大量实验表明,ICPT 在不同的任务和 LVLM 主干中实现了最先进的个性化准确性。