论文

门合并:视觉语言模型的零样本组合个性化

Gate-and-Merge: Zero-shot Compositional Personalization of Vision Language Models

模型优化模型合并

摘要

本文解决了视觉语言模型(VLM)的组合个性化问题。在此问题中,必须在测试时联合识别或描述多个用户定义的概念。我们引入了 Gate-and-Merge,这是一种零样本框架,无需共现训练即可实现组合个性化。在个性化过程中,每个概念都是作为轻量级 LoRA 适配器独立学习的,并与概念词元配对。基本模型保持不变,概念保持清晰。在推理时,我们通过直接在权重空间中合并特定于概念的 LoRA 更新来实现组合。为了抑制不相关的激活并防止干扰,采用门控机制来估计文本和视觉线索,并仅选择有助于预测的模块。我们通过仅组合最有意义且相互一致的更新来进一步稳定构图,帮助保持每个概念的身份。我们的定量和定性分析显示,在单一概念和组合设置中,多个个性化任务的性能持续提高。