论文

视觉语言模型的 U 形多粒度学习

U-shaped Multi-granularity Learning for Vision-Language Models

模型训练参数高效训练

摘要

视觉语言模型的提示学习范式是有效的,但面临粒度困境:全局提示缺乏细粒度的语义意识,而局部提示忽略上下文关联,限制了跨任务泛化。这种困境存在于密集的预测任务中。受到 U-Net 的启发,U-Net 统一了跨粒度的多级表示,我们提出了 UPrompt,一种用于视觉语言模型的 U 形多粒度提示学习框架。与 U-Net 如何通过具有跨级连接的对称编码器-解码器路径集成精细和粗略特征类似,UPrompt 在视觉和文本模态中构造并行的多粒度表示,其中从粗到细的级联增强传播全局上下文以细化局部细节,而从细到粗的分层监督确保跨尺度的语义一致性。对 17 个基准的广泛实验验证了我们的有效性。 UPrompt 在 MSCOCO 上的 rSum 优于 MAMET 和 VPKE 4.1 和 7.3 rSum,在基础到新颖的泛化方面优于 CoCoA-Mix 5.09%,同时以最小的开销(粗粒度)保持有竞争力的性能,并以 1/3 的成本匹配 PSRC(中粒度)。