论文

HyperCLIP++:微调 CLIP 以实现双曲空间中的开放词汇语义分割

HyperCLIP++: Fine-tuning CLIP forOpen-vocabulary Semantic Segmentation in Hyperbolic Space

模型训练参数高效训练

摘要

CLIP 是一种基础视觉语言模型,已成为开放词汇语义分割的强大工具。虽然众所周知,冻结 CLIP 的文本编码器可以保留其泛化能力,但最近的研究表明,联合微调 CLIP 的文本和图像编码器可以显着增强分割性能,特别是对于来自开放集的类。在这项工作中,我们从层次对齐的角度解释了这种现象,因为在微调过程中,图像嵌入的层次级别从图像级转移到像素级。我们通过利用双曲空间来实现这一点,双曲空间自然地编码层次结构。我们的主要观察结果是,在微调过程中,CLIP 文本嵌入的双曲半径会减小,从而有助于更好地与视觉数据的像素级粒度对齐。在此基础上,我们提出了 HyperCLIP++,一种新颖且参数高效的适应策略。 HyperCLIP++通过缩放变换直接调整CLIP嵌入的双曲半径,以实现与目标任务的层次对齐,即分割。为了确保这种层次结构对齐在两种模态中一致地实现,并在训练期间保持它们的跨模态对齐,HyperCLIP++集成了双重交叉关系通信(DCRC)模块,该模块可以同步视觉和文本路径之间的这些调整。我们的实验表明,HyperCLIP++ 在三个基准测试中实现了最先进的性能,同时仅微调 CLIP 总参数的大约 5%。更重要的是,我们观察到调整后,CLIP 的文本嵌入在数据集中表现出相对固定的双曲半径,这表明该分割任务所需的层次级别可以使用双曲半径来量化。