论文
用于图像分类的视觉语言模型的半监督适应
Semi-Supervised Adaptation of Vision-Language Models for Image Classification
摘要
像 CLIP 这样的视觉语言模型在处理自然图像方面表现出了巨大的潜力,但它们的性能往往受到卫星图像独特特征的限制。虽然存在参数有效的适应技术,但它们的功效经常受到注释样本稀缺的限制。在这封信中,我们提出了自进化 CLIP(SE-CLIP),这是一种为场景分类中的递归标签挖掘而设计的半监督框架。该方法遵循双阶段管道,其中对一些带注释的种子进行初始预热,然后是递归发现阶段,迭代地从未标记的池中识别高置信度样本。为了保持不断发展的支持集的完整性,我们采用了类平衡选择策略,以防止模型被容易学习的类别所主导。 UCM 和 NWPU 基准测试的结果表明 SE-CLIP 显着优于现有的半监督方法。该框架提供了一种可行的解决方案,以最少的人为干预使 VLM 适应遥感领域。