论文

低数据监督适应优于在域转移下提示云分段

Low-Data Supervised Adaptation Outperforms Prompting for Cloud Segmentation Under Domain Shift

模型评测模型能力评测

摘要

将视觉语言模型适应遥感图像提出了一个根本性的挑战:卫星数据的视觉和语言分布都远远超出自然图像预训练语料库。尽管如此,提示仍然是占主导地位的部署范例,其驱动因素是特定领域语言可以引导冻结的模型表示走向专门的任务。我们直接在不匹配突出的领域测试这个假设:卫星图像的云分割。在 CloudSEN12+ 云分段基准上使用 CLIPSeg,我们评估了涵盖简单标签、领域术语、外观描述符和上下文线索的 60 个提示变体,发现每个变体的表现均低于零样本基线 (0.255 mIoU),而工程提示得分低至 0.07 mIoU。再多的语言改进也无法弥合 CLIP 的自然图像表示与卫星光谱图像之间的差距。相比之下,仅具有 0.1% 标记数据(约 8 个图像)的监督 微调 总体上超过了零样本性能,并且 5-10% 的数据恢复了最大可实现 mIoU 的约 85%。完整的 微调 始终优于低秩适应 0.03-0.09 mIoU,其中光谱模糊类的差距最大,并且在 0.5% 到 1% 的标记数据下,微调 在恢复之前会暂时降低这些类的性能,这是聚合 mIoU 可以掩盖的监督下降。对于将视觉语言模型适应专业图像的从业者来说,我们的结果传递了一个明确的信息:标记数据并不是提示的昂贵替代方案;这是一条有价值的道路。