论文
开放词汇语义分割中视觉语言模型的持续测试时适应
Towards Continual Test-Time Adaptation of Vision-Language Models in Open-Vocabulary Semantic Segmentation
摘要
开放词汇语义分割(OVSS)依赖于视觉语言对齐来识别任意文本定义的类别,但这种对齐在持续的测试时间分布变化下是脆弱的。我们的诊断分析表明,熵最小化会导致补丁级类崩溃,持续更新会侵蚀视觉语言对齐,并且低位移样本产生的冗余梯度会浪费计算。我们提出了 Diversify、Anchor 和 Filter (DAF),这是一个稳定框架,它通过抵抗崩溃的边际多样性损失增强基于熵的适应,限制相对于冻结源模型的特征漂移的跨模式锚一致性损失,以及跳过低值反向传递以抵消部分源锚开销的特征显着性过滤。我们评估了涵盖自然场景、自动驾驶、水下图像和遥感的五个数据集及其损坏的变体。在评估的连续变化中,DAF 在熵最小化崩溃的情况下保持稳定,与源模型相比,在 Pascal VOC20-C 上将 mIoU 提高超过 8 个点,在 LoveDA 上提高超过 9 个点,在 Foggy Cityscapes 上提高超过 3 个点,并且对于积极的适应和学习率选择具有鲁棒性。