论文

选择性、正则化和校准:利用视觉基础模型进行跨域少样本语义分割

Selective, Regularized, and Calibrated: Harnessing Vision Foundation Models for Cross-Domain Few-Shot Semantic Segmentation

模型训练参数高效训练

摘要

视觉基础模型 (VFM) 在各种视觉任务中都取得了出色的性能。然而,将 VFM 应用于跨域少样本分割(CD-FSS)仍然具有挑战性,该方法仅使用少量标记的样本来分割域转移下新类别的对象。这一挑战主要由两个因素驱动:(1) 相对于 VFM 预训练 的规模,每个新类别的标记样本有限,使得模型在再训练期间容易过度拟合;(2) 在 预训练 期间目标域变化代表性不足,导致跨域不一致和分层敏感性。为了解决这些问题,我们提出了分层示例表示适应(HERA),这是一种基于 VFM 的三阶段选择-正则化-校准分割框架,可以从有限的标签中有效学习并适应新的领域,而无需源数据重新训练。我们首先设计分层层选择(HLS),使用为每个候选层计算的数据相关的样本转移风险(ETR)来自适应地识别信息最丰富的 VFM 层。然后,先验引导正则化(PGR)对所选表示的交互进行正则化,为后续阶段产生结构良好的局部信号。此外,逐像素自适应校准 (PAC) 将选定的表示与精细的交互图相结合,以校准逐像素预测,从而生成一致的掩模。这些阶段一起形成了一个分层的选择-正则化-校准管道,指导新领域中冻结的 VFM 功能,而 微调 在测试时少于参数的 2.7%。大量实验表明,HERA 在多个 CD-FSS 基准测试中超越了现有技术超过 4.1 mIoU。