论文
通过文本反演进行少样本开放词汇遥感分割
Few-Shot Open-Vocabulary Remote Sensing Segmentation via Textual Inversion
摘要
开放词汇分割可以在不进行每类训练的情况下标记文本查询中的任意类别,但在遥感图像上,它在其他地方可靠处理的类别上表现不佳。我们发现这种差距很大程度上归因于文本查询而不是分段模型。由于这些模型并非专门用于俯视图像,因此用作查询的类名通常是视觉语言嵌入空间中的弱地址。我们表明,更好的名称可以修复部分间隙,而其余的故障则需要测试的自然语言改写无法提供的地址。我们通过冻结模型上的文本反转从几个示例中恢复该地址,仅保留推理文本。在代表性基准上,这将受影响类别的并集平均交集从 3.9 提高到 39.4,并且在八个遥感数据集上,它比在推理时注入视觉提示的少样本方法有所改进。