论文
从上面进行快速概念分割:评估 SAM 3 遥感中的零射击和单射击能力
Promptable Concept Segmentation from Above: Evaluating SAM 3's Zero-Shot and One-Shot Capabilities in Remote Sensing
摘要
Segment Anything Model 3 (SAM 3) 等大规模基础模型的部署有望向开放词汇 无需训练 计算机视觉过渡。然而,它们将分布外泛化为地球观测图像的复杂、自上而下的几何结构的能力在很大程度上仍然是未量化的。在 SAM 3 在高度专业化领域的性能差异的推动下,我们在严格的零样本和单样本约束下,提出了一种全面的、跨遥感场景分类、对象检测和实例分割的多任务实证评估。为了实现这一目标,我们通过将其解耦的二进制存在头重新调整为独立的零样本分类器,引入了 SAM 3 的结构调整。此外,通过系统地隔离五种配置中的文本和视觉提示模式,我们明确诊断了模型多模态解码器内的对齐机制。我们的研究结果揭示了严重的跨模式干扰:虽然视觉提示成功地将解码器与复杂的遥感几何图形对齐,但文本提示却注入了未对齐的地面语义偏差,从而主动降低了坐标回归的质量。为了在不进行资源密集型训练的情况下对这些功能进行基准测试,我们为广义零样本任务(场景分类和实例分割)制定了一种新颖的 无需训练 代理评估协议。最终,我们的结果表明,SAM 3 避免了传统领域适应模型中常见的过度拟合,在分割任务中实现了高调和平均分数。然而,它仍然从根本上受到子像素分辨率限制和开销语义盲点的限制,为其多模态解码器的参数高效地理空间 微调 制定了明确的要求。