论文
杂乱无人机图像中通信塔组件零射击分割的显着深度调节
Saliency-Depth Conditioning for Zero-Shot Segmentation of Communication-Tower Components in Cluttered UAV Imagery
摘要
无人机图像中通信塔组件的细粒度分割对于自动检查至关重要,但由于实例级注释有限,很难开发特定于任务的模型。零样本分割模型提供了一种有前途的替代方案,但在杂乱的场景中,视觉上相似的背景结构会干扰组件定位,导致丢失实例和误报。我们提出了一种与模型无关的显着性深度前景调节策略,将基于外观的显着性与单眼相对深度相结合,以构造粗塔先验并抑制不相关的内容。我们将此模块与 Grounded-SAM 和 SAM 3 集成,生成 SD-Grounded-SAM 和 SD-SAM 3。SD-Grounded-SAM 在掩模生成之前进一步应用几何和深度感知框细化,而 SD-SAM 3 依赖于 SAM 3 的内部设置。在 TOW-300(包含 340 个通信塔无人机图像的数据集)上,我们的策略改进了两个基线:SD-SAM 3 实现了最强的实例分割性能,而 SD-Grounded-SAM 产生的误报更少。消融证实了显着性、深度和框细化的互补收益,从而提高了杂乱场景中的鲁棒性。