使用视觉语言模型进行几何海岸线定位
Geometric Coastline Localization using Vision-Language Models
摘要
遥感图像中的海岸线检测通常被表述为像素级分割,尽管海岸监测中使用的海岸线最终表示为几何曲线并由植被线、沙丘脚趾或悬崖边缘等地貌代理定义。我们从表示角度重新审视海岸线提取,并将任务制定为几何边界定位,其中薄海岸线边界直接定位为曲线,而不是从分割掩模导出。使用新西兰海岸变化数据集 (NZCCD) 和 LINZ 航空图像,我们开发了 CoastlineVLM-7B,这是一种基于 GeoChat-7B/LLaVA-1.5 架构构建的视觉语言模型,可联合执行海岸线存在检测、代理类型分类和直接海岸线定位作为有序折线。我们将其与使用一像素宽海岸线掩模训练的 U-Net、UNet++、DeepLabV3+ 和 SegFormer 进行比较,并使用基于容差和距离的几何指标评估定位。在西海岸测试集上,U-Net 提供了更强的局部边界接近度,显示出更好的容差分数以及更低的 Chamfer 和 Modified Average Hausdorff 距离,而 CoastlineVLM-7B 实现了最低的 Hausdorff 和 Earth Mover 距离,表明最坏情况偏差减少了,全局结构对应性更强。消融研究表明,几何定位主要由直接海岸线定位监督驱动,并且 GeoChat 初始化提供了比通用 LLaVA-1.5 初始化更强的起始表示。对澳大利亚 VCMP 数据集的零样本评估显示 U-Net 和 CoastlineVLM-7B 的性能有所下降,但 CoastlineVLM-7B 比 U-Net 实现了更好的几何定位。这些结果表明,直接有序折线定位可以用作表示和本地化海岸线几何形状的替代公式。