论文
SatEdit:通过 VLM 引导的分段注释进行掩模条件图像编辑
SatEdit: Mask-Conditioned Image Editing via VLM-Guided Segment Annotation
摘要
卫星图像编辑需要空间精确的对象级控制,但高空图像的监督编辑数据集的构建成本高昂,因为对象蒙版、语义标签和配对编辑很少能大规模使用。我们介绍了 SatEdit,这是一种掩模条件卫星图像编辑框架,可根据未标记的图像构建训练监督。 SatEdit提出了具有分割基础模型的对象掩码,使用视觉语言模型为采样片段分配语义标签,并在通过掩码引导修复生成配对添加和删除示例之前应用轻量级人工验证。我们使用 LoRA 在 SODA-A 派生的数据集上微调高分辨率图像编辑主干,该数据集包含 91 个类别的 1,014 张图像和 852 个经过验证的对象注释。在与开源和专有图像编辑模型的受控比较中,SatEdit 实现了最高的聚合掩模区域语义对齐,CLIP 得分为 0.6322,CLIP 增量为 0.0726,同时定性地保留了周围的场景。这些结果表明,VLM 辅助分段注释是实现数据高效、空间可控卫星图像编辑的实用途径。