论文

SatBLIP:通过视觉语言学习从卫星图像中进行上下文理解和特征识别

SatBLIP: Context Understanding and Feature Identification from Satellite Imagery with Vision-Language Learning

应用与实践行业应用

摘要

农村环境风险是由当地条件(例如住房质量、道路通行、地表格局)决定的,但标准脆弱性指数很粗略,对风险背景的了解有限。我们提出了 SatBLIP,这是一种用于农村背景理解和特征识别的卫星特定视觉语言框架,可预测县级社会脆弱性指数(SVI)。 SatBLIP 通过将对比图像文本对齐与针对卫星语义定制的引导式图像描述相结合,解决了先前遥感管道(手工制作的特征、手动虚拟审计和自然图像训练的 VLM)的局限性。我们使用 GPT-4o 生成卫星图块的结构化描述(屋顶类型/状况、房屋大小、庭院属性、绿化和道路环境),然后微调卫星适应的 BLIP 模型以生成看不见的图像的说明。图像描述使用 CLIP 进行编码,并通过关注空间聚合下的 SVI 估计与 LLM 派生的嵌入融合。使用 SHAP,我们确定了显着的属性(例如屋顶形式/条件、街道宽度、植被、汽车/开放空间),这些属性持续推动稳健的预测,从而实现农村风险环境的可解释映射。