论文

限制,而不是重新训练:零镜头空中分割的推理时间 VLM 指南

Restrict, Don't Retrain: Inference-Time VLM Guidance for Zero-Shot Aerial Segmentation

模型推理推理策略与问题分解

摘要

全球福利往往取决于对航空和卫星图像的正确解释。对此类图像进行操作(绘制被淹没的地面、作物范围或受损基础设施的地图)需要像素级分割以确保完美的类定位。直接应用预训练的通用基础模型时,通常会错过重要特征,并且不能总是找到属于给定场景的所有类,从而忽略了最重要的较小对象。我们使用运行视觉语言模型 (VLM) 的单个消费级 GPU 来提供这种缺失的指导,改进分割,同时生成驱动结果的结构化、可审计的证据,并可以自行检查。我们融合了三种方法:标记每个像素的冻结基础模型,以及对 VLM 的两个查询,一个用于选择重要的类,另一个用于定位基础模型错过的小对象。通过对四个航空数据集进行评估,我们看到基本模型在每个阶段都有一致的增益。