论文
CLIP 为区域地理定位学到了什么?适配后视觉线索与场景配置的探查
What Does CLIP Learn for Regional Geolocalization? Probing Visual Cues and Scene Configuration After Adaptation
摘要
大规模街景图像集合提供了关于城市环境的丰富视觉信息,但从这类数据中提取细粒度地理信息仍然具有挑战性。细粒度区域地理定位尤其困难,因为邻近区域往往共享粗粒度地理线索。我们研究都市圈范围内的区域地理定位,探究预训练 CLIP 特征是否足以支撑区域判别,以及适配后是什么视觉信息支撑性能。使用来自大洛杉矶地区八个区域的 9,085 张街景图像,我们比较零样本 CLIP、冻结编码器读出、部分编码器更新、低秩适配(LoRA)和全量微调。冻结读出停留在 39.03% 的零样本准确率附近,而编码器适配达到 75.94–82.10%。全量微调还把到预测区域中心的平均距离从 12.30 公里降至 3.86 公里。我们通过语义线索移除、使用边缘图和模糊的外观削减、以及使用补丁打乱的场景配置破坏来探查这些增益。适配后的模型在边缘和模糊条件下准确率更高,打乱后 42.92–45.56% 的预测发生改变,而冻结方法为 10.79–14.60%。然而,适配并未提升外观削减后保留的性能比例,植被和天空仍然具有影响力。Caltech101 对照进一步表明,对打乱的敏感度并非地理定位独有。总体而言,编码器适配大幅提升邻近区域判别,并伴随对完整场景配置更强的敏感度,但没有证据表明粗略结构单独足以支撑预测。这些结论涉及已知位置附近的视点变化,而非地理不重叠区域的泛化。
