论文
视觉语言模型的技能条件视觉地理定位
Skill-Conditioned Visual Geolocation for Vision-Language Models
摘要
视觉语言模型(VLM)在图像地理定位方面表现出了良好的能力,但仍然缺乏结构化的地理推理和自主进化的能力。现有的方法主要依赖于隐式参数记忆,它经常利用过时的知识并产生幻觉推理。此外,当前的推理是一个“一次性”过程,缺乏基于推理结果的自我进化所需的反馈循环。为了解决这些问题,我们提出了 GeoSkill,这是一个基于不断发展的技能图的 无需训练 框架。我们首先通过将人类专家轨迹细化为原子的自然语言技能来初始化图。在执行方面,GeoSkill 采用推理模型来执行由当前技能图引导的直接推理。为了持续增长,自主进化机制利用更大的模型,对源自网络规模数据和经过验证的现实世界推理的图像坐标对进行多重推理。通过分析这些采样轨迹中成功和失败的轨迹,该机制迭代地综合和修剪技能,有效地扩展技能图并纠正地理偏差,而无需任何参数更新。实验表明,GeoSkill 在 GeoRC 上的地理定位精度和 忠实性 推理方面均取得了可喜的性能,同时在不同的外部数据集上保持了卓越的泛化能力。此外,我们的自主进化促进了新颖的、可验证的技能的出现,显着增强了系统对孤立案例研究之外的现实世界地理知识的认知。