论文

将生成器转变为 检索器:解锁 MLLM 以实现自然语言引导的地理定位

Turning Generators into Retrievers: Unlocking MLLMs for Natural Language-Guided Geo-Localization

模型训练参数高效训练

摘要

自然语言引导的跨视图地理定位(NGCG)旨在使用地面场景的文本描述来检索地理标记的卫星图像。虽然最近的 NGCG 方法通常依赖于 CLIP 式的双编码器架构,但它们经常受到跨模态泛化能力较弱的影响,并且需要复杂的架构设计。相比之下,多模态 大语言模型 (MLLM) 提供强大的语义推理功能,但并未直接针对检索任务进行优化。在这项工作中,我们提出了一个简单而有效的框架,通过参数高效的微调使 MLLM 适应 NGCG。我们的方法优化了 MLLM 中的潜在表示,同时保留其预训练的多模态知识,从而无需重新设计模型架构即可实现强大的跨模态对齐。通过对从模型主干到特征聚合的各种变量的系统分析,我们为在 NGCG 中利用 MLLM 提供了实用且可推广的见解。我们的方法在 GeoText-1652 上实现了 SOTA,文本到图像召回@1 提高了 12.2%,并在 CVG-Text 上 12 个子任务中的 5 个中确保了最佳性能,同时以少得多的可训练参数超越了基线。这些结果使 MLLM 成为语义跨视图检索的坚实基础,并为基于 MLLM 的 NGCG 被采用作为传统双编码器设计的可扩展、强大的替代方案铺平了道路。项目页面和代码可在 https://yuqichen888.github.io/NGCG-MLLMs-web/ 获取。