论文

遥感定向目标视觉基础的统一框架和数据集

A Unified Framework and Dataset for Oriented Object Visual Grounding in Remote Sensing

模型推理解码与生成控制

摘要

遥感图像中的视觉基础旨在定位通过引用表达式描述的对象。大多数现有方法预测水平边界框,这对于任意方向的对象通常不准确。为了解决这个限制,我们引入了 O$^2$-VG,这是一个具有三种互补设计的面向对象视觉基础的模型系列。具体来说,O$^2$-VG-Trans 是一个用于面向对象视觉基础的跨模态转换器。它为模范家庭奠定了坚实的歧视基础。在此基础上,O$^2$-VG-Uni 在没有特定文本提示的情况下预测可能的前景对象的通用导向建议。它还支持通过缓存的提案嵌入进行对象检索。使用这些面向通用的建议作为输入提示,O$^2$-VG-VLM 是一种自回归视觉语言模型。它通过多词元预测并行生成定向盒子词元块。此外,我们构建了 DIOR-R-RSVG,一个用于遥感图像中定向对象视觉基础的数据集。它提供图像、表达和定向框三元组用于训练和评估。 O$^2$-VG 系列共同提供了一个灵活的框架,涵盖判别变换器和生成视觉语言模型。它在多个基准测试中实现了卓越的性能。代码可从此 https URL 获取。