论文
SkyNative:用于遥感视觉语言理解的本机多模式架构
SkyNative: A Native Multimodal Architecture for Remote Sensing Vision-Language Understanding
摘要
遥感视觉语言模型 (RS-VLM) 通常采用预训练视觉编码器和投影模块将图像特征映射到 大语言模型 的标记空间中。虽然有效,但这种模块化 RS-VLM 将视觉表示与语言推理分开,可能限制细粒度视觉证据直接参与复杂的空间推理。这一挑战与遥感图像尤其相关,遥感图像通常覆盖广阔的地理区域,包含多尺度物体、密集的目标分布和复杂的空间布局。在本文中,我们提出了 SkyNative,这是第一项探索用于遥感视觉语言任务的本机多模式架构的研究。 SkyNative 通过轻量级补丁嵌入模块将遥感图像转换为视觉标记,并将它们与文本标记放在共享的自回归序列中,允许文本标记直接访问前面的视觉上下文。为了适应两种模态的异构特征,我们进一步采用模态感知解耦机制,该机制应用模态特定的投影、归一化和前馈变换,同时通过共享因果自注意力处理两种模态。大量实验证明了SkyNative在密集小物体感知、大格式上下文理解、复杂推理和鲁棒性方面的强大能力,在HRRSD、RSHR推理和OmniEarth上的得分分别为68.93%、47.40%和63.43%。这些结果表明,SkyNative 中探索的本机 VLM 架构代表了一种有前途的 RS 视觉语言建模方法。