论文
高效遥感视觉问答的统一框架:采用双重、混合和编码器-解码器架构
A Unified Framework for Efficient Remote Sensing Visual Question Answering: Adapting Dual, Hybrid, and Encoder-Decoder Architectures
摘要
由于航空图像的高分辨率、多尺度物体分布和语义复杂性,遥感 (RS) 领域的视觉问答 (VQA) 提出了独特的挑战。虽然通用领域基础模型取得了显着的成功,但它们在 RSVQA 中的直接应用受到大规模领域转移和完整 微调 的计算限制性质的阻碍。本研究对 RS Adapter 进行了比较分析,RS Adapter 是一种参数高效 微调 (PEFT) 策略,应用于三种不同的视觉语言模型 (VLM) 架构:双编码器 CLIP、编码器解码器 BLIP 和混合 FLAVA。我们引入了一个统一的架构手术管道,将轻量级瓶颈适配器注入到冻结主干的注意力层和 MLP 层中,从而能够以不到 5% 的可训练参数实现快速适应。高分辨率 RSVQA x 数据集上的实验结果表明,虽然所有适应模型都实现了收敛,但与单模态模型相比,混合 FLAVA 架构提供了多模态推理和检索能力的卓越平衡。我们的研究结果为灾害评估和城市监测中的资源高效 VQA 建立了新的基线。