论文
使用结构化和本机多模态 Qwen 模型重新审视遥感中的 VQA 变化
Revisiting Change VQA in Remote Sensing with Structured and Native Multimodal Qwen Models
摘要
变化视觉问答(Change VQA)解决了回答有关双时态遥感(RS)图像之间语义变化的自然语言问题的问题。尽管视觉语言模型(VLM)最近被研究用于时间 RS 图像理解,但在现代多模态模型的背景下,Change VQA 仍然没有得到充分探索。在这封信中,我们在统一的低秩适应 (LoRA) 设置下使用最新的 Qwen 模型重新审视 CDVQA 基准。我们将 Qwen3-VL 与 Qwen3.5 进行比较,Qwen3-VL 遵循具有多深度视觉调节和全注意力解码器的结构化视觉语言管道,Qwen3.5 是一种将单阶段对齐与混合解码器主干相结合的本机多模态模型。官方 CDVQA 测试分割的实验结果表明,最近的 VLM 比早期的专门基线有所改进。他们进一步表明,性能并不随模型大小单调扩展,并且对于此任务,本机多模态模型比结构化视觉语言管道更有效。这些发现表明,对于遥感图像中语言驱动的语义变化推理,紧密集成的多模态主干比尺度或显式多深度视觉条件对性能的贡献更大。