论文
用于无人机热图像中物种识别和栖息地背景解释的视觉语言模型的轻量级多模态适应
Lightweight Multimodal Adaptation of Vision Language Models for Species Recognition and Habitat Context Interpretation in Drone Thermal Imagery
摘要
本研究提出了一种轻量级多模态适应框架,以弥合 RGB 预训练 VLM 和热红外图像之间的表示差距,并使用真实的无人机收集的数据集展示了其实用性。热数据集是根据无人机收集的图像开发的,用于通过多模式投影仪对齐对 VLM 进行微调,从而将信息从基于 RGB 的视觉表示传输到热辐射输入。包括 InternVL3-8B-Instruct、Qwen2.5-VL-7B-Instruct 和 Qwen3-VL-8B-Instruct 在内的三个代表性模型在封闭集和开放集提示条件下进行了物种识别和实例计数的基准测试。在测试的模型中,带有开放集提示的Qwen3-VL-8B-Instruct取得了最好的整体性能,鹿的F1分数为0.935,犀牛的F1分数为0.915,大象的F1分数为0.968,1内计数精度分别为0.779、0.982和1.000。此外,将热图像与同时收集的 RGB 图像相结合,使该模型能够生成栖息地背景信息,包括土地覆盖特征、关键景观特征和可见的人类干扰。总体而言,研究结果表明,基于投影仪的轻量级适应为将 RGB 预训练 VLM 转移到热无人机图像提供了一种有效且实用的途径,将其实用性从对象级识别扩展到生态监测中的栖息地环境解释。