论文

DroneFINE:无人机图像视觉语言探测器的领域感知参数高效 微调

DroneFINE: Domain-Aware Parameter-Efficient Fine-Tuning of Vision-Language Detectors for Drone Images

模型训练参数高效训练

摘要

在开放和动态环境中工作的无人机 (UAV) 的目标检测是一项极具挑战性的任务。虽然视觉语言模型 (VLM) 为通用目标检测提供了强大的解决方案,但由于 VLM 预训练 数据和航空图像之间存在巨大的域差距,使其适应无人机场景仍然很重要。事实证明,流行的参数高效 微调 (PEFT) 方法在弥合这一差距方面无效,因为 VLM 的“自然场景、前景主导”视觉先验与无人机数据的“鸟瞰、背景主导、小物体”特征不一致。为了解决这个问题,我们提出了 DroneFINE,这是一种新颖的 PEFT 范例,包含两个为基于 VLM 的无人机图像探测器量身定制的领域感知互补模块。具体来说,设计了一种名为HyperAdapter的数据依赖、前台感知、多路径自适应机制,克服了PEFT的静态结构限制。此外,还开发了一种名为SemanticGate的背景抑制算法。它是一种文本条件指导策略,利用背景词汇主动指导模型抑制不相关区域的响应。 VisDrone 和 UAVDT 上的大量实验表明,DroneFINE 显着优于现有的 PEFT 方法,并实现了与完整 微调 相当的性能,同时大幅减少了可训练参数的数量。