论文

基于合成孔径声呐(SAS)视觉Transformer的LoRA增强对比学习

LoRA Enhanced Contrastive Learning with SAS Vision Transformers

模型训练参数高效训练

摘要

基于合成孔径声呐(SAS)的自动目标识别(ATR)支撑先进海军能力,但深度学习受制于稀缺的目标图像、背景杂波以及人在回路的评估。我们采用三阶段参数高效框架,将DINOv3视觉Transformer(ViT)模型适配到水下SAS ATR。第一阶段在冻结ViT骨干的同时使用低秩适配(LoRA),弥合自然图像预训练与水下声传播之间的差距。第二阶段使用难负样本挖掘,强化针对声学仿形干扰(如酷似人造目标的岩石与沉积构造)的决策边界。第三阶段使用监督对比学习(SupCon)分离目标与杂波表征。我们使用任务级地理划分评估海上实测SAS数据,在85%测试召回率下比较所有实验组,并对每次比较重复三个随机种子。LoRA贡献了主要效应:在相同冻结骨干下将精确率-召回率曲线下面积(AUPRC)从0.300提升至0.679±0.027;秩为4时仅训练0.26%的权重即取得该结果。两个精炼阶段均未超过各自匹配的对照:难负样本挖掘相对等规模随机课程使AUPRC变化-0.0045±0.0119,SupCon相对前一阶段使AUPRC变化+0.0002±0.0096。这些零结果说明,挖掘发生在编码器已然拟合的数据上,且监督阶段已施加了大部分目标-杂波几何结构。一个高效适配阶段即已足够,堆叠精炼并无必要。

基于合成孔径声呐(SAS)视觉Transformer的LoRA增强对比学习:论文配图
图 1:用于适配 DINOv3 ViT-L 模型的参数高效微调(PEFT)架构。双波段(高频(HF)与宽带(BB))SAS 图像经过可训练的 2 通道到 3 通道的 stem。冻结的 ViT-L 主干在其线性投影层中加入可训练的 LoRA 模块。