论文
退化视觉条件下水下机器人的鲁棒跨模态基础模型感知
Robust Cross-Modal Foundation Model Perception for Underwater Robots under Degraded Visual Conditions
摘要
可靠的水下机器人感知仍然很困难,因为光学图像在浑浊、波长相关的衰减、低照度、散射和模糊的情况下会退化。尽管声纳提供的补充信息受光学可见度影响较小,但先前的视觉声纳研究主要集中在特征对齐和标称检测性能上。我们研究了视觉可靠性恶化时的跨模式鲁棒性,并评估了预训练的视觉基础模型表示是否可以在严重退化的情况下通过声纳进行补充。我们使用冻结的 DINOv2 作为视觉编码器,并构建了从干净到极端视觉条件的受控五级基准。我们比较了传统的视觉检测、冻结基础模型表示、声纳上下文、固定多模态融合、干净训练的自适应门控和退化感知门控融合。我们的方法在整个退化范围内训练融合机制,同时保持视觉和声纳编码器冻结,从而允许模态贡献在没有 微调 预训练主干的情况下进行调整。在极端组合退化下,DINOv2基线达到0.4610的平衡精度,而退化感知视觉声纳融合达到0.6152,相对提高了33.5%。学习到的声纳贡献从清洁条件下的 14.2% 增加到极端退化下的 41.3%,证明了跨模式依赖的自适应重新分配。融合在严重浑浊和模糊的情况下提供了最大的收益,而单独的颜色衰减几乎没有带来额外的好处。这些结果表明,基础模型表示仍然有价值,但在严重信息丢失的情况下还不够,并且明确地使融合适应模态可靠性可以提高鲁棒的水下多模态感知。