论文
将视觉基础模型适应声学以实现无姿态 3D 声纳重建
Adapting Vision Foundation Models to Acoustics for Pose-Free 3D Sonar Reconstruction
摘要
在互联网规模 RGB 数据集上训练的视觉基础模型可在从文本到视频生成到少量 3D 场景重建等一系列任务中实现卓越的功能。在大规模声纳数据集上训练的声学基础模型可以在水下领域实现类似的功能,在水下领域,浑浊度和低能见度条件使得传统的 RGB 基础模型不适用。不幸的是,由于缺乏免费的大规模声纳数据集,使得从头开始训练这样的模型变得不切实际。在这项工作中,我们证明视觉基础模型可以通过(1)利用两种传感模式之间的几何关系和(2)采用精确的基于物理的噪声模型来生成合成数据来有效地适应声纳设置。由此产生的声纳适应模型实现了新的功能:我们首次通过实验演示了基于声纳的无姿态 3D 重建。