论文
SonarLLM:面向水下感知的原生声呐-光学多模态大语言模型
SonarLLM: A Native Sonar--Optical Multimodal Large Language Model for Underwater Perception
摘要
可靠的水下感知需要在多变能见度下互补的传感方式。光学相机捕捉外观和语义,但在浑浊水中迅速退化;成像声呐保留几何结构,却呈现独特的距离-方位结构和声学伪影。现有MLLM主要构建于光学编码器之上,因此既不适合建模声呐,也难以自适应地利用声呐-光学互补性。我们提出SonarLLM,一个把声呐作为原生感知模态的声呐-光学MLLM。它结合声呐专用编码器、模态专属的物理感知特征增强和可靠性感知的分层融合,使声学结构与光学语义对齐,并随传感质量变化动态调整两者的贡献。我们还引入SonarBench,一个覆盖识别、计数、视觉问答和描述四项任务的配对基准;并在该基准上提供三种输入设置:仅声呐、仅光学和融合。通过固定场景和声呐观测而改变光学退化程度,SonarBench能够受控地测量跨模态互补性。SonarLLM在仅声呐的识别、计数和VQA上达到72.0%的宏观准确率,超过最强基线34.4个百分点;融合模式下达到68.7%,超过最佳基线25.1个百分点。对于识别和计数,融合相对光学的增益随浑浊度增加从6.0扩大到36.0个百分点,表明在受控光学退化下声呐的互补价值不断提升。这些结果共同表明,鲁棒的异构感知不仅在于加入声呐,更在于依据声呐的传感特性来表示和加权它。
