论文

用于参考图像分割的通道注意力引导跨模态 知识蒸馏

Channel Attention-Guided Cross-Modal Knowledge Distillation for Referring Image Segmentation

摘要

参考图像分割(RIS)需要根据语言描述对图像中的目标区域进行精确分割,是一项融合视觉和语言的跨模态任务。现有的RIS方法通常采用大规模视觉和语言编码模型来提高性能,但其巨大的参数规模严重限制了在计算资源有限的场景中的部署。为了解决这个问题,本文提出了一种通道注意力引导的跨模态 知识蒸馏 方法,该方法将教师网络学习到的视觉和语言之间的高阶细粒度相关性,以及每个通道表示的语义成分之间的相关性转移到学生网络。与传统的像素级关系蒸馏相比,该方法不仅使学生能够学习老师的知识,还保留了部分自主学习能力,缓解了学习偏差的迁移。在两个公共数据集上的实验结果表明,所提出的 蒸馏 方法在推理过程中没有引入额外的参数,并且可以为学生模型实现显着的性能提升。