论文
0.5%>100%:参考图像分割的双向互惠学习
0.5%>100%: Bidirectional Reciprocal Learning for Referring Image Segmentation
摘要
视觉基础模型(VFM)的最新进展在不同的单峰视觉任务中表现出了卓越的能力。然而,将 VFM 应用于参考图像分割 (RIS) 通常需要通过全面微调来实现精确的视觉语言对齐,从而产生大量的计算开销并面临灾难性遗忘的风险。虽然现有的参数高效微调(PEFT)方法能够以最小的训练成本实现安全的知识转移,但它们主要在单独的模式内独立运行,或者只专注于从语言到视觉的单向指导,而忽略了渐进的跨模式交互和用于文本细化的视觉反馈。为了解决这些限制,我们提出了 $\textbf{B}$i Direction $\textbf{R}$eciprocal $\textbf{L}$earning ($\textbf{BRL}$),这是一种基于适配器的新型 PEFT 框架,可促进冻结基础模型的词元混合层和通道混合层内的分层、双向信息流。具体来说,BRL 引入了两个互补的轻量级模块。相互注意适配器(RAA)在词元级别执行跨模式查询键交换,使视觉和语言词元能够相互关注,以实现细粒度的空间基础。互惠门适配器 (RGA) 在通道级别生成跨模态门控信号,允许来自一种模态的全局语义上下文自适应地重新校准另一种模态的通道激活。对 RefCOCO、RefCOCO+ 和 RefCOCOg 基准的大量实验证明了 BRL 相对于之前的 RIS 方法的优越性,实现了最先进的性能,同时需要不到 0.5% 的主干参数更新。代码和模型将在此 https URL 发布。