论文
DeCo:多任务视觉基础的高效解耦学习
DeCo: Efficient Decouple-to-Couple Learning for Multi-Task Visual Grounding
摘要
多任务视觉基础需要模型共同理解语言语义并执行准确的视觉定位和分割。尽管多模态大语言模型取得了成功,但有效地使其适应多个基础目标仍然具有挑战性。现有方法通常通过共享表示来加强任务合作,同时忽略面向任务的特征利益之间的内在冲突。在本文中,我们介绍了$\textbf{DeCo}$,这是一种高效的$\textbf{De}$耦合到$\textbf{Co}$uple学习框架,它通过两阶段范式解决了这一困境:特定于任务的表示解耦,然后是互补的先验耦合。具体来说,我们首先提出任务感知语义解耦(TSD),在显着词级指导下将共享视觉线索路由到各个特征中,从而减轻本地化和分割之间的表示干扰。此外,我们观察到,由于密集的监督,分割自然地提供了信息丰富的本地化先验。基于这一见解,我们引入了混合先验耦合(HPC),它将句子级语义先验与掩模导出的空间先验相结合以增强基础。 DeCo 建立在冻结的多模态编码器的基础上,需要轻量级的可训练参数,同时在多个基础目标上实现强泛化。在 RefCOCO/+、G-Ref、ReferIt、Flickr、DIOR-RSVG、SARVG1.0、RRSIS-D、RIS-LAD 和 RefDIOR 上进行的大量实验表明,DeCo 在自然和遥感基准上都实现了最先进的性能。代码和模型可从此 https URL 获取。