论文

TALENT:用于参考图像分割的目标感知高效调整

TALENT: Target-aware Efficient Tuning for Referring Image Segmentation

模型训练参数高效训练

摘要

参考图像分割旨在基于自然文本表达来分割特定目标。最近,参数高效调整(PET)已成为一种有前途的范例。然而,现有的基于 PET 的方法经常遇到这样的问题:视觉特征不能强调文本引用的目标实例,而是激活同类别但不相关的对象。我们分析并量化了这个问题,将其称为“非目标激活”(NTA)问题。为了解决这个问题,我们提出了一种新颖的框架 TALENT,它利用目标感知的高效调整来实现基于 PET 的 RIS。具体来说,我们首先提出了一个修正成本聚合器(RCA)来有效地聚合文本引用的特征。然后,为了将“NTA”校准为准确的目标激活,我们采用了目标感知学习机制(TLM),包括上下文成对一致性学习和以目标为中心的对比学习。前者利用句子级文本特征来实现对所指对象的整体理解,并构建文本所指亲和图来优化视觉特征的语义关联。后者进一步增强目标定位以发现不同的实例,同时抑制与其他不相关实例的关联。这两个目标协同作用并有效地解决“NTA”问题。广泛的评估表明,TALENT 在各种指标上都优于现有方法(例如,G-Ref val 集上的 2.5% mIoU 增益)。我们的代码将发布在:https://github.com/Kimsure/TALENT。