论文

采用部分标签的多标签分类的密集视觉语言关系

Adapting Dense Vision-Language Relationships for Multi-label Classification with Partial Label

模型训练监督微调与指令调优

摘要

学习具有不完整注释的多标签图像分类是一项具有挑战性的任务,因其在大规模数据集上的高效率和较少劳动力消耗之间的优越权衡而被广泛研究。主要方法依赖于强大的先验假设来从部分注释中恢复丢失的语义。然而,这些统计先验存在不稳定的语义错误,从而导致灾难性的过度拟合。为此,我们提出了一种语言驱动的密集语义适配器(LDSA),它从多模态预训练 CLIP 模型中挖掘先验自适应关系。在我们的方法中,首先提出密集对比适配器来构建密集视觉对比约束,将特定于任务的知识转移到视觉领域。然后,我们在特定于类的提示调整的帮助下提出了一种语言驱动的交互式解码器,该解码器使用视觉域来调整语言代理。通过所提出模块的协作学习,实验结果表明我们提出的 LDSA 在公共多标签分类基准上达到了新的最先进水平,并且可解释的分析表明我们的 LDSA 发现了与先验自适应学习方案的隐含语义关系。