论文
学习在嘈杂的监督下多模态学习中应该信任什么
Learning What to Trust in Multimodal Learning under Noisy Supervision
摘要
多模态分类处理并关联来自多种模态的信息,以实现更准确的预测。然而,现有方法通常依赖于高质量的真实标签,而这些标签在现实场景中很难获得。虽然使用噪声标签学习的样本选择方法旨在从噪声数据中识别正确标记的示例,但传统方法主要关注单峰设置,无法充分利用多峰信息。这激励我们在多模态学习中构建更可靠的噪声检测器。为此,我们从理论上分析了表示结构与噪声检测能力之间的关系。基于此分析,我们提出了 REFINE,这是一种多模态标签噪声检测框架,联合使用融合和单模态表示进行标签噪声检测。具体来说,REFINE通过对目标类和背景类的判别分析来构造判别特征向量,并为每个类选择具有更好噪声检测能力的可信表示空间。之内 每个可信空间,REFINE 测量每个实例表示和判别特征向量之间的对齐。然后它组合从这些空间中选择的子集。组合集为更新多模态分类器提供了更清晰的监督,从而减少了训练期间错误标记示例的影响并提高了模型泛化能力。跨不同任务的大量实验证明了 REFINE 与基线方法相比的优越性。源代码将公开。