论文
确保自我监督的数据管理以保证基础模型的稳健性
Securing Self-supervised Data Curation for Foundation Models Robustness
摘要
自监督数据管理提供了扩展和提高机器学习模型泛化能力的途径。通过利用自监督学习(SSL)进行数据管理,可以有效满足基础模型对海量训练数据集的需求。 SSL 极大地降低了与注释和手动数据集管理相关的成本,同时最大限度地减少了人工监督的需要。然而,必须严格检查 SSL 管理的数据集的完整性,因为依赖匿名和未经审查的外部来源可能会大大增加数据中毒的风险。在本文中,我们提出了一种中毒数据检测器(PDD),这是一种主动防御机制,旨在确保 模型训练 成立之前 SSL 管理的数据集的完整性。 PDD 的设计结合了预训练的 ImageBind 模型和传统分类器,包括随机森林 (RF)、k 最近邻 (KNN)、朴素贝叶斯 (NB) 和支持向量机 (SVM)。我们使用来自三个不同数据集的 176,200 张图像和涵盖分布内和分布外场景的三种不同的对抗性攻击来严格评估 PDD。值得注意的是,SVM-PDD 在分布内(Set3-Set5)和分布外(TrueFace 和 140K RealFace)数据集上都实现了卓越的性能。我们的设计展示了强大的可扩展性,并能够通过集成方法快速集成新的对抗性攻击检测器。