论文

SAGE:用于减轻虚假相关性的亚群感知生成增强

SAGE: Subpopulation-Aware Generative Enhancement for Mitigating Spurious Correlations

模型训练合成数据

摘要

虚假相关性对现代机器学习的稳健性提出了重大挑战。数据集分布固有的不平衡往往导致传统的经验风险最小化(ERM)模型依赖多数虚假属性进行分类,导致少数群体的表现不佳。当虚假属性不可用时,这个问题变得特别具有挑战性。现有的无组标签方法经常对少数群体进行上采样或对真实训练样本进行错误分类;重复相同的实例会减少有效多样性并导致过度拟合。为了在缺乏先验知识的情况下从以数据为中心的角度减轻这些虚假相关性,我们引入了子群体感知生成增强(SAGE),这是一个两阶段的生成增强框架。使用簇派生的子标签和类标签,我们微调条件生成模型和文本编码器,生成有针对性的合成数据以填充训练集中代表性不足的区域,并构建用于最后一层重新加权的平衡验证集。我们通过实验表明,SAGE 在 Waterbirds、CelebA 和 MetaShift 上的最差组准确率分别为 89.5%、85.7% 和 79.1%,比最佳无组标签基线高出 7.7 个百分点。