论文

视觉机器遗忘中的偏差重新分配:忘记一个群体是否会伤害另一个群体?

Bias Redistribution in Visual Machine Unlearning: Does Forgetting One Group Harm Another?

模型评测鲁棒性、公平性与可信度评测

摘要

在 GDPR 和 CCPA 等隐私法规的推动下,机器取消学习使模型能够选择性地忘记训练数据。然而,其公平性影响仍未得到充分探索:当模型忘记人口统计群体时,它是否会中和该概念或将其重新分配给相关群体,从而可能放大偏见?我们使用 CLIP 模型(ViT/B-32、ViT-L/14、ViT-B/16)在按年龄和性别定义的交叉群体的零样本分类设置下研究了 CelebA 上的这种偏差重新分配现象。我们使用每组准确度变化、人口统计奇偶差距和重新分配分数来评估三种遗忘方法:即时擦除、即时重新加权和拒绝向量。我们的结果表明,忘却并不能消除偏见,而是主要按照性别而不是年龄界限重新分配偏见。特别是,在所有模型尺度上,删除占主导地位的年轻女性群体一致地将性能转移到老年女性,揭示了 CLIP 嵌入空间中的性别主导结构。虽然拒绝向量方法减少了重新分配,但它无法实现完全遗忘并显着降低了保留性能。这些发现凸显了当前遗忘方法的根本局限性:在不考虑嵌入几何的情况下,它们可能会放大保留群体中的偏差。