论文

通过奖励门控对 CLIP 进行选择性测试时间去偏

Selective Test-Time Debiasing for CLIP via Reward Gating

模型训练强化学习

摘要

视觉语言模型 (VLM) 表现出强大的零样本性能,但通常会在以人为中心的查询中延续社会刻板印象,从而产生倾斜的人口统计分布。当前的去偏差方法对所有输入查询应用统一的偏差校正,无论其偏差敏感性如何,从而创建基本的公平性——效用权衡。强去偏差会扭曲对偏差不敏感的查询中语义上有意义的信息,而弱去偏差则无法减轻对偏差敏感的查询中的刻板印象。这种一刀切的方法阻碍了同时实现对偏差不敏感的查询的高实用性和对偏差敏感的查询的公平性。我们引入了奖励门控测试时间适应(RG-TTA),这是一种基于强化学习的测试时间适应框架,可根据输入敏感性选择性地应用去偏。 RG-TTA 在测试时策略适应期间根据每个输入的偏差敏感性自适应地触发公平正则化,同时专门专注于优化偏差不敏感输入的跨模式对齐。公平性基准(例如 FairFace、UTKFace)上的实验表明,偏差大幅减少,同时提高了零样本实用性,解决了均匀去偏差的权衡问题。