论文
通过反事实集成解码减轻大型视觉语言模型中的偏差
Mitigating Bias in Large Vision-Language Models via Counterfactual Ensemble Decoding
摘要
大视觉语言模型(LVLM)在广泛的任务中取得了卓越的性能;然而,他们经常从训练数据中继承社会偏见,导致在处理来自不同社会群体的肖像时出现偏见行为。现有的去偏见方法通常在解码过程中比较原始代和有偏见代之间的词元概率,但它们从根本上受到对单一刻板观点的依赖的限制,并且无法解释社会观点的多样性。受到多样性促进公平的社会科学原理的启发,我们提出了反事实集成解码(CED),这是一种新颖的框架,可以在视觉表示空间内构建多组反事实视角,并在解码过程中将它们整合起来,以促进公平的模型行为。 CED 首先通过识别与每个社会群体相关的语义方向并沿着这些方向生成反事实表征,在视觉空间中进行反事实引导,从而提供打破刻板叙事的不同视角。在解码过程中,CED 定位在这些视角之间表现出最大差异的解码器层,并使用不确定性感知权重来整合其词元分布,优先考虑来自不同组的高置信度词元,以产生更平衡的概率分布,从而指导更公平的生成。对三个社会偏见评估基准的广泛实验表明,\tool 比领先基线取得了实质性改进,在涉及职业、描述符和角色特征的场景中将偏见减少了高达 47.97%。此外,CED 还保留了原始模型的核心功能,且退化程度最小。