论文

ViD:大型视觉语言模型的视觉主导性别偏见缓解

ViD: Vision-Dominant Gender Bias Mitigation for Large Vision-Language Models

模型评测鲁棒性、公平性与可信度评测

摘要

大型视觉语言模型 (LVLM) 中的性别偏见破坏了其公平性和可靠性,损害了输出的可信度。当前的缓解方法依赖于训练阶段调整或事后校准,但在动态视觉偏差缓解方面面临局限性。其中包括无法捕获实时视觉文本不一致、依赖预定义的性别偏见分类法,以及与新出现的偏见模式的跨模式对齐退化。为了应对这些挑战,我们提出了 ViD,这是一个受因果启发的框架,可以分析五种不同模式的注意力机制,揭示强语言先验的混杂效应。 ViD 证明视觉到语言的交叉注意力可以有效抑制偏见,同时保留一般推理能力和文本生成质量。 ViD 结合了双重机制:后门调整可以对抗强语言先验,而解码层中的精细标记选择可以优化处理。这增强了模型的稳健性和推理效率。我们的综合方法显着减轻了 LVLM 中多维社会属性的性别偏见,改善了视觉基础和输出公平性。跨基准验证显示,ViD 在单属性评估 (FACET) 上将性别偏见减少了 14.7%,并在图像字幕任务 (MS COCO) 上取得了显着改进,LLaVA 的性别偏见得分从 0.6708 提高到 0.9978。至关重要的是,这些改进不需要额外的训练开销,使 ViD 成为 LVLM 中偏差缓解的可扩展且实用的解决方案。