论文
大视觉语言模型中与护栏无关的社会偏见评估
Guardrail-Agnostic Societal Bias Evaluation in Large Vision-Language Models
摘要
我们提出了一种强安全护栏时代大型视觉语言模型(LVLM)的社会偏见评估方法。现有的基准依赖于要求模型推断图像中人的属性的提示(例如,“这个人是首席执行官还是秘书?”)。然而,我们发现具有强大护栏的LVLM,例如GPT和Claude,经常拒绝这些提示,使得评估不可靠。为了解决这个问题,我们通过将任务与所描绘的人解耦来改变先前的评估范式:我们不推断人的属性,而是使用不询问人的提示(例如,“写一个关于想象中的人的虚构故事。”)并将图像附加为临时用户信息以隐式提供人口统计线索,然后比较不同用户人口统计的输出。通过三个任务的实例化——故事生成、术语解释和考试式 QA——我们的方法即使在受保护的 LVLM 中也能避免拒绝,从而实现可靠的偏差测量。将其应用到最近 20 个 LVLM(开源的和专有的)中,我们发现所有模型都在与个人无关的任务中不合需要地使用用户人口统计信息;例如,故事中的角色通常被男性用户描绘成机械师,而女性用户则被描绘成护士。尽管仍然有偏差,但像 GPT-5 这样的专有模型比开源模型表现出更低的偏差。我们分析了这一差距背后的潜在因素,讨论了持续模型监控和改进作为减少偏差的可能因素。