论文

审计视觉语言模型中的残障表征

Auditing Disability Representation in Vision-Language Models

模型评测鲁棒性、公平性与可信度评测

摘要

视觉语言模型(VLM)日益被部署于社会敏感应用中,但其在残障议题上的行为仍未得到充分研究。我们研究针对以人物为中心图像的残障感知描述,模型在此类任务中常常从基于证据的事实描述转变为解释偏移,包括引入超出可观察视觉证据的无依据推断。为系统分析这一现象,我们构建了一个由中性提示(NP)与残障情境化提示(DP)配对组成的基准,并在零样本设置下评估了15个最先进的开源与闭源VLM,覆盖9个残障类别。我们的评估框架将解释保真度作为核心目标,将通过情感、社会评价和回复长度偏移捕捉情感退化的标准文本指标与LLM-as-judge协议相结合,该协议由具有残障亲历经验的标注者验证。我们发现,引入残障情境会一致地降低解释保真度,引发以推测性推断、叙事铺陈、情感退化和缺陷导向框架为特征的解释偏移。这些效应在种族和性别维度上被进一步放大。最后,我们证明针对性提示和偏好微调能有效提升解释保真度,并大幅减少解释偏移。

审计视觉语言模型中的残障表征
图1:用于审计视觉-语言模型(VLM)中解释性残障偏见的评估流程,该流程使用成对的 Neutral 与 Disability Contextualized 提示及其对应的回答。