论文

相同的图表,不同的故事:视觉语言图表解释中的偏差

Same Chart, Different Story: Bias in Vision-Language Chart Interpretation

模型评测基准与评测资源

摘要

视觉语言模型 (VLM) 越来越多地用于解释图表并为具有社会影响的数据生成自然语言解释。然而,当仅参考的社会群体发生变化时,他们可能会对同一张图表产生不同的叙述,从而强化刻板印象和误导性决策。尽管存在这些风险,但仍不存在系统评估跨社会维度的图表解释偏差的基准。我们推出 ChartBias,这是基于 VLM 的图表解释中审计偏差的第一个基准。 ChartBias 包含 820 个手动策划的现实世界图表,涵盖六个属性:种族、收入、年龄、宗教、移民身份和性别,产生 4,319 个有效图表、属性实例和 8,638 个配对世代,其中图表是固定的,仅交换组术语。在 12 个专有和开源 VLM 中,总共 155,484 个模型响应中,我们发现了三种普遍的失败模式:叙述转变(相同的图表,不同的叙述)、群体幻觉(在没有证据的情况下将图表分配给一个群体)和偏好极性(有利的趋势通常与一个群体相关)。我们进一步提出了一个多代理缓解框架,通过将基于图表的证据提取与群体条件生成分开,并使用反事实判断来验证图表支持群体驱动的差异,作为强大的基线。该框架大大减少了叙述的转变,同时保留了基于图表的推理。我们的研究结果表明,评估图表理解不仅需要衡量准确性,还需要衡量社会群体之间的公平性和一致性。我们在此 https URL 发布 ChartBias。