论文

超越“一种语言,一种文字”:使用 PuMVR 量化多语言 VLM 中的拼写偏差

Beyond 'One Language, One Script': Quantifying Orthographic Bias in Multilingual VLMs with PuMVR

模型评测基准与评测资源

摘要

当前的视觉语言模型 (VLM) 因其多语言功能而闻名,但它们的运行却存在一个有缺陷的假设:一种语言对应于一种书写系统。这忽视了旁遮普语、塞尔维亚语、印地语-乌尔都语、库尔​​德语等多文字语言的数十亿用户,对他们来说,模型的能力可能会因拼写偏差而受到影响。我们推出 PuMVR(旁遮普多模态视觉推理),这是第一个基准测试,旨在通过旁遮普语三种活跃文字(Gurmukhi、Shahmukhi、Roman)中的 375 个基于文化的图像推理任务来量化依赖于文字的偏见。通过评估 10 个最先进的 VLM,我们发现了一个巨大的脚本差距:模型经常在一个脚本中解决视觉难题,而在另一个脚本中却无法完成相同的任务,准确率增量达到 16%,脚本一致性率 (SCR) 低至 24.8%。至关重要的是,视觉输入提高了绝对表现,但并没有缩小这一差距,相对偏差仍然存在。我们的分析表明,推理模式显示出有限的跨脚本可移植性,并且思想链路径仅基于脚本而出现分歧。我们建议将 SCR 作为与脚本无关的评估的核心指标,挑战当前的多语言评估范式,并为公平的人工智能提供框架。