论文
并非真正的多语言:脚本一致性是 VLM 评估中缺失的维度
Not Truly Multilingual: Script Consistency as a Missing Dimension in VLM Evaluation
摘要
当前视觉语言模型 (VLM) 的多语言评估假设语言和正字法之间存在一对一的映射,忽略了数十亿多脚本语言的用户。我们引入 PuMVR(旁遮普多模态视觉推理),这是跨旁遮普三种活动脚本(Gurmukhi、Shahmukhi 和 Roman)的 1,000 个严格并行的图像文本实例的基准。通过评估 10 个最先进的 VLM,我们发现了重大且系统的脚本差距。模型经常在一个脚本中解决视觉任务,而在另一个脚本中却无法完成相同的任务,准确率增量达到 16%。至关重要的是,视觉输入均匀地提高了绝对性能,但并没有缩小拼写差距。此外,跨脚本上下文内传输非常脆弱,暴露了脚本锁定的知识表示。在所有脚本对的 McNemar 测试的支持下,我们的研究结果表明当前的“多语言”VLM 并不是真正的多脚本。我们建议将脚本一致性率 (SCR) 作为与脚本无关的评估的强制性指标,以确保公平的 AI 访问,该比率在我们的基准上低至 24.8%。数据和代码可在以下网址获取:https://github.com/prabhjotschugh/Not-Truly-Multilingual-PuMVR。