论文
视觉语言模型的多语言训练和评估资源
Multilingual Training and Evaluation Resources for Vision-Language Models
摘要
视觉语言模型(VLM)近年来取得了快速进展。然而,尽管有所增长,VLM 的开发很大程度上基于英语,导致了两个主要限制:(i) 缺乏用于训练的多语言和多模式数据集,以及 (ii) 缺乏跨语言的综合评估基准。在这项工作中,我们通过引入一套新的用于 VLM 训练和评估的综合资源来弥补这些差距,涵盖五种欧洲语言(英语、法语、德语、意大利语和西班牙语)。我们采用再生翻译范式,通过结合策划的合成生成和手动注释来生成高质量的跨语言资源。具体来说,我们构建了 Multi-PixMo,这是一个训练语料库,从 Pixmo 预先存在的数据集中使用许可模型(PixMo-Cap、PixMo-AskModelAnything 和 CoSyn-400k)重新生成示例。在评估方面,我们构建了一组翻译广泛使用的英语数据集(MMbench、ScienceQA、MME、POPE、AI2D)的多语言基准。我们通过定性和定量的人类分析来评估这些资源的质量,衡量注释者之间的一致性。此外,我们还进行消融研究,以证明多语言数据(仅针对英语)在 VLM 训练中的影响。包含 3 个不同模型的实验表明,使用多语言、多模式示例来训练 VLM 辅助工具在非英语基准上始终有益,并且对英语也有积极的迁移。