论文
“Înţelegi Româneşte?”罗马尼亚视觉语言模型的秘诀
"Înţelegi Româneşte?'' A Recipe for Romanian Vision-Language Models
摘要
视觉语言模型(VLM)在很大程度上遵循纯文本 LLM 轨迹,在英语基准上表现出色,但在低资源语言上急剧下降,这些语言既不存在大规模图像文本语料库,也不存在基于文化的评估。我们提出了一项为罗马尼亚语构建特定语言 VLM 的系统研究,涵盖从数据构建到架构选择的完整流程。我们将现有的英语 VLM 训练和评估语料库翻译成罗马尼亚语,将机器翻译应用于文本注释和图像内文本,在调整文本内容的同时保留视觉基础。使用这些数据,我们训练和消除了一系列 VLM,以隔离 (i) 不同规模和预训练的视觉主干、(ii) 从多语言到罗马尼亚语适应的 LLM 的语言主干、以及 (iii) OCR 风格的图像文本数据的贡献。我们进一步策划了 HoraVQA,这是一个基于罗马尼亚日常场景的文化本土评估集。适应罗马尼亚语的 VLM 始终优于同尺寸的同类产品,并且在所有评估基准中,甚至超过了下一个更大尺寸类别的模型。