论文
多语言 VLM 的推理能力相同吗?印度语言的跨语言视觉推理审核
Do Multilingual VLMs Reason Equally? A Cross-Lingual Visual Reasoning Audit for Indian Languages
摘要
视觉语言模型在数学、科学和空间推理基准上得分很高,但这些评估绝大多数是英语的。我提出了印度语言的第一个跨语言视觉推理审核。使用 IndicTrans2 将来自 MathVista、ScienceQA 和 MMMU 的 980 个问题翻译成印地语、泰米尔语、泰卢固语、孟加拉语、卡纳达语和马拉地语,并使用 Gemini 2.0 Flash 对每种语言 50 个样本进行交叉验证(译者间一致性 0.79-0.84)。从 7B 开源模型到 GPT-4o 的 8 个 VLM 在所有七种语言中进行了评估,产生了 68,600 条推理记录,其中包括纯文本和思维链消融。我发现从英语切换到印度语言时,准确率下降了 9.8-25 个百分点,其中德拉威语比印度雅利安语准确率下降了 13.2 个百分点。思维链提示会降低孟加拉语(-14.4 pp)和卡纳达语(-11.4 pp)的质量,而不是提供帮助,暴露以英语为中心的推理链。 Aya-Vision-8B 为 23 种语言构建,但在德拉威文字上仍然下降了 28.5 个百分点;单独的多语言预训练并不能转移视觉推理。我发布了翻译后的基准测试和所有模型输出。