论文

Sci-Rho:多语言视觉STEM问题的变体稳健性评测

Sci-Rho: A Multilingual Visually-Grounded Symbolic Benchmark for STEM Problems

模型评测基准与评测资源

摘要

符号基准已成为在对 STEM 相关问题进行细微修改的情况下评估模型稳健性的关键方法。然而,现有的符号基准大多仍然局限于数学推理,缺乏视觉依据,并且主要是英语。在这项工作中,我们引入了 Sci-Rho(科学鲁棒性),这是一个针对跨越 5 个学科和 7 种语言的基于视觉的 STEM 问题的动态基准,包含由包括奥林匹克奖牌获得者在内的领域专家制作的 4,242 个问题模板(每种语言 606 个)。每个模板都实现为可执行的 Python 代码,通过不同的数值、视觉模式、几何形状、配色方案和函数类型生成不同但等效的问题实例,总共产生 42,420 个实例,每个实例都配有推理步骤和 真值 解决方案。我们评估了 17 个最先进的 VLM,发现最坏情况精度(定义为模型在每个生成的变化中正确回答的问题模板的比例)和平均精度之间存在明显差距。我们还发现,较小的模型在不同语言中表现出明显的性能下降,而专有模型和较大的模型仍然保持稳健。步骤级评估也反映了同样的趋势,揭示了平均 F1 分数和最坏情况 F1 分数之间的显着差距。最后,我们对 VLM 注意力头的检查揭示了与文本标记相比,分配给图像标记的相对注意力存在显着的跨语言差异。我们的工作强调了超越静态基准的评估作为衡量 VLM 质量的指标的重要性。