论文
MUSE:情境教育中的视觉语言模型多模态理解基准
MUSE: Benchmarking Large Vision-Language Models on Multi-Modal Understanding in Situated Education
摘要
大型视觉语言模型在多模态理解上取得显著进展,但教育场景能力仍未充分评估。在AI辅助语言学习中,模型必须解释艺术图像,理解其语义、情感和文化内容,并围绕视觉语境推理以支持有意义的交互。然而,现有基准主要关注现实图像或特定领域教育推理,对艺术教育内容覆盖有限。为此,我们提出MUSE,用于评估视觉语言模型在情境教育应用中的艺术图像理解。MUSE将图像标注与问题生成解耦,在降低标注工作量的同时,支持多样且难度可控的任务。它包含十二类任务,覆盖视觉感知、语义与情感解释、文化理解及组合推理,并精心选取多样艺术图像,在涵盖多主题和难度层次的同时,将新加坡和东南亚多文化语境与西方艺术传统共同置于中心。开源和闭源模型评估显示,各能力维度存在显著差距,尤其是情感解释与组合推理。分析进一步识别常见失效模式以及构建可信教育多模态模型的关键挑战。我们希望MUSE成为推动情境教育多模态理解的标准化基准。
