论文

EduArt:大语言模型 中评估艺术史知识的教育水平基准

EduArt: An educational-level benchmark for evaluating art history knowledge in large language models

模型评测基准与评测资源

摘要

大语言模型 现在在一般基准上的得分接近上限,但这些总体指标几乎无法揭示模型在单一学科内的行为方式。现有的以艺术为中心的评估依赖于综合问题,很少报告项目级属性。本文介绍了 EduArt,这是多模式 LLM 中艺术史知识和视觉推理的教育水平基准。 EduArt 包含来自意大利中学练习和美国先修艺术史考试的 871 个人工编写的问题,涵盖两种语言和七种格式,从多项选择到文本内单词位置和错误识别。来自六个提供者系列的十二个模型在默认的仅回答条件和需要书面论证的动机条件下进行了评估,并使用经典测试理论和逻辑回归来隔离格式、语言、图像存在和模型的影响。该基准测试显示出强大的心理测量特性(平均辨别力为 0.514,良好辨别力为 82.3%),而六个模型的多项选择准确度接近上限,表明仅靠识别格式无法区分前沿模型。格式是准确度的一个强有力的独立预测因素:模型在多项选择上超过 94%,在开放完成上下降到 23.9%(Claude Opus 4.6),在错误识别上下降到 6.2%(Claude Sonnet 4.6)。动机条件改变了准确性,主要是消极的、依赖家庭的方向。这些分离表明艺术史知识和部署它的能力是不同的能力,并且单一格式的基准高估了模型可以可靠地做到的事情。映射此能力概况是在艺术史学术中负责任地使用多模式 LLM 的先决条件,其中任务需要生成和操作内容,而不是从固定选项中进行选择。