论文

SpecialEduBench:自闭症儿童语言干预中知识、技能和态度的视觉语言模型基准测试

SpecialEduBench: Benchmarking Vision-Language Models on Knowledge, Skill, and Attitude in Language Intervention for Autistic Children

模型评测基准与评测资源

摘要

语言是自闭症儿童大多数早期干预的目标。由于目标和方法因孩子而异,因此这项工作就落到了一位老师身上,他一次带一个孩子,并在每个场景展开时对其进行判断。人工智能现在正被引入这项工作,但达到特殊教育的基准要求的是模型知道什么,而不是它在孩子面前做了什么。构建一个并不简单,因为响应是否是良好的教学取决于孩子刚刚做了什么,所以没有适用的答案。解决这个问题的证据既是视觉上的,也是口头上的,因为等待的时间、目光的转移以及孩子的理解都没有在笔录中留下任何痕迹。我们引入了 \emph{SpecialEduBench},它根据知识、技能和态度来衡量教学能力,有 4,537 个知识项目、200 个技能项目和 68 个态度项目建立在记录的干预基础上,态度项目将压力与监控交叉到 192 个反应单元中。七位特殊教育专家对这些项目进行撰写、评分和审查,我们根据他们设定的参考分数修改了法官模型的指令。在八种前沿视觉语言模型中,没有一个轴是饱和的,因为最强的轴仍然无法满足大约十分之一的诚实细胞的需求。模型在知识真实的地方聚合,在任务所在的地方分离,在施加压力的地方失败聚集。我们打算将该基准作为部署前运行的审核,并作为为此领域构建的模型的起点。