论文
LEVANTE-bench:使用认知任务对 VLM 与儿童进行多尺度比较(或者“你的 VLM 比五年级学生聪明吗?”)
LEVANTE-bench: Multi-Scale Comparison of VLMs to Children Using Cognitive Tasks (or, "Is Your VLM Smarter Than a 5th Grader?")
摘要
鉴于人类经验固有的多模态性质,视觉语言模型(VLM)在人类认知随着经验的增长和发展而建模方面具有巨大的前景。实现其潜力需要工具来将 VLM 与跨任务、年龄和人群的人类认知发展进行比较。我们推出了 LEVANTE-bench,这是一个基于学习变异性网络 (LEVANTE) 的任务和数据的基准,该网络分发开源任务和数据来衡量儿童跨语言和文化的认知能力。在 LEVANTE-bench 中,我们系统地评估了六项任务的 VLM,将它们与三个国家 5-12 岁儿童 ($N$ = 1547) 的一致性进行了比较。我们在多个尺度上比较模型,评估它们的整体准确性、它们与儿童的任务和项目级别的一致性,以及它们与儿童的试验级误差分布的匹配程度。不同尺度上的一致性是异质的:在任务和项目层面,能力更强的模型与人类的一致性更好。然而,不同任务之间的人为错误分布匹配差异很大,并且对于某些任务,较小的模型可以更好地匹配年幼儿童的错误。此外,即使是表现最好的 VLM 在矩阵推理和心理旋转任务上也遇到了困难。因此,当前的 VLM 架构仅部分符合儿童的认知能力。