论文
前沿视觉语言模型心理理论中的跨任务分离
Cross-Task Dissociation in Frontier Vision-Language Model Theory of Mind
摘要
前沿视觉语言模型是否呈现出跨任务的连贯的心智理论(ToM)概况,与相同的人类参考组相匹配,或者该概况是否从一个范例到下一个范例?我们根据两个心理学衍生基准评估了由九个前沿 VLM 组成的共享小组:Keysar 导演任务(自我中心干扰下的视觉视角采择)和用 Castelli 评分标准评分的 Frith-Happé 动画三角形(纯运动的意图归因)。在导演任务中,在没有思考链的情况下,小组在 78% 的试验中像儿童而不是成人一样犯了以自我为中心的错误;不同模型之间的差异很大,推理可以挽救多个模型。在三角形上,小组低估了意图:其 ToM 概况与高功能自闭症成人 (HF-ASD) 平均值的距离是典型发育成人 (TD) 平均值的三倍多,而目标导向和随机则保持在 TD 附近。没有模型在这两项任务上最接近 TD;在导演任务上看起来像成人的模型落在三角形的 HF-ASD 一侧,而三角形上最像 TD 的模型在导演任务上看起来像儿童。我们报告组级描述,而不是任何模型的诊断标签。