论文
The Unwritten Benchmark:抽象感知推理对多模态机器学习提出的新挑战
The Unwritten Benchmark: A New Challenge for Multimodal Machine Learning in Abstract Perceptual Reasoning
摘要
当前多模态模型在识别静态视觉和听觉内容方面表现出卓越能力。然而,它们进行抽象感知推理——即从动态生成过程中推断未见信息——的能力仍是一个关键且未被充分探索的前沿。在本文中,我们提出The Unwritten Benchmark,一个旨在探测这种抽象感知与认知能力的新挑战。我们将核心任务定义为声学-运动学词汇推断:模型必须仅凭笔尖划擦的音频和手部运动的视频,辨识出以3种不同书写风格正在书写的词汇,而看不到任何墨迹。评估结果揭示了人类与机器性能之间的深刻差距:人类参与者达到很高的有序字母准确率(超过80%),而领先的多模态机器学习模型,包括GPT-4o和Gemini 2.5-Pro,则明显挣扎,未能超过10%。此外,我们在模型中发现一种悖论性的融合效应:同时提供两种模态往往会降低而非提升性能。这一发现表明模型在为该认知任务综合互补感知线索方面存在根本性失灵。这些发现凸显了模型在跨模态因果推理以及对这类认知性、直觉性感知推理至关重要的微运动理解方面的显著局限。
