论文

The Unwritten Benchmark:抽象感知推理对多模态机器学习提出的新挑战

The Unwritten Benchmark: A New Challenge for Multimodal Machine Learning in Abstract Perceptual Reasoning

模型评测基准与评测资源

摘要

当前多模态模型在识别静态视觉和听觉内容方面表现出卓越能力。然而,它们进行抽象感知推理——即从动态生成过程中推断未见信息——的能力仍是一个关键且未被充分探索的前沿。在本文中,我们提出The Unwritten Benchmark,一个旨在探测这种抽象感知与认知能力的新挑战。我们将核心任务定义为声学-运动学词汇推断:模型必须仅凭笔尖划擦的音频和手部运动的视频,辨识出以3种不同书写风格正在书写的词汇,而看不到任何墨迹。评估结果揭示了人类与机器性能之间的深刻差距:人类参与者达到很高的有序字母准确率(超过80%),而领先的多模态机器学习模型,包括GPT-4o和Gemini 2.5-Pro,则明显挣扎,未能超过10%。此外,我们在模型中发现一种悖论性的融合效应:同时提供两种模态往往会降低而非提升性能。这一发现表明模型在为该认知任务综合互补感知线索方面存在根本性失灵。这些发现凸显了模型在跨模态因果推理以及对这类认知性、直觉性感知推理至关重要的微运动理解方面的显著局限。

The Unwritten Benchmark:抽象感知推理对多模态机器学习提出的新挑战:论文配图
图1:The Unwritten Benchmark 概览。词语通过组合单个字母的视听录像合成。每个样本以三种模态呈现:静音视频(Muted Video)、纯音频(Audio Only)和音频+视频(Audio+Video,融合音频)。视频与音频+视频的提示完全相同,仅输入不同。人类能可靠地识别出所写的词,而 MLLM 常常失败。