论文

MirrorBench:通过引入镜子评估MLLM中以自我为中心的智能

MirrorBench: Evaluating Self-centric Intelligence in MLLMs by Introducing a Mirror

智能体系统Agent任务评测

摘要

多模态大语言模型(MLLM)的最新进展在感知与推理上展现出显著突破,显示出其在具身智能方面的潜力。尽管近期研究已在交互式环境中评估具身MLLM,但现有基准主要针对感知、理解外部物体并与之交互的能力,缺乏对以自我为中心的智能的系统性评估。为此,我们提出MirrorBench,一个受心理学经典镜像自我识别(Mirror Self-Recognition, MSR)测试启发的基于仿真的基准。MirrorBench通过一个难度递进的分层任务框架将该范式扩展到具身MLLM,从基础视觉感知到高级自我表征对智能体进行评估。在领先MLLM上的实验表明,即使在最低层级,其表现仍明显劣于人类,揭示了自我指涉理解上的根本局限。我们的研究连接了心理学范式与具身智能,为评估大模型通用智能的涌现提供了一个有原则的框架。项目页面:https://fflahm.github.io/mirror-bench-page/。

MirrorBench:通过引入镜子评估MLLM中以自我为中心的智能:论文配图
图 1:现有的体现基准注重外部目标,很大程度上忽视了以自我为中心的智能。 MirrorBench 通过引入基于镜子的设置和分层评估协议来评估 MLLM 从基本视觉感知到高级自我表征的情况,从而弥补了这一差距。