论文

ViSTR-Bench:MLLM 能否根据动态场景中的连续视觉提示进行推理?

ViSTR-Bench: Can MLLMs Reason from Continuous Visual Cues in Dynamic Scenes?

模型评测基准与评测资源

摘要

多模态 大语言模型 (MLLM) 在各种专家级任务中取得了显着的成功,但它们仍然在人类通过持续观察现实世界而自然发展的基本能力方面遇到困难,例如空间感知和动态推理。最近的研究已经认识到这一差距,并引入了专用基准来评估 MLLM 的时空能力。然而,现有的基准大多集中在静态场景或需要精确的定量预测,而来自时间线索的直观推理在很大程度上尚未得到充分探索。在本文中,我们介绍了视觉时空推理基准(ViSTR-Bench),这是一种新颖的评估套件,旨在系统地评估 MLLM 是否可以根据动态场景中的连续视觉线索进行定性推理。 ViSTR-Bench以时间强调、推理导向、定性评估的原则为指导,建立了涵盖运动感知、空间关系、结果预测和物理动力学的综合四维评估。该基准测试包括 15 个不同的子任务和 1,340 个高质量视频问答对,涵盖不同的桌面、室内和室外场景。对各种最先进的专有、开源和专业空间 MLLM 的广泛评估表明,尽管它们具有强大的一般视频理解能力,但当前模型在复杂的时空推理方面仍然面临重大瓶颈,并且仍然远远低于人类的表现。