论文
视觉语言模型能在点击式解谜游戏中展现类人的逻辑问题解决能力吗?
Do Vision-Language-Models show human-like logical problem-solving capability in point and click puzzle games?
摘要
视觉语言(动作)模型(VLM)正日益被应用于交互式环境,但现有基准往往忽视点击式解谜游戏所需的复杂物理推理。本文提出Vision-Language Against The Incredible Machine(VLATIM),一个旨在评估经典物理解谜游戏The Incredible Machine 2(TIM)中类人逻辑问题解决能力的基准。与现有基准不同,VLATIM专门针对高层逻辑推理与需要精确鼠标交互的连续动作空间之间的关键空白。该基准分为五个渐进部分,所评估的能力涵盖从基础视觉视觉定位与领域理解到多步操作与完整解谜。我们的结果揭示了推理与执行之间的显著差距。大型专有模型虽然展现出更优的规划能力,却难以实现精确的视觉视觉定位。因此,它们尚未展现类人的问题解决能力。
