论文
PuzzleMate:以自我为中心的拼图协助的 MLLM 基准测试
PuzzleMate: Benchmarking MLLMs for Egocentric Puzzle Assistance
摘要
个人人工智能助理有可能从数字界面发展成为能够指导用户完成复杂身体活动的实体伴侣。为了让这些助手成为日常生活中不可或缺的一部分,他们要做的不仅仅是识别物体;还需要做更多的事情。他们必须提供与用户实时进度相一致的精确、分步说明。虽然多模态大型语言模型 (MLLM) 在一般视觉理解方面显示出前景,但它们为细粒度操作任务提供基础、顺序指导的能力在很大程度上尚未得到验证。在本文中,我们选择拼图游戏作为此功能的战略测试平台。与一般的物体识别不同,解谜需要高精度的空间推理、区分微小几何变化的能力,以及严格遵守顺序逻辑。我们通过 PuzzleMate 来研究这种功能,这是一个新颖的框架,专注于通过以自我为中心的观点来解决拼图游戏。我们在用户循环研究中部署 PuzzleMate,以评估最先进的 MLLM 感知当前谜题状态并生成可操作的下一步指令的效果。我们的分析揭示了限制其有效性的七个关键瓶颈。基于这些见解,我们提出了一个基准,可以系统地评估 MLLM 解决难题的推理能力。我们的研究结果表明,GPT-5.2 和 Gemini-2.5-Pro 等当前模型存在巨大的性能差距;虽然这些 MLLM 能力很强,但它们很难驾驭拼图游戏辅助所必需的复杂推理和顺序逻辑。