论文

超越 API:探索 MLLM 在物理工具使用中的局限性

Beyond APIs: Probing the Limits of MLLMs in Physical Tool Use

模型评测基准与评测资源

摘要

多模态 大语言模型 (MLLM) 擅长利用数字 API,并越来越多地充当实体 AI 的“大脑”,指导机器人与物理世界交互。在这种具体环境中,一个核心能力是使用物理工具,它支撑了 MLLM 协助人类完成现实世界任务的能力。尽管很重要,但 MLLM 在物理工具使用方面的熟练程度在很大程度上仍未得到探索。为了弥补这一差距,我们推出了 PhysTool-Bench,这是第一个物理工具使用基准测试,旨在评估 MLLM 理解现实场景、识别物理工具并规划其使用的能力。 PhysTool-Bench 包含 2,678 个真实物理工具的 2,510 个查询,涵盖制造、电力工作、农业和医疗保健等不同领域。具体而言,模型按照两个主要维度进行评估:1)识别场景中存在的所有物理工具,2)根据指令和视觉上下文规划工具选择和使用顺序。在 13 个领先的 MLLM 中,即使是最强大的模型 (Gemini-3.1-Pro) 也只能识别场景中 58.7% 的工具,并且只能完成 21.0% 的端到端查询。我们的分析揭示了两个层面的缺陷:MLLM 难以感知现实场景中的工具,而规划阶段的大幅下降进一步表明缺乏将感知工具映射到任务语义的功能常识,从而指出了实用嵌入式人工智能发展的关键瓶颈。