论文

HumanCLAW:视觉语言模型可以通过身体起作用吗?

HumanCLAW: Can Vision-Language Models Act Through a Body?

模型评测基准与评测资源

摘要

评估视觉语言模型 (VLM) 是否可以通过身体发挥作用是一项挑战。动作的结果将 VLM 的决策与电机控制结合起来。当任务失败时,很难判断 VLM 是否做出了错误的选择,或者电机控制器只是未能执行它,例如失去平衡和跌倒。在这项工作中,我们引入了 HumanCLAW,这是一个将行动决策与底层执行分离的评估框架。在每一步中,现成的 VLM 都会发出原子技能命令,该命令会被转换为亚秒级的连续全身运动块,并产生真实的物理后果,包括重力和碰撞。因此,身体可以在物理世界中自由行动,而执行方面的干扰、平衡和运动错误则被排除在外。仍然可以测量的是模型的行动智能:它对身体下一步应该执行的动作的即时选择。基于这个框架,我们构建了 HumanCLAW-Bench:跨越 41 个室内场景的 1,218 个长视野、以自我为中心的查找-导航-交互片段。我们测试了九个最先进的 VLM,发现没有一个能够解决基准测试;最好的模型仅达到 16.8% 的成功率。识别目标并不是瓶颈。目前的VLM缺乏的是自我意识的体现:他们失去了自己身体的踪迹,不知道自己在哪里,是否达到了目标,或者是否遇到了障碍。