论文
探索视觉语言模型中的碰撞识别以实现安全的人机协作
Probing Collision Grounding in Vision-Language Models for Safe Human-Robot Collaboration
摘要
安全的人机协作需要的不仅仅是视觉描述:监视器必须确定机器人身体是否安全分离,是否已经与场景或人发生碰撞,或者即将发生碰撞。我们将这种能力称为碰撞识别:将视觉观察与机器人身体几何形状、摄像机视角、场景布局、人体接近度和时间运动结合起来,以推断当前和即将发生的接触。我们推出了 TouchSafeBench,这是一种基于物理的基准,用于评估视觉语言模型 (VLM) 中的碰撞识别。 TouchSafeBench 内置于 Habitat~3.0,包含 2,940 个跨社交导航和社交重新排列的模拟室内共存场景,具有同步多视图 RGB-D 观察、自上而下的轨迹图、校准的相机元数据和模拟器衍生的联系人标签。我们研究了两个面向部署的任务:对当前安全状态进行分类,并在接触前警告即将发生的碰撞。在三个前沿或面向机器人的 VLM 和九个视觉表示中,当前模型仍然远不可靠:最佳平均 Macro-F1 保持在 50% 以下,显式深度不会自动转化为机器人身体碰撞证据,并且机器人场景接触始终比人类接触风险更难。 TouchSafeBench 揭示了嵌入式 VLM 的一个主要局限性:视觉流畅并不意味着物理责任。可靠的机器人安全监视器将需要明确绑定视点、机器人形态、度量几何和未来碰撞的表示。我们将在接受后发布基准。