论文
ThermoAct:用于机器人感知和决策的热感知视觉语言动作模型
ThermoAct:Thermal-Aware Vision-Language-Action Models for Robotic Perception and Decision-Making
摘要
在最近的人机协作环境中,人们越来越关注集成视觉信息之外的各种传感器数据,以实现更安全、更智能的任务执行。尽管热数据对于提高机器人安全性和操作效率至关重要,但其集成在先前的研究中相对被忽视。本文提出了一种新颖的视觉-语言-动作(VLA)框架,该框架结合了机器人任务执行的热信息。所提出的系统利用视觉语言模型(VLM)作为高级规划器来解释复杂的自然语言命令并将其分解为更简单的子任务。这种方法有利于高效的数据收集和复杂操作的稳健推理。与仅依赖视觉数据的传统方法不同,我们的方法集成了热信息,使机器人能够感知物理特性并主动确保环境安全。现实世界任务场景的实验结果验证了我们提出的框架的可行性,表明与现有的基于视觉的系统相比,它具有提高任务成功率和安全性的潜力。