论文
ROS2SmolVLA:启用小型视觉-语言-动作模型以集成到工业级轻型机器人中
ROS2SmolVLA: Enabling Small Vision-Language-Action Models for Integration into Industrial-Grade Lightweight Robots
摘要
工业需求改变了生产模式。由于批量较小且产品种类较多,公司在采用更具适应性的生产系统方面面临着越来越大的挑战。特别是,基于机器人的自动化通常是静态的,无法响应不断变化的流程。视觉-语言-动作 (VLA) 模型是一个很有前途的机会,可以根据观察到的系统状态生成机器人动作,从而缓解这一挑战。然而,当前的研究要么侧重于无法在本地计算的大型模型,从而带来合规性和安全性挑战,要么使用实验室级机器人硬件,从而掩盖了在实际工业环境中的利用。在这项工作中,我们将 Hugging Face 的 SmolVLA 应用于 Universal Robots 轻型机器人。此外,我们还发布了开源存储库 ROS2SmolVLA,它实现了 ROS 2 到 SmolVLA 的接口,并使其适用于工业级硬件。通过这种方式,我们允许在实验室和工业环境中广泛采用。我们使用拾放任务验证了通用机器人 UR10e 的 SmolVLA 功能,并给出了实施指南。我们的研究结果表明,SmolVLA 非常适合需要本地计算的小型任务。