论文
Florence-2 的 ROS 2 包装器:机器人系统的多模式本地视觉语言推理
A ROS 2 Wrapper for Florence-2: Multi-Mode Local Vision-Language Inference for Robotic Systems
摘要
基础视觉语言模型与机器人技术越来越相关,因为它们可以提供比狭窄的特定任务管道更丰富的语义感知。然而,它们在机器人软件堆栈中的实际采用仍然取决于可重复的中间件集成,而不仅仅是模型质量。 Florence-2 在这方面特别有吸引力,因为它将字幕、光学字符识别、开放词汇检测、基础和相关视觉语言任务统一在一个相对易于管理的模型大小内。本文介绍了 Florence-2 的 ROS 2 包装器,它通过三种互补的交互模式公开模型:连续主题驱动处理、同步服务调用和异步操作。该包装器专为本地执行而设计,支持本机安装和 Docker 容器部署。它还将通用 JSON 输出与标准 ROS 2 消息绑定相结合,以实现面向检测的任务。报告中还报告了功能验证以及对多个 GPU 的吞吐量研究,表明消费级硬件的本地部署是可行的。该存储库可在此处公开:https://github.com/JEDominguezVidal/florence2_ros2_wrapper