论文
具有分布式生成人工智能模型的人机协作操作对话框架
A Conversational Framework for Human-Robot Collaborative Manipulation with Distributed Generative AI models
摘要
本文提出了一种用于人机协作操作的分布式对话框架,该框架将本地语言和视觉语言模型 (VLM) 与基于机器人操作系统 2 (ROS 2) 的执行堆栈集成在一起。语言理解、视觉基础、编排和运动执行作为单独的 ROS 2 节点运行,从而实现跨分布式硬件的灵活部署,同时保持响应控制循环。系统根据自由格式的用户命令生成拾取、放置和移交的结构化操作请求。它使用 VLM 返回图像空间目标,然后使用深度和校准将其转换为公制机器人框架目标。网络仪表板公开中间意图和基础覆盖层(像素、深度和机器人框架),并且在执行任何动作之前需要操作员明确确认。 Franka FR3 平台上的实验评估了工作台场景模糊性增加下的端到端任务可靠性和延迟,并比较了同一管道中的替代 LLM/VLM 配置。代码和完整文档可在 [github.com/cogrob-tuni/franka-LLM](https://github.com/cogrob-tuni/franka-LLM) 获取。