论文
DuoMind:通过语义通信实现分布式多机器人协调
DuoMind: Enabling Distributed Multi-Robot Coordination with Semantic Communication
摘要
视觉语言模型(VLM)和视觉语言动作模型(VLA)最近推动了通用机器人的快速进步,但大多数进展都集中在单机器人设置上。将这些功能扩展到多机器人系统仍然具有挑战性,因为机器人必须协调长期行为,同时保持可靠、细粒度的执行。我们介绍 DuoMind,这是一种通过语义通信进行多机器人协调的分布式分层框架。每个机器人都使用基于 VLA 的动作模型进行低级执行,并使用基于 VLM 的编排器进行高级推理和Agent间协调。在每个规划步骤中,每个机器人的协调器都会对任务指令、本地观察结果以及从其他机器人收到的消息进行推理。然后,它生成动作模型的低级指令和对等机器人的语义消息。该架构通过将 VLM 的语义推理功能与 VLA 的精确动作生成功能相结合,利用了预训练模型的互补优势。为了解决多机器人协调基准的缺乏问题,我们进一步开发了 RoboPoly,这是一个基准,包含需要在分布式控制下协调、闭环执行的长程操作任务。 RoboPoly 和 RoboTwin 上的实验表明,DuoMind 提高了多机器人任务性能,而消融研究则证实了分层编排和语义通信的贡献。更多详细信息请访问我们的项目页面。