论文
ROSClaw:异构多智能体协作的分层语义物理框架
ROSClaw: A Hierarchical Semantic-Physical Framework for Heterogeneous Multi-Agent Collaboration
摘要
大语言模型(LLM)与体现智能体的集成提高了高级推理能力;然而,语义理解和物理执行之间仍然存在关键差距。虽然视觉语言动作(VLA)和视觉语言导航(VLN)系统使机器人能够根据自然语言指令执行操纵和导航任务,但它们仍然难以处理长范围的顺序和时间结构任务。现有框架通常采用模块化管道进行数据收集、技能训练和策略部署,导致实验验证和策略优化成本高昂。为了解决这些限制,我们提出了 ROSClaw,一种异构机器人的代理框架,它将策略学习和任务执行集成在统一的视觉语言模型(VLM)控制器中。该框架利用异构机器人的 e-URDF 表示作为物理约束来构建模拟到真实的拓扑映射,从而能够实时访问模拟和现实世界代理的物理状态。我们进一步结合了数据收集和状态累积机制,用于存储机器人状态、多模态观察和现实世界执行期间的执行轨迹,从而实现后续的迭代策略优化。在部署过程中,统一的代理保持推理和执行之间的语义连续性,并将特定于任务的控制动态分配给不同的代理,从而提高多策略执行的鲁棒性。通过建立自主闭环框架,ROSClaw 最大限度地减少了对机器人特定开发工作流程的依赖。该框架支持硬件级验证、自动生成SDK级控制程序以及基于工具的执行,从而实现快速跨平台转移和机器人技能的持续改进。我们的项目页面:https://www.rosclaw.io/。