论文

通过 MCP 进行大语言模型驱动的机器人导航的空间和语义推理

Spatial and Semantic Reasoning for LLM-Driven Robot Navigation via MCP

智能体系统Agent 工具调用

摘要

大型语言模型 (LLM) 越来越多地用作机器人系统的自然语言接口,但它们与基于机器人操作系统 (ROS) 的导航的集成仍然受到两个差距的限制。首先,诸如占用网格之类的导航数据被表示为原始几何消息,大语言模型很难直接将其用作空间或语义上下文。其次,添加 LLM 驱动的功能通常需要自定义包装器或机器人特定的接口,从而限制了跨系统的重用。为了应对这些挑战,我们提出了一种非侵入式框架,通过面向导航的表示层将 LLM 推理与基于 ROS 的导航连接起来,通过模型上下文协议 (MCP) 作为标准化、可重用的工具公开,以便任何兼容 MCP 的 LLM 都可以访问它们,而无需机器人特定的包装器。视觉地图模块将占用网格转换为度量、姿势感知图像以进行目标推理,而语义注释模块则记录带有机器人姿势的航点级观察结果。我们在三个任务上评估该框架:自主绘图、基于空间推理的导航和基于语义推理的导航。结果表明,评估的 LLM 后端使用这些表示来实现超过 97% 的地图覆盖率,并在模拟室内环境中从自然语言指令中选择空间或语义导航目标。这演示了以表示为中介的 LLM 导航,而无需修改现有的 ROS 导航堆栈。