论文

世界模型辅助海上无人平台的大模型导航规划

World-Model-Grounded LLM Planning for AUV and ASV Navigation Near Offshore Wind Farms

智能体系统Agent 规划

摘要

大语言模型可以将自然语言任务转化为一系列机器人动作,但它们没有物理感:它们无法判断命令应该运行多长时间,或者是否会让机器人漂移到障碍物中。我们建议使用世界模型来扩展基于 大语言模型 的规划器的功能。我们的方法具有三个组成部分:基于物理的神经世界模型、基于梯度的三相轨迹优化器和具有信任区域保护的模型预测控制器(MPC)式闭环重新规划器。语言模型决定做什么,世界模型决定多长时间,无论这意味着通过 6 DOF 驱动八个推进器还是通过 3 DOF 驱动两个差分推进器。我们评估了在海上风电基础设施附近运行的两类海洋车辆:六自由度自主水下航行器(AUV)和三自由度差动驱动自主水面航行器(ASV)。在每个平台的五个基准任务中,两辆车都以零预测碰撞的方式达到了每个目标,并且都在洋流、波浪和推进器动力学下转移到 GazeboSim,保持无碰撞,并将 GazeboSim 目标距离误差相对于没有世界模型依据的基线减少了 70-82% (ASV) 和大约 93% (AUV),在残余 微调 通道分别将代理模型预测轨迹均方根误差 (RMSE) 减少了60% (AUV) 和 69% (ASV)。对于 ASV,我们进一步展示了视觉语言模型 (VLM) 辅助的语义映射管道,该管道可从卫星图像、海图和预测应用程序编程接口 (API)(而不是机载传感器)中提取障碍物和环境背景,从而达到 96% 的导航精度,作为手动指定障碍物几何形状的直接替代品。