论文
WayFinder:用于零样本路点生成和低级运动学控制的分层视觉语言动作
WayFinder: Hierarchical Visual-Language-Action for Zero-Shot Waypoint Generation and Low-Level Kinematic Control
摘要
视觉语言动作(VLA)模型为自主机器人提供了前所未有的泛化能力;然而,它们在现实世界的部署经常受到不可靠的执行以及针对特定机器人实施例和任务进行微调的过高的计算成本的瓶颈。为了弥补这一差距,我们提出了 WayFinder,这是一种端到端、闭环分层 VLA 框架,通过将高级任务推理与低级运动学控制解耦来避免微调的需要。 WayFinder 利用零样本、场外多模态大语言模型 (MLLM) 策略来处理语言上下文和状态地图,以生成战略航路点。异步地,轻量级板载策略基于连续传感器反馈以高频率执行实时运动控制。我们在 Microsoft AirSim 中评估 WayFinder,在四种不同复杂度的环境和三种 MLLM 尺度上进行测试,以平衡预测功效与计算效率。我们的结果表明,与基线低级策略相比,WayFinder 实现了卓越的导航可靠性。通过仅在导航失败时查询高级 MLLM,WayFinder 消除了微调的需要,最大限度地减少了昂贵的推理,并将导航成功率显着提高了 27.45%。