论文
“亲爱的 LLaVA,请开车”:用于闭环机器人控制的深度感知视觉语言代理
"Dear LLaVA, Please Drive": A Depth-Aware Vision-Language Agent for Closed-Loop Robotic Control
摘要
视觉语言模型 (VLM) 为推理驱动的移动导航提供了令人信服的基础,提供了丰富的上下文理解和大规模预训练的强大泛化能力。大多数现有的导航框架依赖于模仿学习,因此需要大量标记的轨迹数据,限制了它们的可扩展性和鲁棒性。在这项工作中,我们提出了一种参数有效的方法,使用命令式学习范例来微调预训练的 VLM 以实现自主导航。通过针对可微的几何成本场而不是标记轨迹进行优化,我们的模型学会了仅根据立体深度观察生成无碰撞路径。我们为自然语言驱动的机器人控制引入了统一的端到端导航管道。该系统利用共享 VLM 主干和特定于任务的低秩适应 (LoRA) 模块,有效地弥合了从语义目标选择到低级轨迹规划的差距。我们的方法在未见过的环境中实现了按路径长度 (SPL) 加权的竞争性成功,同时更新了模型总参数的不到 1%。定性的真实世界实验验证了模拟到真实的泛化和稳定的路径规划,而无需对真实世界的数据进行微调。这些结果突出了在移动机器人上部署基于 VLM 的代理的实用方法,从而实现高级语义导航,而不需要大规模的标记轨迹数据。