论文
通过交错运动规划,无需更多数据即可让您的 VLA 更加稳健
Make Your VLA More Robust Without More Data By Interleaving Motion Planning
摘要
视觉-语言-动作(VLA)模型在移动操作方面取得了显着的进步,但它们在长视野任务上的表现仍然很差。这些任务尤其具有挑战性,因为(1)必须在空间分布的子任务的扩展序列中维持实现高级目标的进展,以及(2)早期执行错误在整个任务范围内迅速复合。尽管对大型人类遥控移动操作数据进行了微调,但这些挑战仍然存在,这表明仅靠更多数据可能无法解决问题。为了应对这些挑战,我们提出了 MPVI:Motion Planner / VLA Interleaving,这是一个将基于模型的运动规划与 VLA 集成在一起的框架,无需进一步训练即可提高鲁棒性。所提出的集成能够使用开放词汇对象检测、前沿探索和运动规划,通过杂乱的场景定位和导航到远处或遮挡的目标对象。然而,这种集成并非易事,需要模块之间可靠的切换;我们展示了一种通过基于 VLM 的本体感受触发器完成检查来前进的方法。我们在 BEHAVIOR-1K 基准上评估了我们的方法,并证明任务进度比顶级端到端 VLA 基准提高了 113%。其他详细信息可在项目页面获取:https://mpvi.netlify.app/。