论文
开环规划,闭环验证:VLA 的推测验证
Open-Loop Planning, Closed-Loop Verification: Speculative Verification for VLA
摘要
视觉-语言-动作(VLA)模型作为具身控制的大型基础模型,在操作任务中表现出了强大的性能。然而,它们的性能是以较高的推理成本为代价的。为了提高效率,最近的方法采用了动作分块,它可以预测开环执行的未来动作序列。虽然开环执行对于减少计算量有效,但对环境变化敏感,并且由于缺乏闭环反馈而容易出现错误累积。为了解决这个限制,我们提出了 VLA 控制的推测性验证(SV-VLA),这是一个将高效的开环长期规划与轻量级闭环在线验证相结合的框架。具体来说,SV-VLA 使用重型 VLA 作为低频宏观规划器来生成动作块和规划上下文,而轻量级验证器则根据最新的观察结果持续监控执行情况。根据当前观察和规划环境,验证者将计划的操作与闭环参考操作进行比较,并仅在必要时触发重新规划。实验表明,SV-VLA 将分块预测的效率与闭环控制的鲁棒性相结合,能够在动态环境中实现高效可靠的基于 VLA 的控制。代码可用:https://github.com/edsad122/SV-VLA。