论文
视觉语言动作策略的拓扑通知视觉提示
Topology-Informed Visual Prompting For Vision Language Action Policies
摘要
由于部分可观察性,视觉-语言-动作(VLA)策略可能难以处理具有复杂障碍物几何形状的操纵任务。这些复杂的几何形状可能导致类似的视觉观察或机器人配置,需要性质不同的动作,这种区别可以使用拓扑特征来量化。虽然充分了解环境几何形状和对象状态的运动规划者可以在规划中推断出这些签名,但在部署时通常不知道这些信息。为了解决这个问题,我们提出了一个拓扑引导的视觉提示框架,该框架使用基于模拟的规划来增强名义演示数据集,并在部署时提供基于视觉的指导。我们的方法使用高斯链接积分拓扑签名表示来捕获环境的重要拓扑属性。使用来自环境模拟近似的特权几何信息,我们使用轨迹来增强 VLA 微调数据集,这些轨迹将系统移动到演示的签名,并从新配置恢复任务执行。视觉语言模型 (VLM) 在同一数据集上进行微调,以预测实时摄像机观察的签名并预测末端执行器路径点,这些路径点呈现为观察结果的视觉提示以指导 VLA。在三个模拟双手任务和一个现实世界的盒子拾取任务中,我们的方法优于仅在名义演示上微调的 VLA 和可以从观察中删除拓扑相关信息的 VLM 提示基线。在硬件上,它的任务成功率超出了最强基线 40%。项目网站:这个 https URL。