论文
PHR-VLA:视觉-语言-动作模型的规划视野推理
PHR-VLA: Planning Horizon Reasoning for Vision-Language-Action Models
摘要
视觉-语言-动作模型(VLA)通过将语言指令和视觉观察直接映射到动作,在通用机器人操作方面显示出了强大的前景。然而,大多数 VLA 主要以当前观察为条件进行动作预测,缺乏对未来任务动态进行推理的明确机制,这对于细粒度、接触丰富的操作尤为重要。我们提出了 PHR-VLA,这是一个框架,可以通过未来动态的特权潜在表示来实现 VLA 中的规划范围推理。 PHR-VLA 引入了一个轻量级的辅助未来头,在训练过程中,它可以将 VLA 的内部表示与从未来观察中提取的潜在动态保持一致。评估结果表明,腕式摄像头的本地、以接触为中心的补丁级潜在动态监控将 LIBERO 的成功率从 84.1% 提高到 88.4%,将现实世界拆卸任务的成功率从 63.3% 提高到 82.5%。来自第三人称摄像机的补丁级监督也将 Meta-World 的性能从 56.70% 提高到 57.8%。这些结果表明,优先的潜在动态对齐为改进 VLA 策略中的预期推理提供了有效的训练信号。项目网站:\href{https://davoodsz.github.io/PHR-VLA.github.io/}{https://davoodsz.github.io/PHR-VLA.github.io/}