论文
PAPO-VLA:视觉-语言-行动模型的规划感知政策优化
PAPO-VLA: Planning-Aware Policy Optimization for Vision-Language-Action Models
摘要
视觉-语言-动作(VLA)模型在语言引导的机器人任务中显示出有前景的能力。然而,使VLA策略可靠仍然具有挑战性,因为操纵任务是通过闭环交互完成的,其中每个动作都会影响后续的执行。为了分析这个问题,我们重新审视执行过程中的 VLA 策略,并认为 VLA 策略既充当规划者,做出以任务为导向的决策,改变执行方向,又充当执行者,通过密集的连续行动实现这些决策。这种观点表明,提高 VLA 可靠性需要特别注意规划行动。现有的优化方法可以模仿行动或改进完整的轨迹,但它们通常不会明确识别规划行动或衡量其对任务成功的重要性。为了解决这个问题,我们提出了 VLA 模型的规划感知策略优化(PAPO-VLA)。 PAPO-VLA首先通过共同考虑行动变化和轨迹结果来确定规划行动,然后通过因果充分性和因果必要性来估计其重要性,最后将这种重要性纳入GRPO优势估计中。这样,更重要的规划动作会受到更强的优化重视,而整个轨迹仍然通过轨迹级反馈进行优化。多个基准的实验证明了 PAPO-VLA 的有效性。