论文

PAVE:世界行动政策的预测调整和价值引导演变

PAVE: Predictive Alignment and Value-Guided Evolution for World-Action Policies

模型训练强化学习

摘要

直接视觉-语言-动作策略有效地生成连续的机器人动作,但标准行为克隆留下了两个互补的差距:没有明确要求它们的表示来描述场景在多个时间尺度上如何演变,并且质量不等的部署轨迹经常被重用,而没有将有用的动态与不良行为分开。我们引入了“方法”,这是一种直接的世界行动政策,它将结果不可知的预测学习与结果感知的政策改进结合起来。该方法首先保留局部固定偏移 JEPA 目标,并在剩余剧集的 25%、50%、75% 和 100% 处添加轨迹相关的多视野过渡对齐。这些仅训练的目标需要当前的策略表示来保留本地物理变化和长期任务进度,而不向行动负责人提供明确的未来词元。 \method 然后在累积部署轨迹上训练独立的分布价值批评家,计算动作块对齐的 $N$ 步优势,并将它们转换为流匹配参与者的正、负或空文本条件。因此,每个有效的轨迹都可以教导物理上发生的事情,而策略模型仅在与相对更好的动作相关的条件下部署。多视野预测器和批评器从在线执行中删除,保留了根据当前观察、语言指令和本体感觉生成的直接动作。 \redclaim{在三个模拟基准测试中,\method 实现了最强的整体性能,同时保留了直接参与者的在线执行路径。}