论文
DriftOPD:用于一步 VLA 策略的序列级反向 KL 蒸馏
DriftOPD: Sequence-Level Reverse-KL Distillation for One-Step VLA Policies
摘要
视觉-语言-动作(VLA)模型越来越依赖于在后退视野控制下生成短动作块的动作专家。虽然块级训练在机器人实施例中很方便,但它优化了局部动作的可能性,而没有明确考虑长期任务的成功。序列级强化学习可以解决这一限制,但通常需要策略rollout和闭环交互,这对于真实的机器人操作来说成本高昂。我们引入了 DriftOPD,这是一个无需教师、无需部署的框架,用于连续 VLA 动作专家的序列级在策略蒸馏。我们证明,序列级反向 Kullback-Leibler (KL) 散度分解为块级反向 KL 项和捕获当前操作的长期效应的未来潜力项。 DriftOPD 分别使用一步漂移目标和从离线演示中学习到的 Q 函数批评家来优化这两项,从而仅通过离线数据和一步操作生成即可实现序列级优化。在模拟和现实世界操作中的多个 VLA 架构中,DriftOPD 通常优于现有的一步蒸馏基线,同时实现与多步教师策略相当的任务成功性能。这些结果表明,长期行为可以有效地提炼为一步 VLA 行动专家,无需在线互动或单独的老师。