论文
PathTime-VLA:视觉-语言-动作策略分解后训练的路径-时间解耦
PathTime-VLA: Path-Time Decoupling for Factorized Post-Training of Vision-Language-Action Policies
摘要
视觉-语言-动作(VLA)策略通常以固定的时间间隔预测动作,将机器人遵循的路线与其执行速度结合起来。这种耦合使远程操作的适应变得复杂:有用的几何指导伴随着由界面延迟和操作员行为决定的时序。我们的主要见解是将经典运动规划的路径时间参数化引入 VLA 的学习动作表示中。我们引入了 PathTime-VLA,它将运动表示为进度索引的交互路径 $X(s)$ 和正的间隔时间曲线。后者定义了单调时间定律 $t(s)$,产生控制器命令 $X(s(t))$。对于给定的路径,替代执行通过时间曲线表示,允许在不改变几何预测目标的情况下进行块式速度选择。这种表示支持分阶段的训练后程序:演示和 DAgger 干预建立目标域先验,Speed-DQN 从机器人交互中学习执行乘数,Path-AWR 使用推出结果来完善扩散路径生成器。一个 路径条件动作专家实现最终的动作,同时保持路径生成和执行时间的独特学习界面。在三个任务中,完整的方法取得了 58/60 美元的成功,而 BC + DAgger 下的 PathTime-VLA 在固定的 1\times$ 下取得了 57/60$ 的成功,平均完成时间比成功试验缩短了约 39$-$52\%$。