论文

ForeTime-VLA:来自世界动作模型的因果未来令牌蒸馏,用于传送带操作

ForeTime-VLA: Causal Future-Token Distillation from a World Action Model for Conveyor-Belt Manipulation

摘要

操作移动物体要求策略能够预判接触事件,但视觉-语言-动作(VLA)策略通常仅从当前观测进行微调。世界动作模型(WAM)学习预测性动力学,但在部署时运行视频级教师模型或显式想象未来帧代价高昂。我们提出ForeTime-VLA,一个dense的pi0.5策略,它从冻结的Fast-WAM衍生教师蒸馏出具有未来感知、动作等价的表示,同时在推理时保持因果性。离线阶段,当前与未来的视频潜变量被压缩为一个白化的64维目标;在线阶段,八帧历史编码器预测该目标,同时预测操作阶段与归一化的转移剩余时间。四个未来令牌与一个阶段令牌对VLM前缀进行条件化,而预测的未来与转移视界对动作专家进行条件化。训练保留原始的流匹配动作目标,并增加余弦、关系几何、阶段、转移剩余时间与动作等价等目标。在一个去重后的传送带数据集上,我们在每个划分768个匹配窗口上比较40k步检查点:测试MAE从0.134119降至0.130593(2.63%;配对自助法95%置信区间:0.82-4.48%的提升),测试L2下降3.02%,代价是2.46-2.93%的延迟增加。在定量实机评测中,ForeTime-VLA对静止物体达到81.1%、对慢速移动物体达到58.9%的抓取成功率,分别超过次优参考12.2和22.2个百分点。在三种皮带速度下,它完成44/90次抓取,而pi0.5为23/90,其中快速档为11/30对2/30。离线姿态增益与实机接触位姿失败减少之间的吻合,支持因果未来令牌蒸馏是在不部署世界模型教师的情况下改进动态操作的有效途径。

ForeTime-VLA:来自世界动作模型的因果未来令牌蒸馏,用于传送带操作:论文配图
图1:ForeTime-VLA 概览。左:离线教师用冻结的视频VAE编码当前观测和采样的未来帧,然后将其映射为紧凑的动作等价目标。中:可部署的学生用八个因果观测来预测未来、相位和过渡时域变量。这些预测同时条件化慢速 π0.5 VLM 前缀和快速动作专家后缀,同时保留原始的含噪动作与目标流构造。右:训练组合了动作流、未来对齐、关系几何、过渡、相位以及辅助动作重构损失。测试时不存在未来帧和WAM。