论文

TemporalFlow-VLA:学习长视野机器人操作的物理基础执行历史

TemporalFlow-VLA: Learning Physically Grounded Execution History for Long-Horizon Robot Manipulation

模型训练监督微调与指令调优

摘要

视觉语言动作(VLA)模型利用预先训练的视觉语言表示进行机器人控制,但简单地添加历史帧并不能可靠地捕获最近的物理变化。这在多阶段操作中尤其成问题,其中视觉上相似的状态可能需要不同的操作,具体取决于先前的执行。为了应对这一挑战,我们提出了 TemporalFlow-VLA,它通过基于物理的时间监督来学习紧凑的执行历史。使用记录的机器人状态、机器人几何结构和校准相机,我们将机器人表面时间流构建为仅训练目标,并监督两个与执行对齐的时间查询,为动作专家提供结构化历史记录。部署时不会评估几何监督路径。 TemporalFlow-VLA 在 LIBERO 上实现了 97.63 +/- 0.26% 的平均成功率,其中在 LIBERO Long 上实现了 96.60 +/- 0.87%,在 12 个 RoboTwin 任务中实现了 85.5%/84.2% 的干净/随机成功。与现有方法相比,它在长期、多阶段操作方面显示出最明显的优势。受控历史干预表明,行动预测取决于历史内容和时间顺序。通过异步特征缓存,时间调节可维持单帧级服务器端采样延迟,而无需额外的历史编码开销。总体而言,TemporalFlow-VLA 提供了一个紧凑的、以物理运动为依据的接口,用于利用有序的执行历史记录,而无需在部署时进行显式运动估计或几何处理。