论文

FrameSkip:在 VLA 训练中从更少但信息更丰富的帧中学习

FrameSkip: Learning from Fewer but More Informative Frames in VLA Training

模型训练合成数据

摘要

视觉-语言-动作(VLA)策略通常是从密集的机器人演示轨迹中进行训练的,这些轨迹通常是通过远程操作收集的,通过对每个记录的帧进行采样,就好像它提供了同样有用的监督一样。我们认为,这种惯例造成了时间监督的不平衡:长的低变化片段在训练流中占主导地位,而诸如对齐、接触、抓取和释放等操作关键的转换却很少出现。我们引入了 FrameSkip,一个数据层帧选择框架,它使用动作变化、视觉动作连贯性、任务进展先验和抓手转换保留对轨迹帧进行评分,然后在目标保留率下将训练样本重新映射到高重要性帧。由于 FrameSkip 仅在数据加载器中运行,因此它使 VLA 架构、动作头、训练目标和推理过程保持不变。在 RoboCasa-GR1、SimplerEnv 和 LIBERO 中,FrameSkip 改进了全帧训练和更简单的帧选择变体的成功保留权衡,在三个基准测试中实现了 76.15% 的宏观平均成功率,而全帧训练的宏观平均成功率为 66.50%,同时使用压缩轨迹视图,在主要设置中保留 20% 的独特帧。