论文

DATAFARM:用于微调视觉-语言-动作模型的分布对齐任务和运动规划

DATAFARM: Distribution-Aligned Task and Motion Planning for Fine-Tuning Vision-Language-Action Models

模型训练合成数据

摘要

收集高质量的机器人数据仍然是训练机器人基础模型的基本挑战。任务和运动规划 (TAMP) 提供了一种可扩展的方式来生成演示,但我们的实验表明,尽管成功解决了目标任务,但原始 TAMP 轨迹在用于微调预训练的视觉语言动作 (VLA) 模型时几乎没有带来什么好处。我们假设这种失败是由于规划器生成的轨迹与用于预训练 VLA 的数据之间的行为分布不匹配造成的。为了解决这种不匹配问题,我们引入了 DATAFARM:用于微调机器人基础模型的分布对齐任务和运动规划,这是一种将预训练分布直接纳入 TAMP 轨迹生成的方法。 DATAFARM 将生成的轨迹与机器人关节配置、运动风格和时间执行配置文件中的预训练数据对齐。我们在 TAMP 可以执行的三个桌面操作任务和超出 TAMP 能力的布料折叠任务上评估 DATAFARM。 DATAFARM 的平均成功率为 56.7%,大大超过原始 TAMP (8.3%),同时接近人类远程操作 (61.7%)。在可变形对象操作(不在微调分布范围内)上,微调模型保留了 85% 的成功率,而预训练模型的成功率为 90%。这些结果表明,将规划器生成的演示与预训练分布对齐可以使 TAMP 成为 VLA 微调的有效数据源。网站和代码:https://prpl-group.com/datafarm/