论文

SIEVE:使用 VLA 模型进行模仿学习的结构感知数据选择

SIEVE: Structure-Aware Data Selection for Imitation Learning with VLA Models

模型训练合成数据

摘要

视觉-语言-动作(VLA)模型通常通过大规模机器人演示数据集上的模仿学习进行训练,但由于冗余、噪声和覆盖不均匀,更多数据并不一定会产生更好的策略。现有的数据选择方法通常在轨迹或状态动作级别评估演示,缺少构成长期行为的可重用结构。在本文中,我们提出了 SIEVE,一种用于 VLA 模仿学习的结构感知数据选择方法。 SIEVE 将演示视为可重用原语和转换接口的组合。它首先从分段轨迹中发现视觉运动原语,然后通过在收益递减的情况下最大化重用意识结构暴露,将选择预算分配给组合模式。最后,它在每个组合模式桶中选择中心轨迹,以保留中心、稳定且易于模仿的演示。跨多个数据集、基准测试和 VLA 模型的实验表明,SIEVE 始终优于竞争性数据选择基线。值得注意的是,SIEVE 可以超越全数据训练,同时仅使用 50% 的演示和 50% 的训练步骤,这表明通过基元和转换捕获的可重用结构是高效 VLA 模仿学习的重要信号。