论文
RoboDrop:通过本地梯度兼容性管理 VLA 后训练 数据
RoboDrop: Curating VLA Post-Training Data via Local Gradient Compatibility
摘要
视觉-语言-动作 (VLA) 模型通过大规模预训练获得了广泛的泛化能力,但要使其适应新任务和机器人实施例,仍然需要对新收集的数据进行 后训练。与预训练不同,后训练 针对特定于任务和实施例的适应,使其对数据质量特别敏感。在实践中,收集的机器人数据集通常包含异构错误,包括执行错误、传感器漂移和时间戳不一致,这可能会损害 后训练 和策略性能。手动检查成本高昂,而现有的数据清理方法通常是针对特定的损坏类型量身定制的。为了应对这些挑战,我们引入了 \textsc{RoboDrop},这是一种数据管理框架,它使用沿训练轨迹测量的局部梯度兼容性作为其对 后训练 性能影响的代理来审计监督。在一轮热身运行期间,RoboDrop 通过将每个候选样本的梯度与任务语义和视觉匹配的验证样本的梯度进行比较,对每个候选样本进行在线评分。生成的样本分数在剧集级别进行聚合,并且简单的自动后处理规则将它们转换为过滤决策。我们根据受控观察来评估 RoboDrop——动作损坏、模拟中自然次优的演示以及包含非专家收集错误的真实机器人数据集。在这些设置中,RoboDrop 比以前的方法更准确地区分不可靠的演示,而 后训练 在策划数据上始终产生更强大的下游策略,平均实际机器人执行成功率从 $35.0\%$ 上升到 $67.5\%$。这些结果确立了训练轨迹感知、上下文条件监督审核作为稳健 VLA 后训练 的有效方法。