论文
如何(以及如何不)在VLA后训练中使用数据增强
How (and How Not) to Use Data Augmentation in VLA Post-Training
摘要
视觉-语言-动作(VLA)模型目前在各种现实世界的机器人任务中表现出了强大的性能。然而,它们通常仍然缺乏处理大的视觉分布外变化的泛化能力。具有强化学习 (RL) 功能的后训练或VLA已被证明有利于鲁棒性,但仍有很大的改进空间。在这项工作中,我们系统地研究了图像增强对VLA后训练的影响。我们发现,在 RL 更新期间仅增强 Critic 模块,同时在执行轨迹和更新期间保持执行模型的输入干净是至关重要的。对于 $π_{0.5}$ 和 GR00T N1.5,这分别将 LIBERO-Plus 上的发行外成功率提高了 $7.8$ 和 $10.0$ 点,同时增强执行模型则完全崩溃了训练。我们研究了一系列增强类型和优势,并提供了提高VLA后训练泛化能力的实用建议。