论文

DyGRO-VLA:通过动态分组残差优化进行视觉-语言-动作模型的跨任务扩展

DyGRO-VLA: Cross-Task Scaling of Vision-Language-Action Models via Dynamic Grouped Residual Optimization

模型训练强化学习

摘要

强化学习(RL)的最新进展提供了一种优化视觉-语言-动作(VLA)模型的原则性方法,促进任务环境中从轨迹模仿向主动学习的转变。尽管控制精度有所提高,但大多数 RL 优化器仍然是特定于任务的,这将 VLA 模型从通用控制器简化为过度适应一组狭窄任务的策略。在本研究中,我们对这一现象进行了深入分析,并强调了跨任务特征表示对于提高 VLA 模型的泛化性的重要性。受这一发现的启发,我们引入了 DyGRO-VLA,这是一个两阶段优化框架,它 1)基于信息论原理有效捕获跨任务潜在表示,2)通过混合 RL 残差动态细化策略优化。 DyGRO-VLA 使 RL 优化器能够利用与任务相关的潜在信息,同时在整个优化过程中战略性地减轻对学习表示的不利干扰。我们在 LIBERO、RoboTwin2 基准上评估我们的方法,并在现实世界中进一步验证它,证明在多任务训练和分布转移下相对于强大基线的持续改进。