论文
ExToken:高效视觉-语言-行动强化的结构化探索 微调
ExToken: Structured Exploration for Efficient Vision-Language-Action Reinforcement Fine-tuning
摘要
强化学习 (RL) 已展现出在改进复杂操作任务的视觉-语言-动作 (VLA) 模型方面的巨大潜力。然而,其实际可扩展性仍然受到环境交互的巨大成本的严重限制。在这项工作中,我们首先研究了当前 VLA-RL 框架中的探索停滞瓶颈,并揭示了轨迹多样性对于样本效率来说比收集的 rollout 数量从根本上更重要。受这些见解的启发,我们引入了 RL Exploration Token (ExToken),这是一个简单而通用的框架,它根据结构化探索的离线演示得出的离散行为先验来调节 VLA 策略。通过在轨迹采样收集期间针对不同词元调整策略,ExToken 鼓励代理探索不同的行为模式,从而大幅提高状态动作覆盖率和探索效率。为了将训练期间的探索与部署时的确定性推理联系起来,ExToken 进一步结合了一个状态条件词元选择器,可以自适应地预测未见过的场景的有效行为模式。模拟和现实世界的机器人操作任务的大量实验表明,ExToken 持续加速收敛,提高任务性能,并在高度受限的交互预算下表现出强大的鲁棒性。