论文
OneVLA:具体任务的统一框架
OneVLA: A Unified Framework for Embodied Tasks
摘要
导航和操纵是体现智能的基本能力,使机器人能够解释自然语言命令并与周围环境进行物理交互。然而,当前的视觉-语言-动作(VLA)模型仍然受到特定于任务的架构的限制,专门从事导航或操作,这阻碍了通用机器人代理的开发。为了弥补这一差距,我们引入了 OneVLA,这是一种统一的架构,它将这些不同的任务集成到一个单一的、有凝聚力的框架中。具体来说,我们设计了一个统一的动作头,能够生成导航和操纵动作,而不需要特定于任务的变体。此外,我们提出了一种多阶段渐进训练策略 - 结合策划的数据构建和思想链(CoT)微调,促进两个领域之间的强正迁移和相互强化。在模拟和现实环境中进行的大量实验表明,OneVLA 实现了最先进的性能,显着优于专用的单任务模型和现有的跨任务模型。通过统一这些核心功能,OneVLA 为真正的通用机器人系统铺平了道路。模型和源代码将公开发布。