论文
Agentic-VLA:视觉-语言-动作模型的高效在线适应
Agentic-VLA: Efficient Online Adaptation for Vision-Language-Action Models
摘要
通过利用预先训练的视觉语言表示,视觉语言动作(VLA)模型已成为机器人操作的一种有前景的范例。然而,当前的 VLA 训练方法存在两个关键限制:对新环境的泛化能力差以及需要大量演示的训练效率低。我们引入了Agentic-VLA,一个代理训练框架,通过三个关键创新使VLA能够高效地在线适应:(1)自适应奖励合成,根据VLA当前的能力和任务复杂性动态生成和调整奖励函数,将复杂的任务分解为可学习的子目标以进行课程学习; (2)语言引导探索,批评模型为系统探索而不是随机抽样提供结构化指导; (3)经验记忆,存储和检索与任务相关的策略权重,用于热启动适应类似的任务。我们在 LIBERO 基准上评估 Agentic-VLA,取得了显着的改进:长期任务 +12.3%,1-shot 学习 +28.5%,并且无需特定任务演示即可实现跨任务迁移从 0% 到 31.2%。与现有的在线适应方法相比,我们的框架还展示了 2.4 倍的收敛速度。除了 LIBERO 之外,Agentic-VLA 在双臂 RoboTwin 2.0 基准测试中保留了其优势,包括在其随机 Hard 设置下。这些结果表明 Agentic-VLA 是朝着能够在部署中持续学习的真正自适应 VLA 系统迈出的重要一步。