论文
EmbodiedSkills:用于编排、训练和部署 VLA 代理的统一框架
EmbodiedSkills: A Unified Framework for Orchestrating, Training, and Deploying VLA Agents
摘要
视觉-语言-动作(VLA)模型将视觉观察和语言指令直接映射到机器人动作,但长期任务需要的不仅仅是动作预测。随着物理状态的发展,智能体必须协调感知、计划、执行、进度验证和恢复。动作预测或模型生成的技能决策本身并不能保证所提议的操作在当前状态下有效或其结果将得到验证。我们提出了 EmbodiedSkills,一个统一的框架,它将每个技能决策视为一个执行建议:运行时在执行前检查其先决条件,并在执行后验证结果。共享的可执行技能接口将高级技能选择、有界底层VLA 执行和单个代理循环内的操作后验证连接起来。由于此接口保持固定,因此可以替换或调整底层VLA 策略,而无需更改代理循环。该界面还将计划、执行、验证和恢复事件记录为结构化轨迹,为各个组件提供监督,并在有交互式反馈时支持可选的在线适应。我们在 RoboTwin 2.0 和 LIBERO 上使用 Qwen3-VL 和 OpenPI/pi0.5 实例化 EmbodiedSkills。任务适应的底层VLA 策略在 50 个 RoboTwin 2.0 任务中实现了 86.20% 的平均成功率,在四个 LIBERO 套件中实现了 97.40% 的平均成功率。这些结果确定了 EmbodiedSkills 中使用的任务适应底层VLA 策略的执行性能。在四个依赖于内存的 RMBench 任务中,相同的任务适应执行方法取得了 12.5% 的平均成功率。该框架提供了一个可训练和可检查的代理层,用于将这些策略转变为闭环体现系统。