论文

SWAP:逐动作步路由视觉语言动作策略

SWAP: Stepwise Action Policy Routing for Vision-Language-Action Models

智能体系统Agent 架构与控制循环

摘要

使用视觉-语言-动作 (VLA) 模型 骨干模型 的机器人操纵系统通常仅使用一个 VLA 来执行任务。然而,单个 VLA 在不同的任务状态和环境中表现不佳。我们引入了一个在执行过程中动态组合多个VLA 策略的框架:StepWise Action 策略 Routing (SWAP)。 SWAP 将策略路由制定为离线强化学习问题,学习路由批评器,在给定当前观察的每个决策步骤中选择最合适的策略。 SWAP 使机器人能够选择新的策略在线执行,而不是在一个情节期间承诺单个策略。我们在现实世界的 DROID 操作任务和 LIBERO 模拟实验中评估了 SWAP。 SWAP 改进了固定策略的执行和路由基线,使现实世界的 任务成功率 的绝对改进高达 33%,同时将成功的轨迹机器人动作步长减少 28.3%。

SWAP:逐动作步路由视觉语言动作策略:论文原图
图 1:用于机器人操作的策略路由。我们介绍 SWAP,一个用于在线策略路由的离线强化学习框架。给定候选机器人策略,SWAP在线动态选择最佳的策略用于任务执行期间的指令和当前观察。