论文

RouteRLT:学习何时以及由哪个 RL 专家应该控制视觉-语言-动作策略

RouteRLT: Learning When and Which RL Specialist Should Control a Vision-Language-Action Policy

智能体系统Agent 架构与控制循环

摘要

视觉-语言-动作 (VLA) 模型提供了广泛的操作能力,但在精度关键阶段往往会遇到困难,这些阶段主导着连接器插入和电缆管理等接触丰富的工业任务。常见的补救措施是通过强化学习 (RL) 改进预训练的 VLA,从而实现行为克隆之外的特定任务的改进。然而,如何在决定何时需要强化学习以及应采取哪些专门政策的同时保持其通用行为仍然是一个悬而未决的问题。在这项工作中,我们提出了 RouteRLT,这是一个路由框架,它可以学习何时以及由哪个 RL 专家(针对单个精度关键阶段进行训练的 RL 策略)应该从通才 VLA 手中接管控制权。阶段选择器识别活动控制器,稳定器抑制瞬态切换,动作边界管理器处理分块策略输出之间的转换。我们在 LIBERO 中的多对象拾取和放置任务以及具有多个精度关键阶段的实际电缆拾取和端口插入任务上评估 RouteRLT。在模拟中,学习到的路由比基本 VLA 有所改进,并将路由与特权阶段边界相匹配,而无需在部署时访问这些边界。真实的机器人评估验证了在符合操作员的切换协议下自动路由到拾取和插入专家的情况。总而言之,这些结果表明,学习路由应用了 RL 专家控制,其中精确适应最有价值,同时保留通用 VLA 行为,包括从失败的执行尝试中恢复。