论文

通过流程反转转向改进机器人通才策略

Improving Robotic Generalist Policies via Flow Reversal Steering

模型推理解码与生成控制

摘要

通才策略可以从不同的机器人数据集中学习广泛的技能。为了解决或改进具有挑战性的新任务,我们需要一种方法来从策略丰富的行为先验中推断和调用适当的操作,特别是当直接命令策略失败时。我们专注于流匹配通才,并提出流反向转向(FRS):一种采取次优但“合理”的动作的方法,通过反向传递流策略来发现它们的潜在噪声,并将它们映射到附近的通才动作模式。我们在许多模拟和现实世界的操作设置中评估 FRS。首先,FRS 可以将人类或视觉语言模型 (VLM) 的粗略语义指导转化为相应的良好机器人动作,从而改进零样本控制。这些收益可以通过行为克隆来提炼,通过训练辅助策略来输出噪音,通才将其映射到良好的行动——在不到一分钟的训练中显示出高达 95% 的绝对任务成功率提升。最后,FRS 通过利用语义知识引导强化学习来实现策略改进,从而改进标准 RL 无法改进的多项任务。