论文

通过异步分布对齐的反应式实时流策略

Reactive Real-Time Flow Policies via Asynchronous Distribution Alignment

摘要

视觉语言动作模型(VLA)等通用机器人策略已经实现了显着的泛化,但它们的推理延迟可能与实时控制的需求相冲突。异步执行通过在机器人执行前一个动作时预测下一个动作序列来避免动作块之间的暂停。在本文中,我们研究异步执行是否产生与原始 VLA 相同的动作分布。我们发现,对于非马尔可夫演示,异步执行可以产生根本不同的动作分布,这可以限制策略的反应性。在我们的方法中,我们试图通过两种互补机制将异步产生的动作分布与原始 VLA 的动作分布对齐来恢复这种反应性。首先,递归流场蒸馏使用 VLA 的动作生成流来训练异步策略。我们从理论上描述了学习到的分布,并通过实验证明,我们的异步策略几乎可以生成原始 VLA 会产生的所有操作,而现有的异步方法只能恢复该范围的一小部分。其次,Propose-Resolve 异步准备多个动作序列,并根据 VLA 动作分布下的可能性的轻量级近似,使用最新的观察结果在其中进行选择。我们得到的方法与原始 VLA 在 LIBERO 上的成功相匹配,并保留了其在 RoboMimic 上约 80% 的成功,比现有的异步方法高出约 30 个百分点。