$π\mathbf{R}^2$:反应式实时流策略
$π\mathbf{R}^2$: Reactive Real-time Flow Policies
摘要
通用操纵策略越来越多地采用建立在大型预训练骨干上的动作分块流策略的形式。这些块是开环运行的,因此策略无法对执行中到达的感觉输入做出反应,从而牺牲了\emph{反应性}。更频繁地重新规划可以恢复它,但是感知到行动的管道(一个大的主干加上多个去噪步骤)太慢:这种\emph{延迟}禁止频繁的重新规划,并使承诺的行动变得陈旧,使得此类政策不适合动态的闭环控制。我们提出了 $π\mathbf{R}^2$,这使得这些策略具有反应性和实时性,同时保留了大型骨干网络、富有表现力的多模式策略和多动作预测。 $π\mathbf{R}^2$ 建立在扩散强迫的每个位置噪声表的基础上,提出了两个想法。首先,它将调节分为快速通道(本体感觉,每次更新)和异步更新的慢速通道(视觉语言特征),因此该策略对块内的本体感觉做出反应,同时容忍陈旧的视觉。其次,延迟自适应流程调度将运行中的操作视为修复条件,并在每次调用的一个降噪步骤中发出操作,让一个经过训练的模型适应不同的硬件延迟。只需对现有架构进行最小程度的修改,$π\mathbf{R}^2$ 就可以通过预训练策略进行微调:应用于真实 xArm6+XHand 平台上的 GR00T-N1.7,它重新规划闭环的速度比基本策略快大约 $4\times$(在 A5000 GPU 上约为 $25$Hz),每 $40$ms 执行一次新的观察。在模拟和现实世界的操纵任务中,$π\mathbf{R}^2$ 在模拟中将成功率提高了高达 $23\%$,在现实世界中比最强基线提高了 $π\mathbf{R}^2$ 的成功率高达 $30\%$。项目页面:https://pi-r2-flow.github.io/