论文

FutureRTC:具有预期条件动作分块的实时机器人执行

FutureRTC: Real-Time Robot Execution with Anticipatory-Conditioned Action Chunking

模型推理批处理与并行

摘要

视觉-语言-动作(VLA)策略的实时部署需要异步执行,其中后续动作块与当前块的执行同时计算,导致预测-执行不一致并表现为块间不连续性。现有的方法要么表面上平滑块边界,需要昂贵的策略优化,要么专门前向预测本体感受状态但忽略关键的视觉观察。在本文中,我们提出了 \textbf{FutureRTC},这是一种即插即用的适应框架,可以预测异步 VLA 控制的执行时间观察和状态,而无需修改底层策略。具体来说,FutureRTC 具有一个状态校正模块,用于补偿前滚和实际执行时间本体感受状态之间的差异,以及一个观察预测模块,该模块通过运动感知特征传输和重建,利用机器人运动作为显式物理先验来预测执行时间视觉表示。此外,我们引入了策略一致性损失,以使从预测上下文生成的动作块与在 VLA 策略的预期执行时间输入下生成的动作块保持一致。在模拟和现实环境中进行的大量实验表明,FutureRTC 对推理延迟具有卓越的鲁棒性,从而实现更平滑的轨迹、更快的执行速度以及持续更高的任务成功率。