论文

按想象未来的分歧自适应选择机器人动作块

Commit While Futures Agree: Consequence-Aware Adaptive Action Chunking for Robot Manipulation

模型推理解码与生成控制

摘要

动作分块策略预测多步控制序列,但仍然存在一个基本问题:在重新计划之前应该提交多少预测的 动作块?现有系统通常执行固定长度的前缀,隐含地假设相同的执行范围在不同状态下仍然可信。一些自适应方法根据预测动作的相似性或稳定性来估计这一范围。然而,不同的行动可能会导致相同的成功结果,而相似的行动可能会产生不同的未来,这表明承诺应该由想象的未来之间的一致决定,而不是由行动空间的相似性来决定。为此,我们提出了后果感知自适应行动分块(CA$^3$C),这是一个基于简单原则构建的推理时框架:在想象的未来一致时提交,在分歧时重新计划。在不修改或重新训练基础策略的情况下,CA$^3$C 使用动作条件世界模型来想象多个候选 动作块 在相同采样噪声下的未来后果。利用这些想象的结果,我们将执行范围估计制定为贝叶斯变点推理问题,并通过未来共识选择执行候选者。在多个模拟基准和现实世界的机器人操作任务中,CA$^3$C 持续改进了多种动作分块策略,与相应的基础策略相比,故障率相对降低了 71.8%。

按想象未来的分歧自适应选择机器人动作块:论文原图
图 2:结果感知自适应行动分块概述。 (a) 扩散策略样本 $K$ 候选 动作块。 (b) 动作条件世界模型在共享采样噪声下想象它们的视觉未来状态。 (c) CA3C 检测到他们未来的潜在特征开始不一致的地方,确定可信范围 $h^{\star}$,并选择最接近未来共识的候选者。 (d) 机器人在重新规划之前执行所选块的第一个 $h^{\star}$ 动作。