论文

视觉-语言-动作模型推理时的自适应动作分块

Adaptive Action Chunking at Inference-time for Vision-Language-Action Models

模型推理测试时计算扩展

摘要

在视觉-语言-动作(VLA)模型中,动作分块(即执行一系列动作而无需中间重新规划)是提高机器人操纵能力的关键技术。然而,较大的块大小会降低模型对新信息的响应能力,而较小的块大小会增加由于块之间的不连续性而导致模式跳跃和不稳定行为的可能性。因此,选择最佳的块大小是平衡模型反应性和一致性的迫切需求。不幸的是,当前 VLA 模型的主导趋势是推理时的经验固定块长度,这阻碍了它们在不同操作任务中的优越性和可扩展性。为了解决这个问题,我们提出了一种新颖的自适应动作分块(AAC)策略,该策略利用动作熵作为线索,根据当前的预测自适应地确定块大小。对各种模拟和现实世界的机器人操作任务进行的大量实验表明,我们的方法比最先进的替代方案显着提高了性能。视频和源代码可在 https://lance-lot.github.io/adaptive-chunking.github.io/ 上公开获取。