论文
何时切换:可靠扩展视觉语言动作模型的动作块
When to Switch: Reliable Action-Chunk Extension for Vision-Language-Action Models
摘要
视觉-语言-动作 (VLA) 模型充当机器人操作的统一策略,但其昂贵的推理迫使机器人在策略调用之间暂停,导致走走停停的执行,从而中断平滑运动并延长任务完成时间。扩展动作块减少了策略调用,从而减少了这些暂停,但预测更远的未来会使长块执行不可靠。为了理解这种不可靠性是在哪里出现的,我们分析了长块内的动作错误,发现它们集中在操作子技能之间的转换上,并随着块的长度而急剧增长。这表明了转换时机的重要性,即何时在块内切换子技能。受这一观察的启发,我们引入了 RACE(可靠动作块扩展),这是一个框架,通过辅助的单步去噪预测转换时机,并据此条件化动作生成。通过学习和调节转换时间,RACE 减少了子技能转换时的错误,并能够可靠地执行更长的动作块。在模拟基准测试中,在相同的块长度下,RACE 的性能优于微调;凭借 2 倍长的块,它在成功率上超越了最新最先进且高效的 VLA,并且凭借 4 倍长的块,它仍然具有竞争力。在真实的机器人上,RACE 使用了 4 倍长的块,这将因走走停停执行而导致的空闲时间减少了约 5 倍,同时获得了比相同块长度的微调更高的成功率。代码和真实机器人演示可在 https://github.com/Seonghoon-Yu/RACE-VLA 获取
