论文

何时切换:可靠扩展视觉语言动作模型的动作块

When to Switch: Reliable Action-Chunk Extension for Vision-Language-Action Models

模型推理推理加速

摘要

视觉-语言-动作 (VLA) 模型充当机器人操作的统一策略,但其昂贵的推理迫使机器人在策略调用之间暂停,导致走走停停的执行,从而中断平滑运动并延长任务完成时间。扩展动作块减少了策略调用,从而减少了这些暂停,但预测更远的未来会使长块执行不可靠。为了理解这种不可靠性是在哪里出现的,我们分析了长块内的动作错误,发现它们集中在操作子技能之间的转换上,并随着块的长度而急剧增长。这表明了转换时机的重要性,即何时在块内切换子技能。受这一观察的启发,我们引入了 RACE(可靠动作块扩展),这是一个框架,通过辅助的单步去噪预测转换时机,并据此条件化动作生成。通过学习和调节转换时间,RACE 减少了子技能转换时的错误,并能够可靠地执行更长的动作块。在模拟基准测试中,在相同的块长度下,RACE 的性能优于微调;凭借 2 倍长的块,它在成功率上超越了最新最先进且高效的 VLA,并且凭借 4 倍长的块,它仍然具有竞争力。在真实的机器人上,RACE 使用了 4 倍长的块,这将因走走停停执行而导致的空闲时间减少了约 5 倍,同时获得了比相同块长度的微调更高的成功率。代码和真实机器人演示可在 https://github.com/Seonghoon-Yu/RACE-VLA 获取

何时切换:可靠扩展视觉语言动作模型的动作块的原论文方法或结果图
图 3:RACE 概述。给定观察和指令,冻结的 VLM 会提取为两次传递缓存的特征。 RACE 通过辅助单步去噪过程(第 3.2 节)先预测转换时序,然后根据相同的噪声重新开始去噪(第 3.3 节)。