论文

SMILE:平滑运动以改进长视野 VLA 执行

SMILE: Smooth Motion for Improved Long-Horizon VLA Execution

摘要

视觉-语言-动作 (VLA) 模型通过每次调用执行多个操作来降低推理成本,但较长的时间范围通常会降低准确性,因为原始块包含抖动和异常值。我们引入了 SMILE,这是一种保留架构的接口,可以预测 B 样条系数并将其解码为平滑的动作序列。 SMILE 仅更改动作表示,从而实现更长的固定视野,同时保留每个基线的主干和模型规模。我们将 SMILE 应用于 SmolVLA、Evo1、VPP 和 DAWN,提高了 LIBERO、CALVIN 和实际实验的准确性和摊销推理效率。 SMILE-Evo1 达到 98.0%,在 LIBERO 上加速 1.1 倍,而 SMILE-VPP 平均长度达到 4.42,在 CALVIN 上加速 1.5 倍。在匹配的执行范围为 10 时,SMILE-SmolVLA 将非边界加速度降低了 78.6%,速度符号变化率降低了 42.3%。现实世界的 xArm 测试显示出更高的成功率、更少的跌落和更少的接触。这些结果建立了平滑的系数空间生成作为准确、高效的长范围 VLA 执行的途径。项目页面:jongwoopark7978.github.io/smilevla