论文

SALT:VLA 对执行中未知视觉扰动的适配

Adapting Vision-Language-Action Models to Unknown Visual Disruptions During Execution

模型训练监督微调与指令调优

摘要

机器人执行任务时可能会出现视觉中断,从而使视觉语言动作 (VLA) 策略在不知道中断类型或时间的情况下做出响应。我们引入了来自剩余轨迹的自监督适应(SALT),它使用剩余轨迹,即之前 动作块 中未执行的部分,作为测试时适应的自监督。由于连续块在时间上重叠,因此剩余部分为相同未来控制间隔上的当前预测提供了时间对齐的目标。在视觉转变开始时,剩余的可以保留损坏之前形成的计划,因此将策略更新为它可以锚定整个转变的适应(过渡锚定)。 SALT 保留调整后的策略并重新生成当前块,其剩余部分成为下一次重新计划的目标,沿着执行轨迹向前推进校正(顺序校正传播)。监督完全来自策略自己的预测,不需要中断注释、专家操作或目标域演示,并且仅在标称轨迹上校准的轻量级适应门决定更新何时开始。在 LIBERO-10 上,SALT 将 SmolVLA 处理五种持续性视觉损坏的平均成功率从 43.9% 提高到 53.2%,将 GR00T N1.7 从 58.7% 提高到 66.0%,同时在很大程度上保持标称性能。在真实的机器人上,它将数字和物理干扰下的平均任务进度从 0.49 提高到 0.61。

SALT:VLA 对执行中未知视觉扰动的适配:论文原图
图 1:正在进行的任务期间的视觉中断。 VLA 在名义观察下开始执行,但在执行过程中可能会出现意外的视觉损坏并改变其后续操作预测。左:视觉干扰下任务失败的示例。右:每个新 动作块 与前一个块的对齐剩余部分之间的偏差。在名义观察(灰色)下它保持很小,但在第一次损坏的重新计划(红色)时跳跃。详细信息请参见附录 H。