论文
根据您所看到的采取行动:在视觉-语言-行动模型中解锁安全的社交导航
Act on What You See: Unlocking Safe Social Navigation in Vision-Language-Action Models
摘要
安全的社交导航要求机器人能够区分人类和普通障碍物,并在危险迫近之前做出反应。我们表明,预训练的视觉-语言-动作(VLA)模型已经在其内部表示中编码了行人-物体区别和未来碰撞信号,但行为克隆无法将这些信号转化为适合社会的动作。为了解决这种不匹配问题,我们提出了 SALSA,这是一个两阶段无注释的 后训练 框架:(1)社交行为对齐将中间层社交特征与动作头联系起来,并训练反事实的人-物体场景对以打破视觉显着性捷径; (2) 时间安全对齐提供自动生成的未来风险监督,以实现预期碰撞避免。在 SCAND 和现实世界部署中,SALSA 将近似碰撞减少了 86.4%,并将社交反事实准确性从 53% 提高到 93%,这表明通过教导 VLA 策略根据其已有的表示采取行动,可以实现更安全的社交导航。这些结果表明,预训练的 VLA 策略可以通过更好地将其潜在表示与动作生成保持一致,从而实现更安全的社交导航。