论文
用于机器人操作的注视正则化视觉语言动作模型
Gaze-Regularized Vision-Language-Action Models for Robotic Manipulation
摘要
尽管视觉-语言-动作(VLA)模型取得了进步,但机器人操作仍难以完成细粒度的任务,因为当前的模型缺乏主动视觉注意力分配的机制。人类的目光自然地编码意图、计划和执行模式——为引导机器人感知提供强大的监督信号。我们引入了一种凝视正则化训练框架,该框架可以将 VLA 模型的内部注意力与人类视觉模式保持一致,而无需架构修改或推理时间开销。我们的方法将时间聚合的注视热图转换为补丁级分布,并通过 KL 散度规范 Transformer 的注意力,从而在保持部署效率的同时创建对任务相关特征的归纳偏差。当集成到现有的 VLA 架构中时,我们的方法在操作基准方面产生了 4-12% 的改进。注视正则化模型以更少的训练步骤达到相同的性能,并在光照变化和传感器噪声下保持鲁棒性。除了性能指标之外,学习到的注意力模式还可以产生可解释的可视化效果,反映人类的策略,从而增强对机器人系统的信任。此外,我们的框架不需要眼动追踪设备,并且直接适用于现有数据集。这些结果表明,人类感知先验可以显着加速机器人学习,同时提高任务性能和系统可解释性。