论文
机器人动作表示的语义锚定
Semantic Anchoring for Robotic Action Representations
摘要
视觉语言动作 (VLA) 模型继承了预训练视觉语言模型的丰富语义表示,但有限机器人演示上的 微调 降低了这种结构并破坏了泛化。因此出现了一个基本问题:什么构成了良好的行动表现?受镜像神经元理论的启发,即观察和执行共享意图级编码,我们检查机器人的动作表示是否保留了预训练编码器捕获的语义结构。系统探索证实,这种结构在微调过程中会受到侵蚀,并且其质量与任务成功和分布外泛化同步。我们进一步引入了一种即插即用的方法,它将动作表示锚定到语义流形,同时将表示分解为共享语义通道和私有通道,所有这些在推理时都被丢弃,使部署的模型保持不变。我们的方法在模拟和现实世界基准的不同 VLA 主干上进行了验证,在现实世界的分布内任务上的收益率高达 +18.7%,在分布外泛化上的收益率高达 +21.5%。