论文
通过可行的动作邻域先验促进视觉-语言-动作微调
Boosting Vision-Language-Action Finetuning with Feasible Action Neighborhood Prior
摘要
在现实世界的机器人操纵中,国家通常承认邻近的近乎相同的行为。也就是说,对于每个状态,都存在一个可行的动作邻域(FAN),而不是单个正确的动作,其中动作产生难以区分的进展。然而,流行的 VLA 训练方法直接继承自语言环境,没有利用 FAN 属性,从而导致泛化能力差和样本效率低。为了解决这个限制,我们引入了一个 FAN 引导的正则化器,它可以塑造模型的输出分布以与 FAN 的几何结构保持一致。具体来说,我们引入了高斯先验,它促进围绕首选方向和幅度的局部平滑和单峰预测。在强化微调(RFT)和监督微调(SFT)的广泛实验中,我们的方法在分布内和分布外(OOD)场景中实现了样本效率和成功率的显着提高。通过与物理操作的内在动作容差相结合,FAN 引导的正则化为样本高效且可推广的 VLA 适应提供了一种有原则且实用的方法。