论文
平坦度保留了视觉-语言-动作模型中的指令遵循
Flatness Preserves Instruction Following in Vision-Language-Action Models
摘要
视觉语言动作(VLA)模型具有通过利用预训练的视觉语言表示进行开放世界泛化的潜力,但对有限的机器人数据进行下游微调通常会降低这些表示的质量,从而导致脆弱的策略忽略语言指令而倾向于视觉快捷方式,这种失败模式我们称之为指令盲目性。我们假设有限数据的标准微调将梯度应用于稀疏点集,这表现为具有高曲率最小值的急剧损失景观。我们建议通过保持平坦度的优化来直接解决这个问题,同时对完全相同的数据进行微调,其中学习更平坦的景观会导致模型对权重空间中的扰动更加鲁棒。具体来说,我们证明,在 VLA 微调期间简单地应用锐度感知最小化,可以在多个模拟和现实世界基准中显着提高指令跟踪率超过 60%,而无需额外的数据、架构修改或重新训练。我们进一步分析了选择性锐度的影响,量化了其影响,并表明我们的方法是对现有制导技术的补充。项目页面可以在 https://haochenz11.github.io/papers/flatness-vla/ 找到。