论文
打破锁定:在低数据 VLA 后训练 下保持可操纵性
Breaking Lock-In: Preserving Steerability under Low-Data VLA Post-Training
摘要
您是否曾经在小型演示数据集上对通用视觉语言动作 (VLA) 策略进行后训练,却发现它停止响应新指令,并且仅限于在 后训练 期间观察到的行为?我们将这种现象定义为锁定:在低数据、有监督的 微调 (SFT) 之后,策略变得过于专门化于 后训练 数据,并且无法泛化到新的指令,表现为概念锁定(固定在训练对象/属性上)和空间锁定(固定在训练空间目标上)。许多现有的补救措施引入了额外的监督信号,例如从基础模型或辅助目标派生的信号,或者依靠增强数据集来恢复泛化。在本文中,我们表明该策略的内部预训练知识是足够的:DeLock 通过在 后训练 期间保留视觉基础并应用测试时对比提示指导来根据新颖的指令来引导策略的去噪动态,从而减轻锁定。在八次模拟和现实世界评估中,DeLock 始终优于强大的基线,并匹配或超过经过精心策划的演示后训练的最先进的通才政策的表现。