论文
GIFT:目标注入 微调 用于高效的操纵策略适应
GIFT: Goal-Injected Fine-Tuning for Efficient Manipulation Policy Adaptation
摘要
与仅依赖初始观察和语言指令相比,使用生成模型作为高级视觉指导来预测目标图像可以显着增强视觉-语言-动作(VLA)模型的鲁棒性。然而,由于计算训练成本较高,大多数现有基础模型尚未系统地纳入目标图像调节。为此,我们提出了 Goal-Injected 微调 (GIFT),这是一种轻量级且高效的 微调 框架,可将生成的目标图像无缝集成到多个代表性的预训练 VLA 模型中。我们的方法通过零初始化卷积将目标图像特征引入到观察中,该卷积从零逐渐增加参数,并防止有害噪声在 微调 期间破坏预训练策略。随着训练的进行,目标信息逐渐被纳入,从而在不破坏模型稳定性的情况下实现有效的目标理解。我们进一步引入了一种精细的图像编辑方法,可以根据初始观察和任务指令生成语义和视觉上一致的目标图像。实验表明,目标感知 VLA 模型在各个任务中实现了显着的性能提升:仅使用 微调 的单个 epoch,GIFT 在两个 SIMPLER 设置上比基本模型高出 6.0% 和 13.4%,在 LIBERO 上比基本模型高出 4.7%,展示了效率和有效性。