论文

ConSFT:以保守监督微调保留流匹配 VLA 的基础能力

Preserving Foundational Capabilities in Flow-Matching VLAs through Conservative SFT

模型训练持续学习

摘要

流匹配视觉-语言-动作 (VLA) 模型的无约束 微调 会导致密集参数覆盖,从而降低预训练能力。我们提出了保守监督 微调 (ConSFT),这是一种适应目标分布的优化目标,同时减轻灾难性遗忘,需要零先验数据或架构开销。通过基于模型置信度动态缩放学习信号,ConSFT 抑制低置信度样本的过度梯度,以防止不成比例的参数更新,从而限制内在参数破坏风险。受强化学习信任区域裁剪的启发,该公式建立了渐进式学习动态,以确保目标收敛和先验能力保留,保持稀疏参数更新,而不依赖于显式正则化所需的并行参考网络。我们在最先进的流匹配 VLA($π_0$、$π_{0.5}$ 和 GR00T-N1.6-3B)的 LIBERO 和 RoboTwin 基准上评估 ConSFT。该方法在能力保留方面优于普通 SFT,平均高出20个百分点以上,与无需旧任务数据的设置中数据密集的经验回放的功效相匹配。现实世界的机器人部署证实,ConSFT 可以防止下游适应过程中的空间过度拟合,在获取连续目标任务的同时保留预先训练的物理操作技能。