论文

CapVector:在参数空间中学习视觉语言动作模型的可转移能力向量

CapVector: Learning Transferable Capability Vectors in Parametric Space for Vision-Language-Action Models

模型优化模型合并

摘要

本文提出了一种新方法来解决预训练 VLA 模型在标准监督微调(SFT)过程中通常无法有效提高性能并降低适应成本的挑战。一些具有辅助训练目标的高级微调方法可以提高性能并减少收敛步骤数。然而,由于辅助目标的额外损失,它们通常会产生大量的计算开销。为了同时实现辅助训练的增强能力和标准 SFT 的简单性,我们在参数空间内解耦辅助目标 SFT 的两个目标,即增强一般能力和拟合特定任务的动作分布。为了实现这一目标,我们只需要使用两种不同的训练策略来训练模型收敛于小规模任务集,从而产生两个微调模型。两个模型之间的参数差异可以解释为辅助目标提供的能力向量。然后将这些向量与预训练的参数合并以形成能力增强的元模型。此外,当使用轻量级正交正则化损失增强标准 SFT 时,合并模型获得的性能可与辅助微调基线相当,同时减少计算开销。内部和外部实验表明,我们的能力向量(1)在不同的模型中是有效且通用的,(2)可以推广到开箱即用的新环境和实施例。