论文

AEGIS:用于知识保存的锚定强制梯度隔离视觉-语言-动作 微调

AEGIS: Anchor-Enforced Gradient Isolation for Knowledge-Preserving Vision-Language-Action Fine-Tuning

模型训练监督微调与指令调优

摘要

用于机器人操作的 微调 预训练视觉语言模型 (VLM) 引入了基本的稳定性-可塑性困境:连续流匹配动作专家将集中的低秩回归梯度反向传播到在高维交叉熵目标上训练的 Transformer 主干网中。这种跨模式梯度不对称会迅速降低预先训练的视觉推理能力。现有的解决方案要么通过停止梯度断开连续梯度流,要么通过 LoRA 限制更新,这限制了更新等级,但在方向上对语义损坏仍然视而不见;两者通常都依赖于混合批量 VQA 协同训练,使训练计算加倍。我们引入了 AEGIS(锚定强制梯度隔离系统),这是一种无缓冲区、分层正交梯度投影框架,可实现连续流匹配 微调,同时将预训练表示与破坏性参数更新隔离。在训练之前,AEGIS 根据 预训练 数据估计每层高斯激活统计量作为静态参考锚。在 微调 期间,封闭式 Wasserstein-2 传输惩罚通过活动计算图生成锚恢复梯度。顺序双向后传递应用分层 Gram-Schmidt 正交化,在方向冲突期间将任务梯度投影到恢复向量的正交补上。我们为分层正交投影建立了精确的能量保存界限,表明 AEGIS 根据经验仅损失 0.62% 的梯度能量,同时停止累积特征漂移。在 LIBERO 操作基准上进行微调的 PaliGemma2-3B 上,AEGIS 完全保留了预先训练的视觉问答性能和基线保留损失,同时匹配连续动作收敛,无需重播缓冲区、教师模型或协同训练数据。