论文

鲁棒性的几何:优化损失景观曲率和特征流形对齐以实现视觉语言模型的鲁棒微调

The Geometry of Robustness: Optimizing Loss Landscape Curvature and Feature Manifold Alignment for Robust Finetuning of Vision-Language Models

模型训练监督微调与指令调优

摘要

用于视觉语言模型 (VLM) 的 微调 方法面临分布内 (ID) 准确性、分布外 (OOD) 泛化和对抗鲁棒性之间的关键三向权衡。现有的稳健的 微调 策略最多解决了这种权衡的两个轴。泛化保留方法保留了 ID/OOD 性能,但使模型容易受到对抗性攻击,而对抗性训练提高了针对目标攻击的鲁棒性,但降低了 ID/OOD 准确性。我们的主要见解是,鲁棒性权衡源于两个几何故障:参数空间中尖锐的各向异性最小值和在扰动下变形的不稳定特征表示。为了解决这个问题,我们提出了 GRACE(通过自适应曲率估计实现的革兰氏对齐鲁棒性),这是一个统一的 微调 框架,可以联合正则 VLM 的参数空间曲率和特征空间不变性。基于鲁棒 PAC-贝叶斯理论,GRACE 采用按局部曲率缩放的自适应权重扰动来促进更平坦的最小值,并结合特征对齐损失来保持干净、对抗和 OOD 输入之间的表示一致性。在 CLIP 模型的 ImageNet 微调 上,GRACE 同时将 ID 准确率提高了 10.8%,对抗准确率提高了 13.5%,同时保持了 57.0% 的 OOD 准确率(相对于 57.4% 的零样本基线)。几何分析证实,GRACE 收敛到更平坦的最小值,且在分布变化时不会出现特征失真,从而为基础 VLM 的广义鲁棒性迈出了原则性的一步。