论文
重新评估跨物理域 BLIP 微调中的全局梯度范数不平衡
Reassessing Global Gradient-Norm Imbalance in BLIP Fine-Tuning Across Physical Domains
摘要
视觉语言模型的视觉和语言路径之间不平衡的梯度幅度通常被视为需要纠正的缺陷。我们测试了一系列校正的前提,故意排除自适应信号驱动方案(例如 BalGrad、OGM、PMR、CGGM),这些方案在本研究范围之外是机械上不同的类别。测量以参数归一化形式报告的语言与视觉梯度范数比,跨越九个微调条件、三个种子和三个跨越不同物理领域变化(水下、空中、放射学)的字幕数据集,我们发现不平衡程度在不同领域之间存在显着差异,并且没有可预测的顺序。简单的学习率降低大大减少了不平衡,并且在每个数据集上都落在最佳方法的几个 BLEU 点之内。阶段性冻结降低了每个域的比例,但从未排名第一;仅计划控制将冻结视为一个数据集的原因,而不是其他两个数据集的原因。强制两个梯度组大小相等会导致每个域上的每个参数不平衡接近于零,但这既是研究中的最佳结果,也是在具有相同设置的不同数据集上的完整微调方法中最差的位置。梯度范数比的降低并不能一致地预测跨领域的字幕性能,如何达到给定的平衡水平与水平本身一样重要。作为次要发现,应用于 BLIP 的常用重用 LoRA 配置会默默地适应零视觉参数;纠正它可以改善所有三个数据集上的 BLEU-4。