论文

匹配学习率后重新比较CLIP全量微调与LoRA的迁移保留

Matched-Learning-Rate Analysis of Attention Drift and Transfer Retention in Fine-Tuned CLIP

模型评测模型行为与机制分析

摘要

CLIP适配可能改善域内准确率,却损害域外迁移;全量微调与LoRA比较又常受学习率设置不同的干扰。本文匹配学习率,研究适配方法与优化尺度对注意力漂移和迁移保留的共同影响。实验在CLIP ViT-B/32的EuroSAT与Oxford-IIIT Pets上进行80次运行,覆盖四个相同学习率(10的−6次方、5×10的−6次方、10的−5次方、5×10的−5次方)和五个种子,评估注意力漂移、最佳验证准确率及适配器参与时的CIFAR-100零样本准确率。学习率显著影响结构变化:EuroSAT中全量微调从低学习率下轻微熵增加转为高学习率下明显收缩,LoRA在全部匹配设置中熵变化保持为正。同一学习率下,LoRA保留更多零样本迁移,EuroSAT训练后的CIFAR-100平均准确率为45.13%,全量微调为11.28%;Pets分别为58.01%和8.54%。Pets上低学习率LoRA会域内欠拟合,简单按方法平均可能掩盖何时达到有竞争力的表现。注意力传播(rollout)、图块间分析与CKA结果在方向上支持控制实验。匹配学习率改变了两种方法的比较结论;注意力漂移更适合描述表征保留,而非作为迁移行为的因果解释。