论文

用于高效计算 Transformer 适配的电路 微调

Circuit Fine-Tuning for Compute-Efficient Transformer Adaptation

模型训练参数高效训练

摘要

参数高效的 微调 (PEFT) 已成为使 Vision Transformer (ViTs) 适应下游任务的事实上的标准。虽然参数计数一直是 PEFT 中的主要效率指标,但它并不意味着 \textit{计算效率}:参数稀疏方法仍然会导致每步完全 模型训练 成本,并且通常需要很长的调度才能达到峰值精度。我们引入了 Circuit 微调 (CFT),这是一种计算高效的框架,它使用电路发现(通常用于解释经过训练的模型)在训练前为 微调 选择模块。传统上,归因是针对经过训练的任务头制定的,而我们针对接近零初始化的探针头制定归因,该探针头隔离了骨干网对目标分布的响应,而不是特定分类器的偏好。然后,CFT 仅微调恢复的子图。 CFT 不需要学习率预热,平均在 ${\sim}20$ epoch 内达到最高准确度,而强 PEFT 基线为 $44$--$96$,训练 FLOP 次数减少 $2.3$--$6.6\times$,挂钟时间减少高达 $16\times$,同时添加零参数且无推理操作。标准视觉传输基准 (VTAB-1k)、分层主干网 (Swin)、域转移医学成像 (CBIS-DDSM) 和视觉语言模型(CUB-200 上的 Gemma-3)的实验证明了 CFT 的有效性。代码可在 https://github.com/UriKialy/CFT 获取