论文
你只能重新编程一次:重新思考视觉重新编程的长期训练
You Only Reprogram Once: Rethinking Prolonged Training for Visual Reprogramming
摘要
视觉重编程是一种用于调整预训练模型的参数有效方法,但其训练在计算上仍然昂贵:即使主干网冻结,视觉提示通常也会通过数百个时期的完整模型进行优化。在改变预训练模型看到的内容之前,我们会问我们是否充分使用了它已经告诉我们的内容。我们发现,对完整源响应进行建模已经可以产生强大的下游预测,而无需立即优化。受此观察的启发,我们引入了 You Only Reprogram Once (YORO),它在单个仅前向遍历中从冻结的响应空间构建下游预测器。其贝叶斯判别映射 (BDM) 从流类统计数据中导出协方差感知仿射映射,无需反向传播、优化器更新或重复访问训练集。当进一步的输入适应有帮助时,YORO-FP 可以选择性地细化 20 个时期的视觉提示。 BDM 还通过将属性提示相似性视为源响应来自然地扩展到 CLIP。在三个完整数据设置中,YORO 比最强的先验无梯度映射平均精度提高了 18.4--24.4\%。在 16 镜头 CLIP 上,它将四骨干平均率从 71.4\% 提高到 77.2\%。 YORO-FP 在选定的任务上提供了进一步的收益,而验证通常保留一次性预测器。这些结果表明视觉重新编程的不同默认设置:首先读出冻结的响应,仅在需要时优化输入。