论文
重新思考视觉基础模型自适应的逐层信息分配
Rethinking Layer-Wise Information Allocation for Vision Foundation Model Adaptation
摘要
视觉基础模型越来越多地被重新用作下游视觉识别的冻结主干,这使得参数高效的适应成为一个中心问题。基于提示的适应,包括视觉提示调整(VPT),提供了一种轻量级的方法来专门化这些模型,但其分层行为仍然知之甚少:性能对提示深度、位置和任务分布很敏感,并且标准域内基准测试的收益并不总是转化为稳健的泛化。我们认为,这种限制不仅仅是一个优化问题,而且是一个分层的信息分配问题:现有的基于提示的方法缺乏对提示条件表示应该保留、抑制和跨深度传播的原则性控制。受信息瓶颈原则的启发,我们引入了提示信息瓶颈(PIB),这是一个规范分层压缩充分性权衡并促进更连贯的跨层信息路径的框架。关键思想是,有效的适应应该是最小的但足够的,在早期层中保留与任务相关的局部证据,同时逐步丢弃更深层中的滋扰因素和冗余细节。大量实验表明,PIB 在 34 个数据集上实现了强大的性能,在 FGVC 上达到 92.1%,在 HTA 上达到 93.01%,在 VTAB-1k 上达到 77.33%,而在主要设置中平均仅调整 0.35% 的参数。除了基准准确性之外,PIB 还有助于解释即时容量扩展的非单调行为,减少捷径依赖,并提高分布偏移和细粒度识别设置下的鲁棒性。这些结果将 PIB 定位为适应冻结视觉基础模型的实用方法和信息分配视角。我们的代码位于 https://github.com/itsnotacie/MM-26-PIB