论文

提高分辨率何时有助于冻结视觉骨干?全局注意力预测低秩适配的收益

When Does Resolution Help a Frozen Backbone? Global Attention at Resolution Predicts Scalable Adaptation for Camouflaged and Marine Animal Segmentation

模型评测模型行为与机制分析

摘要

冻结视觉基础模型用于细粒度分割时,效果越来越依赖骨干选择。骨干是否在高分辨率词元集上使用全局注意力,可以预测低秩适配器能否将分辨率提升转化为准确性提升。各向同性ViT对完整网格使用全局注意力,效果随分辨率继续改善;分层骨干的早期注意力限制在局部窗口,并在全局阶段前池化网格,因而在较低分辨率达到平台。六种骨干的对照研究建立了这一模式,修改骨干的实验进一步指向原因:保留池化仍有收益,去掉全局注意力则没有。该效应针对低秩适配。在固定的SALT流程中,强各向同性骨干仅用RGB单次前向,在四个数据匹配的伪装分割数据集取得最佳S-measure,并在所有所测海洋动物及显著目标数据集领先;两个海洋动物基准达到新的最佳水平,其中MAS3K的mIoU为0.878。