论文
QINA:用于预训练视觉模型的量子启发非线性适配器
QINA: Quantum-Inspired Nonlinear Adapters for Pretrained Vision Models
摘要
在有限的数据和冻结骨干约束下适应大型预训练视觉模型仍然是迁移学习的核心挑战。虽然轻量级适配器和参数高效的微调方法被广泛采用,但大多数依赖于通用多层感知器或低秩线性更新,对特征变换的光谱和几何结构提供有限的控制。我们研究结构化非线性特征提升是否可以改善冻结状态中的表征对齐。我们引入了量子启发非线性适配器(QINA),这是一种紧凑的模块,可以执行可学习的三角特征提升,然后进行有界非线性聚合。该设计引入了具有显式依赖于范数的 Lipschitz 界限的结构化振荡基函数,从而能够对预训练表示进行频谱重塑,而无需增加感受野或显着扩展参数计数。重要的是,该方法完全在标准深度学习框架内运行,不需要量子硬件。通过对自然和医学成像数据集、分类和分割任务、多个适配器和放置以及不同的训练预算进行的系统实验,我们表明冻结状态下的性能主要受到表示限制。非线性提升改善了适应性,并且所提出的结构化三角公式始终优于恒等基线、固定傅立叶特征映射和参数匹配基线适配器。在评估的冻结主干设置中,结构化频谱参数化提供了比通用非线性适配器更有效的感应偏置。这项工作强调了几何和频谱感知适应机制对于大型预训练视觉模型的重要性。