论文
用于参数高效通用视觉适应的自路由张量适配器
Self-Routed Tensor Adapters for Parameter-Efficient Universal Visual Adaptation
摘要
通用视觉表示需要适应跨异构领域的适应机制,而无需将知识分割成特定于领域的模块。参数高效的 微调 可以有效地适应冻结的视觉基础模型,但标准的低秩适配器对所有输入使用固定的子空间,当域的风格、背景和语义上下文不同时,这可能会受到限制。基于 MoE 的适配器通过多个专家路径提高专业化,但通常依赖外部路由器和大型专家库,添加参数并将路由与适应分开。我们提出了 \textbf{自路由张量适配器},一个用于多域视觉适应的紧凑框架。 SRTA 将每个输入投影到低秩空间中,使用可学习域矩阵根据该表示计算路由权重,并使用这些权重来混合共享 Tucker 核心的切片。这会产生一个特定于样本的适应矩阵,无需外部门控网络,允许重用共享视觉因素,同时支持领域感知专业化。为了加强路径学习,我们引入了渐进式深度加权路由目标,用于监督跨适配器层的路由决策。在五个异构多域视觉分类基准中,SRTA 实现了比 MoE 式 PEFT 基线有竞争力或稍强的平均准确度,同时使用更少的可训练参数。在排名 64 时,SRTA 在 4 域设置中使用 2.77M 参数,而 MoLoRA 使用 9.52M;在 6 域设置中使用 3.00M,而 MoLoRA 使用 14.31M。总体而言,SRTA 提供了有效的精度参数权衡,使视觉基础模型适应通用多域表示。 \href{https://github.com/surajyadav-research/SRTA}{GitHub}