论文

Vision Transformer 参数高效 微调 的结构化超边缘自适应

Structured Hyperedge Adaptation for Parameter-Efficient Fine-Tuning of Vision Transformers

模型训练参数高效训练

摘要

参数高效的 微调 (PEFT) 已成为一种实用的解决方案,可将大型预训练视觉 Transformer (ViTs) 应用于下游任务,同时仅更新一小部分参数。然而,现有的基于适配器的方法独立地对每个标记执行适应,隐含地假设应该单独学习标记细化。这种基于词元的公式忽略了视觉场景中自然出现的词元之间的结构化关系,可能导致冗余更新和空间不一致的特征细化。在这项工作中,我们重新审视参数高效适配器的设计,并建议在超边缘空间而不是词元空间中执行自适应。我们引入了 HyperAdapter,这是一种基于超图的适配器架构,可通过软词元路由实现结构化、群组感知的自适应。 HyperAdapter 使用基于原型的分配在 ViT 词元上构建软超图,将词元特征聚合到潜在的超边表示中,在超边级别应用轻量级瓶颈自适应,并通过超图关联结构将结果更新扩散回词元。该设计将显式结构归纳偏置注入 PEFT,同时保留标准适配器的模块化和效率。跨不同视觉基准的广泛实验表明,在可比较的参数预算下,结构化超边缘适应始终优于强大的 PEFT 基线,在需要结构化推理的任务上尤其明显。我们的结果表明,适应空间的选择是 ViT 参数有效传输中一个关键但尚未充分探索的维度。