论文
PETR:通过视觉语言模型的免训练路由进行快速集成
PETR: Prompt Ensembling with Training-free Routing for Vision-Language Models
摘要
即时学习可以有效地使视觉语言模型(VLM)适应下游任务,但在已见类别上的收益通常是以牺牲对未见类别的泛化为代价的。为了解决这个限制,我们提出了无训练路由的提示集成(PETR),其关键创新是精心设计的双提示架构:从不同的数据和目标中学习两个互补的提示,分别强调可见的类歧视和看不见的类泛化。在训练期间,两个提示都使用共享的冻结 CLIP 主干进行微调,并从训练集 logits 中收集统计信息。在推理时,我们确定每个测试样本与所见数据的相似度,并将样本路由到最合适的提示分支。据我们所知,这是第一个基于统计相似性执行免训练自适应路由的即时调优框架。该设计提供了可解释的路由信号,并避免了常见的 MoE 式路由病症,例如路由器训练不稳定和负载不平衡。对 11 个基准数据集的广泛实验表明,我们的框架在可见类和未见类上始终优于以前的方法,实现了新的最先进的结果。