论文
学习编排视觉基础模型以进行多任务密集预测
Learning to Orchestrate Vision Foundation Models for Multi-Task Dense Prediction
摘要
视觉基础模型 (VFM) 表现出由其预训练目标决定的互补优势。然而,流行的多任务密集预测方法仍然训练整个骨干网络,要么通过在多任务监督下进行 微调 训练,要么通过在附加阶段提取多个 VFM 来训练。我们询问下游学习是否可以组合基础模型中已有的冻结表示。密集任务需要复合表示,而没有任何专家可以单独提供。实现它们是困难的:简单的融合仅比最好的单个专家产生边际收益,而学习的路由往往会崩溃到初始化时较强的候选者,从而使新初始化的训练信号组合者匮乏。我们提出了 COVE,它通过 Synergy Composer 构造成对的复合候选,并使用任务条件路由器在原始候选和复合候选之间进行路由。为了防止这种崩溃,COVE 将用于探索的高斯 logits 扰动与反事实监督相结合,有选择地增加信用不足的路由分配。在 NYUD-v2 和 PASCAL-Context 上,COVE 使用较小的冻结编码器池在大多数任务上匹配或超越基于 ViT-L 的方法,并且计算量大约是最近基于 VFM 的竞争对手的一半,同时在每个任务上都超过了最好的单个冻结专家。