论文

用于多任务密集预测的原型内存的任务状态适应

Task-State Adaptation with Prototype Memory for Multi-Task Dense Prediction

摘要

视觉基础骨干网为密集预测提供了强大的表示,但单个共享特征仍然需要支持具有不同的、依赖于图像的适应要求的任务。我们提出了 MemMTL,一个多任务密集预测框架,它从全局视觉上下文中估计紧凑的任务状态,并通过可学习的任务状态原型存储器对其进行细化。在对所有任务共享的本地专家库进行稀疏 top-$k$ 选择之前,将精炼状态转换为任务条件专家 logits 并与 词元级 logits 组合。一个独立的与任务无关的残差库提供了一个通用的适应路径,并且在特定于任务的预测之前,这两个路径都被添加到主干特征中一次。我们在 NYUD-v2 和 PASCAL-Context 上指定了一个匹配的评估协议,具有 SAM 3 和 ViT-L 主干,以测量预测质量、计算成本以及任务状态调节、原型检索和稀疏路由的贡献。当前工作草案中的数字记录早于该规范实施,并且必须重新生成才能支持经验主张。