论文
PMT:使用 Frozen Vision 编码器进行图像和视频分割的 Plain Mask Transformer
PMT: Plain Mask Transformer for Image and Video Segmentation with Frozen Vision Encoders
摘要
大规模预训练的视觉基础模型 (VFM) 使单个冻结编码器能够同时服务多个下游任务。最近用于图像和视频分割的基于 VFM 的仅编码器模型(例如 EoMT 和 VidEoMT)以极低的延迟实现了有竞争力的精度,但它们需要对编码器进行微调,从而牺牲了多任务编码器共享,而这使得 VFM 对大规模部署具有实际吸引力。为了协调仅编码器的简单性和速度与冻结 VFM 功能,我们提出了普通掩模解码器 (PMD),这是一种基于 Transformer 的快速分段解码器,可在冻结 VFM 功能之上运行。由此产生的模型,Plain Mask Transformer (PMT),保留了仅编码器设计的架构简单性和低延迟,同时保持编码器表示不变和可共享。该设计无缝适用于图像和视频分割,继承了仅编码器框架的通用性。在标准图像分割基准上,PMT 与最先进的冻结编码器相匹配,同时运行速度提高约 3 倍。对于视频分割,它的性能甚至与完全微调的方法相当,同时比最先进的冻结编码器模型快 8 倍。代码:https://github.com/tue-mps/pmt。