论文
CoordFormer:给我任何坐标,我会给你标签
CoordFormer: Give Me Any Coordinates and I Will Give You Labels
摘要
由于高计算成本和捕获细粒度细节的困难,极高分辨率图像的语义分割仍然具有挑战性。我们提出了 CoordFormer,一种新颖的基于坐标的语义分割架构,它通过配备局部交叉注意力机制的坐标解码器来预测任意空间位置的标签。该解码器将坐标嵌入与高分辨率局部补丁特征相结合,并与从 ViT 基础编码器处理的下采样图像中提取的全局标记进行交互,从而在保持像素级精度的同时实现丰富的语义上下文。这种设计能够在任意分辨率下进行灵活的推理,同时在极高分辨率输入上保持较低的内存,并支持高效的以语义边缘为中心的策略,该策略将沿边界集中计算,保持细粒度的准确性,同时减少延迟和计算成本。 CoordFormer 在 MaSS13K 上实现了最先进的性能,并在 DIS5K 和 KPI 上优于同等规模和更高参数的方法,证明了其在高质量、极高分辨率语义分割方面的有效性。