论文
无监督分割能否降低视频语义分割的标注成本?
Can Unsupervised Segmentation Reduce Annotation Costs for Video Semantic Segmentation?
摘要
目前用于视频语义分割的深度神经网络需要大量细粒度的像素级注释才能获得最佳结果。然而,获得这样的注释是非常昂贵的。另一方面,原始的、未注释的视频帧实际上可以免费获得。同样,不需要精确边界的粗注释也便宜得多。本文研究了利用此类资源来降低视频分割数据集所需的注释成本的方法。我们证明,使用最先进的分割基础模型、Segment Anything Model (SAM) 和 Segment Anything Model 2 (SAM 2),我们可以利用未注释的帧和粗略注释,通过自动生成掩模来减轻视频分割数据集手动注释所需的工作量。我们的调查表明,如果使用得当,我们可以将注释的需求减少三分之一,而视频语义分割的性能却相似。更重要的是,我们的分析表明,为了获得最佳性能,数据集中的帧种类比帧数量更重要。