论文
用于指代图像分割与定位的低成本主动学习
Cost-efficient Active Learning for Referring Image Segmentation and Grounding
摘要
收集自然语言引用表达式以及区域注释(例如掩模或框)是视觉基础(VG)的主要瓶颈,因为注释者必须编写区分目标区域和视觉相似区域的描述。我们通过在现实环境下为 VG 制定主动学习 (AL) 来解决这个问题,其中只有原始图像可用而没有附带文本。由于 真值 文本不可用,因此样本选择必须估计哪些图像包含需要区分性引用表达式的不明确区域。为了解决这个问题,我们使用基础模型生成辅助区域-文本对,并引入引用区域模糊性,这是一种新的获取函数,用于衡量模型的置信度是塌陷到单个区域还是分散在多个候选区域中。它允许我们的方法优先考虑具有强烈跨区域竞争的图像,这些图像由于其视觉模糊性而提供更多信息。我们还设计了一个引用表达注释界面,帮助注释者只需点击几下即可快速专注于编写区分性语言。 RIS 和 REC 基准测试表明,我们的 AL 框架始终优于多个 AL 基线,而用户研究显示我们的描述标签速度提高了 1.6 倍。