论文
Moondream 分割:从文字到面具
Moondream Segmentation: From Words to Masks
摘要
我们提出了 Moondream Segmentation,这是 Moondream 3(一种视觉语言模型)的参考图像分割扩展。给定图像和引用表达式,模型自回归解码矢量路径,并迭代地将光栅化掩模细化为最终的详细掩模。我们引入了强化学习阶段,通过直接优化掩模质量来解决监督信号中的模糊性。此阶段的采样轨迹将为细化模型产生粗略到 真值 的目标。为了减轻多边形注释的评估噪声,我们发布了 RefCOCO-M,这是一个带有边界精确掩模的经过清理的 RefCOCO 验证分割。 Moondream Segmentation 在 RefCOCO (val) 上实现了 80.2% 的 cIoU,在 LVIS (val) 上实现了 62.6% mIoU。