论文
MoVISA:视频对象分割的多标记推理
MoVISA: Multi-Token Reasoning for Video Object Segmentation
摘要
使用多模态大语言模型 (MLLM) 推理进行视频对象分割的最新进展证明了使用单个文本标记(例如 SEG)来预测跨图像和视频的分割掩模的有效性。然而,我们观察到这种单标记策略缺乏在视频分割任务中跨时间精确定位多个对象所需的粒度。为了解决这个限制,我们开发了视频对象分割的多词元推理(MoVISA)。 MoVISA 使用多个分段标记(例如 SEG0 和 SEG1)来表示不同帧中的对象。这种设计可以在语言提示和时空掩模预测之间实现更细粒度的对齐,从而提高性能和可解释性。在具有挑战性的 MeViS、DAVIS17、ReVOS 和 Ref-Youtube-VOS 基准测试中,我们的模型在 MeViS 上实现了 13.2% 的 J 和 F 改进,在 ReVOS 上实现了 8.4% 的 J 和 F 改进。代码和模型将被发布。