论文

X2SAM:图像和视频中的任何分割

X2SAM: Any Segmentation in Images and Videos

应用与实践视觉感知与空间理解

摘要

多模态 大语言模型 (MLLM) 已表现出强大的图像级视觉理解和推理能力,但其对图像和视频的像素级感知仍然有限。诸如 SAM 系列之类的基础分割模型可以生成高质量的掩模,但它们依赖于低级视觉提示,并且无法本地解释复杂的对话指令。现有的分割 MLLM 缩小了这一差距,但通常专门用于图像或视频,很少在一个界面中同时支持文本和视觉提示。我们推出了 X2SAM,这是一种统一的分割 MLLM,可将任何分割功能从图像扩展到视频。给定对话指令和视觉提示,X2SAM 将 LLM 与掩模内存模块结合起来,该模块存储引导视觉特征,以生成时间一致的视频掩模。相同的公式支持跨图像和视频输入的通用、开放词汇、引用、推理、基础对话生成、交互式和视觉基础分割。我们进一步介绍了视频视觉基础(V-VGD)分割基准,该基准评估模型是否可以根据交互式视觉提示分割视频中的对象轨迹。通过针对异构图像和视频数据集的统一联合训练策略,X2SAM 提供强大的视频分割性能,在图像分割基准上保持竞争力,并保留一般图像和视频聊天能力。