论文

多时态参考分割的开源基准和基线

An Open-Source Benchmark and Baseline for Multi-temporal Referring Segmentation

模型评测基准与评测资源

摘要

大视觉语言模型(LVLM)显示出强大的视觉理解和语言引导的基础能力,但其多时态视觉推理的能力仍未得到充分开发。为了弥补这一差距,我们引入了 \textbf{多时间参考分割(MTRS)},这是一项新任务,旨在从多时间图像中分割语言描述的时间变化。 MTRS 通过联合要求时间对应推理、语言基础和像素级掩模预测来扩展传统的引用分割和变化检测。我们提出 \textbf{CRAFT-Agent},一个带有人工审核的自动化数据构建管道,并构建 \textbf{MTRefSeg-21K},第一个 MTRS 基准,包含跨不同场景、视点和领域的 21K 高质量多时态图像-文本-掩码三元组。对一系列基于 VLM 和 LVLM 的模型进行基准测试表明,直接推理的性能很差,而特定于任务的 微调 仍然有限。为了解决这个问题,我们提出了 \textbf{MTRefSeg-R1},这是一种采用两阶段策略训练的变化感知 LVLM 框架。它首先从 20K 仅视觉双时态样本中学习一般时间变化感知,然后在 MTRefSeg-21K 上进行微调,以实现细粒度语言引导的时间定位。 MTRefSeg-R1 显式地模拟跨时间视觉差异,将语言指令与时间变化对齐,并预测引用的变化掩模。大量实验表明,与现有 LVLM 基线相比,MTRefSeg-R1 实现了强大且往往更优越的性能,展示了 MTRS 的挑战和潜力。