论文
VideoSEG-O3:用于推理视频对象分割的多轮强化学习框架
VideoSEG-O3: A Multi-turn Reinforcement Learning Framework for Reasoning Video Object Segmentation
摘要
推理视频对象分割 (RVOS) 需要时间动态、空间细节和语言推理的复杂集成,以实现精确的像素级定位。现有方法仅限于对固定初始输入进行推理,并且缺乏主动获取进一步视觉证据的能力,而这对于解决长或复杂视频中的复杂参考通常至关重要。为了解决这个问题,我们提出了 \textbf{VideoSEG-O3},这是第一个用于 RVOS 的多轮强化学习框架,它模拟了人类 \textit{``从粗到细''} 的认知过程。它采用 \textit{多轮时空思想链} 通过迭代地精确定位关键间隔和关键帧来捕获细粒度的细节。此外,为了使策略能够在 RL 阶段感知分割质量,而不仅仅是 \texttt{[SEG]} 的文本概率,我们引入了 \textit{SEG 感知 logits 校准},它将逐像素分割反馈直接集成到 词元级 logits 中。此外,我们设计了一个\textit{解耦思维轨迹},将推理过程分层分解为时间、空间和语言维度,并构建了\textbf{VTS-CoT},一个具有综合推理轨迹的专用冷启动数据集。代码和模型将在https://github.com/Dmmm1997/VideoSEG-O3发布。