论文
RCoT-Seg:视频推理和分割的强化思想链
RCoT-Seg: Reinforced Chain-of-Thought for Video Reasoning and Segmentation
摘要
视频推理分割(VRS)旨在基于传达人类意图和时间逻辑的隐式指令来分割视频中的目标对象。现有的基于 MLLM 的方法在通过简单采样或辅助 MLLM 选择帧后使用 [SEG] 词元预测掩模,其中有限的监督和帧语言相似性规则通常会产生范围狭窄的关键帧选择,从而削弱整体时间理解并导致复杂多对象场景中的脆弱定位。为了解决这些问题,我们引入了 RCoT-Seg,这是一种视频思维框架,它将 VRS 分解为时间视频推理 (TVR) 和关键帧目标感知 (KTP),明确地将时间推理与空间感知分开。具体来说,在TVR阶段,提出了一个代理关键帧选择模块,该模块使用精心策划的CoT-start语料库进行初始化,并由GRPO在任务对齐奖励下进行细化,通过自我评估、加强时刻定位和时间推理来生成和重新选择关键帧。在 KTP 阶段,RCoT-Seg 对所选帧执行高分辨率分割,并使用基于 SAM2 的方法在整个序列中传播掩模,取代启发式采样和外部选择器,同时提高空间精度和帧间一致性。大量的实验结果表明,所提出的 RCoT-Seg 相对于最先进的方法取得了良好的性能。代码和模型将在 https://github.com/Victor-wjw/RCoT-Seg 公开发布。