论文
AgentRVOS:零镜头参考视频对象分割的对象轨迹推理
AgentRVOS: Reasoning over Object Tracks for Zero-Shot Referring Video Object Segmentation
摘要
参考视频对象分割(RVOS)旨在根据自然语言查询来分割整个视频中的目标对象。用于此任务的 无需训练 方法遵循通用管道:MLLM 选择关键帧,将这些帧中引用的对象作为基础,然后视频分割模型传播结果。虽然直观,但这种设计要求 MLLM 在任何对象级证据可用之前做出时间决策,从而限制了推理质量和时空覆盖范围。为了克服这个问题,我们提出了 AgentRVOS,这是一个基于 SAM3 和 MLLM 的互补优势构建的 无需训练 代理管道。给定从查询中得出的概念,SAM3 通过生成的掩模轨迹提供对完整时空范围的可靠感知。然后,MLLM 通过对此对象级证据进行基于查询的推理来识别目标,并在 SAM3 的时间存在信息的指导下进行迭代修剪。大量实验表明,AgentRVOS 在多个基准测试中的 无需训练 方法中实现了最先进的性能,并且在不同的 MLLM 主干中获得了一致的结果。我们的项目页面位于:https://cvlab-kaist.github.io/AgentRVOS/。