论文

第五届 PVUW MeViS-Text 挑战赛的第一名获胜者:强大的 MLLM 与 SAM3 相遇以参考视频对象分割

The 1st Winner for 5th PVUW MeViS-Text Challenge: Strong MLLMs Meet SAM3 for Referring Video Object Segmentation

应用与实践视觉感知与空间理解

摘要

本报告介绍了我们在第五届 PVUW MeViS-Text 挑战赛中获胜的解决方案。该轨道研究以运动为中心的语言表达下的视频对象分割,其中模型必须共同理解外观、时间行为和对象交互。为了解决这个问题,我们构建了一个完整的 无需训练 管道,它将强大的多模态 大语言模型 与 SAM3 相结合。我们的方法包含三个阶段。首先,Gemini-3.1 Pro将每个目标事件分解为实例级定位目标,选择目标最清晰可见的帧,并生成判别性描述。其次,SAM3-agent 在所选帧上生成精确的种子掩码,官方 SAM3 跟踪器在整个视频中传播该掩码。第三,细化阶段使用 Qwen3.5-Plus 和行为级验证来纠正不明确或语义不一致的预测。在没有特定于任务的 微调 的情况下,我们的方法在 PVUW 2026 MeViS-Text 测试集上排名第一,最终得分为 0.909064,J&F 得分为 0.7897。该代码位于 https://github.com/Moujuruo/MeViSv2_Track_Solution_2026。