论文
基于协议的视听分割:第八届LSVOS挑战赛MeViS-Audio赛道冠军报告
Agreement-Based Audio-Visual Segmentation:Champion Report for the MeViS-Audio Track in the 8th LSVOS Challenge
摘要
MeViS-Audio 轨道要求系统对整个视频中由语音动作表达描述的对象进行分段,并在所描述的目标不存在时返回空掩码。我们提出了一个简单的分阶段解决方案。 Qwen3-ASR 首先将语音转换为文本。然后使用互补的基础和分割模型生成多个视频掩模轨道。我们不相信单个预测,而是选择与其他候选者具有最高平均掩模一致性的轨道。一小组明确的方向、计数和复数规则可以纠正需要比普通单对象跟踪更多的查询。最后,视频级分类器结合视觉、视听和视频内查询分数来决定是否存在任何目标。提交的系统获得0.5952 J&F,0.7931无目标准确率,0.9205目标准确率,最终得分为0.769589。挑战组织者通知我们团队,这个成绩在赛道上排名第一。