论文
APRVOS:第五届 PVUW MeViS-Audio Track 第一名获得者
APRVOS: 1st Place Winner of 5th PVUW MeViS-Audio Track
摘要
该报告提出了一个针对 MEVIS\_Audio 设置定制的音频感知引用视频对象分割 (Ref-VOS) 管道,其中引用表达式以语音形式而不是纯文本形式提供。与标准的基于 Sa2VA 的 Ref-VOS 管道相比,所提出的系统引入了两个额外的前端阶段:语音转录和视觉存在验证。具体来说,我们首先使用 VibeVoice-ASR 将长格式语音输入转换为结构化文本记录。由于音频派生的查询本质上是嘈杂的,并且可能描述视频中视觉上不存在的实体,因此我们引入了基于 Omni 的判断模块来确定转录目标是否可以基于视觉内容。如果判断目标不存在,则管道提前终止并输出全零掩码。否则,脚本将转换为面向分段的提示并输入 Sa2VA 以获得整个视频的粗略掩模轨迹。重要的是,该轨迹被视为初始语义假设而不是最终预测。在其之上,代理细化层评估查询可靠性、时间相关性、锚点质量和潜在错误源,并可以调用 SAM3 来提高空间边界精度和时间一致性。由此产生的框架将 MEVIS\_Audio 任务显式分解为音频到文本转换、视觉存在验证、粗视频分割和代理引导的细化。这种分阶段设计比直接将嘈杂的 ASR 输出发送到分段模型更适合音频调节的 Ref-VOS。