论文
MLLM 辅助音频 VOS:MeViS-Audio Track 第 8 届 LSVOS 挑战赛第三名报告
MLLM-Assisted Audio VOS: A 3rd Place Report for the MeViS-Audio Track, 8th LSVOS Challenge
摘要
在本技术报告中,我们提出了用于音频引导视频对象分割的 无需训练 框架,它将多模态 大语言模型 (MLLM) 与基于 SAM 的分割模型集成在一起。我们将任务分解为几个阶段,并为每个阶段确定合适的基础模型。在不引入额外的 模型训练 或特定于任务的 微调 的情况下,我们的方法利用 MLLM 强大的多模态推理能力来建模文本-视觉对应,并采用基于 SAM 的模型来准确生成对象掩模。所提出的框架展示了利用音频引导视频分割基础模型的有效性,并在第八届 LSVOS 挑战赛的 MeViS-Audio Track 中取得了有竞争力的表现。