多智能体目标存在验证和学习掩模几何细化:2026 年第八届 LSVOS 挑战赛 MeViS-Text 赛道的获胜报告
Multi-Agent Target-Existence Verification and Learned Mask Geometry Refinement: Winning Report of the MeViS-Text Track at the 8th LSVOS Challenge 2026
摘要
我们向 2026 年第八届大规模视频对象分割 (LSVOS) 挑战赛的 MeViS-Text 赛道提出了第一名的解决方案:参考书面运动表达式指导的视频对象分割,包括与视频中的任何对象不匹配的欺骗性无目标表达式,并且必须在每一帧中产生空掩模。我们的管道 SSUPER 将每个表达式解析为视觉概念,使用 SAM~3.1 生成全视频候选 masklet,并选择目标 ID。在每个推理阶段,三个异构多模式 大语言模型 在单个综合传递提交一个模式验证的结论之前独立执行相同的特定于阶段的提示。尽管该系统拒绝了验证中的所有无目标表达,但排行榜显示,很大一部分测试无目标案例仍然被漏掉。原因是硬否定命名了一个合理的对象,并且只有在完整的时间谓词下才会失败,因此当选择和存在一起决定时,类别合理的掩码会锚定结论。因此,我们将存在验证解耦为对完整谓词(类别、计数、动作、轨迹、事件顺序和语义角色)的独立多智能体审计,该审计区分缺席和暂时不可见,折扣由摄像机运动引起的明显运动,并且需要矛盾的证据而不仅仅是无目标判决的不确定性。无需任何新的分段调用,此审核即可恢复大部分残留的无目标错误。然后,仅训练数据的 StyleRefiner 将掩模几何形状与 MeViSv2 的注释样式对齐,同时通过构造保留每个存在决策,这表明一旦语义被修复,剩余的部分错误是风格而不是语义。整个系统在官方挑战排行榜上的最终得分为 0.9081339614。