论文

使用 ASH 实现自动视频标注:零样本开放词汇多对象跟踪和分割

Towards Automatic Video Annotation with ASH: Zero-Shot Open-Vocabulary Multi-Object Tracking and Segmentation

模型推理推理加速

摘要

基于记忆注意力的视频实例分割(VIS)方法已经表现出强大的零样本跟踪能力,但其大量的内存需求将其限制在短视频剪辑上,并且其单提示推理设计使得多类别开放词汇跟踪在计算上令人望而却步。这项工作介绍了对任意视频的全自动跟踪注释的两项贡献。通用存在词元 (GPT) 重新制定了 SAM3 的推理管道,通过虚拟提示批处理同时处理 N 个文本提示,将图像编码成本从 O(N) 降低到 O(1),且无需修改任何学习组件。标注与分割处理器 (ASH) 通过重叠时间块和基于 IoU 的块间身份匹配,将任何记忆注意力 VIS 跟踪器扩展到任意长度的序列,无需特定于数据集的训练。在 SAM3 上实例化后,生成的管道 - SAM3-ASH - 在完全零样本条件下在 MOTS20 上实现了最先进的 HOTA,并且在七个附加基准中与训练有素的专家保持竞争力,同时峰值 GPU 内存消耗保持在 25 GB 以下,为可扩展、免训练的自动视频标注建立了实用基准。