论文
STORM:视频中的端到端参考多对象跟踪
STORM: End-to-End Referring Multi-Object Tracking in Videos
摘要
引用多对象跟踪 (RMOT) 是将视频中语义上与给定文本查询或引用表达式匹配的所有对象关联起来的任务。现有的 RMOT 方法将对象定位和跟踪分解为单独的模块,并且由于训练视频的稀缺、模糊的注释和受限的领域而表现出有限的性能。在这项工作中,我们引入了 STORM,这是一种端到端的 MLLM,它在统一的框架内联合执行定位和跟踪,消除了外部检测器,并实现了对外观、运动和语言的连贯推理。为了提高数据效率,我们提出了一种任务组合学习(TCL)策略,将 RMOT 分解为图像基础和对象跟踪,使 STORM 能够利用数据丰富的子任务并学习结构化的时空推理。我们进一步构建了 STORM-Bench,这是一个新的 RMOT 数据集,具有通过自下而上的注释管道生成的准确轨迹和多样化、明确的引用表达式。大量实验表明,STORM 在图像目标定位、单目标跟踪和 RMOT 基准方面实现了最先进的性能,在复杂的现实场景中展示了强大的泛化性和强大的时空定位能力。 STORM-Bench 发布于 https://github.com/amazon-science/storm-referring-multi-object-grounding。