论文

跨物种的即时动物姿势追踪

Promptable Animal Pose Tracking Across Species

应用与实践视觉感知与空间理解

摘要

动物姿态估计和跟踪对于野生动物监测和保护研究非常重要,在专家时间有限的情况下,自动化方法势在必行。虽然人类姿势估计和跟踪由于大量注释数据集而取得了快速进展,但由于物种之间巨大的形态和行为差异以及有限的注释数据,动物姿势仍然具有挑战性。现有方法要么从泛化性较差的带注释数据集(例如 APTv2)中优化通用关键点定位,要么使用视觉跟踪来跟踪自定义关键点,但以性能为代价。在本文中,我们证明了在大型数据集上训练的视觉基础模型可以有效地使用有限的标记数据来跟踪动物姿势。我们提出了两种模型,一种是无监督的,另一种是监督的,来跟踪用户在视频中选择的关键点。监督方法通过采用关键点提示编码器将参考帧中的结构先验显式注入特征匹配中,提供卓越的跟踪精度。与此同时,无监督路线通过利用 无需训练 对应匹配的不同基础模型特征来提供强大的跨物种鲁棒性。对具有挑战性的动物视频基准 APTv2 和 TigDog 的广泛评估表明,我们的框架实现了强大的性能,同时保持了准确性和泛化性之间的有效平衡,为现实世界的动物行为分析和保护应用提供了实用的解决方案。