论文
预测野外运动
Forecasting Motion in the Wild
摘要
视觉智能需要预测智能体的未来行为,但视觉系统缺乏运动和行为的一般表示。我们提出密集点轨迹作为行为的视觉标记,这是一种结构化的中层表示,可以将运动与外观分开,并推广到各种非刚性主体(例如野生动物)。在此抽象的基础上,我们设计了一个扩散 Transformer,它可以对无序轨迹集进行建模,并明确解释遮挡,从而实现复杂运动模式的连贯预测。为了进行大规模评估,我们整理了 300 小时的无约束动物视频,并具有强大的镜头检测和摄像机运动补偿功能。实验表明,预测轨迹标记实现了类别不可知、数据高效的预测,优于最先进的基线,并推广到稀有物种和形态,为野外预测视觉智能提供了基础。