论文

用于神经编码和解码的稀疏视图可解释 3D 动物行为表示

Sparse-View Interpretable 3D Animal Behavior Representations for Neural Encoding and Decoding

模型训练预训练

摘要

更深入地了解大脑功能需要对行为进行精确、结构化的表征。然而,以适合科学分析的形式从视频中提取行为表征仍然是一个基本挑战。许多先前的研究通过姿势估计或非线性视频嵌入来表示行为。然而,姿势跟踪会丢弃超出预定义关键点的丰富信息,而非线性视频嵌入则缺乏可解释性。我们通过 SABLE(稀疏视图动物行为潜在嵌入)解决了这一限制,这是一种自我监督框架,利用几何归纳偏差来学习行为表示。通过利用来自单眼深度和姿态估计的先验增强多视图变换器,SABLE 从极其稀疏的视图重建 3D 动物行为,同时学习显式 3D 潜在结构。如果没有真实的 3D 标签,它可以可靠地从双视图视频中恢复 3D 行为,而最先进的 (SOTA) 方法会失败或产生退化的解决方案。在国际大脑实验室和 Cheese3D 数据集中,我们证明 SABLE 学习的 3D 表示在神经编码和解码方面能够匹配或超过先前的 SOTA 性能。一旦在动物身上进行了预训练,SABLE 就可以作为一种现成的模型,将零样本推广到未见过的动物,而无需针对特定动物进行校准或再训练。我们的方法建立了 3D 感知视频嵌入来捕获复杂的行为,为研究大脑行为关系开辟了新途径。