论文

动物重新识别能学到什么?线性生物学概念及其在视觉表示中的起源

What Does Animal Re-Identification Learn? Linear Biological Concepts and Their Origins in Visual Representations

模型评测模型行为与机制分析

摘要

保护工作越来越依赖于相机陷阱,这些相机收集的野生动物图像超出了专家手动分析的范围,这使得动物重新识别 (Re-ID) 对于监测个人和种群至关重要。然而,对于基于 ViT 的 Re-ID 模型来说,理解哪些线索驱动模型决策是一项挑战,其度量学习目标没有为生物概念提供明确的监督。我们询问这些模型是否仍然沿着具有生物学意义的轴组织它们的表示。使用针对西部低地大猩猩 Re-ID 进行微调的 DINOv3 主干网(具有三重边缘损失),我们发现性别和年龄以线性方向出现,可推广到保留的个体,达到 0.91 AUROC,并且可以从每个个体的单个图像中恢复。激活转向进一步表明,模型有因果关系地使用了性别方向,将很大一部分预测翻转到异性。比较现成的和经过微调的主干网表明,Re-ID 训练不会创建这些概念,而是在网络中重新定位它们。最后,数据归因表明,我们发现的表征反映了分级的生物轴,在人群中进行了冗余编码,并由视觉上模糊的个体塑造。总之,这些发现表明可解释性如何揭示 Re-ID 表示的生物结构和故障模式,为野生动物监测的可审核计算机视觉迈出了一步。