论文
SapiensID 2.0:使人类识别基础模型与人类感知保持一致
SapiensID 2.0: Aligning Human Recognition Foundation Models with Human Perception
摘要
虽然基础模型显着提高了跨多种模式的人类识别能力,但它们主要依赖于静态、几何特征提取。这种方法从根本上偏离了人类的认知。因此,当前的模型经常遭受“语义盲目性”,过度拟合瞬态噪声,同时无法利用不变的软生物识别技术,并且难以捕获时间运动特征。为了弥补这一差距,我们提出了 SapiensID 2.0,这是一种富含语义和时间意识的人类识别框架。为了克服软生物特征注释的缺乏,我们将零样本语义知识从多模态 大语言模型 (MLLM) 转移到判别性嵌入空间中。我们使用不变特征对齐(ITA)来提取核心持久特征,并使用瞬态噪声解缠(TND)来解耦服装等工件,从而解决这些空间之间的维度不匹配问题。此外,我们设计了一个运动语义注意力头(K-SAH),可以跨时间窗口扩展空间注意力。通过随着时间的推移跟踪语义补丁,K-SAH 无需大规模视频数据集即可捕获丰富的运动学特征。大量实验表明,SapiensID 2.0 在基于图像和视频的人员重新识别和步态识别方面实现了最先进的性能,同时保持了强大的人脸识别功能。