论文
揭露人脸嵌入:使用基础模型读取、渲染和命名
Unmasking Face Embeddings: Reading, Rendering and Naming with Foundation Models
摘要
现代人脸识别(FR)的成功很大程度上归功于深度神经网络,它学习从人脸图像中提取紧凑的身份嵌入。这些模型通常经过身份识别训练,生成的嵌入对于生物识别匹配非常有效,但对语义解释基本上不透明。相比之下,在广泛的视觉或视觉语言任务上进行预训练的基础模型提供了丰富的接口来描述、检索、生成和组织视觉内容。这种对比自然而然地提出了一个问题:当来自特定领域的 FR 模型的人脸嵌入与基础模型可互操作时,可以使用哪些功能?基于最近关于跨模型嵌入兼容性的工作,我们使用简单的预先计算的线性变换(仅根据配对嵌入进行估计)将现有的 FR 模型与现成的基础模型连接起来。一旦与基础模型对齐,人脸嵌入就可以通过多种方式“揭开”,而无需训练或修改任何一个模型:它可以用自然语言阅读,从而可以在 FR 嵌入库上进行自由格式的文本查询;使用未经修改的扩散解码器渲染成恢复人的外观的面部图像;并转换为姓名,即使在没有注册脸部库的情况下也能进行识别。实际上,一个线性变换将身份嵌入转变为网络规模基础模型的丰富嵌入。这种互操作性将人脸嵌入暴露为语义和视觉上丰富的生物特征表示,对可解释性、检索、重建和模板安全性产生直接影响。