论文

EXPL-FR:通过视觉语言对齐解释人脸识别模型

EXPL-FR: Explaining Face Recognition Models via Vision-Language Alignment

模型评测评测方法与指标

摘要

深度人脸识别(FR)模型达到了接近饱和的准确性,但仍然不透明:从业者无法询问相似性分数依赖于哪些语义属性。 EXPL-FR 在 FR 模型自己的嵌入空间内回答了这个问题。轻量级适配器将视觉语言模型 (VLM) 的图像编码器与冻结的 FR 空间对齐,仅在面部图像上进行训练,而不是在文本上进行训练。由于 VLM 的编码器共享一个空间,因此相同的适配器适用于文本编码器,将 22 个类别的 978 个属性提示(也可扩展)转换为 FR 空间锚点,无需额外费用。我们不假设这种传输有效:面部验证协议对其进行测量,并且仅更改适配器的消融隔离了其贡献。并非每个概念都能生存下来,因为 FR 模型通过丢弃必须验证身份的因素来获得不变性。无标签可检测性度量将 FR 空间中每个概念的可分离性与 VLM 空间进行比较,并且 100 个最可检测的形成模型的可读语义签名,它比完整词汇表更好地分离身份。我们涵盖了四个 FR 主干和两个 VLM 编码器,EXPL-FR 不需要架构访问,并支持身份级别、每个图像和差异解释。我们根据真实的验证行为,在三种监督设置、人工标签(当前实践)、VLM 伪标签和完全提示驱动的审计下对属性级审计进行基准测试。在没有标签的情况下,提示驱动的审计根据测量的每个种族 RFW 错误对四个 FR 模型进行排名,并根据其真实验证成本对受控属性变化进行排名。