论文
人脸识别中开放权重视觉语言模型的解释质量基准测试
Benchmarking the Explanatory Quality of Open-Weight Vision-Language Models in Face Recognition
摘要
视觉语言模型(VLM)最近被提议作为人脸识别的有前途的工具,因为它们可以产生自然语言解释以及相似性分数。此功能被认为对于法医环境中的面部比较很有吸引力,这要求决策透明且可审计。然而,针对该用例的 VLM 的现有评估主要集中在识别准确性上,而生成的解释的有效性仍然未量化。在这项工作中,我们引入了基于 VLM 的人脸识别的基准测试框架,该框架将解释质量视为核心评估轴。我们提出解释应满足的两个标准:相关性,即依赖于身份稳定的面部特征;和忠实度,即与可见图像内容对齐,没有幻觉特征。我们共同开发了一种方法,能够量化评估模型的相关性和可信度,该方法基于将模型输出限制为支持自动查询和审计的结构化解释格式。使用这个框架,我们对几个开放权重 VLM 系列进行了基准测试,共同评估人脸验证的准确性和解释质量。我们的结果强调了所产生的解释的剩余缺陷,并强调需要此类解释质量指标才能全面了解模型性能。所提出的基准和开源评估工具为可解释的人脸识别系统的适当基准测试和未来微调奠定了基础。