论文

采用视觉语言模型进行人脸图像质量评估

Employing Vision-Language Models for Face Image Quality Assessment

模型评测模型能力评测

摘要

人脸图像质量评估(FIQA)是生物识别管道中的关键控制步骤。它确保仅处理可靠的样本,以保持系统的准确性。最先进的 FIQA 方法具有很高的实用性,但通常作为“黑匣子”运行。它们产生的标量分数没有人类可解释的理由。这种透明度的缺乏限制了它们在人机交互场景中的有效性,例如自动边境控制,其中可行的反馈至关重要。在本文中,我们研究了现成的视觉语言模型 (VLM) 通过在零样本设置中执行 FIQA 来弥补这一差距的潜力。我们提出了一个用于评估 VLM 性能的综合评估框架。这涉及通过错误与拒绝曲线对传统 FIQA 方法进行基准测试。此外,我们使用一系列不同的数据集(从面向监视的数据集到综合生成的数据集)分析了它们的可解释性、一致性和鲁棒性,以促进变化。我们的结果表明,生物识别实用程序的性能在很大程度上取决于架构,而不仅仅是参数数量。大多数 VLM 的输出与传统方法的输出一致。我们还发现 VLM 排名性能和生成的分数可能因提示而异。我们的综合消融研究表明,虽然增加参数数量可以提高内部一致性,但与较小的模型相比,它会产生更差的退化检测性能。这些发现表明,使用 VLM 进行零样本 FIQA 分数估计是有前途的,并且可以作为可解释性模块有效补充传统的 FIQA 流程。这些代码可从 https://github.com/ThEnded32/VLM4FIQA.git 获取。