论文
用于可解释人脸识别的视觉语言模型融合
Vision Language Model Fusion for Explainable Face Recognition
摘要
负责任地部署人脸验证系统需要的不仅仅是准确的决策:系统还应该提供可解释和可审计的证据,使用户能够理解、评估和质疑他们的决策。视觉语言模型(VLM)通过将视觉分析与自然语言推理相结合,为可解释的人脸识别提供了有希望的基础。然而,依赖单一模型可能会进一步限制决策的准确性以及所提供的解释。因此,这项工作研究了是否可以组合多个 VLM 以提高识别准确性,并丰富与这些决策相关的解释。这项工作评估了四个 VLM 作为独立的人脸验证系统,随后提出了一个融合框架,其中两个源模型提供相似性分数和文本理由,第三个 VLM 充当决策模型。考虑四种不同的融合场景,逐步为决策模型提供分数、理由、面部图像以及这些模式的组合。总体而言,研究结果表明多 VLM 融合的价值超出了识别性能。 VLM 可以提供补充的理由和观点,从而对人脸识别决策进行更丰富的解释,支持更高的透明度、可审计性和错误分析。这与开发负责任的可解释的面部验证系统有关,用户和操作员不仅应该能够理解最终决定,还应该能够理解其背后的证据和潜在来源。所提出的多模态 VLM 结合了决策评分、解释和面部图像,比最先进的 VLM 和特定领域的面部识别模型实现了更高的识别精度,同时还提供了预计比单个 VLM 生成的解释更稳健的融合解释。