论文

零样本面部和眼周性别估计的 CLIP 基准测试

Benchmarking CLIP for Zero-Shot Face and Periocular Gender Estimation

模型评测鲁棒性、公平性与可信度评测

摘要

我们研究 CLIP 从全脸和眼周图像中进行零样本性别估计。使用带有男性/女性提示的图像文本相似性对 Adience 的 11,299 张正面图像进行评估,实现了 95.54% 的全脸准确率,无需特定任务的训练。对于眼周,零样本预测强烈偏向男性,这主要是由于决策边界未对准。阈值对齐大大减少了这种偏差,达到 85.29% 的准确度。在 CLIP 特征上训练的线性 SVM 仅提供边际增益,最佳眼周准确度为 86.17%,比文献中之前的 Adience 结果高出约 2.8%。然而,与全脸性能的差距证实了眼周性别估计的更大难度

零样本面部和眼周性别估计的 CLIP 基准测试的原论文方法或结果图
图 1:左上:CLIP 模型架构(来自 [1])。右上和左下:我们对面部/眼周性别估计的适应。右下:来自 Adience 数据库的图像(来自 [2])。