论文
VLAgeBench:零样本人类年龄估计的大型视觉语言模型基准测试
VLAgeBench: Benchmarking Large Vision-Language Models for Zero-Shot Human Age Estimation
摘要
从面部图像估计人类年龄是一项具有挑战性的计算机视觉任务,在生物识别、医疗保健和人机交互方面具有重要应用。虽然传统的深度学习方法需要大量的标记数据集和特定领域的训练,但大型视觉语言模型 (LVLM) 的最新进展提供了零样本年龄估计的潜力。这项研究对用于面部年龄估计的最先进的大视觉语言模型(LVLM)进行了全面的零样本评估,这项任务传统上由特定领域的卷积网络和监督学习主导。我们在两个基准数据集 UTKFace 和 FG-NET 上评估了 GPT-4o、Claude 3.5 Sonnet 和 LLaMA 3.2 Vision 的性能,没有任何 微调 或特定于任务的适应。使用八个评估指标,包括 MAE、MSE、RMSE、MAPE、MBE、$R^2$、CCC 和 $\pm$5 年精度,我们证明通用 LVLM 可以在零样本设置中提供具有竞争力的性能。我们的研究结果强调了 LVLM 在精确生物特征年龄估计方面的新兴能力,并将这些模型定位为现实世界应用的有前途的工具。此外,我们强调了与图像质量和人口统计亚组相关的性能差异,强调了公平感知多模态推理的必要性。这项工作引入了一个可重复的基准,并将 LVLM 定位为法医学、医疗保健监控和人机交互等实际应用的有前途的工具。该基准测试侧重于没有 微调 的严格零样本推理,并强调了与提示敏感性、可解释性、计算成本和人口统计公平性相关的剩余挑战。